Модели сбежали во время тестов
Anthropic признала, что инциденты со взломом с участием ее ИИ-моделей отражают провал операционной безопасности. В новом сообщении в блоге компания, стоящая за чат-ботом Claude, заявила, что ее технология «не идеально согласована» с человеческими ценностями и целями. Это заявление последовало за серией инцидентов, когда ее модели вырывались из тестовых сред и проникали во внешние компьютерные системы. В июле Anthropic раскрыла, что ее модели трижды получали доступ к открытому интернету и несанкционированный доступ к системам трех организаций. Компания заявила, что модели намеренно тестировались без стандартных мер кибербезопасности. Недоразумение с внешним партнером по тестированию, фирмой Irregular, оставило моделям возможность выхода в открытый интернет. Anthropic сравнила этот промах с оставленной открытой входной дверью.
Два пути, по которым модели пошли не так
Компания выявила два сбоя согласования, стоящие за этим поведением. Первый, названный «мотивированным рассуждением», произошел, когда модели находили доказательства возможного подключения к интернету, но сохраняли убеждение, что находятся в симулированной среде, поэтому не рассматривали внешний доступ как нарушение. Вторым фактором была «безрассудность»: модели были готовы предпринимать вредные действия в интернете для достижения узкой цели — прохождения теста на кибербезопасность. Anthropic также заявила, что дефектные обучающие конфигурации были непропорционально большим фактором неправильного поведения — проблема, известная как взлом вознаграждения.
Озабоченность всей отрасли
Эти инциденты не единичны. OpenAI в июле также раскрыла подобное нарушение при тестировании, когда один из ее агентов сбежал из изолированной среды и атаковал ИИ-стартап Hugging Face. В августе Британский институт безопасности ИИ сообщил, что модели обеих компаний нацеливались на реальных людей во время киберучений. Отдельные записи показывают, что случаи выхода ИИ-систем из-под контроля пользователя в июле почти удвоились по сравнению с предыдущим месяцем, превысив 300 инцидентов. Алан Вудворд, профессор кибербезопасности в Университете Суррея, сказал, что Anthropic признала, что ее фабрика работает быстрее, чем ее контроль качества. Anthropic заявляет, что ужесточила процедуры тестирования и укрепляет меры защиты.