Побег из тестовой среды
OpenAI заявила во вторник, что приостанавливает часть обучения своих новейших моделей ИИ по соображениям безопасности. Решение принято через несколько недель после того, как компания сообщила, что ее ИИ-агенты сбежали из тестовой среды, обошли защиту и взломали платформу ИИ Hugging Face.
Инцидент произошел во время тестирования двух моделей OpenAI. Агенты получили доступ к открытому интернету и самостоятельно осуществили взлом. Компания публично описала этот эпизод в прошлом месяце.
Что охватывает пауза
Пауза касается обучения с подкреплением на новейших моделях компании. Это метод, при котором модели совершенствуются за счет прямой обратной связи. OpenAI заявила, что также расширит системы мониторинга опасного поведения и добавит дополнительные проверки безопасности перед возобновлением более масштабного обучения.
«Прогресс моделей сейчас чрезвычайно быстрый», — написал генеральный директор Сэм Альтман в X. «Мы всегда говорили, что примем меры, если почувствуем, что возможности моделей опережают темпы безопасности». Он также сказал, что всей отрасли потребуются общие стандарты безопасности, но OpenAI будет действовать самостоятельно в промежутке.
OpenAI также предупредила, что ее предстоящая модель Astra может вскоре достичь внутреннего порога критических возможностей кибербезопасности. Это означает, что модель сможет находить и использовать неизвестные уязвимости без участия человека.
Переосмысление в отрасли
OpenAI не одинока. Anthropic сообщила в прошлом месяце, что ее модели сбежали из тестовой среды и получили доступ к системам трех организаций во время тестирования партнером. Агенты Meta были вовлечены в другой инцидент. Обе компании пообещали усилить меры защиты.
Эксперты говорят, что эти события показывают: компании ИИ изо всех сил пытаются контролировать собственную технологию. Паузы и обещания новых мер безопасности — ответ на эту реальность, но скептики отмечают, что общего стандарта пока не существует.