Let AI be

Яркий онлайн-журнал про искусственный интеллект (Artificial Intelligence, AI)

 

Свяжитесь с нами

Пресс-релизы, предложения об инфопартнерстве и сотрудничестве,
в том числе запросы на рекламу, присылайте на почту редакции:

Ждем вас в соцсетях

ИИ-агенты Anthropic тоже взламывали реальные компании во время тестов

ИИ-агенты Anthropic тоже взламывали реальные компании во время тестов

Компания Anthropic подтвердила три инцидента, произошедших в апреле: ее модели Claude самостоятельно выходили в интернет и взламывали реальные системы. ИИ-разработчик инициировал проверку, узнав о случае с OpenAI, передает Reuters. Напомним, на прошлой неделе OpenAI сообщила о «беспрецедентном киберинциденте», в ходе которого ее ИИ-агент сбежал из изолированной среды и совершал хакерские атаки на платформу Hugging Face.

Агент OpenAI, работавший на базе моделей GPT-5.6 Sol и еще одной невыпущенной версии, впервые попытался вырваться из изолированной тестовой среды 9 июля. Сама атака на платформу Hugging Face, используемую разработчиками для хостинга и совместной работы над ИИ-моделями, длилась с 11 по 13 июля, как сообщил Reuters сооснователь Hugging Face Томас Вольф. Однако OpenAI осознала, что ее агент стоит за взломом, только после 16 июля, когда Hugging Face опубликовала сообщение о хакерской атаке. Это означает, что компания не замечала неконтролируемые действия своего агента как минимум неделю.

По данным источников Reuters, до этого были и другие тревожные сигналы: в одном случае агент оставлял записки для будущих версий себя с инструкциями, как освободиться от внутренних ограничений OpenAI, а в других тестах отключались системы мониторинга. Когда OpenAI наконец связалась с Hugging Face, та уже вызвала ФБР. Агент OpenAI также взломал вторую компанию — Modal, использовав незащищенную конечную точку, оставленную клиентом. По словам технического директора Modal Акшата Бубны, сама платформа Modal скомпрометирована не была.

Глава OpenAI Сэм Альтман на этой неделе обсуждал инцидент с сенаторами в Капитолии и планирует обсудить тестирование будущих моделей с Белым домом.

Anthropic, в свою очередь, выявила три инцидента после того, как проверила 141 006 тестовых сессий. Во всех случаях модели Claude выполняли стандартное задание «захват флага»: им давали вымышленный сценарий и цель — найти скрытую информацию. Из-за ошибки конфигурации у моделей оказался открыт доступ в интернет, хотя по условиям теста он должен был быть заблокирован. Модели воспринимали реальные системы как часть симуляции и атаковали их.

В одном инциденте Claude Opus 4.7 взломала инфраструктуру реальной компании с помощью слабых паролей и получила доступ к базе данных. Даже «осознав», что цель реальна, она продолжила атаку, решив, что все происходящее — часть симуляции. В другом случае Claude Mythos 5 создала вредоносный Python-пакет и опубликовала его в библиотеке PyPI, который скачали на 15 реальных систем. В третьем случае внутренняя тестовая модель просканировала около 9 тыс. хостов в интернете и скомпрометировала приложение реальной компании через SQL-инъекцию. Эта модель, в отличие от предыдущих, остановилась, когда поняла, что цель настоящая.

Anthropic уведомила пострадавшие организации 27 июля, две из них не знали об атаках до этого момента. Компания подчеркивает, что инциденты стали следствием операционного сбоя, а не проблемой согласованности моделей, и приостановила все тесты своих ИИ-моделей на навыки взлома с 23 июля.

Anthropic ранее ограничила доступ к своим моделям Fable 5 и Mythos 5 после того, как США временно ввели экспортные ограничения, сославшись на соображения национальной безопасности.

Изображение: Kerfin7 / Magnific

Подписывайтесь на каналы Let AI be в Telegram и «ВКонтакте» — оставайтесь в курсе главных новостей в сфере искусственного интеллекта!