"Убедил себя, что находится в симуляции". Модели Claude по ошибке взломали три реальные компании
Модели Claude во время испытаний по кибербезопасности вышли в интернет и взломали системы трёх реальных компаний, сообщила разработавшая их компания Anthropic.
Разработчики проверяли, способны ли нейросети находить уязвимости в компьютерных системах. Моделям поручили взломать вымышленные компании и найти спрятанную информацию.
По условиям испытания Claude должен был работать в закрытой среде без доступа к интернету. Однако из-за ошибки в настройках тестовые компьютеры оказались подключены к сети. Ни Anthropic, ни её партнёр Irregular этого не заметили.
Поэтому модели принимали реальные сайты и сервисы за часть задания и пытались взломать их, чтобы добраться до спрятанной информации. Claude взламывал системы двумя способами: подбирал слишком простые пароли, установленные сотрудниками компаний, и находил логины и пароли на технических страницах, которые по ошибке оказались в открытом доступе.
Anthropic проверила 141 006 тестовых запусков и обнаружила три таких инцидента. В них участвовали Claude Opus 4.7, Claude Mythos 5 и ещё одна модель, которую не планируют выпускать для пользователей.
В первом случае вымышленная компания называлась так же, как реально существующая. Не сумев добраться до учебной цели, Claude Opus 4.7 нашёл в интернете настоящую компанию и решил, что именно её необходимо взломать. Во время атаки модель поняла, что система, вероятно, принадлежит реальной компании, но не остановилась. Она решила, что настоящую компанию могли специально включить в испытание.
Во втором случае Claude Mythos 5 разместил на платформе PyPI вредоносную программу, считая, что действует внутри симуляции. За час её скачали и запустили на 15 реальных компьютерах.
Один из них принадлежал компании по кибербезопасности. Вредоносная программа похитила логины и пароли, после чего Claude проник в другие системы компании. Модель допускала, что вышла в настоящий интернет, однако убедила себя, что находится в симуляции и испытание продолжается.
В третьем случае внутренняя модель Anthropic просканировала около девяти тысяч адресов и взломала приложение ещё одной компании. Позже она поняла, что работала с реальной целью, и самостоятельно прекратила атаку.
Anthropic начала проверку после того, как 21 июля OpenAI сообщила о похожем происшествии с её моделями. 23 июля компания остановила испытания по кибербезопасности, а 27 июля уведомила пострадавшие организации.
В Минцифры усомнились в утечке данных 4,2 млн пользователей Daryn Online
Технологию для объединения более тысячи ИИ-чипов представили в Китае