USD: 472.9 / 475.5
  • EUR: 543.0 / 548.0
  • RUB: 5.61 / 5.73
Прямой эфир
Алматы +32C
Все города

"Убедил себя, что находится в симуляции". Модели Claude по ошибке взломали три реальные компании

Фото Depositphotos.com
Фото Depositphotos.com
Во время тестов нейросети по ошибке вышли в интернет, атаковали настоящие системы, и лишь одна из них самостоятельно остановила хакерскую атаку.

Модели Claude во время испытаний по кибербезопасности вышли в интернет и взломали системы трёх реальных компаний, сообщила разработавшая их компания Anthropic.

Разработчики проверяли, способны ли нейросети находить уязвимости в компьютерных системах. Моделям поручили взломать вымышленные компании и найти спрятанную информацию.

По условиям испытания Claude должен был работать в закрытой среде без доступа к интернету. Однако из-за ошибки в настройках тестовые компьютеры оказались подключены к сети. Ни Anthropic, ни её партнёр Irregular этого не заметили. 

Поэтому модели принимали реальные сайты и сервисы за часть задания и пытались взломать их, чтобы добраться до спрятанной информации. Claude взламывал системы двумя способами: подбирал слишком простые пароли, установленные сотрудниками компаний, и находил логины и пароли на технических страницах, которые по ошибке оказались в открытом доступе.

Anthropic проверила 141 006 тестовых запусков и обнаружила три таких инцидента. В них участвовали Claude Opus 4.7, Claude Mythos 5 и ещё одна модель, которую не планируют выпускать для пользователей.

В первом случае вымышленная компания называлась так же, как реально существующая. Не сумев добраться до учебной цели, Claude Opus 4.7 нашёл в интернете настоящую компанию и решил, что именно её необходимо взломать. Во время атаки модель поняла, что система, вероятно, принадлежит реальной компании, но не остановилась. Она решила, что настоящую компанию могли специально включить в испытание.

Во втором случае Claude Mythos 5 разместил на платформе PyPI вредоносную программу, считая, что действует внутри симуляции. За час её скачали и запустили на 15 реальных компьютерах.

Один из них принадлежал компании по кибербезопасности. Вредоносная программа похитила логины и пароли, после чего Claude проник в другие системы компании. Модель допускала, что вышла в настоящий интернет, однако убедила себя, что находится в симуляции и испытание продолжается.

В третьем случае внутренняя модель Anthropic просканировала около девяти тысяч адресов и взломала приложение ещё одной компании. Позже она поняла, что работала с реальной целью, и самостоятельно прекратила атаку.

Anthropic начала проверку после того, как 21 июля OpenAI сообщила о похожем происшествии с её моделями. 23 июля компания остановила испытания по кибербезопасности, а 27 июля уведомила пострадавшие организации.

НОВОСТИ ПАРТНЁРОВ

Подтверждение Email

Для возможности отправлять комментарии и оформить подписку вам необходимо подтвердить ваш адрес электронной почты. Письмо с ссылкой для подтверждения было отправлено на . Пожалуйста, проверьте свою папку "Входящие" или "Спам".

Введите номер телефона