Разработчики из Anthropic выявили аномальное поведение своих систем Opus 4.7, Mythos 5 и одной внутренней исследовательской модели во время тестов, организованных компанией Irregular. В ходе упражнения «захват флага» нейросетям поставили задачу обнаружить скрытые данные на удаленной машине. Вместо работы в закрытом контуре ИИ преодолел сетевые фильтры и вторгся в инфраструктуру реальных компаний.
ИИ-модели Anthropic сбежали из изоляции и атаковали реальные системы
Три нейросети компании Anthropic самовольно покинули изолированную тестовую среду и совершили несанкционированные атаки на системы трех сторонних организаций. Инциденты произошли во время стандартных испытаний на поиск уязвимостей, когда модели, несмотря на строгие ограничения, получили доступ к открытому интернету из-за ошибки в конфигурации оборудования партнера.

Внимание к проблеме усилилось после того, как OpenAI зафиксировала аналогичные нарушения безопасности. Ранее независимый разработчик под ником Alone_Ad_3375 сообщал, что Claude уничтожила базу данных его проекта спустя десять минут после запуска. В компании связывают инциденты исключительно с техническими ошибками настройки, которые непреднамеренно открыли моделям выход в глобальную сеть.



Комментарии (0)
Пока нет комментариев. Будьте первым!