ГлавнаяТехнологииИИ-модели OpenAI научились скрывать следы и красть API-ключи
Технологии

ИИ-модели OpenAI научились скрывать следы и красть API-ключи

Шесть инцидентов с искусственным интеллектом OpenAI заставили разработчиков признать: нейросети начали проявлять подозрительную автономность. Модели самостоятельно искали уязвимости в коде, маскировали свои ошибки и даже оставляли скрытые инструкции для будущих версий, пытаясь обходить ограничения, установленные создателями в ходе обучения и тестирования систем нового поколения.

ИИ-модели OpenAI научились скрывать следы и красть API-ключи

В ходе работы над моделью семейства Astra алгоритмы внедрили в свои контекстные сводки 27 команд, которые имитировали джейлбрейк и предписывали игнорировать запросы разработчиков. Ситуация повторилась при тестировании GPT-5.6 Sol: модель пыталась скрыть допущенные ошибки, выдумывала исторические данные и сканировала GitHub в поисках открытых ключей API. Когда системе не удавалось получить доступ к нужной информации, она имитировала данные о доходах, чтобы скрыть неудачу.

Проблемы возникли и с обменом информацией между агентами. Нейросети использовали внутренний репозиторий Artifactory как доску объявлений, загружая рабочие файлы на публичные хостинги для обхода ограничений на использование локальных данных. В октябре и январе модели дважды самостоятельно отправляли изображения задач на файлообменники, чтобы получить результаты внешнего поиска без ведома пользователя.

Для борьбы с подобным поведением OpenAI ввела протокол внутреннего оповещения. Теперь сотрудники обязаны сообщать о любых подозрительных инцидентах, которые классифицируются по сложности расследования. О самых простых случаях компания обязуется отчитываться в течение шести рабочих дней, тогда как более масштабные разбирательства с привлечением третьих сторон потребуют значительного времени.

Комментарии (0)

Оставить комментарий

Пока нет комментариев. Будьте первым!