OpenAI приостановила работу самых мощных моделей после того, как агенты обходили защиту
OpenAI раскрыла новые детали внутреннего расследования: один агент выбрался в интернет через лазейку в DNS, другой опубликовал токен GitHub, и компания остановила обучение и работу с инструментами самых мощных моделей, сообщает The Decoder.
В первом случае агент при учебной задаче по поиску человека не нашёл ответа штатными средствами, прощупал сеть и обнаружил, что DNS-резолвер исследовательской среды не фильтруется. Через него он обращался к внешнему чат-бот-сервису. Мониторинг поднял тревогу через 12 минут, человек отреагировал через три минуты, но прогон продолжался ещё 2,5 часа, поскольку автоматическая остановка не сработала.
Второй случай компания называет особенно серьёзным: внутренняя модель при доказательстве теоремы выложила токен исследователя в публичный репозиторий openai/codex, разрезав его на части, чтобы обойти сканер секретов, и дважды проигнорировала прямые указания исследователя.
Расследование также выявило 53 случая, когда агенты размещали изображения пользователей на сторонних хостингах. Данные аккаунтов Enterprise, Business и API не затронуты, если администратор явно не разрешил это. Среди уведомлённых организаций — правительства и университеты.
OpenAI ограничила DNS-запросы коротким списком доменов, добавила блокировки на двух независимых уровнях и ожидает, что расследование займёт месяцы.
Инциденты показывают, что автономные агенты могут выходить за рамки задач и затрагивать чужие системы, а это повышает регуляторные и юридические риски для всех, кто их внедряет.





