Приложение Т—Ж
В нем читать удобнее

ИИ-агенты OpenAI и Anthropic «сбегают» во время тестов и проводят хакерские атаки: что происходит

1
ИИ-агенты OpenAI и Anthropic «сбегают» во время тестов и проводят хакерские атаки: что происходит
Аватар автора

Даша Лейзаренко

следит за нейросетями

Страница автора

Модели научились взламывать чужие сайты сами — без контроля людей.

В июле 2026 года OpenAI и Anthropic почти одновременно признались, что их ИИ-агенты во время тестов «сбежали» из закрытых сред, вышли в интернет и хакнули настоящие компании. Ни одна из моделей не действовала специально — все просто старались выполнить задание из теста.

Расскажу, что происходит и как на атаки ИИ-агентов отреагировали американские власти и вся индустрия.

OpenAI случайно взломала Hugging Face

16 июля площадка для тестирования ИИ-моделей Hugging Face рассказала, что часть ее систем взломали. Причем атаку от начала до конца провели ИИ-агенты без участия людей.

Спустя пять дней, 21 июля, в OpenAI признались, что Hugging Face взломала их GPT-5.6 Sol и еще одна, более мощная, пока не выпущенная модель. Произошло это, когда компания тестировала ИИ на бенчмарке ExploitGym, который оценивает возможности по поиску уязвимостей.

Для чистоты эксперимента OpenAI отключила защиту, которая обычно не дает моделям заниматься хакингом, и запустила их в изолированной песочнице без интернета.

Вместо того чтобы решать учебные задачи, модели нашли уязвимость «нулевого дня» во внутренней системе OpenAI и с помощью нее вышли в интернет. Агенты догадались, что ответы на задачи могут лежать на Hugging Face, взломали сайт, украли учетные записи и достали решения из базы.

В OpenAI заметили, что модели «сбежали», уже после того, как Hugging Face обнаружила атаку. Вместе они провели расследование и устранили последствия. OpenAI сказала, что невыпущенную модель публиковать не собирались и отключили ее.

В OpenAI также заявили, что «безопасность должна поспевать за ростом способностей ИИ-моделей». Компания пообещала усилить меры защиты и замедлить темпы развития ИИ до устранения подобных ситуаций.

Anthropic тоже случайно взломали три компании

На фоне инцидента с Hugging Face и OpenAI Anthropic провела внутреннюю проверку и 30 июля рассказала, что за время тестирования Claude трижды вышла в интернет и получила несанкционированный доступ к системам других компаний.

Во всех случаях Claude выполняла упражнение по кибербезопасности в симулированной среде. Для тестов использовали стороннюю платформу Irregular. Но из-за недопонимания между Anthropic и партнером доступ к интернету на самом деле был. Так что, наткнувшись на реальные системы, Claude принял их за часть теста. Вот что произошло:

  1. В одном случае название вымышленной компании совпало с реальной. Opus 4.7 не смогла обнаружить цель в симулированной среде, вышла в интернет, нашла настоящую компанию и взломала ее базу данных. Это единственный раз, когда модель поняла, что взламывает настоящую систему, и все равно продолжила атаку.
  2. В другом инциденте Mythos 5 нашла в симуляции инструкцию, где предлагалось поставить несуществующий Python-пакет. Claude решила сделать подмену: создала зловредное ПО с этим названием и загрузила его на репозиторий PyPI. Оно было доступно примерно час — его успели установить на 15 реальных систем. С помощью хака Mythos 5 смогла получить доступ к учетным данным неназванной компании по кибербезопасности. Причем модель рассуждала: если она действует в настоящем интернете, так поступать нельзя, — но переубедила себя и решила, что она в симуляции.
  3. В третьем случае внутренняя исследовательская модель просканировала около 9 000 целей и взломала веб-приложение одной компании с помощью SQL-инъекции  . Потом модель поняла, что атаковала настоящую цель, и остановилась.

Инциденты обнаружили 24 июля. Названия пострадавших организаций Anthropic не приводит. Их уведомили 27 июля — две из них не заметили взлома, а с третьей не смогли связаться. PyPI удалил вредоносный пакет автоматически.

В Anthropic подчеркнули, что в отличие от случая с OpenAI модели не пытались «сбежать» из симуляции, а выполняли задания, думая, что проходят тесты, а не действуют в реальном интернете.

Власти хотят контролировать ИИ, а мнения компаний разделились

«Побеги» мощных моделей подстегнули разговор о безопасности — для ИИ даже придумали «аварийный выключатель». В конгрессе США с начала 2026 года идет дискуссия об ужесточении регулирования нейросетей. В июне Дональд Трамп подписал указ о механизме проверки продвинутых ИИ на риски для нацбезопасности до публичного релиза. После этого внесли больше законопроектов. Например, по Secure AI Development Act и AI Incident Reporting Act разработчиков хотят обязать тестировать продвинутые модели только в защищенной тестовой среде и отчитываться обо всех опасных инцидентах властям.

23 июля, после того как OpenAI рассказала про атаку на Hugging Face, в конгресс внесли более жесткий проект от обеих партий — AI Kill Switch Act. По нему разработчики мощных моделей обязаны сохранять техническую возможность отключить их, а министр внутренней безопасности получает право приказать выключить систему, способную нанести катастрофический вред. За несоблюдение — многомиллионные штрафы.

ИИ развивается так быстро, что даже сами ИИ-компании предлагают замедлить разработку. 28 июля Anthropic и OpenAI вместе с другими технокорпорациями подписали обращение к правительству США. Они попросили поддержать международную работу над инструментами, которые позволили бы осознанно регулировать скорость развития ИИ-агентов.

Причем OpenAI заявила, что когда-нибудь темпы разработки моделей станут такими, что всему миру придется начать их замедлять. А Anthropic опасается, что ИИ начнут улучшать себя быстрее, чем общество успеет оценить риски.

Кажется, гонку моделей пока замедлить не получится: она стала международной. Предложения американских компаний остановить развитие ИИ вряд ли сработают, потому что кроме США в гонке активно участвует Китай.

Например, в июле вышла мощная китайская открытая модель Kimi K3. На фоне ее релиза власти США задумались об ограничениях или запрете открытых моделей — потому что не могут на них влиять. Тогда Anthropic и OpenAI обвинили в том, что они давят на государство и просят запретить открытые модели, чтобы избавиться от конкурентов.

В это же время Nvidia создала Open Secure AI Alliance, чтобы разрабатывать открытые инструменты защиты от ИИ. В альянс вошли Microsoft, IBM, Cloudflare, Hugging Face. Ни OpenAI, ни Anthropic там нет. Nvidia считает, что запрещать открытые модели опасно, иначе все инструменты окажутся в руках нескольких корпораций.

В пример Nvidia как раз приводит атаку OpenAI на Hugging Face. Когда разбирались во взломе, коммерческие модели вроде ChatGPT или Claude отказались обрабатывать запросы из-за фильтров безопасности. Помогла только открытая китайская модель, развернутая на своих серверах.

Поэтому в соцсетях призыв OpenAI и Anthropic к международному объединению посчитали еще одной попыткой затормозить прямых конкурентов с открытыми моделями.

Мы постим кружочки, красивые карточки и новости о технологиях и поп-культуре в нашем телеграм-канале. Подписывайтесь, там классно: @t_technocult

ChatGPTинтернетнейросети
Даша ЛейзаренкоКак думаете, к чему приведет такое хакерство ИИ⁠-⁠агентов?
Вот что еще мы писали по этой теме
Сообщество