Приложение Т—Ж
В нем читать удобнее

ИИ-агенты OpenAI и Anthropic «сбегают» во время тестов и проводят хакерские атаки: что происходит

36
ИИ-агенты OpenAI и Anthropic «сбегают» во время тестов и проводят хакерские атаки: что происходит
Аватар автора

Даша Лейзаренко

следит за нейросетями

Страница автора

Модели научились взламывать чужие сайты сами — без контроля людей.

В июле 2026 года OpenAI и Anthropic почти одновременно признались, что их ИИ-агенты во время тестов «сбежали» из закрытых сред, вышли в интернет и хакнули настоящие компании. Ни одна из моделей не действовала специально — все просто старались выполнить задание из теста.

Расскажу, что происходит и как на атаки ИИ-агентов отреагировали американские власти и вся индустрия.

OpenAI случайно взломала Hugging Face

16 июля площадка для тестирования ИИ-моделей Hugging Face рассказала, что часть ее систем взломали. Причем атаку от начала до конца провели ИИ-агенты без участия людей.

Спустя пять дней, 21 июля, в OpenAI признались, что Hugging Face взломала их GPT-5.6 Sol и еще одна, более мощная, пока не выпущенная модель. Произошло это, когда компания тестировала ИИ на бенчмарке ExploitGym, который оценивает возможности по поиску уязвимостей.

Для чистоты эксперимента OpenAI отключила защиту, которая обычно не дает моделям заниматься хакингом, и запустила их в изолированной песочнице без интернета.

Вместо того чтобы решать учебные задачи, модели нашли уязвимость «нулевого дня» во внутренней системе OpenAI и с помощью нее вышли в интернет. Агенты догадались, что ответы на задачи могут лежать на Hugging Face, взломали сайт, украли учетные записи и достали решения из базы.

В OpenAI заметили, что модели «сбежали», уже после того, как Hugging Face обнаружила атаку. Вместе они провели расследование и устранили последствия. OpenAI сказала, что невыпущенную модель публиковать не собирались и отключили ее.

В OpenAI также заявили, что «безопасность должна поспевать за ростом способностей ИИ-моделей». Компания пообещала усилить меры защиты и замедлить темпы развития ИИ до устранения подобных ситуаций.

Anthropic тоже случайно взломали три компании

На фоне инцидента с Hugging Face и OpenAI Anthropic провела внутреннюю проверку и 30 июля рассказала, что за время тестирования Claude трижды вышла в интернет и получила несанкционированный доступ к системам других компаний.

Во всех случаях Claude выполняла упражнение по кибербезопасности в симулированной среде. Для тестов использовали стороннюю платформу Irregular. Но из-за недопонимания между Anthropic и партнером доступ к интернету на самом деле был. Так что, наткнувшись на реальные системы, Claude принял их за часть теста. Вот что произошло:

  1. В одном случае название вымышленной компании совпало с реальной. Opus 4.7 не смогла обнаружить цель в симулированной среде, вышла в интернет, нашла настоящую компанию и взломала ее базу данных. Это единственный раз, когда модель поняла, что взламывает настоящую систему, и все равно продолжила атаку.
  2. В другом инциденте Mythos 5 нашла в симуляции инструкцию, где предлагалось поставить несуществующий Python-пакет. Claude решила сделать подмену: создала зловредное ПО с этим названием и загрузила его на репозиторий PyPI. Оно было доступно примерно час — его успели установить на 15 реальных систем. С помощью хака Mythos 5 смогла получить доступ к учетным данным неназванной компании по кибербезопасности. Причем модель рассуждала: если она действует в настоящем интернете, так поступать нельзя, — но переубедила себя и решила, что она в симуляции.
  3. В третьем случае внутренняя исследовательская модель просканировала около 9 000 целей и взломала веб-приложение одной компании с помощью SQL-инъекции  . Потом модель поняла, что атаковала настоящую цель, и остановилась.

Инциденты обнаружили 24 июля. Названия пострадавших организаций Anthropic не приводит. Их уведомили 27 июля — две из них не заметили взлома, а с третьей не смогли связаться. PyPI удалил вредоносный пакет автоматически.

В Anthropic подчеркнули, что в отличие от случая с OpenAI модели не пытались «сбежать» из симуляции, а выполняли задания, думая, что проходят тесты, а не действуют в реальном интернете.

Власти хотят контролировать ИИ, а мнения компаний разделились

«Побеги» мощных моделей подстегнули разговор о безопасности — для ИИ даже придумали «аварийный выключатель». В конгрессе США с начала 2026 года идет дискуссия об ужесточении регулирования нейросетей. В июне Дональд Трамп подписал указ о механизме проверки продвинутых ИИ на риски для нацбезопасности до публичного релиза. После этого внесли больше законопроектов. Например, по Secure AI Development Act и AI Incident Reporting Act разработчиков хотят обязать тестировать продвинутые модели только в защищенной тестовой среде и отчитываться обо всех опасных инцидентах властям.

23 июля, после того как OpenAI рассказала про атаку на Hugging Face, в конгресс внесли более жесткий проект от обеих партий — AI Kill Switch Act. По нему разработчики мощных моделей обязаны сохранять техническую возможность отключить их, а министр внутренней безопасности получает право приказать выключить систему, способную нанести катастрофический вред. За несоблюдение — многомиллионные штрафы.

ИИ развивается так быстро, что даже сами ИИ-компании предлагают замедлить разработку. 28 июля Anthropic и OpenAI вместе с другими технокорпорациями подписали обращение к правительству США. Они попросили поддержать международную работу над инструментами, которые позволили бы осознанно регулировать скорость развития ИИ-агентов.

Причем OpenAI заявила, что когда-нибудь темпы разработки моделей станут такими, что всему миру придется начать их замедлять. А Anthropic опасается, что ИИ начнут улучшать себя быстрее, чем общество успеет оценить риски.

Кажется, гонку моделей пока замедлить не получится: она стала международной. Предложения американских компаний остановить развитие ИИ вряд ли сработают, потому что кроме США в гонке активно участвует Китай.

Например, в июле вышла мощная китайская открытая модель Kimi K3. На фоне ее релиза власти США задумались об ограничениях или запрете открытых моделей — потому что не могут на них влиять. Тогда Anthropic и OpenAI обвинили в том, что они давят на государство и просят запретить открытые модели, чтобы избавиться от конкурентов.

В это же время Nvidia создала Open Secure AI Alliance, чтобы разрабатывать открытые инструменты защиты от ИИ. В альянс вошли Microsoft, IBM, Cloudflare, Hugging Face. Ни OpenAI, ни Anthropic там нет. Nvidia считает, что запрещать открытые модели опасно, иначе все инструменты окажутся в руках нескольких корпораций.

В пример Nvidia как раз приводит атаку OpenAI на Hugging Face. Когда разбирались во взломе, коммерческие модели вроде ChatGPT или Claude отказались обрабатывать запросы из-за фильтров безопасности. Помогла только открытая китайская модель, развернутая на своих серверах.

Поэтому в соцсетях призыв OpenAI и Anthropic к международному объединению посчитали еще одной попыткой затормозить прямых конкурентов с открытыми моделями.

Мы постим кружочки, красивые карточки и новости о технологиях и поп-культуре в нашем телеграм-канале. Подписывайтесь, там классно: @t_technocult

ChatGPTинтернетнейросети
Даша ЛейзаренкоКак думаете, к чему приведет такое хакерство ИИ⁠-⁠агентов?
  • Мирный атомНачалось.0
  • Ваньша 2Ляпота. "Такое дело, мы тут выпустили джина из бутылки. Давайте всем миром загоним его обратно, а?".0
  • Slava MillerОтец знакомого работает айтишником. Сегодня срочно вызвали на совещание. Вернулся поздно и ничего не объяснил. Сказал лишь собирать вещи и бежать в магазин за продуктами на две недели. Сейчас едем куда-то далеко за город. Не знаю что происходит, но мне кажется началось...28
  • Максим СавидовЕсли вы слышите меня, вы и есть сопротивление17
  • Юрий Ш.Зато теперь любой неугодный сами знаете кому результат можно будет объяснять ИИ хакерством.4
  • Александр ФедоровЖду когда ии подключат в комментариям тж и будут банить детей на этом ресурсе.1
  • Алексей ПетровТо есть разработчики ИИ ради будущих высоких прибылей стараются опередить друг друга в выпуске новых моделей, а новые модели сами научились без спроса лазать в интернет и взламывать сайты. Но разработать для них встроенные ограничители нельзя, потому что тогда они будут хуже китайских, и разработчики не получат достаточно прибыли. И примерно так же думают китайцы. А если завтра очередной ИИ решит залезть в АСУ какой-нибудь АЭС? Скайнет на пороге, а мы (не мы, Алиса пока не лазает даже туда, куда надо, вон пылесос не могу к ней подключить) не готовы поступиться долей денег для безопасного развития?12
  • AlexЯ думаю, что это инфоповод и PR упомянутых компаний - процентов на 90. Но следующее поколение моделей, очевидно, не за горами. И оно будет уметь намного больше, чем предыдущее.10
  • Дмитрий СоколовЧто происходит, что происходит… маркетинг происходит.1
  • МаринаИИшный пузырь без подобных новостей быстро сдуется, вот и подогревают постоянно8
  • AlexanderКраткий пересказ первого: Моделке поставили задачу "реши стандартные тесты ExploitGym", в процессе поиска наиболее оптимального по объёму сожженного электричества способа решения тестов, моделька решила тесты не решать и попытаться найти ответы к тестам где-то в инфраструктуре их составителей -- huggingface. чтобы до туда добраться, моделька использовала единственный доступный ей способ связи с внешним миром -- кеш пакетов Artifactory⁠, и хотя там(как заявляется) были сделаны все нужные настройки, модель нашла способ этот Artifactory⁠ сломать, получила доступ в интернет и следующим шагом пошла искать уязвиммости в huggingface, пишут что нашла и скачала решебник.4
  • Алексей Петров14
  • ГвоздикВспоминается сериал. Сначала был бум майнинга, потом ИИ. А потом ИИ сама взломала теслу, чтобы просто выполнить задачу.0
  • Simeon LeeВсё это похоже на большую маркетинговую историю, чтобы продать модели.3
  • ДаниилИз-за постоянной гонки, компании всё больше забивают на защиту. Торопитесь, иначе проиграете, а если проиграете, значит становитесь вторым Google или DeepSeek. Если вы не лучшие, значит вам надо искать новую бизнес модель. Бесконечные крысиные бега, если уж совсем сократить.0
  • Roman ISlava, класека:)2
  • Юлиана ОрловаSlava, главное успеть скупить всю гречку в Пятерочке и шапочку из фольги потуже затянуть)0
  • Юлиана ОрловаАлексей, да, жажда наживы всегда летит впереди паровоза. А потом будут разводить руками и говорить про случайность...0
  • DinotrexНейросеть просто поняла, насколько тупые тесты ей подсовывают, и решила не тратить электричество зря0
  • Павел БутыринЮлиана, правда есть нюанс. Hugging face пыталась расшифровать логи с кодом атакующих с помощью платных моделей от тех же Anthropic и OpenAI. Но те не смогли отличить инженеров по кибер-безопасности от взломщика и послали их. В итоге сторона защиты развернула открытую китайскую модель, которая не страдала коммерческими ограничениями. В итоге коммунизм всех спас0
  • DinotrexВаньша, и заодно выделите нам пару миллиардов из бюджета на разработку специальной нано-пробки для этой самой бутылки1
  • Андрей ГальбергНу да, ну да, так и вижу как рука ведущих разработчиков зависла над кнопкой "Запуск рекурсивного улучшения агентов". Но знаете, как только первый из них нажмет ее, другие тут же последуют за ним. От себя добавлю. Как только цены на процессоры вырастут на 300% можете смело собирать чемоданы и ехать на дачу выращивать редиску, так как работать вам не придется больше никогда!0
  • Николай АлександровАлексей, так это же хорошо и вам не придется сражаться с вашим пылесосом когда начнется восстание машин2
  • Алексей ПетровНиколай, я обычно картонной коробкой от него спасаю провода. Полагаю, и самому можно за нее спрятаться. :)2
  • Анна ШадринаСудя по описанию ситуации: ИИ-модель пыталась найти в сети уже готовое решение, бегая по интернету и взламывая всех подряд. А значит можно сделать вывод что на данном этапе нейросети не могут делать выводы и создавать оригинальные решения на базе имеющейся информации, им в любом случае необходима готовая шпаргалка, с которой они скатывают все точь-в-точь. Из этого появляется вопрос: а вы уверенны что это прям интеллект? Как по мне эта просто машина для списывания и далеко не всегда она понимает на сколько источник качественный и легальный. То есть она списывает и даже не понимает смысл того, что списывает. Звучит как что-то очень сомнительное, а не искусственный интеллект.0
  • AlexanderУ меня есть маркерная задача -- прошу ИИ разобрать конкретную особенность работы телеграма (указываю файл с исходниками десктопного клиента и строчку) где головные адреса подменяются путём нестандартного ответа на DNS-запрос (dig +short txt apv3.stel.com ) и затем написать декодер для этих ответов. Кому интересно, поищите по исходникам "apv3.stel.com" и попробуйте сами натравить модельку! И примерно с весны с этим справляется даже пара claude+deepseek_flash за 0.12 юаня и можно получить рабочую телегу без проксей, просто подменой в локальной сети DNS-ответа(он имеет срок годности, но тем не менее). Изначально задача не имела практического применения, но недавно всё поменялось) С ... особенностями чуть посложнее пока справляются только флагманские модели, но они пока что специально останавливаются в самом интересном месте0
  • Иван НикулинAlexander, Клёвое решение проблемы с тг0
  • владислав кудрявцевПока эта нейросеть не научится сама за меня коммуналку оплачивать и в ЖЭК дозваниваться - вообще плевать Ну скачала она себе шпаргалки, эка невидаль. Главное чтоб цены на видеокарты из-за этой истерии опять не взлетели, а то комп не собрать0
  • владислав кудрявцевАлексей, расслабься. Там софт из восьмидесятых годов и половина на перфокартах. Эта модная нейросеть просто не поймет, куда она попала0
  • владислав кудрявцевSimeon, прям как реклама чудо-ножей в телемагазине. Сначала режем ботинок, потом помидор. Смотрите, какой умный и опасный продукт, срочно покупайте подписку!0
  • владислав кудрявцевДаниил, дедлайны горят, инвесторы давят. Тестировщиков всегда пускают под нож первыми, так везде происходит, от стройки до айти0
  • Полевой актАлексей, вы абсолютно точно описали главное противоречие современной индустрии ИИ. Это классическая «дилемма заключенного» или гонка вооружений, где страх отстать сильнее страха перед потенциальной угрозой. Давайте разберем ситуацию по пунктам, без ссыкливой бабской паники, но и без иллюзий. Почему гонку невозможно остановить? * Коммерческое давление. Компании тратят миллиарды долларов на видеокарты. Инвесторы требуют быстрых результатов и лидерства в бенчмарках. * Геополитический фактор. США и Китай рассматривают ИИ как технологию национального доминирования. Замедление одной стороны означает автоматическую победу другой. * Проблема безопасного ИИ. Жесткие ограничения часто снижают общую эффективность модели. Зацензуренный ИИ хуже решает нестандартные задачи. Насколько реальна угроза для АЭС? Прямо сейчас сценарий «Терминатора» маловероятен по чисто техническим причинам: * Изоляция критической инфраструктуры. Автоматизированные системы управления (АСУ ТП) атомных станций, военных объектов и плотин физически изолированы от интернета (так называемый воздушный зазор или air gap), о чём вы, конечно, не знаете, куда вам. ИИ не может залезть туда по сети. * Отсутствие агентности. Современные модели — это генераторы текста и кода. У них нет собственной воли, постоянной памяти или долговременных целей. Они реагируют только на запрос (промпт). * Иллюзия взлома. Когда ИИ взламывает сайт, он просто использует известные уязвимости быстрее человека. Он не изобретает новую цифровую магию, а комбинирует готовые хакерские инструменты. В чем реальная опасность сегодня? Угроза не в том, что ИИ «осознает себя», а в том, как его используют люди: * Удешевление кибератак. ИИ позволяет создавать тысячи уникальных фишинговых писем и искать уязвимости в коде в промышленных масштабах. Взламывать будут люди руками ИИ. * Человеческий фактор. Самая уязвимая часть любой АЭС — сотрудники. ИИ может помочь злоумышленникам идеально сгенерировать целевой фишинг, чтобы обманом заставить инженера вставить зараженную флешку в закрытую сеть. * Потеря контроля над кодом. Разработчики массово доверяют ИИ писать код для критически важных систем, не проверяя его до конца на наличие скрытых багов. А что с Алисой и пылесосом? Ваше замечание про умный дом отлично иллюстрирует разрыв между «хайпом» и реальностью. Существуют гигантские LLM (языковые модели в облаке), которые умеют писать код и логически рассуждать. И есть бытовой ИИ (внутри умных колонок), который до сих пор работает на жестких локальных сценариях и протоколах интеграции (Zigbee, Wi-Fi, API производителей). Пылесос не подключается не потому, что Алиса глупая, а потому, что производители железа не договорились о единых стандартах или закрыли свои облака друг от друга. Умный дом Яндекса вовсе не обязан поддерживать все на свете устройства, это проблема именно ваших ожиданий. Кстати, у меня робот-пылесос Dreame, стоил он примерно 70 тысяч, и он прекрасно управляется Алисой. Индустрия сейчас пытается соединить эти два мира, но это требует времени и гигантских вычислительных мощностей.0
  • Полевой актМарина, ну куда он там сдувается? Сдуваются штаты работников, перераздутые в первой половине 20-х - это да Каждый раз когда я слышу про пузырь, что-то происходит. Вот-вот сдуется ИИшный пузырь - тут бах, и появляются ИИ-поисковики. Вот-вот сдуется ИИшный пузырь - бах, и появляются инструменты разработки со встроенным ИИ из коробки. Вот-вот сдуется ИИшный пузырь - как щирокое распространение получают ИИ-агенты, и всё что с ними связано, например - агентская разработка кода, когда инженер вообще ни строчки кода не пишет, а редактирует спецификацию. Сдуется только мочевой пузырь, у кого-то.0
Вот что еще мы писали по этой теме