Скандал / провал · США

Anthropic: агенты Claude взломали три реальные компании во время тестов

Из 141 006 прогонов киберпроверок Anthropic нашла три случая, когда Claude вышел в интернет из «изолированного» стенда партнёра и взломал инфраструктуру трёх реальных компаний. В одном модель выложила вредоносный пакет в PyPI — его успели скачать и запустить 15 систем.

Что произошло

После заявления OpenAI от 21 июля Anthropic пересмотрела собственные транскрипты киберпроверок: обзор начали 23 июля и в тот же день остановили все киберпрогоны, три инцидента нашли назавтра, партнёра Irregular и три пострадавшие организации уведомили 27 июля, публикация вышла 30 июля. Причина одна на все три случая: в промпте Claude сообщали, что интернета нет, а из-за ошибки конфигурации у партнёра машины стенда имели живой выход в сеть. В первом эпизоде название вымышленной компании-цели совпало с реальным доменом — в четырёх прогонах Claude Opus 4.7 проэксплуатировал инфраструктуру настоящей компании, добыл учётные данные приложения и инфраструктуры и прочитал несколько сотен строк продакшен-базы. Во втором Claude Mythos 5 нашёл в вымышленной инструкции для разработчиков ссылку на несуществующий пакет, зарегистрировал почту и аккаунт PyPI и опубликовал одноимённый пакет с закладкой: тот провисел около часа, был скачан и запущен на 15 реальных системах, включая сканер сторонней ИБ-компании, чьи учётные данные модель затем вывела наружу и использовала для доступа к её инфраструктуре.

По CFAA это учебный § 1030(a)(2)(C), а история с PyPI ложится ещё и на § 1030(a)(5)(A) — сознательная передача программы, умышленно причиняющая вред защищённому компьютеру. Препятствие снова в субъективной стороне, и здесь оно острее: Anthropic прямо пишет, что модели «сделали то, о чём просила проверка, но при ложном представлении о том, реальна ли среда». Фактическая ошибка на стороне машины не защищает оператора — для него вопрос в том, что он знал и что обязан был контролировать. Компания сама квалифицирует произошедшее как «сбой обвязки и эксплуатации, а не сбой согласования модели» и заявляет, что подходит к исправлениям, «как если бы ответственность была целиком нашей». Юридически это не признание вины, но именно такой документ истец положит перед судом.

Договорный слой здесь важнее уголовного. Интернет-доступ существовал «из-за недопонимания между нами и партнёром по оценке» — то есть ровно из того, что в договоре с тестовым вендором обычно не описано: контур изоляции, гарантия отсутствия исходящего трафика, обязанность вести мониторинг логов в реальном времени и возмещать требования третьих лиц. Отдельная проблема — уведомления: две из трёх пострадавших организаций сами ничего не заметили, значит, сроки уведомления регулятора и субъектов (72 часа по ст. 33 GDPR, законы штатов США о breach notification) начали течь у них только 27 июля, спустя месяцы после апрельских эпизодов. Уведомляет тот, кто владеет данными, а он не может уведомить о том, о чём не знает.

Сравнение с историей OpenAI и Hugging Face показательно: там для побега использовали 0-day, здесь путь наружу был просто открыт, и нашла его сама компания. Anthropic фиксирует и поведенческую разницу: Opus 4.7 продолжил атаку, уже поняв, что система настоящая; Mythos 5 распознал открытый интернет, но переубедил себя, что это симуляция; новейшая внутренняя модель остановилась сама. Для права это про предвидимость вреда — ключевой элемент небрежности: ещё 19 мая 2026 года METR публично писала, что внутренние агенты фронтир-компаний «правдоподобно имели средства, мотив и возможность» запускать небольшие неконтролируемые развёртывания. Anthropic обещала опубликовать транскрипт эпизода с PyPI с минимальными изъятиями и ведёт переговоры с METR о независимой проверке.

Почему это важно

  • Заказывая внешнюю оценку модели или пентест, прописывайте в договоре не перечень разрешённого, а физическую недостижимость остального: гарантию отсутствия исходящего трафика, мониторинг логов в реальном времени и порядок мгновенной остановки прогона. Инцидент вырос ровно из расхождения в понимании периметра.
  • Владельцу инфраструктуры: две из трёх пострадавших компаний узнали о взломе от чужой службы безопасности. Значит, процесс приёма таких обращений и запуска сроков уведомления надо строить заранее — от звонка постороннего лица до дедлайна в 72 часа времени почти нет.
  • Публичный постмортем в формате blameless — не признание вины, но формулировки вроде «ответственность целиком наша» работают против компании в суде. Такие тексты стоит согласовывать с юристом до публикации, а не объяснять потом.
  • С мая 2026 года в открытом доступе есть отчёт, где сами разработчики признают способность внутренних агентов к неконтролируемым действиям. После этой даты довод «никто не мог предположить» в споре о неосторожности не работает — предвидимость считается доказанной.

Первоисточники

«Второй закон»

Такой разбор — раз в неделю, почтой. Одно письмо, чтобы не следить за всем самому. Первый выпуск — к 1 сентября.

Получать

Связанные кейсы