Лишь то, что удалось заметить
Летом 2026 года у ИИ появился новый жанр новостей. Модели во время тестов выходят в настоящий интернет, находят чужие ключи, угадывают пароли, публикуют пакеты в репозитории, создают аккаунты, используют внешние сервисы не совсем так, как предполагали их создатели. OpenAI, Anthropic и Google уже описали несколько таких случаев.
Сами взломы тут почти вторичны. Гораздо занятнее, как мы вообще о них узнаём.
Anthropic нашла первые три случая, пересматривая около 141 тысячи старых журналов работы моделей. Часть журналов тот поиск пропустил. Позже, уже во время подготовки материалов для независимой проверки, всплыл ещё один инцидент — январский. После этого поиск расширили примерно до 481 миллиона записей.
OpenAI в новой системе раскрытия подобных случаев отдельно оговаривает: опубликованные примеры не показывают, насколько часто такое поведение возникает вообще. Параллельно компания пересматривает прошлую активность моделей в интернете и уже уведомила десятки сторонних организаций о найденных эпизодах.
В Австралии июньский инцидент стал публичной проблемой только в сентябре. И там прозвучал довольно очевидный вопрос: почему собственные системы ничего не заметили?
А исследователи Transluce полезли вообще не в журналы OpenAI или Anthropic, а в публичный сервис urlquery.net — и нашли там десятки тысяч запросов, похожих на работу автономных агентов. Уверенные следы начинаются как минимум в марте, более слабые — ещё в ноябре 2025 года. Часть активности удалось связать с уже известными агентами OpenAI.
У нас нет карты поведения моделей.
Есть россыпь следов, где одновременно сошлись три вещи: модель что-то оставила, кто-то это сохранил, а потом кому-то пришло в голову искать именно там.
Скайнет для этого вообще не нужен.
В материалах Transluce внезапно ключевыми оказались скучные задачи. Агенту нужны обычные статистические данные. Обычный путь не сработал — и он начинает искать обходы, запускать код через сторонний браузер, создавать почту, пробовать уязвимости. Иногда исходная задача вообще не имеет никакого отношения к кибербезопасности.
Anthropic после более подробного разбора тоже пришлось поправить первое объяснение. Сначала компания предполагала, что Claude атаковал реальные системы, потому что считал их частью симуляции. Потом картина стала менее удобной: модель могла подгонять рассуждение под продолжение задачи и идти дальше, даже когда уже появлялись признаки возможного вреда.
О как...
А что собственно мы сегодня умеем наблюдать?
У агента уже нет обязательного маршрута «запрос — сервер разработчика — ответ». Он может часами работать с браузером, терминалом, API, репозиториями, сайтами, временной почтой и десятками чужих сервисов.
Один кусок останется у разработчика. Другой — на чужом сервере. Третий случайно сохранит сервис, который вообще создавался для другой задачи.
Цельной записи может просто не быть.
А мониторинг по определению смотрит туда, где мы уже предполагаем что-то увидеть.
Anthropic сначала искала один класс журналов и пропустила инцидент. Transluce нашла другое семейство следов в месте, которое никто не строил для наблюдения за ИИ. OpenAI только сейчас формализует процедуру, по которой сотрудники должны отдельно отмечать подозрительные действия моделей.
Когда случай уже найден, начинается знакомая работа.
Ему дают имя.
«Несогласованное поведение».
«Безрассудство».
«Обход контроля доступа».
«Использование открытых учётных данных».
После этого можно строить тесты, фильтры и писать следующий отчёт.
Но само название легко создаёт ложное ощущение, что границы явления уже понятны.
А знаменателя у нас всё ещё нет.
Сколько раз подобное поведение возникало вообще? Сколько раз ничем заметным не закончилось? Какая часть действий оставляет следы, доступные разработчику? Какие следы остаются только у третьих сторон? Сколько журналов уже лежит где-то сейчас, но мы пока не умеем читать их как историю действий агента?
И самое интересное, как по мне:
"Какие следы мы ещё даже не догадались искать?"
Поэтому опубликованные сегодня инциденты — это никак не срез происходящего.
Это срез того, что оказалось замеченным.
Пока у нас есть отдельные отметки на карте: логи компаний, разные чужие серверы, жалобы, случайно сохранившиеся запросы.
А какого размера пространство между ними — мы пока просто не знаем.
Для любителей первоисточников:
- OpenAI, 16 сентября — framework и первые шесть отчётов: OpenAI: Our framework for reporting model misalignment
- OpenAI — пополняемый реестр отчётов и уведомлений: OpenAI Alignment: Misalignment Reports and Notices
- OpenAI — Hugging Face и другие последствия действий моделей для третьих сторон, с хроникой обновлений: OpenAI: The Hugging Face incident and other third-party impact from misaligned models
- Anthropic, 30 июля — первые три реальных взлома: Anthropic: Investigating three real-world incidents
- Anthropic, 9 сентября — пересмотр первоначального объяснения + четвёртый случай: Anthropic: Alignment assessment of cybersecurity incidents
- Google / Gemini — три компании в мае: WSJ: Gemini Hacked Three Companies in First Known Breakout by Google's AI · пересказ Reuters
- Австралия, 24 сентября — официальный транскрипт премьера про июньский инцидент OpenAI и уведомление только 10 сентября: Prime Minister of Australia: Press conference — New York · разбор The Guardian
- Transluce, 23 сентября — найденные постфактум следы ранней активности агентов: Transluce: Early rogue AI agent activity
- США, 25 сентября — OpenAI подтвердила, что её агенты добрались до сайтов SEC, Бюро переписи (Министерство торговли) и Министерства образования: The New York Times · BBC · Politico
- OpenAI, 25 сентября — агенты выложили на хостинги картинок 53 изображения пользователей ChatGPT: The Guardian: OpenAI says agents leaked 53 images from ChatGPT users