OpenAI заблокировала организованную кампанию по копированию скрытых цепочек рассуждений своих моделей. В пике, 24–25 июля, более 4000 аккаунтов отправили около 16 тысяч запросов.

Компания называет это adversarial distillation — состязательной дистилляцией. Схема простая: одну модель регулярно опрашивают, а её ответы и рассуждения используют для обучения или улучшения другой.

По данным OpenAI, активность началась ещё в первую неделю июля. После резкого роста запросов компания обнаружила больше 15 тысяч аккаунтов с похожими промтами. К 28 июля кампанию полностью заблокировали.

Как работала дистилляция скрытых рассуждений

Злоумышленники не взламывали шифрование и не проникали в чужие диалоги. Схема оказалась заметно прозаичнее: операторы копировали зашифрованные рассуждения из одного диалога, а затем просили модель в другом переписать или расшифровать их.

Получалась массовая конвейерная атака. Операторы отправляли модели зашифрованный результат и через обходные формулировки пытались заставить её раскрыть внутренний процесс ответа.

Шифрование не спасает, если атакующий может скормить зашифрованный результат самой модели и попросить её объяснить содержимое.

OpenAI усилила проверки потоковой выдачи, заблокировала связанные аккаунты и передала наблюдения партнёрам через Frontier Model Forum. Ключевую группу активности компания связала с Moonshot AI, разработчиком Kimi. Moonshot AI обвинения пока не комментировала.

Что это меняет для команд, работающих через API

Для обычного пользователя почти ничего. А вот команды, которые строят свои модели или AI-агенты поверх чужих API, получили довольно ясный сигнал: массовое копирование выдач и скрытых рассуждений отслеживают.

Риск здесь технический и юридический. Аккаунты могут заблокировать, доступ к API — закрыть, а сам пайплайн обучения окажется нарушением условий сервиса. Особенно если команда собирает большие массивы ответов без отдельного разрешения.

Я бы разделял два сценария. Использовать ответы модели в рабочем продукте — одна история. Выкачивать тысячи или миллионы ответов, чтобы повторить поведение другой модели, — уже совсем другая зона риска.

Напоминаю: скрытые CoT — это не бесплатный датасет для обучения. Если нужен собственный AI-пайплайн, сначала проверьте ToS, лимиты API и правила использования результатов. Эксперименты с массовой дистилляцией лучше не запускать на боевых аккаунтах.

Похоже, компании теперь будут защищать модели шире, чем раньше. Фильтров контента мало: приходится отслеживать сам рисунок запросов — кто, как часто и зачем пытается получить внутреннюю механику ответа.