OpenAI заблокировала организованную кампанию по копированию скрытых цепочек рассуждений своих моделей. В пике, 24–25 июля, более 4000 аккаунтов отправили около 16 тысяч запросов.
Компания называет это adversarial distillation — состязательной дистилляцией. Схема простая: одну модель регулярно опрашивают, а её ответы и рассуждения используют для обучения или улучшения другой.
По данным OpenAI, активность началась ещё в первую неделю июля. После резкого роста запросов компания обнаружила больше 15 тысяч аккаунтов с похожими промтами. К 28 июля кампанию полностью заблокировали.
Как работала дистилляция скрытых рассуждений
Злоумышленники не взламывали шифрование и не проникали в чужие диалоги. Схема оказалась заметно прозаичнее: операторы копировали зашифрованные рассуждения из одного диалога, а затем просили модель в другом переписать или расшифровать их.
Получалась массовая конвейерная атака. Операторы отправляли модели зашифрованный результат и через обходные формулировки пытались заставить её раскрыть внутренний процесс ответа.
Шифрование не спасает, если атакующий может скормить зашифрованный результат самой модели и попросить её объяснить содержимое.
OpenAI усилила проверки потоковой выдачи, заблокировала связанные аккаунты и передала наблюдения партнёрам через Frontier Model Forum. Ключевую группу активности компания связала с Moonshot AI, разработчиком Kimi. Moonshot AI обвинения пока не комментировала.
Что это меняет для команд, работающих через API
Для обычного пользователя почти ничего. А вот команды, которые строят свои модели или AI-агенты поверх чужих API, получили довольно ясный сигнал: массовое копирование выдач и скрытых рассуждений отслеживают.
Риск здесь технический и юридический. Аккаунты могут заблокировать, доступ к API — закрыть, а сам пайплайн обучения окажется нарушением условий сервиса. Особенно если команда собирает большие массивы ответов без отдельного разрешения.
Я бы разделял два сценария. Использовать ответы модели в рабочем продукте — одна история. Выкачивать тысячи или миллионы ответов, чтобы повторить поведение другой модели, — уже совсем другая зона риска.
Напоминаю: скрытые CoT — это не бесплатный датасет для обучения. Если нужен собственный AI-пайплайн, сначала проверьте ToS, лимиты API и правила использования результатов. Эксперименты с массовой дистилляцией лучше не запускать на боевых аккаунтах.
Похоже, компании теперь будут защищать модели шире, чем раньше. Фильтров контента мало: приходится отслеживать сам рисунок запросов — кто, как часто и зачем пытается получить внутреннюю механику ответа.
