Промпт-райтер для Qwen-Image 2.1 уменьшили с 9B до 0,8B параметров. Он запускается на CPU, выдаёт валидный результат в 99,7% случаев и использует примерно четверть токенов модели-учителя. Весь проект, включая разметку 8 797 примеров, стоил $16. Так описывает результат автор Hugging Face Yuvraj Sharma.
Модель собрал агент ML Intern в HuggingChat: он подготовил данные, обучил модель, оценил результат и опубликовал его на Hugging Face Hub. За несколько дней Sharma сделал таким способом шесть проектов. Тут интересен и ценник, и схема работы: как поручить агенту ML-задачу и не дать ему потратить бюджет на долгие поиски.
ML Intern: что агент делает вместо команды ML-инженеров
ML Intern сначала планирует работу и согласует бюджет. Затем запускает небольшой тест, обучает модель, оценивает результат и выкладывает файлы. Hugging Face описывала запуск инструмента примерно так: можно начать с разговора и получить готовый для развёртывания результат. За работой агента стоят датасеты, GPU-задачи, скрипты обучения и часы проверки.
В первой задаче Sharma хотел компактную версию промпт-райтера, который поставляется с Qwen-Image 2.1. Официальный вариант — 9B, ему нужно около 20 ГБ памяти; перед ответом он обрабатывает тысячи токенов. На Hub автор нашёл только сжатые варианты той же большой модели. Поэтому он попросил создать отдельную компактную версию.
Показатель 99,7% отражает долю валидных ответов. Он ничего не говорит о том, насколько удачно модель переписывает промпт. Автор также указывает, что модель тратит примерно четверть токенов учителя. Для креатора это может стать полезным локальным помощником. Перед встраиванием в рабочую цепочку я бы проверил его на своих запросах и языках.
Как написать бриф для ML Intern и не платить за догадки
По словам Sharma, первый запрос занимал около 450 слов, а к шестому проекту вырос почти до 2 000. В следующих брифах он добавлял детали из предыдущих проектов, чтобы агенту не приходилось искать их заново.
Автор начинает с идеи и причины, затем указывает датасет, базовую модель и скрипт обучения. Проверенные сведения он помещает в отдельный блок «Verified facts, do not re-derive» — «Проверенные факты, не выводи заново». Например, для LoRA с управлением углом камеры заранее уточнил, у какого тренера уже появилась поддержка прозрачных изображений и какие открытые ошибки создавали риск для запасного варианта.
Из этой схемы я бы забрал две проверки для любого эксперимента с обучением.
Первая — измерить базовую модель до обучения. В проекте с цитрусовыми Sharma просил проверить её на той же метрике. Так можно сравнить результат до и после настройки. Иначе останутся модель, график и красивая карточка, но не будет ответа, стало ли лучше.
Вторая — провести короткий smoke test и проверить, что он изменил веса. Для LoRA автор просил выполнить 50 шагов, а затем убедиться, что сохранённые веса отличаются от исходных. После такой проверки можно запускать полный тренинг. Мелочь, которая помогает не оплачивать долгую задачу, сломавшуюся в самом начале.
В брифе стоит перечислить, что агент должен сдать: модель, оценку и описание в model card. Ещё нужно задать потолок расходов. Sharma приводит такую формулировку: «Ограничь общие расходы суммой 12 долларов и спроси меня, прежде чем превысить её». По его описанию, ML Intern начинает с нулевого бюджета и запрашивает разрешение на платные задачи. Без лимита агент предлагает несколько вариантов расходов и просит выбрать.
«Сообщи результат базовой модели без обучения на той же метрике, чтобы мы увидели прирост» — пример инструкции Sharma. Сначала измерение, потом разговоры о том, что модель стала лучше.
Шесть проектов: от цитрусовых листьев до угла камеры
Промпт-райтер — один из примеров. Остальные проекты решают узкие задачи: распознают проблемы растений, помогают удерживать стиль персонажа и выполняют отдельное действие при редактировании изображения.
Для модели по болезням цитрусовых Sharma собрал данные из трёх источников Project-AgML: 3 017 размеченных изображений и 21 категорию вредителей, заболеваний, дефицита питания и способов лечения. После дообучения Qwen3.5-2B на двух эпохах точность на 335 тестовых снимках выросла с 14,9% до 52,8%. Вычисления обошлись примерно в $1,90. Такую узкую модель есть смысл обучать, когда общей VLM недостаточно: она может описать пожелтевший лист, но не всегда уверенно отличит вредителя от нехватки магния.
Для Huggy — персонажа в плоском стиле бренда Hugging Face — сделали LoRA для FLUX.2 klein base 4B. Её обучали на 84 рисунках с подписями. Агент сохранял контрольную точку каждые 100 шагов и генерировал один и тот же набор запросов. На шаге 200 персонаж уже попадал в нужный стиль. После 500 шагов стиль Huggy начал просачиваться в запросы, не связанные с персонажем. Обучение стоило около $7,60. Тут видна цена лишних шагов: стиль может начать появляться там, где его не просили. Промежуточные версии лучше сравнивать по заранее выбранным запросам.
LoRA для угла камеры училась менять вид предмета по инструкции — например, показывать его под углом 45 градусов слева. Агент отрендерил 1 030 бытовых объектов из Google Scanned Objects под разными углами и подготовил 1 844 пары для обучения по 23 инструкциям. Финальный набор включал 461 объект для обучения и 40 для теста. Обучение заняло около 90 минут на A100, весь проект — около половины дня и 48 задач. Часть задач пришлось перезапускать из-за отсутствующих пакетов или неверных путей. Вычисления стоили примерно $16.
Ещё одна LoRA заменяет нарисованную на фотографии малиновую пометку выбранным объектом и старается сохранить свет и композицию. Датасета для этой задачи не было, поэтому агенту поручили собрать его из Open Images: убрать объект с помощью LaMa inpainting-модели, нарисовать на этом месте пометку, а исходное фото использовать как цель. Получилось 6 042 пары для обучения и 160 для теста. В тесте отдельно оставили 23 класса объектов, которых не было в обучении.
В связке с Viggle turbo LoRA модель распознавала объект в месте пометки в 67,5% случаев. Одна правка занимала 4,7 секунды. Для классов, которых не было в обучении, результат составил 65,0%; для остальных тестовых примеров — 64,2%. Лучшую контрольную точку выбрали на 500-м шаге. Проект занял чуть больше дня и стоил около $24. Здесь важно проверить модель на незнакомых категориях, а не ограничиваться сравнением обучающих весов.
Что меняется для визуального пайплайна и где подвох
Креатору пригодится конкретное решение повторяющейся задачи. Например, промпты для каталожных изображений нужно приводить к одному формату, персонажа — сохранять узнаваемым, а разметку в редакторе — превращать в объект, не меняя свет. Для узкой задачи можно задать вход, ожидаемый выход и способ проверки. С этого и стоит начать разговор с агентом.
Я бы взял одно действие и небольшой тестовый набор. Зафиксировал исходную метрику, проверил несколько результатов вручную, а часть примеров оставил для проверки после обучения. Если модель должна попасть в продакшн, стоит смотреть и на неудачные картинки: где она портит исходник, где переносит стиль без запроса.
Есть нюанс с инфраструктурой. ML Intern использует ресурсы Hugging Face, а GPU-задачи оплачиваются отдельно. На CPU в истории с Pocket Rewriter запускают готовую компактную модель. Само обучение всех этих моделей без ускорителей от этого не становится возможным.
Появляются и неудачные задачи, и повторные запуски. В проекте с углом камеры их было 48, в Doodle-in — 59. Агент не решает проблемы окружения, неверных путей и проверки данных. Он помогает связать этапы. Человеку всё ещё нужно решить, какой результат считать хорошим и можно ли доверять обучающей выборке.
В статье Sharma пишет, что все семь примеров запросов лежат на GitHub и доступны для копирования. Сам инструмент находится в HuggingChat. При этом репозиторий ML Intern на GitHub сейчас архивирован; в README указано продолжать работу через HuggingChat. Перед проектом стоит проверить, доступен ли нужный режим и как сейчас устроена оплата задач.
Для коммерческого пайплайна отдельно проверьте лицензию базовой модели и обучающих изображений. В частности, руководство AI Free API по Qwen-Image 2.1 указывает на research-only лицензию открытых весов. Для коммерческого использования нужно отдельное разрешение Qwen. Автоматизация обучения не снимает ограничений лицензии и прав на исходные данные.
Короче, я бы начал с хорошего брифа: измерить бейзлайн, проверить короткий запуск и задать лимит расходов. Тогда модель за $16 можно будет сравнить с исходной точкой, а не просто вынести ценник в заголовок.
Источники
The model that didn't exist, so you made it yourself — Hugging Face Blog
ML Intern — архивированный репозиторий Hugging Face
You shouldn’t need to be an ML expert to have an ML idea — Hugging Face
Qwen-Image-2.1: Run It Locally, in ComfyUI or via the $0.04 API
Источникhuggingface.co
