На конференции Yunqi 22 сентября Alibaba обозначила планку для следующих Qwen: серии Qwen4.5 и Qwen5 должны двигаться к 5–10 трлн параметров. Reuters подтвердил этот диапазон. Само число пока мало что говорит креаторам. Интереснее, как Alibaba собирается оплачивать такую гонку: компания наращивает модели и одновременно перестраивает их, чтобы удешевить инференс.
Есть и более прикладные сигналы. Руководитель мультимодального направления Чжэн Бо обещает показать новое поколение видеогенератора в ноябре. Анонсированная Qwen-Image-3.1 нацелена на дизайн и e-commerce. Пока это планы со сцены. Независимых сравнений нет, но направление уже понятно.
Qwen4.5 и Qwen5: зачем Alibaba модели на 5–10 трлн параметров
Руководитель Qwen Лю Дайхэн представил на Yunqi дорожную карту: за Qwen4 должны последовать Qwen4.5 и Qwen5 с масштабом 5–10 трлн параметров. Это ориентир, а не обещание выпустить каждую модель с точно заданным числом. Alibaba обозначила масштаб, к которому хочет приблизиться.
Для сравнения: Leiphone пишет, что у Qwen2.5 было 72 млрд параметров, а у Qwen3.8 — 2,4 трлн. Рост примерно в 33 раза. В том же материале Лю Дайхэн описывает позицию Alibaba так: «Предел возможностей базовой модели по-прежнему зависит от вычислительных мощностей, данных и масштаба модели». Компания намерена наращивать вычисления на этапе предобучения и продолжать следовать Scaling Law.
Большая модель сама по себе не гарантирует, что каждый запрос станет лучше или дешевле. Обучение и запуск тоже обходятся дорого. Поэтому мне интереснее другая часть заявления: Qwen3.8-Flash использует разреженное и линейное внимание, а также внешнюю память. По данным выступления, на один инференс активируется 6 млрд параметров. Обучение обошлось в девять раз дешевле, входной миллион токенов подешевел в четыре раза, а обработка длинного контекста ускорилась в 8,6 раза.
Это данные Alibaba, а не результаты независимого теста на одинаковых задачах. Вектор, впрочем, понятен: общий размер модели растёт, а для одного запроса компания старается задействовать меньше вычислений. Если эти архитектурные приёмы сработают в продуктовых моделях, креаторы смогут получать более сильные возможности без такого же роста стоимости каждого вызова API. Конкретных тарифов в юанях материал не приводит.
Как модели уже участвуют в создании следующего поколения
Второй сигнал с Yunqi: модели помогают инженерам строить новые модели и инфраструктуру. Это направление называют RSI, рекурсивным самоулучшением. AI помогает проектировать эксперименты, писать и оптимизировать код, а люди и инструменты проверяют результаты.
Leiphone описывает эксперимент с Qwen3.8-Max. Модель получила спецификацию блока сетевого соединения на кристалле и без готового кода прошла этапы проектирования и проверки с помощью EDA-инструментов. По данным издания, за более чем 60 часов физическую площадь удалось сократить на 42%, а расчётную мощность — на 59,5%. В другом эксперименте модель адаптировала фреймворк SGLang под новый GPU T-Head. Работа заняла 56 часов, а пропускная способность в сценарии обычного диалога выросла на 96%.
Qwen пока не проектирует новые модели или чипы без контроля. Речь об отдельных инженерных задачах, результаты которых приводит Leiphone. Такая помощь может ускорить разработку: меньше ручной возни с тестами и адаптацией — быстрее следующий цикл. Источник также сообщает, что Qwen3.8-Max больше месяца автономно проводил эксперименты и завершил 33 результативных цикла. Независимой проверки этих цифр в материале нет.
В статье есть и сравнения с другими лабораториями. По описанию экспериментов Anthropic, Claude ускорил код для обучения небольшой модели сначала в три раза, затем в 52 раза. Люди-исследователи за полдня обычно добивались примерно четырёхкратного ускорения. OpenAI, как сообщает автор, использует GPT-Red для поиска уязвимостей других моделей, а затем применяет найденные атаки для обучения следующих версий GPT. Темп разработки может оказаться не менее важным, чем размер следующей модели.
Что меняется для создателей видео, изображений и звука
Самый близкий к рабочему процессу анонс — новое поколение видеогенератора. Чжэн Бо обещает представить его в ноябре и называет будущий формат Agent Video. Пользователь задаёт замысел, а система разбирает сюжет, планирует сцены, персонажей и окружение, затем собирает видео.
Чжэн Бо описал направления развития коротко: «длиннее, управляемее, цельнее и умнее».
Пока это описание концепции и срок показа. Готовый рекламный ролик без ручного монтажа никто не обещал. Я бы проверял генератор на конкретных этапах: удерживает ли он персонажа в нескольких сценах, можно ли управлять планами и движением, насколько просто заменить неудачный эпизод и совпадают ли звук с изображением. Для креатора это полезнее эффектного демо.
Для изображений представили Qwen-Image-3.1. Alibaba заявляет, что модель подходит для коммерческого дизайна, e-commerce и точного редактирования. В описании анонса компания также обещает сократить часы визуальной работы до секунд. Пока это заявление, а не измеренная экономия на реальном проекте. Доступность и цены в юанях не указаны; сторонняя карточка модели описывает Qwen-Image 3.1 как будущий релиз.
Ещё несколько анонсов стоит держать в поле зрения. Qwen-Audio-3.1 обновляет распознавание речи, синтез и общение в реальном времени. Alibaba сообщает, что модель уже работает в её продуктах и устройствах. Музыкальную модель HappyShrimp 1.1 заявили для более чем ста музыкальных стилей и более десяти языков. HappyOyster 2.0 Preview — модель мира, которая должна точнее моделировать движение и столкновения объектов.
Кстати, часть мультимодальных задач можно пробовать уже сейчас. Alibaba Cloud объявила о доступности Qwen3.8-Omni-Flash на платформе Qianwen. Официальное описание обещает контекст до миллиона токенов и работу с текстом, изображениями, аудио и видео. Для обработки аудио- и аудиовизуального ввода компания заявляет снижение цены более чем на 98% и 93% соответственно. Это сравнение с предыдущим поколением по данным Alibaba, а не конкретная цена за минуту в российских рублях.
Как креатору проверить Qwen уже сейчас
Начать можно без ожидания ноябрьского видеогенератора. Возьмите короткий исходник со звуком и поручите Qwen3.8-Omni-Flash три задачи по очереди: расшифровать речь, кратко пересказать ролик, разобрать сцены для будущего монтажа. Сверьте ответы с исходником вручную. Проверьте имена и порядок событий, а ещё точность таймкодов, если модель их выдаёт.
Для будущего Agent Video подготовьте один тестовый бриф: короткий сюжет, список сцен, описание героя и визуальные ограничения. Когда модель выйдет, по нему можно проверить связность, управляемость и качество отдельных дублей. Для Qwen-Image 3.1 подойдёт предметный кадр для карточки товара с последующей правкой фона или объекта. Сравнивать стоит время на весь проход, включая исправления, а не скорость первой генерации.
Напоминаю: на Yunqi прозвучали планы, результаты экспериментов и коммерческие обещания. Это разные уровни подтверждения. Сейчас доступны отдельные инструменты вроде Qwen3.8-Omni-Flash. Видеогенератор обещан на ноябрь, а Qwen-Image-3.1 пока только анонсировали. Прайсов в юанях для новых моделей нет, поэтому стоимость рабочего процесса пока не посчитать.
Короче, мне интереснее связка масштаба и более дешёвого запуска. Alibaba ещё хочет встроить модели в инженерную работу. Если эти инструменты дойдут до креаторов, проверять будем не число параметров, а количество ручных правок между идеей и готовым роликом.
Примеры моих AI-видео и визуальных тестов
Источники
Reuters — Alibaba планирует модель на 5–10 трлн параметров
Alibaba Cloud — Qwen3.8-Omni-Flash
Qwen-Image 3.1 Preview — карточка модели
Источникleiphone.com
