В свежем дайджесте AI/ML за 14–20 сентября собрали около 17 релизов. Qwen3.8-Omni-Flash, Gemini 3.8 Live, Vidu S2, ElevenLabs Music v2.5, новые видеомодели и даже Siri, которая вроде бы должна научиться действовать за пользователя.
Звучит мощно. Но есть нюанс: фактчекер нашёл всего один источник — сам телеграм-дайджест. Официальных подтверждений и рабочих демо в досье нет. Поэтому ниже — карта заявлений, за которыми стоит следить, а не список готовых инструментов для продакшна.
Дайджест AI/ML: агенты, голос и контекст
Alibaba якобы выпустила Qwen3.8-Omni-Flash для AI-агентов. Модель должна работать с текстом, аудио и видео. В материале указаны $0.15 за миллион входных токенов и $0.47 за выходные. Аудио на входе, по этим данным, подешевело на 98% относительно Qwen3.5-Omni-Plus. Весов нет.
Google приписывают запуск Gemini 3.8 Live и Live Extended Thinking — speech-to-speech моделей, которые слушают, отвечают голосом и размышляют прямо во время разговора. Среди заявленных характеристик — 97 языков, автоматическое определение языка и первое место в Speech to Speech индексе Artificial Analysis с результатом 82.6.
Отдельно описан Live Avatar. Говорящий AI-персонаж видит камеру или экран, отвечает голосом, двигает губами и перестраивает ответ после перебивания. Для креаторов это может пригодиться в обучении, поддержке и интерактивных шоу. Правда, реалистичные аватары в демо уже сейчас местами выглядят жутковато. Минута такой речи, по материалу, стоит около 39 центов.
В ту же сторону смотрят Gemini 3.8 Flash TTS и Flash-Lite TTS. Им можно задавать тембр, акцент, темп и манеру речи обычным текстом. Ещё заявлены смех, вздохи, паузы, 100+ языков и диалектов, включая русский, а также двухголосые диалоги.
Интереснее с точки зрения архитектуры другая работа — Context Language Models. Исследователи предложили дать модели возможность самой переписывать контекст: удалять старые сообщения, сжимать результаты поиска и хранить компактное состояние задачи. В одном тесте агент удерживал историю в пределах 6–8 тысяч токенов после 163 редактирований.
После обучения Qwen3.5-9B на BrowseComp-Plus результат вырос с 28.8% до 42.5%. Вычислений потребовалось на 38.8% меньше, чем у варианта с обычной суммаризацией. Есть и проблема: изменение середины истории ломает стандартное кеширование. Авторы частично решили её через Suffix Cache Reuse и сократили серверные вычисления ещё примерно на 35%.
Новые AI-инструменты для видео и музыки
Shengshu якобы открыла API Vidu S2. Ветка состоит из двух моделей: S2-Avatar оживляет персонажа по голосу или тексту, а S2-Editing меняет стиль, одежду, фон или героя прямо во входящем видеопотоке. Есть экспериментальный стереорежим для VR.
Creatify Labs представила Boreal — видеомодель для рекламы и UGC с генерацией в реалтайме. Заявлены 720p по $0.20 за секунду и 1080p по $0.60. В слепых тестах результат якобы выбирали в 81% случаев, но название базы для сравнения не раскрыли.
