Локальные Qwen3.8 прогнали через десять задач на одной RTX PRO 6000 Blackwell с 96 ГБ памяти. За три недели тестов общей победительницы не нашлось: Flash-Next взяла пять заданий, обычная 27B — четыре, ещё один тест закончился ничьёй.

Главный технический нежданчик — DFlash2. На Qwen3.8-27B драфтер поднял скорость с 75 до 210 токенов в секунду для одного пользователя. Схема здесь такая: маленькая модель предлагает продолжение, основная быстро его проверяет. Это и есть speculative decoding.

Что показали тесты локальных Qwen3.8

В сравнении участвовали три сборки: RadixArk/Qwen3.8-27B-NVFP4, orcarouter/Qwen3.8-27B-Uncensored-NVFP4 и RadixArk/Qwen3.8-Flash-Next-NVFP4. Все запускались локально, с одинаковыми промптами и настройками из карточек моделей.

Для AI-агентов расклад получился интересный. Обычная 27B набрала 73,3% на подмножестве BFCL для вызова инструментов. Uncensored получила 70,8%, Flash-Next — 64,5%. В арене с армиями 27B набрала 700 из 1000.

В этой же арене она оказалась выше Claude Fable 5.1 с 678 баллами и GPT-5.6 с 473. Но делать из этого общий рейтинг моделей не стоит: облачные участники работали через чат-приложения, а саму арену придумал автор теста.

Flash-Next лучше показала себя в задачах для креаторов. Она собрала лучший voxel-замок, лучший дизайн-борд и лучший видеомонтаж — 19 из 20 баллов в ручной оценке. В симуляции с машиной Руба Голдберга только она довела шар до стакана.

Разница там хорошо видна по процессу. Flash-Next сделала 49 запусков симулятора, перебрала 40 деталей и потратила 224 тысячи токенов на размышления. Две версии 27B потратили примерно по 111 тысяч и остановились ещё до написания первой детали.

Скорость зависит не только от модели

На полном окне примерно в 245 тысяч токенов Flash-Next заполняла контекст за 22,4 секунды. Двум версиям 27B понадобилось 97–99 секунд. При этом NVFP4 с DFlash2 оказался примерно в 2,2 раза быстрее BF16.

В общей таблице SGLang выдал 210 токенов в секунду против 160 у vLLM. Но на одной и той же Uncensored-сборке vLLM оказался быстрее: 169 против 146. Так что выбирать движок по одной красивой цифре рискованно.

Есть ещё одна оговорка по железу. Flash-Next тестировали при лимите мощности 600 Вт, а матрицу 27B — при 400 Вт. Автор оценил потери скорости заполнения примерно в 6% на каждые снятые 50 Вт. Сравнение полезное, но до лабораторной чистоты ему далеко.

Кому какая версия пригодится