
Окей, щас будет лонгрид.
26 августа 2026 интернет на пару часов забыл про всё. «Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight!» И цифры… 125 миллиардов параметров всего. Плюс ещё 51 млрд отдельным слоем. А активируется на каждый токен – лишь 6 миллиардов.
Первая мысль была: так не бывает.
Coming soon
Тут надо сразу расставить точки, потому что вокруг названия путаница – это уже отдельный вид спорта. Полноценного Qwen4 НЕ СУЩЕСТВУЕТ. Ни весов, ни карточки, ни даты. Есть Qwen3.8-Flash-Next – модель которую сама команда Qwen прямо называет «experimental preview of the architecture that will underpin Qwen4».
Прецедент уже был, кстати. Полтора года назад вышел Qwen3-Next, сыграл ровно ту же роль для Qwen3.5: обкатали гибридную архитектуру Gated DeltaNet + Gated Attention на промежуточном релизе – и потом этот же движок поехал во все модели линейки от Qwen3.5 до Qwen3.8 Max. Flash-Next играет для Qwen4 ту же роль, что Qwen3-Next играл для Qwen3.5.

Все ждали Qwen4, а вышел не Qwen4. Вышел трейлер к трейлеру. С полным техотчётом, открытыми весами и правом покопаться в архитектуре до релиза.
Как Qwen дошёл до жизни такой
Чтоб понять, зачем понадобилась новая архитектура – полезно окинуть взглядом путь.
Первая версия модели, известная как Tongyi Qianwen (通义千问), стартовала в апреле 2023-го на архитектуре Llama* (*принадлежит компании Meta, деятельность которой запрещена в РФ).
Дальше: Qwen2 в 2024-м заигрывает со sparse-архитектурами (Mixture-of-Experts), а в апреле 2025-го выходит Qwen3 – уже с гибридным режимом thinking/non-thinking и MoE-моделями вроде 235B-A22B, обученными на 36 триллионах токенов на 119 языках. В феврале 2026-го выходит Qwen3.5, а вместе с ней – тот самый Qwen3-Next, прародитель нынешнего трюка с предварительным показом архитектуры.
Дальше – Qwen3.6, Qwen3.7, а 3 августа 2026-го – Qwen3.8-Max на 2,4 триллиона параметров, второй по размеру открытый ИИ в мире после Kimi K3 от Moonshot AI. Спустя одиннадцать дней вышла плотная Qwen3.8-27B под Apache 2.0 – модель которая по словам одного из авторов оказалась «GPT 5.6 Luna level» и обошла даже Opus 4.6.
А ещё через двенадцать дней подъехал герой сегодняшней статьи.
Четыре кита новой архитектуры
Официальный блог Qwen формулирует изменения предельно чётко – модернизация идёт сразу по четырём осям: attention, residual, embedding и optimization. Давайте разберёмся.
Внимание. GDN помнит, QSA ищет
Классический Transformer с полным вниманием обходится дорого: чем длиннее контекст, тем сильнее растут и вычисления и объём KV-кеша, который нужно гонять туда-обратно через память. Решение, найденное командой Qwen ещё для Qwen3-Next и доведённое здесь до ума, – гибридная схема.
48 слоёв модели сгруппированы в 12 одинаковых блоков. В каждом блоке три слоя используют Gated DeltaNet (GDN) – механизм постоянно сжимающий историю диалога в состояние фиксированного размера. Вроде непрерывно обновляемого конспекта. А четвёртый слой в группе – полноценное внимание только не «в лоб» а через новый механизм Qwen Sparse Attention (QSA).

Идея красивая: вместо того чтобы, как в DSA от DeepSeek, оценивать важность каждого токена по отдельности, лёгкий индексатор сначала нарезает последовательность на микроблоки, оценивает важность блоков целиком – и только потом полноценное внимание работает по отобранным фрагментам. GDN эффективно запоминает, QSA точечно ищет; один герой держит в голове общий сюжет, второй бежит проверять конкретные улики. Если точнее, индексатор сжимает ключи в микроблоки с коэффициентом 4 и оставляет лучшие 512 блоков – около 2051 логической позиции токенов, притом что финальный софтмакс всё равно работает по исходным несжатым K/V.
На контексте в 1 миллион токенов ядро QSA ускоряет prefill до 7,6 раза, decode – до 4,9 раза. А при типичном сценарии, с 90%-ным cache hit rate, Qwen3.8-Flash-Next выдаёт в 8,6 раза больше prefill-throughput, чем Qwen3.7-Plus на миллионе токенов контекста.

Gated Residual: у сигнала теперь четыре полосы
В обычном трансформере все слои читают и пишут в один и тот же residual stream – единый «поток» информации сквозь всю сеть. Чем глубже сеть, тем сильнее ранние признаки размываются последующими наслоениями.
Gated Residual (GR) решает это следующим образом: поток расширяется в четыре параллельные ветки, а поэлементный динамический гейт сам определяет, сколько информации читать из каждой ветки и сколько записывать обратно. Здесь имеется побочный эффект, одна из веток естественным образом превращается в магистраль, напрямую соединяющую первый слой внимания с большинством последующих слоёв – архитектура сама без явного дизайна обучилась строить байпас для важной информации. Состояние потока при этом можно хранить в FP8 что дополнительно снижает нагрузку на память.
Вот так эволюция в реальном времени находит обходной путь.
N-gram embedding
Пожалуй, самая занятная часть архитектуры.
Обычный эмбеддинг сопоставляет вектор одному токену. N-gram embedding идёт дальше: смотрит на текущий токен плюс несколько предыдущих и ищет соответствие в таблице примерно из 20 миллионов записей биграмм и триграмм. Источник вдохновения разработчики называют прямо – Per-Layer Embedding из Gemma 3n и DeepSeek Engram.
Фокус в том что позиции для поиска можно вычислить заранее – а значит, саму таблицу необязательно держать в VRAM. Она живёт в обычной RAM хоста и подгружается асинхронно параллельно с вычислениями. Вы получаете «локальную память паттернов» размером с половину бюджетного дата-центра, не платя за неё ни лишним временем на матричные умножения, ни гигабайтами VRAM.
Как метко заметили некоторые, формула «работает как 6B, знает как 180B» эффектная, однако не совсем честная: часть параметров почти не требует вычислений, но хранить их всё равно приходится где-то. Физику никто не отменял – оптимизировали именно вычисления, а не объём памяти.
Muon вместо привычного AdamW
Последний штрих – оптимизатор. Модель обучена с помощью Muon вместо классического AdamW с доработками по точности ортогонализации, разделению труда между Muon и AdamW(эмбеддинги и MoE-роутер по-прежнему достаются AdamW) и разбиению слитых матриц параметров.
Команда протестировала классический приём batch size warmup – постепенное увеличение размера батча в начале обучения – и выяснила, что он больше не нужен и требует на 18,8% больше шагов оптимизатора без выигрыша в качестве. В финальном рецепте обучение стартует сразу с целевого batch size. Они просто убрали лишний шаг. А сэкономленные 18,8% шагов – это часы и часы машинного времени.
Бенчмарки: обгонять Opus 4.6 Max, отставая по параметрам в разы
Теперь к цифрам. Официальная таблица Qwen сравнивает Flash-Next с Qwen3.7-Plus (вышла в мае 2026-го), DeepSeek-V4-Flash-0731 (июль 2026-го) и Claude Opus 4.6 [max] (февраль 2026-го).
Бенчмарк |
Qwen3.8-Flash-Next |
Qwen3.7-Plus |
DeepSeek-V4-Flash-0731 |
Claude Opus 4.6 (Max) |
|---|---|---|---|---|
SWE-bench Pro |
62.5 |
55.8 |
56.0 |
53.4 |
SWE-bench Multilingual |
81.0 |
75.8 |
– |
77.5 |
DeepSWE 1.1 |
58.7 |
16.5 |
54.4 |
– |
CoWorkBench |
73.9 |
65.1 |
45.1 |
68.2 |
JobBench |
55.7 |
27.6 |
41.3 |
36.6 |
GPQA Diamond |
91.7 |
90.3 |
90.8 |
91.3 |
LiveCodeBench v6 |
91.9 |
89.6 |
90.6 |
88.8 |
HLE |
35.9 |
34.7 |
33.8 |
40.0 |
Сразу смотрим на JobBench: при активных параметрах в 6 млрд, против заведомо большего числа у Claude, разрыв – почти 20 п. в пользу Qwen.
Но модель не выигрывает буквально всё. На Humanity’s Last Exam Opus 4.6 [max] держит лидерство — 40 против 35,9. В экстремальных рассуждениях топовые модели пока держат оборону.
Зато на визуальных и агентных задачах Qwen3.8-Flash-Next разносит Opus 4.6 Max: 84,5 против 62 на AndroidWorld, 88,5 против 73,9 на RealWorldQA, а на MathVision – 95,7 против 65,5.

Независимый Artificial Analysis оценивает модель в 56 баллов по своему Intelligence Index – заметно выше медианы (29) среди сравнимого класса. Но есть нюанс: модель оказалась «very verbose» – тест потребовал 200 миллионов токенов против медианных 110 миллионов. Рассуждает долго, что подтверждают и владельцы локальных запусков. Кстати, да, об этом ниже.

GLM-5.3-Flash вышел в тот же день
Буквально в тот же день 26 августа свою модель GLM-5.3-Flash выпустила и Zhipu AI. Совпадение? Вполне возможно, что нет – китайские лаборатории следят друг за другом внимательнее, чем кажется со стороны.
Qwen3.8-Flash-Next |
GLM-5.3-Flash |
|
|---|---|---|
Архитектура |
125B всего / 6B активных |
320B всего / 18B активных |
Нативный контекст |
262K (до 1M с YaRN) |
1M токенов |
DeepSWE v1.1 |
58,7 |
63,4 |
SWE-bench Pro |
62,5 |
не опубликован |
Цена за вход |
$0,16/1M |
~$0,075/1M (промо) |
GLM забирает верх по DeepSWE, у него нативный миллионный контекст без костылей вроде YaRN – но Qwen активирует втрое меньше параметров на токен, что критично для локального запуска. Вот это вот «втрое меньше параметров» – оно на практике значит «влезает в комп, а GLM нет».
А что там по-русски?
Модель при полной адекватности в агентных задачах ощутимо просела по качеству русского по сравнению с предыдущими Qwen – путает окончания и формы слов, причём сравнение шло с моделями от 27B до 397B, и даже младшие модели линейки показались автору более грамотными. Проблема тянется ещё с версии 3.5, и без строгого системного промпта связного результата на русском добиться непросто. Так что если планируете использовать модель для чего-то серьёзного на русском – тестируйте заранее.
Как запустить Qwen3.8 Flash Next?
Unsloth сообщил таблицу требований RAM.
Квант |
Требуемая память |
|---|---|
1-bit |
75 GB |
2-bit |
79 GB |
3-bit |
90 GB |
4-bit |
112 GB |
5-bit |
200 GB |
8-bit |
270 GB |
BF16 |
355 GB |
Обратите внимание на разницу между 1-bit (75 GB) и наивно ожидаемым размером «180B в 1 бит» (около 22 GB). Разгадка с цифрами такая: огромная N-gram таблица НИКОГДА не квантуется агрессивнее 4 бит, ведь это чувствительный к точности lookup-механизм а не обычные веса. Именно она раздувает даже самый лёгкий квант почти до 73 GB.

Состав файла:

Банки MoE-экспертов – 37,11 GB (54,9%)
Таблица N-gram – 26,82 GB (39,7%), в 4-битном формате даже в «однобитной» сборке
Attention и QSA – 1,71 GB (2,5%)
Всё остальное – 1,91 GB (2,8%)
Почти 40% файла – это одна операция чистого копирования данных (GGML_OP_GET_ROWS), которая вообще не делает математики.
Голая версия: только CPU
Модель протестировали на десктопе с Intel Core Ultra 9 285K (24 ядра), 95,3 ГБ RAM и без видеокарты:

Получилось порядка 11 токенов в секунду на генерации – и это плато достигается уже на 8 потоках. А вот обработка промпта (prefill) продолжает расти вплоть до 24 потоков добираясь до 53 t/s. То есть генерация упирается в скорость памяти, а обработка промпта – уже настоящая арифметика, которая хорошо параллелится по ядрам.
С RTX 5090 в подмогу
Добавляем одну видеокарту RTX 5090 (32 ГБ VRAM) – и скорость подпрыгивает почти впятеро, до 52 t/s. Фокус в том чтобы «прикрепить» таблицу N-gram к системной RAM флагом -ot per_layer_token_embd=CPU, а часть экспертных слоёв постепенно двигать на карту флагом -ncmoe.

При «правильном» числе слоёв на карте скорость достигает пика в 52 t/s. Но стоит подвинуть на карту ещё одну группу слоёв – скорость не падает плавно, а ОБРУШИВАЕТСЯ: с 52 до 3,7 t/s. Без единого сообщения об ошибке! Драйвер видеокарты при переполнении VRAM тихо сбрасывает данные через PCIe в системную память – и всё продолжает работать, только раз в пятнадцать медленнее.
Если настройка, которая должна быть быстрее, оказывается медленнее – сперва подозревайте переполнение видеопамяти.
На больших контекстах скорость проседает мягко – около 15–17% на 32K токенов, и это немного для модели такого масштаба:

Качество ответов – отдельная история. По уровню перплексии на датасете wikitext-2 (предсказание текста в стиле вики, опираясь на имеющиееся начало текста) даже сжатая до 1 бита версия Flash-Next (4,01) обходит 4-битную версию младшей 27B-модели (5,68):

На тесте из 12 практических задач четыре из пяти сборок ответили безупречно – 1,000. А 1-битная версия 27B просела до 0,309:

Показательнее всего вопрос «Кто изобрёл транзистор?»: 1-битная 27B-модель уверенно назвала трёх несуществующих учёных и перепутала дату на 22 года, а сжатая до того же 1 бита Flash-Next ответила безошибочно.
Если вынести за скобки бенчмарки, суть проста: Alibaba показывает, что стоимость токена можно системно снижать не только числом GPU, а архитектурными решениями – разделением памяти на «дешёвую адресуемую» и «дорогую вычислительную», сокращением внимания до нужных фрагментов, расширением residual-потока вместо его углубления.
Полноценный Qwen4 пока не вышел – только слухи о возможном окне в сентябре 2026-го. Если архитектурный движок действительно ляжет в основу флагмана, его можно будет запустить у себя дома с криком «加油!» в темноту ночи.
Qwen4, мы тебя ждём. Только не подведи.
m0xf
Только на Windows. На Linux будет ошибка OOM.
TomskDiver
На Windows тоже можно сделать чтобы был OOM вместо сброса в RAM (CUDA - Sysmem Fallback Policy).