Окей, щас будет лонгрид.

26 августа 2026 интернет на пару часов забыл про всё. «Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight!» И цифры… 125 миллиардов параметров всего. Плюс ещё 51 млрд отдельным слоем. А активируется на каждый токен – лишь 6 миллиардов.

Первая мысль была: так не бывает.

Coming soon

Тут надо сразу расставить точки, потому что вокруг названия путаница – это уже отдельный вид спорта. Полноценного Qwen4 НЕ СУЩЕСТВУЕТ. Ни весов, ни карточки, ни даты. Есть Qwen3.8-Flash-Next – модель которую сама команда Qwen прямо называет «experimental preview of the architecture that will underpin Qwen4».

Прецедент уже был, кстати. Полтора года назад вышел Qwen3-Next, сыграл ровно ту же роль для Qwen3.5: обкатали гибридную архитектуру Gated DeltaNet + Gated Attention на промежуточном релизе – и потом этот же движок поехал во все модели линейки от Qwen3.5 до Qwen3.8 Max. Flash-Next играет для Qwen4 ту же роль, что Qwen3-Next играл для Qwen3.5.

Официальное превью архитектуры Qwen3.8-Flash-Next от Alibaba
Схема архитектуры Qwen3.8-Flash-Next от Alibaba

Все ждали Qwen4, а вышел не Qwen4. Вышел трейлер к трейлеру. С полным техотчётом, открытыми весами и правом покопаться в архитектуре до релиза.

Как Qwen дошёл до жизни такой

Чтоб понять, зачем понадобилась новая архитектура – полезно окинуть взглядом путь.

Первая версия модели, известная как Tongyi Qianwen (通义千问), стартовала в апреле 2023-го на архитектуре Llama* (*принадлежит компании Meta, деятельность которой запрещена в РФ).

Дальше: Qwen2 в 2024-м заигрывает со sparse-архитектурами (Mixture-of-Experts), а в апреле 2025-го выходит Qwen3 – уже с гибридным режимом thinking/non-thinking и MoE-моделями вроде 235B-A22B, обученными на 36 триллионах токенов на 119 языках. В феврале 2026-го выходит Qwen3.5, а вместе с ней – тот самый Qwen3-Next, прародитель нынешнего трюка с предварительным показом архитектуры.

Дальше – Qwen3.6, Qwen3.7, а 3 августа 2026-го – Qwen3.8-Max на 2,4 триллиона параметров, второй по размеру открытый ИИ в мире после Kimi K3 от Moonshot AI. Спустя одиннадцать дней вышла плотная Qwen3.8-27B под Apache 2.0 – модель которая по словам одного из авторов оказалась «GPT 5.6 Luna level» и обошла даже Opus 4.6.

А ещё через двенадцать дней подъехал герой сегодняшней статьи.

Четыре кита новой архитектуры

Официальный блог Qwen формулирует изменения предельно чётко – модернизация идёт сразу по четырём осям: attention, residual, embedding и optimization. Давайте разберёмся.

Внимание. GDN помнит, QSA ищет

Классический Transformer с полным вниманием обходится дорого: чем длиннее контекст, тем сильнее растут и вычисления и объём KV-кеша, который нужно гонять туда-обратно через память. Решение, найденное командой Qwen ещё для Qwen3-Next и доведённое здесь до ума, – гибридная схема.

48 слоёв модели сгруппированы в 12 одинаковых блоков. В каждом блоке три слоя используют Gated DeltaNet (GDN) – механизм постоянно сжимающий историю диалога в состояние фиксированного размера. Вроде непрерывно обновляемого конспекта. А четвёртый слой в группе – полноценное внимание только не «в лоб» а через новый механизм Qwen Sparse Attention (QSA).

Схема работы Qwen Sparse Attention (QSA)
Схема Qwen Sparse Attention (QSA)

Идея красивая: вместо того чтобы, как в DSA от DeepSeek, оценивать важность каждого токена по отдельности, лёгкий индексатор сначала нарезает последовательность на микроблоки, оценивает важность блоков целиком – и только потом полноценное внимание работает по отобранным фрагментам. GDN эффективно запоминает, QSA точечно ищет; один герой держит в голове общий сюжет, второй бежит проверять конкретные улики. Если точнее, индексатор сжимает ключи в микроблоки с коэффициентом 4 и оставляет лучшие 512 блоков – около 2051 логической позиции токенов, притом что финальный софтмакс всё равно работает по исходным несжатым K/V.

На контексте в 1 миллион токенов ядро QSA ускоряет prefill до 7,6 раза, decode – до 4,9 раза. А при типичном сценарии, с 90%-ным cache hit rate, Qwen3.8-Flash-Next выдаёт в 8,6 раза больше prefill-throughput, чем Qwen3.7-Plus на миллионе токенов контекста.

График относительного prefill-throughput при 90% cache hit rate
График относительного prefill-throughput при 90% cache hit rate

Gated Residual: у сигнала теперь четыре полосы

В обычном трансформере все слои читают и пишут в один и тот же residual stream – единый «поток» информации сквозь всю сеть. Чем глубже сеть, тем сильнее ранние признаки размываются последующими наслоениями.

Gated Residual (GR) решает это следующим образом: поток расширяется в четыре параллельные ветки, а поэлементный динамический гейт сам определяет, сколько информации читать из каждой ветки и сколько записывать обратно. Здесь имеется побочный эффект, одна из веток естественным образом превращается в магистраль, напрямую соединяющую первый слой внимания с большинством последующих слоёв – архитектура сама без явного дизайна обучилась строить байпас для важной информации. Состояние потока при этом можно хранить в FP8 что дополнительно снижает нагрузку на память.

Вот так эволюция в реальном времени находит обходной путь.

N-gram embedding

Пожалуй, самая занятная часть архитектуры.

Обычный эмбеддинг сопоставляет вектор одному токену. N-gram embedding идёт дальше: смотрит на текущий токен плюс несколько предыдущих и ищет соответствие в таблице примерно из 20 миллионов записей биграмм и триграмм. Источник вдохновения разработчики называют прямо – Per-Layer Embedding из Gemma 3n и DeepSeek Engram.

Фокус в том что позиции для поиска можно вычислить заранее – а значит, саму таблицу необязательно держать в VRAM. Она живёт в обычной RAM хоста и подгружается асинхронно параллельно с вычислениями. Вы получаете «локальную память паттернов» размером с половину бюджетного дата-центра, не платя за неё ни лишним временем на матричные умножения, ни гигабайтами VRAM.

Как метко заметили некоторые, формула «работает как 6B, знает как 180B» эффектная, однако не совсем честная: часть параметров почти не требует вычислений, но хранить их всё равно приходится где-то. Физику никто не отменял – оптимизировали именно вычисления, а не объём памяти.

Muon вместо привычного AdamW

Последний штрих – оптимизатор. Модель обучена с помощью Muon вместо классического AdamW с доработками по точности ортогонализации, разделению труда между Muon и AdamW(эмбеддинги и MoE-роутер по-прежнему достаются AdamW) и разбиению слитых матриц параметров.

Команда протестировала классический приём batch size warmup – постепенное увеличение размера батча в начале обучения – и выяснила, что он больше не нужен и требует на 18,8% больше шагов оптимизатора без выигрыша в качестве. В финальном рецепте обучение стартует сразу с целевого batch size. Они просто убрали лишний шаг. А сэкономленные 18,8% шагов – это часы и часы машинного времени.

Бенчмарки: обгонять Opus 4.6 Max, отставая по параметрам в разы

Теперь к цифрам. Официальная таблица Qwen сравнивает Flash-Next с Qwen3.7-Plus (вышла в мае 2026-го), DeepSeek-V4-Flash-0731 (июль 2026-го) и Claude Opus 4.6 [max] (февраль 2026-го).

Бенчмарк

Qwen3.8-Flash-Next

Qwen3.7-Plus

DeepSeek-V4-Flash-0731

Claude Opus 4.6 (Max)

SWE-bench Pro

62.5

55.8

56.0

53.4

SWE-bench Multilingual

81.0

75.8

77.5

DeepSWE 1.1

58.7

16.5

54.4

CoWorkBench

73.9

65.1

45.1

68.2

JobBench

55.7

27.6

41.3

36.6

GPQA Diamond

91.7

90.3

90.8

91.3

LiveCodeBench v6

91.9

89.6

90.6

88.8

HLE

35.9

34.7

33.8

40.0

Сразу смотрим на JobBench: при активных параметрах в 6 млрд, против заведомо большего числа у Claude, разрыв – почти 20 п. в пользу Qwen.

Но модель не выигрывает буквально всё. На Humanity’s Last Exam Opus 4.6 [max] держит лидерство — 40 против 35,9. В экстремальных рассуждениях топовые модели пока держат оборону.

Зато на визуальных и агентных задачах Qwen3.8-Flash-Next разносит Opus 4.6 Max: 84,5 против 62 на AndroidWorld, 88,5 против 73,9 на RealWorldQA, а на MathVision – 95,7 против 65,5.

Независимый Artificial Analysis оценивает модель в 56 баллов по своему Intelligence Index – заметно выше медианы (29) среди сравнимого класса. Но есть нюанс: модель оказалась «very verbose» – тест потребовал 200 миллионов токенов против медианных 110 миллионов. Рассуждает долго, что подтверждают и владельцы локальных запусков. Кстати, да, об этом ниже.

GLM-5.3-Flash вышел в тот же день

Буквально в тот же день 26 августа свою модель GLM-5.3-Flash выпустила и Zhipu AI. Совпадение? Вполне возможно, что нет – китайские лаборатории следят друг за другом внимательнее, чем кажется со стороны.

Qwen3.8-Flash-Next

GLM-5.3-Flash

Архитектура

125B всего / 6B активных

320B всего / 18B активных

Нативный контекст

262K (до 1M с YaRN)

1M токенов

DeepSWE v1.1

58,7

63,4

SWE-bench Pro

62,5

не опубликован

Цена за вход

$0,16/1M

~$0,075/1M (промо)

GLM забирает верх по DeepSWE, у него нативный миллионный контекст без костылей вроде YaRN – но Qwen активирует втрое меньше параметров на токен, что критично для локального запуска. Вот это вот «втрое меньше параметров» – оно на практике значит «влезает в комп, а GLM нет».

А что там по-русски?

Модель при полной адекватности в агентных задачах ощутимо просела по качеству русского по сравнению с предыдущими Qwen – путает окончания и формы слов, причём сравнение шло с моделями от 27B до 397B, и даже младшие модели линейки показались автору более грамотными. Проблема тянется ещё с версии 3.5, и без строгого системного промпта связного результата на русском добиться непросто. Так что если планируете использовать модель для чего-то серьёзного на русском – тестируйте заранее.

Как запустить Qwen3.8 Flash Next?

Unsloth сообщил таблицу требований RAM.

Квант

Требуемая память

1-bit

75 GB

2-bit

79 GB

3-bit

90 GB

4-bit

112 GB

5-bit

200 GB

8-bit

270 GB

BF16

355 GB

Обратите внимание на разницу между 1-bit (75 GB) и наивно ожидаемым размером «180B в 1 бит» (около 22 GB). Разгадка с цифрами такая: огромная N-gram таблица НИКОГДА не квантуется агрессивнее 4 бит, ведь это чувствительный к точности lookup-механизм а не обычные веса. Именно она раздувает даже самый лёгкий квант почти до 73 GB.

Диаграмма квантований Qwen3.8-Flash-Next против 96 ГБ RAM
Диаграмма квантований Qwen3.8-Flash-Next против 96 ГБ RAM

Состав файла:

Состав 1-битной сборки модели: банки MoE-экспертов, таблица N-gram, внимание
Состав 1-битной сборки модели: банки MoE-экспертов, таблица N-gram, внимание
  • Банки MoE-экспертов – 37,11 GB (54,9%)

  • Таблица N-gram – 26,82 GB (39,7%), в 4-битном формате даже в «однобитной» сборке

  • Attention и QSA – 1,71 GB (2,5%)

  • Всё остальное – 1,91 GB (2,8%)

Почти 40% файла – это одна операция чистого копирования данных (GGML_OP_GET_ROWS), которая вообще не делает математики.

Голая версия: только CPU

Модель протестировали на десктопе с Intel Core Ultra 9 285K (24 ядра), 95,3 ГБ RAM и без видеокарты:

Скорость генерации в зависимости от количества потоков CPU
Скорость генерации в зависимости от количества потоков CPU

Получилось порядка 11 токенов в секунду на генерации – и это плато достигается уже на 8 потоках. А вот обработка промпта (prefill) продолжает расти вплоть до 24 потоков добираясь до 53 t/s. То есть генерация упирается в скорость памяти, а обработка промпта – уже настоящая арифметика, которая хорошо параллелится по ядрам.

С RTX 5090 в подмогу

Добавляем одну видеокарту RTX 5090 (32 ГБ VRAM) – и скорость подпрыгивает почти впятеро, до 52 t/s. Фокус в том чтобы «прикрепить» таблицу N-gram к системной RAM флагом -ot per_layer_token_embd=CPU, а часть экспертных слоёв постепенно двигать на карту флагом -ncmoe.

Кривая скорости при выгрузке экспертных слоёв на GPU: резкий пик, затем обвал
Кривая скорости при выгрузке экспертных слоёв на GPU: резкий пик, затем обвал

При «правильном» числе слоёв на карте скорость достигает пика в 52 t/s. Но стоит подвинуть на карту ещё одну группу слоёв – скорость не падает плавно, а ОБРУШИВАЕТСЯ: с 52 до 3,7 t/s. Без единого сообщения об ошибке! Драйвер видеокарты при переполнении VRAM тихо сбрасывает данные через PCIe в системную память – и всё продолжает работать, только раз в пятнадцать медленнее.

Если настройка, которая должна быть быстрее, оказывается медленнее – сперва подозревайте переполнение видеопамяти.

На больших контекстах скорость проседает мягко – около 15–17% на 32K токенов, и это немного для модели такого масштаба:

Скорость генерации в зависимости от глубины контекста до 32K токенов
Скорость генерации в зависимости от глубины контекста до 32K токенов

Качество ответов – отдельная история. По уровню перплексии на датасете wikitext-2 (предсказание текста в стиле вики, опираясь на имеющиееся начало текста) даже сжатая до 1 бита версия Flash-Next (4,01) обходит 4-битную версию младшей 27B-модели (5,68):

Perplexity на wikitext-2 для разных квантований
Perplexity на wikitext-2 для разных квантований

На тесте из 12 практических задач четыре из пяти сборок ответили безупречно – 1,000. А 1-битная версия 27B просела до 0,309:

Оценка качества на 12 практических задачах
Оценка качества на 12 практических задачах

Показательнее всего вопрос «Кто изобрёл транзистор?»: 1-битная 27B-модель уверенно назвала трёх несуществующих учёных и перепутала дату на 22 года, а сжатая до того же 1 бита Flash-Next ответила безошибочно.


Если вынести за скобки бенчмарки, суть проста: Alibaba показывает, что стоимость токена можно системно снижать не только числом GPU, а архитектурными решениями – разделением памяти на «дешёвую адресуемую» и «дорогую вычислительную», сокращением внимания до нужных фрагментов, расширением residual-потока вместо его углубления.

Полноценный Qwen4 пока не вышел – только слухи о возможном окне в сентябре 2026-го. Если архитектурный движок действительно ляжет в основу флагмана, его можно будет запустить у себя дома с криком «加油!» в темноту ночи.

Qwen4, мы тебя ждём. Только не подведи.

Комментарии (2)


  1. m0xf
    30.08.2026 15:36

    Драйвер видеокарты при переполнении VRAM тихо сбрасывает данные через PCIe в системную память – и всё продолжает работать, только раз в пятнадцать медленнее.

    Только на Windows. На Linux будет ошибка OOM.


    1. TomskDiver
      30.08.2026 15:36

      На Windows тоже можно сделать чтобы был OOM вместо сброса в RAM (CUDA - Sysmem Fallback Policy).