Пока все тестируют Qwen 3.8 27B, появилась новая модель от Alibaba с Qwen 4 архитектурой. Это не байт и не шутка: выпущенная пару дней назад новая мультимодальная MoE модель под названием Qwen3.8-Flash-Next является ранним архитектурным превью, используемым в будущей Qwen 4 [1].

Модель играет ту же роль, что и Qwen3-Next для Qwen3.5: гибридная конструкция Gated DeltaNet с Gated Attention, представленная тогда, с тех пор используется в сериях Qwen3.5, Qwen3.6, Qwen3.7 и Qwen3.8. Новая архитектура переосмысливает этот подход, давайте разбираться, что изменилось.

Что нового в архитектуре Qwen 4 (Qwen3.8-Flash-Next)

На базовом уровне это мультимодальная архитектура типа Mixture-of-Experts (MoE). Однако в отличие от привычных MoE, здесь применено несколько решений для эффективной локальной работы с большими контекстными окнами (262K нативно и 1M с YaRN):

  1. Разделение общего и активного объема параметров

    • Общий объем модели: 125 млрд параметров основного MoE-графа + 51 млрд параметров N-gram таблиц + 4 млрд параметров головы MTP (Multi-Token Prediction).

    • Активные параметры на токен: всего 6B (512 маршрутизируемых экспертов, из которых активны 10 + 1 общий эксперт). То есть по вычислениям на токен модель сопоставима с компактными моделями на 6B, а по уровню знаний превосходит тяжелые 70B+ модели.

  2. 51B N-gram Embeddings (PLE) и офлоадинг в RAM/SSD

    Одной из главных архитектурных новинок стало добавление отдельного слоя N-gram эмбеддингов размером 51B параметров. Рядом с основной моделью живет отдельная таблица на 20 млн записей (биграммы и триграммы). В предыдущей архитектуре число параметров и объем вычислений находились на одной оси (зависели друг от друга). N-gram память позволяет разделить эту зависимость.

    N-gram слой не требует квадрирования или сложных матричных умножений, т.к. ключи в этой таблице являются детерминированными хешами от последней пары токенов. Позиции обращений рассчитываются заранее, поэтому всю эту таблицу (51B) незачем держать в видеопамяти.

    Подойдет обычная оперативная память или SSD/NVMe, и нужные данные считываются с помощью асинхронного префетчинга через mmap из обычного SSD или системной памяти без потери точности, пока видеокарта будет считать остальное в самих экспертах. В итоге эта таблица работает как быстрая память большого объема для частых фраз и локальных паттернов языка.

  3. Гибридный механизм: GDN + QSA (Qwen Sparse Attention)

    Слои Gated DeltaNet идентичны в обеих моделях (конфигурация голов и размерность сохранены). В Qwen 3.8 27B каждый такой слой задействует четыре KV-головы (Gated Attention): это обеспечивает высокую точность, однако вычислительные затраты и объем памяти растут линейно с увеличением контекста, что делает данный слой самым ресурсоемким в стеке.

    В Qwen3.8-Flash-Next механизм Gated Attention заменен на Qwen Sparse Attention. Главное отличие нового подхода заключается в детализации отбора. Вместо оценки каждого отдельного токена в истории индексирующий модуль (MQA: 4 query-головы и 1 общая K-голова с размерностью 128) анализирует микроблоки токенов. После этого модель обращается к контексту (активирует внимание) в рамках фиксированного бюджета размером 512 блоков или 2048 токенов.

    Таким образом, Gated DeltaNet эффективно запоминает, а QSA точно ищет: 36 слоев (из 48) сжимают историю в состояние фиксированного размера, 12 слоев делают точечный выборочный поиск по настоящей истории. Модель сама решает, сколько информации считывать из каждой ветки и сколько записывать обратно.

    В модели 48 слоев:

    • 36 слоев (3 из 4): используют Gated DeltaNet (GDN), линейный рекуррентный механизм, который сжимает историю в рекуррентное состояние фиксированного размера, предотвращая рост KV-кэша.

    • 12 слоев (1 из 4): используют Qwen Sparse Attention (QSA). В отличие от классического Attention, QSA агрегирует последовательность в микроблоки и выбирает только наиболее релевантные области. Это дает до 8.6x прироста скорости Prefill на контекстах в 1 млн токенов.

  4. Gated Residual (GR) и MTP

    Gated Residual разделяет единый residual-поток на 4 ветки. Поэлементный динамический gate управляет чтением слоя, а единый скалярный gate управляет записью. Интересно то, что одна из этих веток берет на себя роль магистрали для сквозного переноса информации из начальных слоев в глубокие.

    Это сохраняет стабильность обучения и емкость слоев неизменными. Вычислительный оверхед на инференсе минимален, в том числе благодаря хранению веток в формате FP8.

    По MTP все просто: добавили один слой, обученный на нескольких шагах вперед. Получился готовый драфтер для спекулятивного декодирования, бесплатный буст скорости генерации, без потери точности. Что это такое, можно прочитать в другой моей статье [2]

Сравнение Qwen3.8-Flash-Next vs Qwen 3.8 27B

Для наглядности сравним новую архитектуру с недавно вышедшей моделью Qwen 3.8 27B [3].

Параметр / Характеристика

Qwen 3.8 27B (Dense)

Qwen3.8-Flash-Next (Qwen 4 MoE)

Тип модели

Плотная (Dense)

MoE (Mixture of Experts) + N-gram

Общие параметры

27 млрд

~180 млрд (125B MoE + 51B N-gram + 4B MTP)

Активные параметры / токен

27 млрд

6 млрд

Механизм внимания (Attention)

GDN + Gated Attention (Full Attention)

GDN + QSA (Sparse Micro-block Attention)

N-gram память

Отсутствует

51B N-gram Embeddings (поддержка mmap)

Residual-связи

Одиночный поток

4-поточный Gated Residual (GR)

Нативный контекст

262K

262K (расширяемый до 1M)

Сравнение в бенчмарках

Несмотря на то что Qwen3.8-Flash-Next использует всего 6B активных параметров на токен (в 4.5 раза меньше, чем Qwen 3.8 27B), архитектура Qwen 4 демонстрирует существенное превосходство в агентских задачах, кодинге и логике:

Бенчмарк

Qwen3.8-Flash-Next (Qwen 4 MoE)

Qwen3.8-27B (Dense)

Улучшение

DeepSWE 1.1 (агентский кодинг)

58.7

42.2

+16,5

SWE-bench Pro

62.5

61.7

+0,8 (паритет)

SWE-bench Multilingual

81.0

73.8

+7,2

NL2Repo-Bench

48.1

42.3

+5,8

CoWorkBench (in-house)

73.9

70.7

+3,2

JobBench

55.7

33.4

+22,3

Agents’ Last Exam (Score / Pass@1)

51.2 / 24.3

42.9 / 20.4

+8,3 / +3,9

Toolathlon Verified (Pass@1)

73.5

67.1

+6,4

IFBench

81.3

79.5

+1,8

GPQA Diamond

91.7

89.2

+2,5

HLE (GPT-4o judge)

35.9

30.8

+5,1

LiveCodeBench v6

91.9

90.3

+1,6

Примечательно следующее: если Qwen 3.8 27B по тестам вплотную подбирается к Claude Opus 4.6, то превью новой архитектуры Qwen 4 обходит ее в большинстве тестов и вплотную подбирается к Claude Opus 4.8. Вполне возможно, что Qwen 4 на релизе начнет щупать Claude Fable 5 за мягкое.

Запуск 4-битной версии на 128 ГБ RAM со скоростью 20-30 tok/s

Благодаря тому, что N-gram слой можно выгружать в системную память ОЗУ или через mmap на SSD, требования к VRAM GPU кардинально снизились. Как отмечается в документации Unsloth [4], 4-битные квантованные версии (GGUF UD-Q4_K_XL и UD-IQ4_XS) позволяют использование на системах со 128 ГБ оперативной памяти (например, Mac Studio / MacBook Pro на Apple Silicon с Unified Memory или ПК/сервер со 128GB RAM).

При этом показатели работы при запуске через Unsloth / llama.cpp следующие:

  • Необходимый объем памяти: ~85-110 ГБ ОЗУ/Unified Memory для полной загрузки 4-битной квантовки.

  • Скорость генерации: около 20-30 токенов в секунду при инференсе, что является впечатляющим результатом для модели со 180B весов. У меня на 128GB RAM выдает 25-27 токенов в секунду, но видеокарта для получения такой скорости все равно нужна.

  • Интерактивный режим гибридного мышления (Hybrid Thinking): в Unsloth Desktop из коробки поддерживается переключение режимов reasoning_effort (xhigh, medium, low, none), а также сохранность цепочки рассуждений (Preserve Thinking) между репликами диалога.

Итоги

Модель Qwen3.8-Flash-Next наглядно задает тренд на развертывание локального ИИ на обычных рабочих станциях со 128 ГБ оперативной памяти. Такой подход исключает затраты на дорогостоящие GPU-кластеры и сохраняет высокую скорость инференса до 30 токенов в секунду, а 6 миллиардов активных параметров гарантируют отличный баланс качества и быстродействия для работы локальных агентов.

Важно отметить, что Alibaba на сегодняшний день остается единственной компанией, предоставляющей в открытый доступ веса полного спектра моделей: от компактных решений меньше 1B до флагманов 100B+ параметров.

Линейка Qwen закрывает все актуальные задачи, объединяя классические рассуждающие LLM, мультимодальные и голосовые системы. Это позволяет бизнесу строить автономные on-premise ансамбли на базе инфраструктуры одного вендора с идеально совместимыми компонентами.

Такой подход открывает доступ к уникальным возможностям, включая каскадную маршрутизацию для удешевления инференса, бесшовное построение мультимодальных конвейеров и эффективную дистилляцию корпоративных знаний.

Update: в комментариях много вопросов о там с какой скоростью будет работать модель на их железе. Вот здесь пользователи делятся получившейся скоростью на своих сборках. Используйте эти данные как ориентир, только помните, что помимо самого железа критически важно правильно настроить под него параметры запуска модели.

References

  1. Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency, Qwen Blog (2026)

  2. Нейронные сети нетрадиционного ускорения, Habr (2026)

  3. Qwen/Qwen3.8-27B, Hugging Face (2026)

  4. Qwen3.8-Flash-Next: How to Run Locally, Unsloth Docs (2026)

Комментарии (82)


  1. DasProtoss
    27.08.2026 23:42

    “У меня на 128GB RAM выдает 25-27 токенов в секунду, но видеокарта для получения такой скорости все равно нужна”
    Так какая видеокарта-то? ЭТО ЖЕ ОСНОВНОЕ. На чистой памяти оно могло выдать у тебя ~1 токен/сек…


    1. ToxaBes Автор
      27.08.2026 23:42

      Без карты тоже должно работать, все зависит от того прочитал ли пользователь какие параметры выставлять, от его проца, а также от скорости и поколения DDR памяти:

      • M1 Ultra 128G выдает примерно 20 t/s,

      • AMD EPYC 7763 + 128GB DDR4 RAM выдает примерно 45 t/s

      • Intel i9 12900k128 GB DDR4 3600 MT/s + RTX 3090 примерно 65 t/s

      Это данные от пользователей. Моя система не показатель тк там все патчено-перепатчено под различные штуки.


      1. Akela_wolf
        27.08.2026 23:42

        Intel i9 12900k128 GB DDR4 3600 MT/s + RTX 3090 примерно 65 t/s

        Вот это красота. То есть на моем Ryzen 5950 можно добавить +64 Гб до 128 и получить настолько нормальную скорость?


        1. mirwide
          27.08.2026 23:42

          Неизвестно что они там запускали.
          Ryzen 9950x3d 128 Gb DDR5-6000 + RTX 4070 ti super 16 Gb

          llama-cli --model Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf -c 200000 --load-mode mlock -t 16
          [ Prompt: 39.8 t/s | Generation: 20.9 t/s ]
          
          llama-cli --model Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf -c 200000 --load-mode mlock -t 16 -ngl 0
          [ Prompt: 34.3 t/s | Generation: 7.4 t/s ]

          Примерно с такой же скоростью работает генерация для DeepSeek-V4-Flash-UD-Q3_K_XL у которой активных параметров в 2 раза больше. Но менее стабильно, потому что немного не влазит в 128 Gb.


          1. ToxaBes Автор
            27.08.2026 23:42

            Добавил в конец статьи апдейт со ссылкой на страницу где пользователи делятся результатами на своих сборках и часто публикуют настройки. Возможно, это поможет вам настроить свой запуск на большую скорость.


            1. mirwide
              27.08.2026 23:42

              Нет там чудо параметров. Вы не ту циферку взяли.

              19 t/s decoding

              65 t/s prompt processing

              Примерно тоже самое. Слабая память и не самый мощный проц компенсируется большим объемом GPU RAM. На одном i9 хорошо если будет 5 t/s.


              1. ToxaBes Автор
                27.08.2026 23:42

                Да, вы правы, прошу прощения, привык что первым идет prompt processing, потом decoding.

                Покрутил настройки на своей системе, поднял скорость до 32-35 токенов в секунду. Похоже, что настройки для данной модели нужно подбирать вручную под каждую систему.


        1. Luis2
          27.08.2026 23:42

          Скорость упрется в пропускную способность твоей ddr4. Трансформеры это memory bound задача, тут частота памяти решает гораздо больше объема


    1. AiR_WiZArD
      27.08.2026 23:42

      Старый сервер с 96 Гб DDR4 ОЗУ и 2 зеонами E5-2683 v4 (32 ядра суммарно) без видеокарты с MTP выдает до 10 токенов в секунду, без MTP 7t/s, что очень неплохо для столь древнего железа.


      1. Prohoziy2202
        27.08.2026 23:42

        Для инференса важно не количество ядер, а пропускная способность памяти. В данном случае с вероятностью 99% там 4-х канал на частоте 2133мгц. Сейчас если собирать систему под большие модели, и есть хоть какой нибудь бюджет, топ это сокет 4677, там в одном процессоре 6-ти канал на частоте 2933мгц, что грубо говоря даёт прирост вдвое.


  1. debagger
    27.08.2026 23:42

    Интереснее скорость префилла. Ждать по полчаса загрузки 100к контекста - это неюзабельно.


    1. Luis2
      27.08.2026 23:42

      Юзабельно это кластер из а100 в серверной, на домашнем железе всегда приходится терпеть компромисс между размером модели и ожиданием ответа)


    1. ToxaBes Автор
      27.08.2026 23:42

      Интереснее скорость префилла.

      300-400 t/s

      Для сравнения, на Qwen 3.8 27B префил у меня 800-900 t/s.


  1. Joysi
    27.08.2026 23:42

    Звучит интересно, я так понимаю, что на ПК подобному 192Gb DRAM (DDR5-5200) + 16GbVRAM - возможно одно из оптимальных решений.


    1. ToxaBes Автор
      27.08.2026 23:42

      Да, вы правильно понимаете, в конце статьи добавил ссылку на страницу где можно сравнить свою сборку с теми кто уже запускает модель на своем железе.


      1. Joysi
        27.08.2026 23:42

        Получаю 22-24 t/s на i7-265 +DDR5-5200 (192G) + 5070Ti(16G VRAM)
        llama-server -m Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf -c 262144 --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --host 0.0.0.0 --port 8080


        1. ToxaBes Автор
          27.08.2026 23:42

          Хороший результат! Все что 20 t/s и выше вполне юзабельно в каждодневном использовании.

          Для сравнения, у меня 30-35 t/s на том же 262К контексте, версии модели и настройках. Железо: Threadripper 3970X + DDR4-3200 (128GB quad-channel mode) + RTX A6000 48GB.


          1. AcckiyGerman
            27.08.2026 23:42

            А какой квант запускаете? FP8?


            1. ToxaBes Автор
              27.08.2026 23:42

              А какой квант запускаете? FP8?

              Для сравнения запускал тот же квант, что и у автора комментария, на который отвечал: Qwen3.8-Flash-Next-UD-Q4_K_XL


        1. vitaliy-sn
          27.08.2026 23:42

          Эта же модель на 96GB DDR4-3500 + 5070 Ti + 5060 Ti выдает 17-19 t/s tg и 360-370 t/s pp на задаче с ~10к контекста на входе.


          1. dkeiz
            27.08.2026 23:42

            а до сотни контекста разогнать можно? так то рабочие показатели


            1. vitaliy-sn
              27.08.2026 23:42

              llama-server был запущен с “-c 102400”.

              Провел тест с заполнением контекста до 97122, вот таблица pp для наглядности:

              n_tokens | tokens per second
              2048     | 368.42
              20480    | 328.15
              38912    | 306.56
              57344    | 290.65
              75776    | 276.73
              94208    | 263.98
              97122    | 261.80

              Генерация при этом была всего 11 t/s.

              Надо подождать, когда улучшат поддержку новой архитектуры и добавят MTP. Как раз к тому времени, как выпустят qwen4, может всё станет хорошо.


  1. Abcolyt
    27.08.2026 23:42

    Интересно. Ещё бы столько оперативной памяти было(


  1. max-daniels
    27.08.2026 23:42

    А если у меня 64 Гб RAM + 24 Гб VRAM? Мне особо не светит юзать данную модель?


    1. McHack
      27.08.2026 23:42

      Эту модель на данный момент - нет. Однако, я думаю быстренько появятся либо по умному пережатые модельки, по типу APEX или ещё что. Либо REAP модельки где часть экспертов выкинули. В одном из этих случаев - залезет


      1. Mijka64
        27.08.2026 23:42

        Почему? В Q1 она 72ГБ, и существенная часть на SSD. Должно влезть (я не пробовал, теоретизирую, у меня 96+24 и только в планах на выходные)


        1. HyperWin
          27.08.2026 23:42

          Все что ниже Q4 лучше даже не пробовать


          1. ToxaBes Автор
            27.08.2026 23:42

            Это справедливо в общем случае, но не для этой модели. Эту стоит попробовать. Главный минус Q1 не то что он выдают "всего" 80% от оригинальной точности, а то что в них нет MTP голов из-за чего генерация чуть медленнее.


            1. edyapd
              27.08.2026 23:42

              А у Qwen3.8-Flash-Next-UD-Q4_K_XL они есть? А то если я устанавливаю ключ ’–spec-type draft-mtp’ так она ругаться начинает. Хотя на 27В принимает этот ключ в этом же кванте.


              1. ToxaBes Автор
                27.08.2026 23:42

                Должны быть. Насколько я знаю MTP слой сохранен от Q4 и выше.


              1. vitaliy-sn
                27.08.2026 23:42

                Поддержку MTP для этой модели пока еще не реализовали в llama.cpp


          1. Joysi
            27.08.2026 23:42

            А по мне и Q3 - неплохо:

            Попробовал разную квантизацию для одного и того "популярного" нечеткого промпта:

            Generate clean SVG code for a whimsical illustration of a friendly pelican riding a vintage bicycle, transparent background, minimalist vector style

            ПК - i7-265 + DDR5-5200 (192G) + 5070Ti(16G VRAM)

            gguf - из https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF/tree/main

            Запускал в llama с параметрами --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --host 0.0.0.0 --port 8080 ( -c 262144 , за исключением Q6 - там  -c 131000).

            Интересно наблюдать за уровнем детализации - например незакрепленные крылья колес, кол-во спиц, некорректность слоев , подчеркивание контуров и т.п. Также резкий просад по скорости на Q5/Q6 (а вот Q5 от Q6 почти не отличаются).

            Результаты

            Qwen3.8-Flash-Next-UD-IQ3_XXS 24 t/s
            Qwen3.8-Flash-Next-UD-IQ3_XXS 24 t/s
            Qwen3.8-Flash-Next-UD-Q4_K_XL 23 t/s
            Qwen3.8-Flash-Next-UD-Q4_K_XL 23 t/s
            Qwen3.8-Flash-Next-UD-Q6_K_XL 16.5 t/s
            Qwen3.8-Flash-Next-UD-Q6_K_XL 16.5 t/s

            А вот с Qwen3.8-Flash-Next-UD-Q5_K_XL вообще не сложилось, формировал неполное изображение (причем не вываливался, дальше в сессии можно было продолжать работать с нормальными ответами). 3-4 попытки с разными размерами макс размера контекстного окна и top_k/top_p + прописывание –cache_type_k/v q4_0 не разрешили ситуацию (просто иная "битая" картинка). Скорость ~18 t/s. Странно, Q6 отрабатывал полностью.

            Qwen3.8-Flash-Next-UD-Q5_K_XL 17.5 t/s
            Qwen3.8-Flash-Next-UD-Q5_K_XL 17.5 t/s

            Возможно Q5 и починится... Пока для 16G VRAM- все же лучше Q3/Q4 (в зависимости от кол-ва DRAM). Q6 - сильно падает скорость генерации.


            1. ToxaBes Автор
              27.08.2026 23:42

              Спасибо за тесты, очень наглядно!

              По поводу UD-Q5_K_XL: попробуйте поднять K-кеш c Q4 до Q8, я думаю ситуация исправится. Если же нет, то и V-кеш нужно поднять до Q8.


              1. Joysi
                27.08.2026 23:42

                Спасибо

                Да, помогло `llama-server -m Qwen3.8-Flash-Next-UD-Q5_K_XL-00001-of-00006.gguf -c 100000 --top-p 0.95 --top-k 20 --temp 0.9 --min-p 0.00 --host 0.0.0.0 --port 8080 --cache_type_k q8_0 --cache_type_v q8_0`

                Но результат... давно я так не смеялся ("хлебальник" душевный получился, карикатурный даже ... По моему, у Q3 из ответа выше - лучше справился, хотя детализации меньше):

                Qwen3.8-Flash-Next-UD-Q5_K_XL 17.8 t/s
                Qwen3.8-Flash-Next-UD-Q5_K_XL 17.8 t/s


    1. melodicmsk
      27.08.2026 23:42

      В статье же написано, что 50В можно хранить хоть на ссд. Поэтому должно скорее всего полететь.


      1. Ndochp
        27.08.2026 23:42

        Вот только какой запускатор сумеет правильно разложить между NVME, RAM, VRAM интересно. Не встречали еще инструкций для какого-нибудь дешманского 1ТБ/64/16?


    1. Luis2
      27.08.2026 23:42

      Четырехбитная квантовка весит под 100 гигов, в твои 88 гигов суммарной памяти оно влезет исключительно с жестким свопом, файл подкачки убьет скорость до нуля


      1. AcckiyGerman
        27.08.2026 23:42

        Ответ неверен. Уже вчера на реддит подобрали конфиги llama, которые оставляют весь N-gram (-50gb) на SSD. Ничего сложного нет, см. мои недавние комментарии.


    1. ToxaBes Автор
      27.08.2026 23:42

      Требуемый размер памяти (RAM+VRAM) в зависимости от квантования:

      • UD-Q4_K_XL 111.3 GB

      • UD-IQ4_XS 93.7 GB

      • UD-Q3_K_XL 90 GB

      • UD-IQ3_XXS 82 GB

      • UD-Q2_K_XL 78.9 GB

      • UD-IQ1_M 74.5 GB

      • UD-IQ1_S 72.5 GB

      По идее, у вас должна заработать нижняя половина списка.


    1. reqvar
      27.08.2026 23:42

      Подожди ещё недельку-две.


    1. tonx92
      27.08.2026 23:42

      Unsloth gguf q1 там 3 файла, 10мб 50гб и 22.5 тот что 50 по идее можно даже на диск, но пока что в оперативу. А 22.5 у вас влезает в видеопамять, и в случае с мое не обязательно всему kv кэшу в видеопамять помещаться, по логике должна не просто запуститься так ещё и скорость давать. Но вот надо ли оно, сам сижу и думаю q1 у нее это 80% top1% Accuracy, 27b я могу в q6k_xl и это около 98%, в swe pro у моделей разница почти никакая 62,5 у flash и 61,7 у 27b. Но по всей видимости будет быстрее, в общем выглядит так как будто эта модель создана именно для того что бы ее исключительно на ОЗУ гонять. Т.к. с видеокартой 27b должна быть сильно умней при том же занимаемом объеме ГПУ.


    1. leen_vl
      27.08.2026 23:42

      Светит. И греет) Я подцепил эту модель в UD_Q2_K кванте к лламе (пока к ветке pr-27742, пулреквест еще не вмержили в main), развернул на ноуте I7-1362H, 32 ГБ, RTX5070 8 ГБ VRAM. Запускал с маппингом, так что чтение экспертов в VRAM идет напрямую с SSD, плюс в оперативке немного болтается. Префилл удручающий - порядка 20 - 40 т/с, генерация на коротких контекстных окнах 10-20, на длинных 5 - 10. Шевелится, хотя и пыхтит. В окошке рассуждения здравые, холодный запуск секунд 5-10, подгрузка эксперта меньше секунды. Пока балуюсь с max reasoning, по ощущениям весьма неплохо. Оговорюсь - тестов не делал, сравнений с цифрами на руках не проводил, этого и без меня в сети хватает. Все на личных впечатлениях. Блок запуска лламы из ини-файла:
      [Qwen3.8-Flash-Next]
      model = /home/user/models/Qwen3.8-Flash-Next-UD-Q2_K_XL-00001-of-00003.gguf
      mmproj = /home/user/models/Qwen3.8-Flash-Next-Uncensored.mmproj-Q8_0.gguf
      ctx-size = 70000
      threads = 8
      threads-batch = 4
      temperature = 0.7
      jinja = true
      top-p = 0.95
      top-k = 64
      repeat-penalty = 1.1
      ngl = auto
      parallel = 1



  1. Tsimur_S
    27.08.2026 23:42

    Интересно что они таки не стали пропускать 4, как обычно в Азии делают.


    1. Belarus
      27.08.2026 23:42

      Видимо, новое поколение не такое суеверное.


    1. reqvar
      27.08.2026 23:42

      Чушь поришь. В какой Азии? Сибирь - это Азия. И Грузия - это Азия. И Владивосток - это Азия. И Дубайщина - это Азия.


      1. AcckiyGerman
        27.08.2026 23:42

        Аляска это запад или восток?


        1. Ndochp
          27.08.2026 23:42

          С октября 1867 - дальний запад.


  1. Bardakan
    27.08.2026 23:42

    эта статья - нейрослоп. Иначе как объяснить, что указаны 4 источника данных, но ни в одном "qwen 4" даже не упоминается


    1. ToxaBes Автор
      27.08.2026 23:42

      эта статья - нейрослоп. Иначе как объяснить, что указаны 4 источника данных, но ни в одном “qwen 4” даже не упоминается

      У меня есть для вас упражнение:

      1. Открываете первую ссылку из источников: https://qwen.ai/blog?id=qwen3.8-flash-next

      2. Читаете там первое предложение первого абзаца: In this release we are opening the weights of Qwen3.8-Flash-Next, a multimodal MoE model that also serves as an early preview of the architecture used in Qwen4

      3. Выдыхаете.

      Повторяйте по утрам натощак.


      1. Bardakan
        27.08.2026 23:42

        в названии и в тексте вашей статьи указано "qwen 4" (через пробел), в статьях указано "qwen4". Как я должен догадаться, что у вас опечатка? Тем более, что вы ее до сих пор не исправили.

        Зато сразу лезете минусовать профиль и выписываете всякую чушь в комментариях. И "qwen 4" по вашим ссылкам действительно нет.


        1. ToxaBes Автор
          27.08.2026 23:42

          У вас какое-то недомогание, иначе я не могу этого объяснить. Выздоравливайте.


        1. Dhwtj
          27.08.2026 23:42

          Выпейте водки 50 грамм

          Глаза сфокусируются


          1. Bardakan
            27.08.2026 23:42

            А эту статью надо было после 50 грамм читать? Тогда понятно. Я просто непьющий - изображение не расползается.

            Кстати оскорблять человека и одновременно ставить ему минусы в карму за «грубое общение» - вам самим не смешно?


            1. Dhwtj
              27.08.2026 23:42

              Какие минусы? Это не я!

              Честно, не я
              Честно, не я
              Анонимус жесток, но это не я
              Анонимус жесток, но это не я


            1. nikulin_krd
              27.08.2026 23:42

              Вы прибежали, обвинили человека что его статья нейрослоп, а когда вам мягко указали на то что вы не правы, вы вместо того чтобы признать свою ошибку и извиниться продолжаете нести чушь, а теперь удивляетесь минусам


              1. Bardakan
                27.08.2026 23:42

                Т.е. моя фраза про опечатки в статье - это "нести чушь", а три чела включая автора написали в духе "иди лечись" - это "мягко указали", и я еще после этого извиниться должен? На что вы расчитываете?

                Единственное, что меня удивляет после этого - в статье про stackoverflow кто-то жаловался на местную систему кармы. Тем временем хабр:


        1. HyperWin
          27.08.2026 23:42

          Мои соболезнования.


  1. Luis2
    27.08.2026 23:42

    Благодаря тому, что N-gram слой можно выгружать в системную память ОЗУ или через mmap на SSD

    Костыль века, хоть и рабочий. Пси-ай шина будет дымиться от постоянных свопов, зато в оперативку влезет


    1. ToxaBes Автор
      27.08.2026 23:42

      Да, все так. Стратегия Alibaba заключается в закрытии всех ниш своими моделями. Вот и дошла очередь позаботиться о пользователях без мощных видеокарт и дать им возможность пощупать фронтир модель на ОЗУ. При правильной настройке эта модель вполне может стать для них ежедневным помощником. В том числе и поэтому я решил о ней написать.


      1. Mijka64
        27.08.2026 23:42

        Нет, не так.

        Pci-E шина дымилась при плотной архитектуре, когда все веса были нужны на каждый токен.

        Оффлоад экспертов уже сносно работал, хотя и ограничивал скорость.

        Ngram-слой на ssd вообще не будет узким местом.


        1. ToxaBes Автор
          27.08.2026 23:42

          Я имел ввиду, что у большинства пользователей в оффлоад уйдет не только Ngram-эмбеддинги, но и заметная часть слоев основной архитектуры. И вот это уже даст нагрузку.