В пятницу вышла Qwen3.8-27B. Скажу честно, с середины мая я отказался от подписок и сидел исключительно на локальной Qwen3.6 (для всех своих домашних проектов), у меня даже статья была на эту тему. Поэтому мне было очень интересно увидеть на что способна новая Qwen3.8-27B. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что, как мне кажется, не совсем корректно), поэтому я решил поделиться настройками, которые работают (у меня), надеюсь они будут кому-нибудь полезны. Qwen3.8-27B превзошла мои самые смелые ожидания, и уж что-что а задумчивой она не кажется.

Загрузка

Так получилось, что я не использую GGUF файлы от Unsloth. Как-то давно я попробовал их GGUF и качество мне очень не понравилось, не знаю уж как они его готовят, но почему-то качество работы той старой модели было не очень (много галлюцинаций и повторов), поэтому я обычно конвертирую gguf самостоятельно (прошу не ругаться и тапками не кидаться).

Сообщение о том что модель доступна для скачивания пришло минут на 40 раньше чем я ожидал, ну окей, создал новую папку и загрузил веса.

hf download Qwen/Qwen3.8-27B --repo-type model --local-dir ./Qwen3.8-27B_official_sources_from_Qwen

Далее создал gguf файл:

pipenv run python convert_hf_to_gguf.py ~/models1/Qwen3.8-27B/Qwen3.8-27B_official_sources_from_Qwen/   --outfile ~/models1/Qwen3.8-27B/my_conversions/Qwen3.8-27B-F16.gguf --outtype f16

Насколько я понимаю данная операция просто переупаковывает тензоры в один файл формата GGUF с точностью F16, GPU на этом этапе не используется и скорость зависит только от CPU и диска. В моем случае это заняло примерно 14 минут.

Я запускаю модель на старенькой 4090, поэтому следующим шагом идет квантование. Использую Q4_K_M, поэтому следующей командой, которую я запустил была:

llama-quantize Qwen3.8-27B-F16.gguf    Qwen3.8-27B-Q4_K_M.gguf    Q4_K_M

тут пришлось еще минут 5 подождать.

Запуск

И вот модель готова к запуску! Я дрожащими руками настраиваю llama.cpp… Шучу конечно! Но мне действительно не терпелось запустить модель, поэтому я тупо скопировал файл настроек для 3.6 поменял обозначение модели на 3.8 и запустил как есть. Собственно вот настройки:

llama-server -m ~/models1/Qwen3.8-27B/my_conversions/Qwen3.8-27B-Q4_K_M.gguf \
    -ngl 99 \
    --port 8882 \
    --temp 0.6 \
    --top-p 0.95 \
    --top-k 20 \
    --min-p 0.00 \
    -t 6 \
    -c 180000 \
    --cache-type-k q8_0 \
    --cache-type-v q8_0 \
    --parallel 1 \
    --flash-attn on \
    --presence-penalty 0.52 \
    --repeat-penalty 1.0 \
    --repeat-last-n 206 \
    --reasoning-budget 4096 \
    --reasoning-budget-message "Let's move on to the final answer."
    --cache-ram 32768 

Ну и оно заработало! Без Overthinking, без галлюцинаций, практически идеально! За прошедшие 3 дня я прогнал модель почти по всем сценариям в которых я ее использую и со всеми скиллами, которые я написал за последние месяцы. Во всех случаях модель существенно превосходила 3.6.

Больше всего меня впечатлила работа модели в агентном режиме. У меня есть довольно длинный сценарий из 27 шагов, в ходе которого модель должна скачивать данные из интернета, заполнять таблицу в csv файле, использовать Python и статистические методы для анализа данных и по результатам формировать отчет. Qwen3.6 не справлялась с полным сценарием и обычно останавливалась после 8-12 шагов, пришлось разбить сценарий на фазы и запускать их по-очереди. Qwen3.8 справилась с полным сценарием и за 22 минуты корректно выполнила все 27 шагов с логгированием промежуточных результатов в markdown файл и построением финального отчета.

reasoning-budget

Отдельно нужно сказать про такой параметр как reasoning-budget. В Qwen3.6-27B я добавил этот параметр потому, что модель довольно долго думала. Значение параметра для 3.6 было 2048 с ним модель думала примерно 20-30 секунд до начала ответа, и мысли модели мне не очень нравились, она периодически зацикливалась и ее приходилось останавливать, пришлось даже добавить: --presence-penalty 0.52, --repeat-penalty 1.0, --repeat-last-n 206 (вы можете видеть эти параметры в моих настройках). Однако новая Qwen3.8-27B меня очень приятно удивила. Она начала отвечать сразу! Т.е. 3.6 даже на простой вопрос - сначала думала (да не так долго, но думала), а 3.8 ответила сразу, размышление 1 секунда. Поэтому в данный момент я увеличил лимит рассуждения до 4090 токенов (можно видеть в настройках llama.cpp) и честно сказать подумываю о том, чтобы увеличить его еще в 2 раза, или вообще убрать.

Я не претендую на то, что параметры запуска, которые я привел, единственно правильные, более того, они не совпадают с официально рекомендованными, и получились случайно (как я сказал - я скопировал настройки, которые использовал для 3.6) но для меня они работают очень хорошо. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что, как мне кажется, не совсем корректно), поэтому я решил поделиться настройками, которые работают, надеюсь они будут кому-нибудь полезны.

Комментарии (141)


  1. Politura
    19.08.2026 02:24

    reasoning-budget на самое лучшее решение, это как мешком по голове, чтоб все мысли убрать. У 3.8 можно гораздо гибче размышления настраивать с помощью reasoning-effort.

    Попробуй такой параметр для llama-server:

    --chat-template-kwargs '{"reasoning_effort": "low"}'

    Можно задавать low, medium, high, и кажется xhigh


    1. Mintavrus
      19.08.2026 02:24

      xhigh ставится по умолчанию, если не ставить другой параметр. От этого и идут жалобы что модель якобы очень много думает


    1. rtrgdfb Автор
      19.08.2026 02:24

      кажется возникло недопонимание по поводу reasoning-budget
      Изначально я добавил эту настройку для 3.6, потому, что 3.6 периодически зацикливалась на: "...I will provide the best answer, I will provide ..." и так по-кругу.
      Т.е. reasoning-budget для 3.6 использовался как ограничитель, чтобы модель остановилась, если ушла в цикл. Нужно отметить, что reasoning-budget не обрывает рассуждение на середине, а довольно мягко способствует тому, чтобы модель в него уложилась.
      3.8 в этом плане гораздо лучше, за последние 4 дня она ни разу не уходила в подобный цикл. Поэтому я увеличил reasoning-budget и планирую его еще увеличить. Т.е. меня полностью устраивает как она рассуждает и я готов дать ей еще немного пространства для рассуждения (не ограничить, а добавить), рассуждения выглядят обоснованными и вполне логичными, и не затягиваются надолго, если задача сложная модель может потратить больше токенов, но для простых задач тратит совсем немного (значительно меньше чем тратила 3.6), т.е. выглядит так, что 3.8 эффективние использует бюджет.
      (вообще конечно нужно поиграть с настройками, но вроде как все и так работает, а времени пока нет)


      1. Politura
        19.08.2026 02:24

        Понятно, да, как стоп-кран от зацикливания имеет смысл оставить, хотя 4к токенов маловато, у меня бывало 3.6 без зацикливания и по 8к токенов думало над чем-то сложным.


        1. jarkevithwlad
          19.08.2026 02:24

          у меня 3.8 бывало 30к токенов обдумывал и в конце всё же ответ давал сам


      1. Krypt
        19.08.2026 02:24

        Мне кажется - циклы в мышлении - это артефакт квантования - для 3.6 я вижу разницу между Q3_K_M и Q4_K_M - Если я чате который ушёл в цикл остановить модель и стереть цикл до его старта - Q3 квант опять уйдёт в цикл. Если же в этот чат загрузить Q4 перед началом цикла - он выдаст "wait, no, <minor correction>" и продолжит корректно рассуждать.


        1. Petroleum_man
          19.08.2026 02:24

          Циклы частая история и на fp16, и на многих моделях встречаются


        1. ToxaBes
          19.08.2026 02:24

          Мне кажется - циклы в мышлении - это артефакт квантования

          Вы абсолютно правы, в большинстве случаев так и есть. В Q8/BF16 зацикливание проявляется в основном из-за неверно выставленного параметра temperature.


      1. ToxaBes
        19.08.2026 02:24

        Каждый раз одно и тоже, люди используют гиперпарамтеры по умолчанию, потом у них то Qwen 3.6 27B галлюцинирует, то Qwen 3.6 35B A35 зацикливается, то Qwen 3.8 27B долго думает...

        Что сложного в том, чтобы открыть, например, unsloth и прочитать:

        Qwen3.8-27B is a hybrid thinking model with different default settings for thinking and non-thinking modes. Extra high is enabled by default so if you want shorter thinking traces, you can adjust the thinking effort:

        • Thinking Mode: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

        • Instruct (or non-thinking) mode: temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0

        Сравните рекомендуемые параметры с вашими.

        От себя могу добавить, что рекомендуемые параметры точно работают для Q8 и BF16. Для Q4 и ниже уже начинается лотерея т.к. такие модели могут зацикливаться из-за накопленных ошибок.


        1. Cordekk
          19.08.2026 02:24

          Минус вашему комментарию поставил случайно, поэтому плюсанул карму


          1. ToxaBes
            19.08.2026 02:24

            Курс обмена конечно приятный, но не стоило. Поставили и поставили.


  1. m0xf
    19.08.2026 02:24

    Почему использован --temp 0.6, если разработчиками модели рекомендуется 1.0?


    1. rtrgdfb Автор
      19.08.2026 02:24

      так получилось. Я редко использую модель для написания красивых текстов, на письма и что-то короткое 0.6 - нормально, а излишнее творчество мне ни к чему, пусть лучше на один и тот-же вопрос она отвечает более-менее одинаково.


      1. Mintavrus
        19.08.2026 02:24

        Как я понял температура 1.0 в qwen3.6 не тоже самое что температура 1.0 в qwen3.8. Поэтому для одних и тех же сценариев для qwen3.6 разработчики рекомендуют 0.6, а для qwen3.8 - 1.0


        1. rtrgdfb Автор
          19.08.2026 02:24

          может быть, нужно будет просмотреть, но в целом, то что выдает qwen с 0.6 меня устраивает


        1. fshp
          19.08.2026 02:24

          Но ведь архитектура моделей одинаковая. Разница только в весах


        1. nullc0de
          19.08.2026 02:24

          Абсолютно одинаковая. Даже рекомендуемые параметры у обоих версий одинаковые.

          Просто у 3.8 появился reasoning_effort который регулирует глубину рассуждений, температура же отвечает за "качество" рассуждений и постоянство ответов.

          Смотрите мой комментарий ниже.


    1. nullc0de
      19.08.2026 02:24

      Это дает более детерминированный ответ. Некоторые задачи требуют одинакового точного и повторяемого результата. При температуре 1.0 в ответ включается креативность модели, она начинает выдумывать где не надо и ее рассуждения может занести не в ту степь. 1.0 - хорошо для написания уникальных текстов, генерации картинок без повторений. Но цена высокой температуры это галлюцинации, например кривые лица на изображении или люди с 6 пальцами. Для программирования хороший вариант это 0.6-0.7 так как важнее постоянство ответа. Не обязательно придерживаться рекомендаций разработчиков модели, нужно модель настраивать под свои конкретные задачи.


  1. neco
    19.08.2026 02:24

    а если не секрет, на каком железе это запускается?


    1. Mintavrus
      19.08.2026 02:24

      В тексте написано, что на RTX4090. Все остальные параметры железа глубоко вторичны.


    1. rtrgdfb Автор
      19.08.2026 02:24

      на виртуалке с Arch и проброшенной внутрь RTX4090


      1. jarkevithwlad
        19.08.2026 02:24

        а можно вопрос? для чего именно виртуалка с арчем? я только что повторил то же самое сразу на вин11


        1. rtrgdfb Автор
          19.08.2026 02:24

          просто я как-то давно вместо винды установил Arch, у него rolling release, вот он так и катится от обновления к обновлению. Виртуалка удобна для экспериментов, потому, что если что-то сломается не нужно все переустанавливать, ну а Arch на виртуалке - потому, что удобно иметь одну систему везде.


          1. AntonSn
            19.08.2026 02:24

            На windows система достаточно значительное количество VRAM резервирует, даже если подключить монитор к igpu процессора. На cachy os, используя beellama и сжатие kv кеша kvarn6 у меня получилось запустить модель в 5q без mtp на 24 ГБ vram


            1. KoIIIeY
              19.08.2026 02:24

              Гугл мне сказал что разницы между q4 и q5 практически нет.

              Или вы имеете ввиду что скорость адекватная?


              1. AntonSn
                19.08.2026 02:24

                Качество модели по идее должно быть лучше. Но я разницы не заметил, если честно :D. Сразу скажу, что я не программист, мои задачи просты: системное администрирование - настрой, установи; задачи связанные с таблицами - напиши скрипт на python - pandas. Кстати, Glimmer для этих задачи мне показался поприятнее - работает быстрее в плане размышлений и в плане ток/сек.


            1. rtrgdfb Автор
              19.08.2026 02:24

              (спасибо! попробую mtp и разные квантования)


      1. Okeu
        19.08.2026 02:24

        а на чем виртуалку крутите, qemu? я чет немного от темы отстал, никогда гпу не пробрасывал на обычных десктопных решениях)


        1. rtrgdfb Автор
          19.08.2026 02:24

          да qemu. Подробную инструкцию дать не смогу, делал пару лет назад, не помню, но не очень сложно, может 1-2 часа. Использовал Archwiki, тогдашний ChatGPT и что-то с форумов.


          1. Okeu
            19.08.2026 02:24

            да у меня сейчас вопрос развертывания не стоит, просто думаю на будущее, что есть варианты для домашнего сервака с виртуалками) спасибо)


  1. ros_molodezh
    19.08.2026 02:24

    спасибо очень полезная информация


    1. rtrgdfb Автор
      19.08.2026 02:24

      рад слышать! Спасибо, что прочитали.


  1. jarkevithwlad
    19.08.2026 02:24

    пользуюсь unsloth там кстати внутри и mtp есть сразу, я вот так включаю

    --spec-type draft-mtp --spec-draft-n-max 2

    и ещё рекомендую всем турбоквант, у меня эта модель в q4_k_m влазит полностью в gpu 24gb с 128к контекста и место ещё остаётся


    1. KoIIIeY
      19.08.2026 02:24

      А сколько токенов в секунду? У меня на 7900хтх максимум 14 почему то


      1. jarkevithwlad
        19.08.2026 02:24

        у меня на 3090 40-60ток/с с mtp и 25-30 без mtp


        1. KoIIIeY
          19.08.2026 02:24

          Не покажете конфиг запуска? :)

          У меня 14 с мтп


          1. jarkevithwlad
            19.08.2026 02:24

            llama-server.exe -m “C:\models\Qwen3.8-27B-Q4_K_M\Qwen3.8-27B-Q4_K_M.gguf” --ctx-size 128000 -ngl all --load-mode none -fa on --jinja --temp 0.6 --repeat-penalty 1.1 --top-k 20 --top-p 0.95 --min-p 0.0 --port 8080 --no-context-shift -ctk tbqp3 -ctv tbq3 --spec-type draft-mtp --spec-draft-n-max 2


            1. KoIIIeY
              19.08.2026 02:24

              –flash-attn on -ngl 99 --chat-template-kwargs ‘{“reasoning_effort”:“low”}’ --parallel 1 --cache-type-k q8_0 --cache-type-v q8_0

              у меня видеокарта через окулинк воткнута, и вот с таким подходом 50-75 токенов сделал


    1. rtrgdfb Автор
      19.08.2026 02:24

      unsloth у меня как-то не зашел, а на счет mtp - хорошая идея, попробую. Спасибо!


      1. jarkevithwlad
        19.08.2026 02:24

        вашим способом gguf даже меньше чем у unsloth

        и при этом mtp так же в нём уже есть и работает

        пример скорости с mtp


        1. rtrgdfb Автор
          19.08.2026 02:24

          Спасибо! У вас кстати скорость получилась больше чем у меня (у меня примерно 45-50 токенов в секунду)


          1. jarkevithwlad
            19.08.2026 02:24

            я думаю это из-за виртуалки с пробросом gpu, я раньше в wsl запускал и у меня скорость вроде как меньше была чем в вин11, хотя у меня сейчас должна быть скорость меньше чем у вас (особенно учитывая что у меня только 3090), т.к. турбоквантование контекста сжимает потребление памяти контекстом в 4.74x и уменьшает скорость в 0.87x при этом качество в сравнении с контекстом f16 даже выше на 8%


            1. rtrgdfb Автор
              19.08.2026 02:24

              нашел!!! :) я поставил ограничение мощности видеокарты на 360 Ватт а потом об этом забыл! :))) Так-что виртуалка тут ни при чем


              1. jarkevithwlad
                19.08.2026 02:24

                странно, но моя выдаёт такую скорость при 350 ватт-ах, стоковые экстрим параметры на 420 ватт не использую))


                1. rtrgdfb Автор
                  19.08.2026 02:24

                  интересно! если будет время посижу в выходные посмотрю растройки llama-server. Можете еще раз подсказать какая скорость у Вас получается с какими настройками?


                  1. jarkevithwlad
                    19.08.2026 02:24

                    Скрытый текст

                    llama-server.exe -m “C:\models\Qwen3.8-27B-Q4_K_M\Qwen3.8-27B-Q4_K_M.gguf” --ctx-size 128000 -ngl all --load-mode none -fa on --jinja --temp 0.6 --repeat-penalty 1.1 --top-k 20 --top-p 0.95 --min-p 0.0 --port 8080 --no-context-shift -ctk tbqp3 -ctv tbq3 --spec-type draft-mtp --spec-draft-n-max 2

                    скорость выше в чате на скриншотах


                    1. rtrgdfb Автор
                      19.08.2026 02:24

                      спасибо!


                    1. rtrgdfb Автор
                      19.08.2026 02:24

                      Еще раз спасибо! обновил llama.cpp, поставил
                      --spec-type draft-mtp
                      --spec-draft-n-max 2
                      и скорость выросла до 55-79 токенов в секунду. Средний прирост скорости 1.74 раза. (Контекст правда пришлось ужать со 180000 до 140000, работает, но практически без резерва vRAM)


        1. fermentum
          19.08.2026 02:24

          У вас "старый" gguf от Unsloth.

          Давеча они выкатили версию UD 3.0, уменьшив размер и сохранив качество.


  1. jarkevithwlad
    19.08.2026 02:24

    поправьте, у вас вместо gguf -> guff

    --outfile ~/models1/Qwen3.8-27B/my_conversions/Qwen3.8-27B-F16.guff


    1. rtrgdfb Автор
      19.08.2026 02:24

      Поправил. Спасибо!


  1. jarkevithwlad
    19.08.2026 02:24

    залил сорсы своего форка llama.cpp (only cuda), суть такая: это последняя версия llama.cpp но с поддержкой турбоквантования контекста, не уверен насчёт сборки для линукс но может и выйдет что то, тестировал у себя только для вин 11 под rtx 3090
    для контекста в режиме турбокванта рекомендую -ctk tbqp3 -ctv tbq3
    а для mtp --spec-type draft-mtp --spec-draft-n-max 2


    1. ToxaBes
      19.08.2026 02:24

      рекомендую -ctk tbqp3 -ctv tbq3

      А вы понимаете, что этим делаете лоботомию сети? V кеш еще можно квантовать в Q8, но K кеш должен быть в FP16/BF16. Точность K-кеша критически важна, это суть механизма внимания, в логике которого в конце идет softmax.

      Softmax это экспоненциальная функция. Из-за экспоненты даже небольшая погрешность в K сильно искажает веса внимания и модель начинает смотреть не туда или теряет контекст.

      Лучше квантуйте напрочь саму модель и урезайте леща длину контекста, вместо того чтобы трогать K кеш, иначе ваши модели будут галлюцинировать и зацикливаться выдавая мусор. А потом пользователи будут писать о том какие плохие модели, не могут ничего.

      Квантование модели и квантование кеша это две большие разницы.


      1. jarkevithwlad
        19.08.2026 02:24

        только у меня модель не "будут галлюцинировать и зацикливаться выдавая мусор" а работает без проблем, почитайте что и V и что K кэш имеет качество в турбокванте этом выше чем bf16 и по тестам больше задач решает


        1. ToxaBes
          19.08.2026 02:24

          Нет, это не правда, TurboQuant не делает качество KV-кэша выше, чем у исходного формата bf16 просто потому что bf16 это исходная точность для большинства моделей, а TurboQuant дает сжатие с потерями.

          Вы транслируете миф не разобравшись в вопросе.

          При работе с очень длинным текстом (256K+ токенов) кэш в формате bf16 полностью забивает видеопамять (VRAM). Модель на bf16 либо падает с ошибкой Out Of Memory, либо вынуждена обрезать контекст и за счет этого проваливает задачу. TurboQuant сжимает кэш в 3-5 раз (до 3-4 бит на элемент), благодаря чему длинный текст влезает в GPU и задача успешно решается.

          Также, на небольших выборках квантованная модель за счет шума квантования может случайно угадать на 1-2 теста больше, чем bf16.

          В IT-новостях оба эти момента подают как TurboQuant превзошел несжатую модель!!!1.


          1. jarkevithwlad
            19.08.2026 02:24

            Нет, это не правда

            ну это ваше мнение

            случайно угадать на 1-2 теста больше, чем bf16

            ну для вас может и случайно, на я вижу слишком много закономерностей, и турбоквантом именно этим пользуюсь с момента его появления, а их есть не мало разных, в том числе и которые хуже чем bf16

            это ваше дело верить или нет, я раньше сам делал тесты и у меня турбоквант показывал себя лучше (на qwen 3.5 9b) но сорян результатов и тестов не осталось

            не включают его в офф сборку llama cpp по разным причинам, начиная от того что реализаций разных есть не мало и всё ещё идут споры как правильно это стоит делать и с какой реализацией


            1. ToxaBes
              19.08.2026 02:24

              ну это ваше мнение

              Не только мое, ознакомьтесь, раз, два.

              И вы не со мной спорите, а с логикой работы механизмов квантования.

              Я верю, что в отдельных тестах у вас что-то показало хорошее, более того у исследователей из Google тоже показало хорошее, вот только потом независимые проверки показали, что это хорошее относится к узкому набору академических задач и моделям БОЛЬШИХ размеров.


              1. jarkevithwlad
                19.08.2026 02:24

                Скрытый текст

                как я и писал выше, вариаций турбоквантования много, тесты я делал именно этого варианта, также автор на гите приводит пять seeds и пишет о среднем примерно +20% vs f16 так что лично я буду и дальше использовать этот тип турбоквантования т.к. уже пол года пользуюсь и проблем с моделями не вижу, даже если использую их при заполненном контексте


          1. Shannon
            19.08.2026 02:24

            Проблема квантования - это выбросы в оригинале, для этих выбросов нужен bf16, который имеет огромный динамический диапазон, и такие выбросы причина, почему нельзя просто без потерь квантовать контекст. Контекст очень чувствителен к этим выбросам и нельзя их срезать.

            До вращения RMS=9.6
            До вращения RMS=9.6

            В TurboQuant проблему выбросов решили через вращение Адамара. Изначальный вектор переводится в другую систему координат, сохраняя его энергию, но распределяя значения уже более равномерно. Такой новый сглаженный вектор не имеет выбросов и может иметь лучшую математическую стабильность, и плюс хорошо поддается квантованию почти без потерь.

            Пик сглажен без потерь. После вращения RMS=9.6
            Пик сглажен без потерь. После вращения RMS=9.6

            В общем есть теоретическое обоснование, почему TurboQuant может быть стабильнее чем bf16, как это на практике - нужно больше тестов. Вращение Адамара уже реализовано в llama.cpp, поэтому, например, квантовать в Q8_0 на основной ветке стало вполне приемлемо, по сравнению с тем, что было раньше.


            1. ToxaBes
              19.08.2026 02:24

              В TurboQuant проблему выбросов решили через вращение Адамара.

              TurboQuant использует случайное вращение векторов (метод PolarQuant), чтобы размазать крупные выбросы по всем измерениям. Т.е. повезет/не повезет размазать хорошо.

              В общем есть теоретическое обоснование

              Приведите ссылки, потому что практически проверки это не показывают.

              См. комментарий выше.


              1. Shannon
                19.08.2026 02:24

                TurboQuant использует случайное вращение векторов (метод PolarQuant), чтобы размазать крупные выбросы по всем измерениям. Т.е. повезет/не повезет размазать хорошо.

                Смысл поворота Адамара в повороте, случайность позволяет перекрутить вектор. “повезет/не повезет” - тут это не применимо, так как мы можем проверить результат. Разница лишь в том, какая часть вектора будет пиком, сглажен он будет целиком и совершенно не важно какая будет итоговая случайная форма, важно только то, что вектор теперь входит в диапазон 3-4 бит.


                1. ToxaBes
                  19.08.2026 02:24

                  совершенно не важно какая будет итоговая случайная форма

                  Как это не важно, если вращение подгоняет вектор под гауссовское распределение. Именно под такую форму математически строится сетка квантования на 3-4 бита. При этом случайная матрица знаков обязательна быть определенной формы так сказать, иначе чистый Адамар в худшем случае может не размазать, а заново собрать пик.

                  важно только то, что вектор теперь входит в диапазон 3-4 бит.

                  Размазывая крупный выброс по всем измерениям, мы превращаем его в распределенный фоновый шум. Вектор начинает влезать в малый диапазон, но из-за этого шума проседает точность скалярных произведений в слоях Внимания. Т.е. важно то, насколько точным будет результат в слоях внимания, а не то что вектор теперь влезает в диапазон.

                  Видимо таки придется написать небольшую статью-гайд про квантование для малых объемов памяти.


    1. Fwild
      19.08.2026 02:24

      >--spec-type draft-mtp --spec-draft-n-max 2

      можно поставить --spec-draft-n-max на максимум, и ограничивать количество черновых токенов через минимальную вероятность принятия: --spec-draft-p-min 0.80 - на легко предсказуемых участках будет будет успешно предсказывать больше токенов за раз, на трудно предсказуемых - будет меньше зря пытаться.

      Про tbq3 - это не из этой https://habr.com/ru/companies/selectel/articles/1022312/ статьи? Там явная бессмыслица попадается, если присмотреться.

      https://github.com/ggml-org/llama.cpp/pull/21038#issuecomment-4150413357 (TQ5 лучше, чем Q8, TQ8 ~FP16) я как-то больше верю.


      1. jarkevithwlad
        19.08.2026 02:24

        нет не про эту статью, а из github


        1. Fwild
          19.08.2026 02:24

          и там tbqp3 заметно хуже чем F16 на всех тестах.

          F16 - тоже сжатие с потерями, его можно превзойти - но для этого нужно "разжимать" условный tbqp10 в F32, а не F16(как сейчас)(или обучить модель на "сжатых" токенах), пока вычисления идут в F16 - результат лучше, чем у F16 получить невозможно.


  1. sgnppv
    19.08.2026 02:24

    К сожалению в распоряжении ПК с 4090 24гб нет, зато есть две 5080 16гб, у кого был опыт использования двух видеокарт для этих целей?


    1. jarkevithwlad
      19.08.2026 02:24

      у меня опыта нет, но в целом должно быть юзабельно, gpt говорит вот так следует делать:

      Скрытый текст


      1. sgnppv
        19.08.2026 02:24

        У GPT я и сам уже спросил, но мне интересен личный опыт - он, как показывают даже комментарии к этому посту, весьма неоднороден


      1. RealFSA
        19.08.2026 02:24

        Лучше split mode tensor. Ллама это умеет и грузит все карты одновременно на 100%


        1. jarkevithwlad
          19.08.2026 02:24

          это только последние версии умеют и не всё всегда идеально работает


    1. Mintavrus
      19.08.2026 02:24

      2 5080 16 ГБ это гораздо лучше для запуска qwen3.8-27b чем одна 4090. Можно использовать менее заквантованную модель и больше контекста


    1. RealFSA
      19.08.2026 02:24

      Три 5060ti 16gb в режиме -sm tensor и nvfp4 квантовании и mtp выдают в среднем 60-65 токенов в секунду.


      1. sgnppv
        19.08.2026 02:24

        Спасибо за инфу! Вопрос еще - а как с нагрузкой на блок питания?


        1. RealFSA
          19.08.2026 02:24

          Там питальник на 1.6кВт. его достаточно. А карточки в максимуме обещают по 180 ватт на карту, но если верить llama-swap выше 110 на карту не поднимается.

          Меня другое расстраивает. Год назад брал 5060ti 16gb по 33-40000 руб, а теперь уже и 8gb дошли до 55000.


    1. alexandr93
      19.08.2026 02:24

      Может у кого есть опыт? Есть 3060, хотел докупить модифицированную 2080ti 22 gb. И не знаю имеет ли смымл для qwen 27b. Адекватная ли будет скорость и размер контекста? Просто не хочется контекст меньше 200к, потому что в агентских сценариях он заполняется очень быстро.


      1. debagger
        19.08.2026 02:24

        У меня как раз такая конфигурация работала, пока 2080ti 22 gb не сгорела. Два месяца. Скорость вполне приемлемая была - примерно 30-40 t/s с mtp и 500 t/s на заполнение.


        1. alexandr93
          19.08.2026 02:24

          Спасибо. Я просто эти чаты джипити просил рассчитать примерную скорость. Там был ответ, что около 5 токенов в секунду. Но самому по ощущениям казвлось, что больше. Сгорело потому что китайцы неправильно питание рассчитали с новыми чипами?


          1. debagger
            19.08.2026 02:24

            Чипы ужаренные, и память и GPU. Это видимо все после майнинга, годами жарилось в фермах. Поэтому - лотерея. Мне не повезло.


    1. klonklion
      19.08.2026 02:24

      У меня опыт есть, правда две 3090. Скейлится замечательно, делать для этого ничего не нужно, правда, конфигом llama.cpp поделиться не могу, т.к. запускаю в LM Studio.
      С MTP выходит 50 tps.


  1. jarkevithwlad
    19.08.2026 02:24

    нашёл ещё более быстрый вариант "FastMTP" внутри модели "HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF"

    но нужно собирать особую сборку llama.cpp

    HauhauCS FastMTP: up to 3.02x document TG and 1.93x reasoning TG versus non-MTP — plus up to 35.2% more document TG and 21.1% more reasoning TG than standard embedded MTP.


    1. hdyncrwaqw
      19.08.2026 02:24

      месяц назад тестировал разные комьюнити версии qwen3.6 , без цензуры, более оригинальные и в результате для моих devops задач самой комфортной оказалась чистая модель от unsoloth, а все сторонние версии наоборот вызывали огромное количество зацикливаний и галлюцинаций. также иногда в комьюнити сборках что-то ломают и для агентской системы модель уже не пригодна ибо aider или openhands перестаёт видеть где код, а где обычный текст


      1. rtrgdfb Автор
        19.08.2026 02:24

        Я вот все хочу разобраться, как самому сделать uncensored модель, да руки не доходят. Думаю, если бы кто-то написал руководство было бы круто. Хотя наверняка кто-то уже написал, вы в эту сторону не смотрели?


        1. Rio
          19.08.2026 02:24

          Готовое решение есть https://github.com/p-e-w/heretic


          1. rtrgdfb Автор
            19.08.2026 02:24

            Спасибо! нужно будет попробовать.


    1. jarkevithwlad
      19.08.2026 02:24

      p.s. для проверки сделал ещё один форк с турбоквантом + fastmtp и вот мои результаты скорости на rtx3090 (350w)

      p.s.s. 128к контекста так же помещаются полностью в vram

      Скрытый текст
      параметры запуска

      llamacppfast/llama-server.exe -m “C:\models\Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf” --spec-draft-model “C:\models\Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-FastMTP-32K.gguf” --spec-draft-ngl all --spec-type draft-mtp --spec-draft-n-max 3 --spec-draft-p-min 0 --ctx-size 131072 --parallel 1 --batch-size 2048 --ubatch-size 512 -ngl all --split-mode none --load-mode none -fa on --no-mmap --temp 1.0 --top-k 20 --top-p 0.95 --min-p 0.0 --presence-penalty 0 --repeat-penalty 1.0 --jinja --reasoning on --reasoning-effort xhigh --reasoning-preserve --reasoning-format deepseek --host 127.0.0.1 --port 8080 --no-context-shift -ctk tbqp3 -ctv tbq3

      странно но скорость упала, думаю из за турбокванта, хоть и по логам всё ок..


      а вот сразу после неё запустил турбоквант + обычный mtp (так же 350w) + froggeric/Qwen-Fixed-Chat-Templates (он кстати по умолчанию делает размышления Medium)

      Скрытый текст
      параметры запуска

      llamacpp2026/llama-server.exe -m “C:\models\Qwen3.8-27B-Q4_K_M\Qwen3.8-27B-Q4_K_M.gguf” --ctx-size 131072 -ngl all --load-mode none -fa on --jinja --temp 1.0 --repeat-penalty 1.0 --top-k 20 --top-p 0.95 --min-p 0.0 --port 8080 --no-context-shift -ctk tbqp3 -ctv tbq3 --spec-type draft-mtp --spec-draft-n-max 2 --chat-template-file “C:\models\chat_template.jinja”

      и ещё пробовал работу с лимитом в 500w (реальное потребление было 440w) и скорость выросла но всего около 1% разница..


      1. punzik
        19.08.2026 02:24

        У меня на стоковой llama.cpp и двух 3090 (350Вт):

        $ llama-server --host 0.0.0.0 --port 8081 -m ./Qwen3.8-27B-UD-Q8_K_XL.gguf -ngl 999 -c 240000 --temp
         1.0 --top-p 1.0 --top-k 20 --min-p 0.00 --presence-penalty 0.0 -np 1 --spec-type draft-mtp --spec-draft-n-max 2 --reasoning-preserve --cache-ram 32768 --ctx-checkpoints 32 -sm tensor --fit off
        ...
        2.32.873.159 I slot print_timing: id  0 | task 0 | n_decoded =   6623, tg =  64.52 t/s, tg_3s =  64.97 t/s
        2.35.901.106 I slot print_timing: id  0 | task 0 | n_decoded =   6833, tg =  64.66 t/s, tg_3s =  69.35 t/s
        2.38.910.320 I slot print_timing: id  0 | task 0 | n_decoded =   7063, tg =  64.99 t/s, tg_3s =  76.43 t/s
        2.41.929.441 I slot print_timing: id  0 | task 0 | n_decoded =   7310, tg =  65.44 t/s, tg_3s =  81.81 t/s
        2.44.934.252 I slot print_timing: id  0 | task 0 | n_decoded =   7529, tg =  65.64 t/s, tg_3s =  72.88 t/s
        2.47.995.636 I slot print_timing: id  0 | task 0 | n_decoded =   7779, tg =  66.05 t/s, tg_3s =  81.66 t/s
        2.50.998.628 I slot print_timing: id  0 | task 0 | n_decoded =   8007, tg =  66.30 t/s, tg_3s =  75.92 t/s
        2.54.009.860 I slot print_timing: id  0 | task 0 | n_decoded =   8227, tg =  66.46 t/s, tg_3s =  73.06 t/s
        

        Q6 влазит с полным контекстом и даёт до 90т/с.


        1. jarkevithwlad
          19.08.2026 02:24

          у вас ключевое преимущество это: "двух 3090"


        1. Mintavrus
          19.08.2026 02:24

          У вас разделение происходит в режиме tensor. Подскажите, у вас карты соединены с помощью nvlink? Если без nvlink, то в каком режиме работают PCIE слоты? (В Линукс скорость работы PCIE можно посмотреть утилитой nvtop)


          1. punzik
            19.08.2026 02:24

            Без nvlink. Работает на материнке Machinist X99 с процессором Xeon E5-2697 (всё с Али). Параметры линка PCIe во время генерации:

            $ nvidia-smi --query-gpu=pcie.link.gen.current,pcie.link.width.current
            pcie.link.gen.current, pcie.link.width.current
            3, 16
            3, 16
            


  1. Recursicorn
    19.08.2026 02:24

    Счастливые обладатели 5090 могут попробовать: https://github.com/Neroued/ninfer - оптимизированный движок под конкретную связку 5090/qwen.


    1. Nikobraz
      19.08.2026 02:24

      Спасибо, 170-200 токенов в секунду дает


  1. PUSH_CA
    19.08.2026 02:24

    спасибо, добавили уверенности и сам собрал модель на Q6 , весит < чем модель от unsloth. Думаю, что теперь всегда буду сам собирать модели.

    ещё собрал sh файл для этого, может кому-то пригодится :

    #!/bin/bash
    
    # Путь к папке llama.cpp (измените, если проект лежит в другом месте)
    LLAMA_DIR="/path/llama.cpp"
    
    # 1. Проверяем, существует ли виртуальное окружение по абсолютному пути. Если нет — создаем.
    if [ ! -d "$LLAMA_DIR/.venv" ]; then
        echo "Создаем виртуальное окружение в $LLAMA_DIR/.venv..."
        python3 -m venv "$LLAMA_DIR/.venv"
        
        echo "Активируем и устанавливаем зависимости..."
        source "$LLAMA_DIR/.venv/bin/activate"
        pip install --upgrade pip
        
        # Установка зависимостей, необходимых для convert_hf_to_gguf.py
        if [ -f "$LLAMA_DIR/requirements.txt" ]; then
            pip install -r "$LLAMA_DIR/requirements.txt"
        else
            # Если requirements.txt не найден, ставим базовый набор для конвертации
            pip install torch torchvision torchaudio transformers sentencepiece safetensors gguf
        fi
    else
        # 2. Если уже существует, просто активируем по абсолютному пути
        source "$LLAMA_DIR/.venv/bin/activate"
    fi
    
    # 3. КОНВЕРТАЦИЯ
    python "$LLAMA_DIR/convert_hf_to_gguf.py" \
      /path/qwenHF/Qwen3.8-27B \
      --outfile /path/qwenHF/out_model/Qwen3.8-27B-F16.gguf \
      --outtype f16
    
    # 4. КВАНТОВАНИЕ
    "$LLAMA_DIR/build/bin/llama-quantize" \
      path/qwenHF/out_model/Qwen3.8-27B-F16.gguf \
      path/qwenHF/out_model/Qwen3.8-27B-Q4_K_M.gguf \
      Q4_K_M
    


    1. rtrgdfb Автор
      19.08.2026 02:24

      Вот и хорошо! Это не сложно!


      1. funca
        19.08.2026 02:24

        Используйте uvx / uv run вместо pip / pipenv - будет ещё проще и в 20 раз быстрее. Он сам установит нужную версию --python и зависимости --with / --with-requirements в venv, который сам же и создаст.


    1. funca
      19.08.2026 02:24

      сам собрал модель на Q6 , весит < чем модель от unsloth

      Unsloth используют пропиетарный фреймворк Dynamic, который, по их измерениям, приводит к меньшей деградации качества - видимо за счёт некоторого увеличения размера модели на выходе. Сейчас там уже третья версия https://unsloth.ai/docs/basics/dynamic-3.0-ggufs . Набор утилит из llama.cpp полезен когда есть чисто академический интерес разобраться в принципах.


      1. Shannon
        19.08.2026 02:24

        Dynamic это не название фреймворка, и даже не алгоритм квантования, а обозначение их рецепта динамического квантования, когда разные тензоры квантуются по разному плюс используется imatrix для суб-динамического квантования внутри тензора. Всё это делается скриптом llama.cpp по кастомной схеме, вместо заранее созданных вроде “Q4_K_M”. В llama-quantize указывается --custom-q "$custom", а сам --custom-q уже может быть динамически настроенным:

        custom="
        # 64 Repeating Layers [0-63] + blk.64 MTP/nextn tensors
        
        ## MTP/nextn tensors
        blk\.64\..*\.weight=iq4_ks
        
        ## Gated Attention/Delta Net [Blended 0-63]
        blk\..*\.attn_gate\.weight=iq4_ks
        blk\..*\.attn_qkv\.weight=iq4_ks
        blk\..*\.attn_output\.weight=iq4_ks
        blk\..*\.attn_q\.weight=iq4_ks
        blk\..*\.attn_k\.weight=iq4_ks
        blk\..*\.attn_v\.weight=iq4_ks
        blk\..*\.ssm_alpha\.weight=q8_0
        blk\..*\.ssm_beta\.weight=q8_0
        blk\..*\.ssm_out\.weight=q6_0
        
        # Dense Layers [0-63]
        blk\..*\.ffn_down\.weight=iq4_ks
        blk\..*\.ffn_(gate|up)\.weight=iq4_ks
        
        # Non-Repeating Layers
        token_embd\.weight=q6_0
        output\.weight=q8_0
        "
        
        

        Матрица важности задается через --imatrix, и качество динамического квантования напрямую зависит от imatrix датасета. Сейчас imatrix используют даже для статического квантования Q4_K_M.

        Проблема чужих imatrix в том, что они не оптимизированы для русского языка, основной упор делается на английский язык. Создать свой датасет для imatrix под свой сценарий может быть не плохим решением, позволяя сжать модель сильнее, но сохраняя качество для вашего сценария.

        И если цель минимальный размер, то стоит смотреть в сторону ik_llama, вот у них как раз именно новые математические алгоритмы квантования, позволяющие тоже качество засунуть в меньший размер. Кванты вроде Q4_K_M или IQ4 созданы не llama.cpp, а ikawrakow, который сейчас в ссоре с ggerganov и поэтому ikawrakow создал форк ik_llama.cpp, где продолжает улучшать алгоритмы квантования и новые SOTA кванты показывают отличные результаты.


        1. funca
          19.08.2026 02:24

          Там вроде немного сложнее. Вот попытка сделать подобный пайплайн, адаптированный под консьюмерское железо https://github.com/imrrohitt/OpenDynamicGGUF


          1. Shannon
            19.08.2026 02:24

            Я скорее про то, что это всё еще поиск рецепта, и этот рецепт не универсальный. Dynamic это путь перебора, который завязан на магическом калибровочном датасете, который они не показывают, не указывают длину контекста подбора, процент представление других языков, помимо английского и т.д. Не факт, что этот датасет совпадает с вашим сценарием или языком, что может выражаться в нестабильности ответов, зацикливании или сломанной согласованности с увеличением контекста.

            Если выбирать между TurboQuant и выборочным перебором, где определяется какая часть контекста важна, а какая нет на основе собранного кем-то сценарии, то мало кто выберет второй вариант, если будет знать, что TurboQuant дает математическое решение снижения веса контекста в 2-3 раза без значимых потерь. И ik_llama дает математическое уплотнение, уплотняя упаковку самих данных.

            Для тех, кому интересно попробовать:


            1. funca
              19.08.2026 02:24

              Если выбирать между TurboQuant и выборочным перебором

              Спасибо за ссылки. Как TurboQuant связан с квантизацией моделей?


              1. Mintavrus
                19.08.2026 02:24

                Турбо квант вообще никак не связан с квантизацией модели. Турбо квант квантизирует кэш контекста.


                1. funca
                  19.08.2026 02:24

                  Тогда почему между ними надо выбирать, а не использовать оба, например?


              1. Shannon
                19.08.2026 02:24

                Через аналогию. Аналогично TubroQuant, у ik_llama улучшение за счет новых алгоритмов квантизации, за счет уплотнения всех данных, а не просто за счет перебора и выбора, что оставлять, а что выкинуть.


                1. funca
                  19.08.2026 02:24

                  Насколько я понимаю, без квантования модели пока не влезают в консьюмерское железо. А с квантами результат сильно портят ошибки, которые связаны с накоплением погрешностей вычисления. Вот с этим и пытается бороться UD, подгоняя веса для минимизации ошибок в типичных сценариях. Да, условно с русским может стать хуже, но по крайней мере JSON на выходе будет джейсоном. Оптимизации, связанные с данными, тоже полезны. Просто, как тут выше уже сказали, они решают другие задачи.


  1. Leo_sk
    19.08.2026 02:24

    Всё таки. Вот зачем. Как-то я очень скептично отношусь к локальным моделькам... Да, это почти уровень opus 4.6 умещающийся в видеокарте на 16-24гб, окей, вау, великолепно... Но в чем смысл? Да если по электричеству посчитать загрузку видеокарты под агента условные 24/7 то выйдет те-же 20 долларов подписки если не дороже... Только вот подписка даст не фронтир 8-10 месячной давности а слегка получше модельки. Нет, для каких-то специфичных целей/условий еще туда-сюда, но для повседневного использования...


    1. jarkevithwlad
      19.08.2026 02:24

      хобби, обработка данных без утечки, не у всех питание от сети, я себе скоро поставлю солнечные панели и будет кондей крутить + локальные нейронки, rtx3090 бу не так дорого сейчас (лично я себе покупал для игр и работы с 3d, но наступила эра нейронок..) + недавно вышла minimax h3 для генерации видео, на 24гб работает отлично, при этом у меня подписка gpt и видео-генератора там уже нет + доступны модели всегда, даже когда подписка закончилась


      1. UB3
        19.08.2026 02:24

        не так дорого это под 85 тр в среднем? какое же это недорого :)


        1. jarkevithwlad
          19.08.2026 02:24

          а вы посмотрите цены на rtx5090 / a6000 / мак студии последние хотя бы на 128gb, не говоря про 512gb..

          p.s. я купил за 700$ в хорошем состоянии, не ужаренную, полностью обслужил включая термопрокладки, а теперь учитывая текущие цены и рынок, думаю придётся на ней сидеть ещё лет 10..


    1. rtrgdfb Автор
      19.08.2026 02:24

      у меня была статья на эту тему: Почему Qwen3.6-27B лучше чем Claude? Железная коробка, которая научилась думать - в которой я попробовал сформлировать ответ на Ваш вопрос - "Зачем". И там длинное обсуждение в комментариях, почитайте.

      А если в нескольких словах: приватность, стоимость, гарантированное качество ответа, возможность автономной работы, альтернатива монополии биг-теха на интеллект и знания.
      Не уверен, что это действительно уровень Opus, но это неважно. Важно то, что она делает то, что мне нужно (нужно именно мне а не какому-то чуваку из Google, OpenAI, кгб, цру, масад, <подставьте свое>) и делает это значительно быстрее, чем могу сделать я сам и с качеством достаточным для выполнения поставленных задач.


      1. Leo_sk
        19.08.2026 02:24

        Ну такое. Нет, про приватность то ок, аблитерированные модельки - ну допустим, хотя они ничего нормального писать то и не умеют) (нормальная художка, тем более nsfw, прям больное место абсолютно всех моделей) Но вот всё остальное это на мой взгляд немного натягивание бедного животного на его же хвост, где минусы подаются как плюсы. Чтоб был нормальный контекст (это я с учётом квантования контекста) нужна видеокарта от 32гб (ну или безжалостно квантвоать модельку, но качество страдает) выжать приемлемую скорость декода тоже сложно. Нужно однозначно пихать всё в видеокарту, даже моешка вероятно не поможет, я вот на 32ddr4 и 8гд rtx 3070 запускал 3.8 27b (в q4 k.m кажется), и получил свои честные 3.5 токена в секунду... Ну это ни о чём.

        И качество. По бенчмаркам (хотя там вероятно некорректно сравнение обязок) qwen 3.8 27b действительно в общем-то обходит opus 4.6, но блин, может она подойдёт для чего-то относительно несложного, мелких правок, чата, но модельки за последние 8 месяцев вообще говоря улучшились, как и обвязки. И прям существенно. Так что чат да, поиграться да, мелкая несложная работа возможно, если есть видяха стоимость как крыло самолета.

        Про то что корпорации следят за нами... Ну Карл. Покажите мне того кто не следит в той или иной мере.