Недавно я обновил свою видеокарту до RTX-5060-TI 16GB. Получив новую карту я решил исследовать, что можно на ней запустить из нейросетей. Традиционно пишут, что нормальные ИИ модели начинаются с rtx3090 и выше, что ниже 24GB VRAM жизни нет. В этой статье я постараюсь развеять этот миф.

нарисовано моделью из статьи
нарисовано моделью из статьи

Модели на ограниченном железе всегда имеют компромисс между скоростью, качеством и контекстом. Сформирую требования, пригодные для агентик кодинга:

  1. Контекстное окно > 80к (системный промпт + пара скиллов уже 15к токенов, при низком контексте модель постоянно будет забывать детали и сжимать историю сообщений)

  2. Скорость >= 50 тпс (чем выше скорость, тем быстрее проходят циклы разработки, тем быстрее новые фичи идут в релиз. До этого пробовал с 30 тпс работать, агент кажется заторможенным)

  3. Интеллект должен быть достаточным для того, чтобы допускать мало ошибок в коде и чтобы его дебагинг больше чинил, чем ломал

Выбор модели

Бесспорным флагманом локальных нейросетей на низкой врам сейчас является Qwen3.8–27b. Также имеется более умный Qwen3.8-Next‑Flash, но он требует не менее 64гб ОЗУ для нормальной работы и его ТПС на моем железе держится в районе 20, что не удовлетворяет требованиям скорости. В качестве целевой модели будет выбран Qwen3.8–27b

Начнём с очевидного — стандартный qwen весит 51,77ГБ — получим почти полную выгрузку в ОЗУ и скорость 0.3 токена в секунду. Исходная модель кодирует веса в формат bf16, что означает 16 бит на один вес модели. Для высокой скорости работы модель и её веса должны целиком помещаться в гпу, поэтому необходимо брать квантованную модель.

Кратко расскажу суть квантования. Специалисты ML с Hugging Face сжимают веса моделей так, чтобы минимизировать потери её интеллекта, при этом значительно уменьшив вес файла. Сейчас уже научились квантовать модели практически без потерь навыков в кодинге. Именно такие кванты используются для нашей задачи. Под целевое железо нам подходят 3 и 4 кванты, обеспечивающие размеры модели менее 16 гигабайт.

В процессе тестирования моделей всплыло дополнительное требование. Стандартные модели поставляются с цензурой, которая часто вставляет палки в колеса, отказываясь выполнить запрос. Для решения этой проблемы выбирались кванты с модификацией на удаление цензуры. На HF популярны методы Abliteration и Heretic. Abliteration находит в активациях модели направление, связанное с отказами, и модифицирует веса так, чтобы подавить его влияние без полноценного переобучения. Heretic развивает этот подход и автоматически подбирает параметры такой модификации, стараясь одновременно снизить число отказов и минимизировать отклонение поведения модели от оригинала.

Qwen3.8–27B‑IQ4_XS

Помимо чисел у квантов ещё есть категории от XXS до XXL, от них зависит насколько агрессивное было сжатие. Стандартный Q4 квант весит чуть больше 16гб и имеет выгрузку в озу, поэтому для тестов использовался более малый IQ4_XS (вес 15.3 ГБ). Популярных децензоров с минимальными потерями в кодинге два — orcarouter и JonathanColetti. Я протестировал оба и разницы не заметил, orca по ощущениям немного лучше рисует svg, поэтому остановился на ней.

Для запуска модели использовался llama‑server последней версии. Конфиг к этой модели выглядел так:

llama-server ^
  -m models/Qwen3.8-27B-Uncensored-IQ4_XS.gguf ^
  -ngl all ^
  --fit off ^
  -c 64000 ^
  -np 1 ^
  --flash-attn on ^
  -ctk q4_0 ^
  -ctv q4_0 ^
  -b 512 ^
  -ub 128 ^
  --jinja ^
  --reasoning off
Объяснение параметров

ngl all — попытаться положить всю модель и контекст на гпу, ускоряет вычисления

fit off — запрещает серверу менять параметры контекста и слоёв модели на гпу. По умолчанию может срезать контекст или выгрузить часть слоёв на процессор при нехватке гпу памяти

c — доступный контекст, в данном случае 64 000 токенов

np 1 — ограничивает параллельность запросов к серверу до одного, благодаря нему делает некоторые оптимизации ускоряя вычисления

flash‑attn — быстрое внимание, делает вычисления блоками, снижает потребление врам и повышает скорость

ctk, ctv — квантование контекста до 4 бит, снижает потребление врам

b, ub — батчи на которых выполняется prefill, то есть обработка input токенов. Повышение b увеличивает скорость появления первого токена вместе с расходом врам, 512/128 компромисс скорости и расхода памяти

jinja — формат общения с моделью удобный для агентов и llama ui

reasoning — влияет на уровень рассуждений и бюджет токенов на них

Данный конфиг дал примерно 25 тпс, что недостаточно для нормальной работы. В качестве оптимизации был изучен механизм mtp (Multi‑Token Prediction) — подход, при котором модель пытается предсказывать сразу несколько последующих токенов вместо одного. Этот метод особенно хорош в написании кода, на нём прирост достигает х3 скорости. В рассуждениях скорость становится ниже, поскольку модель реже угадывает токены. В текущую модель mtp уже встроен, для его активации потребовалось добавить в конфиг несколько новых параметров:

  -ctkd q4_0 ^
  -ctvd q4_0 ^
  --spec-type draft-mtp ^
  --spec-draft-n-max 3 ^
Объяснение

ctkd, ctvd — квантование мтп кэша, также экономит врам

spec‑type draft‑mtp — метод спекулятивного декодинга. Кроме мтп есть другие методы, один из них будет описан дальше

spec‑draft‑n-max — сколько токенов за раз пытается угадать модель. Число индивидуально под каждую модель, вычисляется эмпирическим путём через тестирование на одинаковых промптах

Добавление этих параметров повысило средний тпс до 40–50, что в целом удовлетворяет требованию по скорости, но мтп увеличило расход врам и потребовало уменьшить контекст до 32к. С открытом браузером на несколько вкладок контекст пришлось дополнительно понизить до 20к, что сделало этот вариант непригодным для агент кодинга. Я оставил этот квант в качестве модели для чата, как эксперта для одноразовых задач.

Общение в чате с Qwen3.8-IQ4_XS
Общение в чате с Qwen3.8-IQ4_XS

Qwen3.8–27B‑UD‑Q3_K_XL

Чтобы вместить больше контекста пришлось искать модели в третьем кванте. Подходящей под эту задачу мне показалась UD‑Q3_K_XL (13.2 ГБ) от outsourc‑e. Эта модель является форком популярной версии от unsloth с вырезанной цензурой, сохраняя максимальные навыки кодинга. Под эту модель был написан отдельный конфиг:

llama-server ^
  -m models/Qwen3.8-27B-Unleashed-UD-Q3_K_XL.gguf ^
  -ngl all ^
  --fit off ^
  -c 92160 ^
  -np 1 ^
  --flash-attn on ^
  -ctk q4_0 ^
  -ctv q4_0 ^
  -ctkd q4_0 ^
  -ctvd q4_0 ^
  --spec-type draft-mtp ^
  --spec-draft-n-max 3 ^
  -b 512 ^
  -ub 128 ^
  --jinja ^
  --reasoning-effort low ^
  --reasoning-budget 2048

Из заметных изменений здесь комфортно вмещается 92к контекста даже с открытым браузером, а также добавлен небольшой reasoning для более качественных ответов. Эта модель выдаёт около 50 тпс на кодинге и полностью соответствует заявленным в начале критериям.

После получения подходящей модели я начал смотреть как подключить её к opencode. Для этого потребовалось модифицировать её конфиг вписав в неё локальный адрес сервера llama:

{
  "$schema": "https://opencode.ai/config.json",
  "model": "llama.cpp/qwen3.8-27b",
  "plugin": [
  "superpowers@git+https://github.com/obra/superpowers.git"
  ],
  "provider": {
    "llama.cpp": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "llama-server (local)",
      "options": {
        "baseURL": "http://127.0.0.1:8080/v1"
      },
      "models": {
        "qwen3.8-27b": {
          "name": "Qwen3.8 27B",
          "limit": {
            "context": 92160,
            "output": 15360
          }
        }
      }
    }
  },
  "compaction": {
    "auto": true,
    "prune": true,
    "reserved": 8192
  }
}

Из интересного, я добавил ограничение аутпута — 15к токенов на один ответ, чтобы модель не съела весь контекст и автоматическое сжатие контекста за 8к токенов до лимита. Также был добавлен плагин superpowers , который делает модели значительно эффективнее, за счёт создания детальных планов и разработки через TDD.

В качестве тестов модель написала несколько простых игр на html+js. С хорошим планом игры работали уже с первого промпта, в случае возникновения ошибок нейросеть самостоятельно вносила исправления до полной работоспособности.

Пример сделанных игр
Пример сделанных игр
Процесс разработки
Процесс разработки

На этапах thinking и составлении плана тпс проседает до ~38, на написании кода вырастает до 50. Это связано с тем, что мтп чаще угадывает код и значительно реже обычный текст. Эту нейросеть можно использовать в работе, но я решил найти варианты, которые можно разогнать ещё сильнее.

Qwen3.8-GSQ‑RCO‑IQ3_S

Эта версия кванта размером всего 11.8 гб, что по задумке обеспечивает большую вместимость контекста. У неё имеется версия со встроенным мтп, но в ходе тестов выяснилось, что на этой модели мтп плохо угадывает контекст. В результате была взята модель без встроенного мтп, а также протестирована новая архитектура DFlash. Это модифицированная версия мтп, которая позволяет прогнозировать следующие токены параллельно, давая прирост в скорости. Файл DFlash2-Q4_K_M весит 1.14 гб и запускается вместе с моделью. Для запуска я использовал следующий конфиг:

llama-server ^
  -m models/Huihui-Qwen3.8-27B-abliterated-GSQ-RCO-IQ3_S.gguf ^
  -md models/Qwen3.8-27B-DFlash2-Q4_K_M.gguf ^
  -ngl all ^
  -ngld all ^
  --fit off ^
  -c 92160 ^
  -np 1 ^
  --flash-attn on ^
  -ctk q4_0 ^
  -ctv q4_0 ^
  -ctkd q4_0 ^
  -ctvd q4_0 ^
  --spec-type draft-dflash ^
  --spec-draft-n-max 4 ^
  -b 512 ^
  -ub 128 ^
  --jinja ^
  --reasoning-effort low ^
  --reasoning-budget 2048

Из примечательного здесь spec‑type draft‑dflash — новый метод прогнозирования и увеличение draft‑n‑max. В некоторых квантах максимальное ускорение достигается на n=6, но в третьем кванте он теряет acception rate и снижает скорость, поэтому оптимальным выбран n=4. Также контекст остался прежним, поскольку освободившееся место от сжатия модели занял dflash.

Тестирование в кодинге не показало явной деградации, различие было на уровне стат. погрешности. При этом скорость кодинга возросла до 55–65 тпс, в пике достигая 70, что эффективно ускоряет разработку.

Пример игр, написанных этим квантом
Пример игр, написанных этим квантом
Разработка
Разработка

Прямое сравнение моделей

Протестировав эти три модели можно составить таблицу с их соотношением сильных и слабых сторон

Модель

Скорость

Контекст

Интеллект

IQ4_XS

40 — 50 тпс

22к

100%

UD‑Q3_K_XL

45 — 55 тпс

92к

97%

GSQ‑RCO‑IQ3_S

55 — 65 тпс

92к

95%

Деградация моделей в кодинге почти не заметна, но низкие кванты могут быть слабее в рассуждениях на длительных сложных задачах.

В качестве дополнительного теста я попросил все три модели нарисовать медведя на машине в svg файле. Дополнительно к ним был подмешан импостер gemma4-26b.

Промпт

Создай автономный SVG 16:9 по мотивам референса.

Сцена: яркая мультяшная векторная иллюстрация. Летний пейзаж с голубым небом, облаками, солнцем, горами, зелёными холмами, хвойными деревьями и цветами. По центру дороги стоит красный ретро‑кабриолет, вид спереди. За рулём сидит улыбающийся бурый медведь в голубом шарфе.

Слева расположен большой зелёный дорожный знак с надписями: «ОМСК» «80» «СЕВЕР» и белой стрелкой вверх.

На номере автомобиля текст: «КОСОЛАПЫЙ»

Сверху крупный мультяшный заголовок: «Qwen 3.8 27b»

Стиль: flat vector, детская иллюстрация, чистые формы, округлые контуры, насыщенные цвета, лёгкие градиенты и блики. Композиция должна быть визуально близка референсу, но точные размеры, координаты и мелкие детали выбери самостоятельно.

Используй только SVG‑примитивы и текст. Не используй raster images, base64, canvas и внешние ресурсы.

Верни только валидный SVG‑код от <svg> до </svg>.

Результаты:

Кванты квенов не подписаны, попробуйте угадать кто что нарисовал. Мне кажется лучше всех получился рисунок справа вверху, нарисовал его самый маленький IQ3_S.

P. S. тест не очень надёжный и может выдавать сильно разное качество на нескольких запусках, однако при сильной деградации моделей разница становится ощутимой. В данном случае сильной разницы между квенами нету.

Выводы

Невозможность запускать сильные модели на бюджетных видеокартах мне кажется преувеличенной. Конечно, переход на RTX-3090 даёт определенные преимущества. Можно запустить квант побольше и выделить больше контекста, пропускная способность ллм может перевалить за 100 тпс. Но списывать свою 16 ГБ врам видеокарту со счетов не стоит, она вполне может запускать мощные модели с хорошим контекстом и скоростью работы.

Комментарии (75)


  1. vpman
    09.09.2026 17:13

    Если кому-то важно работать с изображениями, то VL голову mmproj можно держать в CPU RAM , если указать –no-mmproj-offload. Тогда распознавание изображений идет немного дольше, зато VRAM не занимает.
    По моим наблюдениям Dflash дает хороший буст скорости для кода- до 70-80t/s, против 30-40ts для человеческих текстов.
    MTP примерно одинаково работает для всего - 40-50ts, но при этом занимает места на 800мб меньше. Можно добавить контекста или повысить квант кеша до q8.
    Увеличение драфтов –spec-draft-n-max N увеличивает занятую VRAM.


  1. dmitrin
    09.09.2026 17:13

    На 5070ti 16gb активно используем Qwen3.8-27B-GSQ-RCO-IQ3_XXS размером в 10.1gb. Она с dflash2 выдаёт порядка 70 т/с и, что самое приятное, влезает аж 190к контекста. А он этой модели нужен, даже на 150к ей тесновато, на 100к наверняка сплошные компакты идут.

    С OpenCode в виде харнесса ощущения получаются близкие к Sonnet образца зимы-весны, что уже очень полезно и юзабельно.


    1. yellow-elephant
      09.09.2026 17:13

      А подскажите, пожалуйста, конфиг llama.cpp. Сегодня забираю свою 5070ти, хочу попробовать.


    1. yellow-elephant
      09.09.2026 17:13

      Уже разобрался, отбой :3


    1. dmitrin
      09.09.2026 17:13

  1. ontop
    09.09.2026 17:13

    Я запускаю IQ_3S из вашей выборки, которая от Австралийского университета на 250 контекста, на 50t/s. Работает прекрасно, сравнивал с Q4_K_S по интелекту потерь нету. Использую вывод на материнской для монитора, видеокарта получается на 100% свободна по Vram (50 мегабайт это системный драйвер вероятно) .

    9070 16gb. Изучая тему квантования, пришел к выводу, что создание модели с квантованием почти без потерь в отношении к FP8, это реальная задача в ближайшие 2-3 года, то есть получить модель на 16 GB = FP8 которая не будет уступать по всем параметрам это реально. Но двигают это интузиасты и различные научные учреждения. Unsloth это стартап студентов. Корпорации не очень заинтересованы в том, чтобы обычные пользователи запускали модели на обычных видеокартах, так как продать видеокарту дороже в 3 раза для них намного выгоднее.

    Еще на качество модели очень сильно влияет сжатие контекста, q4/q4 довольно сильно портит перплексию и дивергенцию, потому вы можете повысить качество запуска IQ_3S за счет выбора другого способа сжатия, на обычной llama.cpp есть Q5_1/Q5_1 это лучше в 2 раза чем Q4, при 20% росте. Если на Nvidia есть поддержка можно попробовать turboquant форк llama от atomicbot. turbo4 сжатие как q4, но качество выше.


    1. vpman
      09.09.2026 17:13

      У меня, если ставить квант кеша отличный от 8/8 или 4/4, то начинает активно использоваться CPU и скорость падает на 30%. Досадно, так бы можно было сэкономить еще памяти за счет v кеша, например.


      1. Pand5461
        09.09.2026 17:13

        Надо собрать llama.cpp с флагом -DGGML_CUDA_FA_QUANTS=all, по умолчанию компилируются только комбинации q4_0-q4_0;q8_0-q8_0;f16-f16;bf16-bf16.


        1. vpman
          09.09.2026 17:13

          Сработало. Спасибо!


    1. Rive
      09.09.2026 17:13

      Корпорации не очень заинтересованы в том, чтобы обычные пользователи запускали модели на обычных видеокартах, так как продать видеокарту дороже в 3 раза для них намного выгоднее.

      Поддержка FP8 - относительно новая фича, то есть в старых видеокартах работа CUDA с FP8/FP16 невозможна, и из-за этого кванты для них почти не имеют практического смысла.


  1. Backend-Sanya
    09.09.2026 17:13

    на что можно рассчитывать с RTX5070 и 32GB RAM?


    1. ki11j0y
      09.09.2026 17:13

      У меня тот же вопрос, хотя могу докинуть еще 32гб из второй машины.


    1. Mashinow Автор
      09.09.2026 17:13

      У 5070 основная проблема 12гб врам. Без просадки в скорости подойдет Qwen3.8-27b-IQ3_XXS, о котором писал комментатор выше. Без mtp можно контекста 64к докинуть примерно к нему.

      Есть ещё более старая qwen3.6-35b-a3b, она не такая умная, но менее требовательна к видеокартам и быстро работает с оффлоадом. Её можно запускать в q4 с 128к контекста, будет примерно 50 токенов в секунду


    1. Foggy4
      09.09.2026 17:13

      На самом деле на многое. В статье автор описывает почему то только плотные модели, которые активируют весь массив параметров для генерации каждого токена. Но есть еще и MoE-модели, которые активируют лишь часть параметров для генерации токенов, на данный момент одной из лучших моделей этого класса является Tiel-Coder-35B-A3B , на моей практике она уступает плотному Qwen3.8 27B не драматично. Если поиграть с настройками, то на вашем железе она может дать сопоставимые или лучше результаты тем, что были рассмотрены в статье.


  1. eodus
    09.09.2026 17:13

    В этом бюджете и в этом классе моделей очень рекомендую попробовать бинарную квантификацию (DBF, Double Binary Factorization, https://arxiv.org/abs/2505.11076). Грубо говоря, все веса кодируются в +-1 и умножение заменяется сложением по маске. Я сделал ее поддержку для Qwen3.6-35B-A3B в llama-cpp (https://eodus.github.io/blog/posts/llm-binarization-episode-01-dbf/) и оно наботает на скорости и объеме Q2, но с качеством почти Q3. Кажется, из этой идеи можно выжать еще больше, если поиграть с разложением


  1. Mintavrus
    09.09.2026 17:13

    Размер 90 тыс токенов - это критически мало для боле менее серьезных задач. У меня только начальный промпт занимает ~45 тыс токенов, потому что включает в себя необходимые инструменты: SearXGN (для поиска в интернете), Context7 (информация о последних изменениях библиотек), GitHub-MCP и Browser MCP. Без них вообще не представляю как можно нормально работать. Отключение размышлений как показала практика работы с моделью qwen3.8-27b ведёт к существенному снижению качества итогового результата. Нужно ставить хотя бы уровень low. На самом деле с выходом qwen3.8 почти всегда стал упираться в ограничение 256k контекста. Для решения проблемы настроил правила handoff (это отдельная интересная тема)


    1. ilya369
      09.09.2026 17:13

      "промпт занимает ~45 тыс токенов " промт всех промтов.


      1. Mintavrus
        09.09.2026 17:13

        Вы никогда mcp-сервер не подключали к модели, или инструменты?

        "Входной промпт" это как бы не только то что вы ручками в чате набили. Для некоторых задач он у меня и более 100k токенов занимал.


        1. IQuant
          09.09.2026 17:13

          А их вообще надо подключать?

          Пользуюсь qwen3.8-27b, модель вполне способна догадаться использовать CLI клиент гитхаба или его api через curl. В случае с библиотеками - вопрос решился инструкцией “использовать cargo add для добавления последней версии библиотеки”. Давать управлять браузером не пробовал, но думаю тоже сработает.

          Своей модели я даю только 7 инструментов (read, bash, edit, write, 2 для запуска команд в отдельном окне tmux и инструмент для запуска подагентов) и мне пока хватает (возможно что-то для поиска надо будет добавить). Системный промпт в пределах 3к токенов.


          1. Mintavrus
            09.09.2026 17:13

            Надо. Слишком долго расписывать почему. Но уверен, вы сами до этого дойдете. К примеру, в том же GitHub-MCP есть очень крутая функция поиска не только в коде, но и по тексту в Issues, Pull Requests, обсуждениях и релизах, что иногда очень помогает решать проблемы.


            1. IQuant
              09.09.2026 17:13

              ИМХО тратить столько контекста всегда сильно расточительно. Особенно учитывая что в моём случае его всего 80к - иначе модель не влезает в память полностью, а снижать квантование контекста ниже q8 я не готов.

              Эта функция вполне могла бы быть скриптом, описание к которому находится в его же --help. В системный промпт достаточно добавить лишь его упоминание, и тогда плату в виде потребления контекста надо будет платить лишь в момент, когда этот скрипт понадобится. Подход описывается тут.


    1. remzalp
      09.09.2026 17:13

      Тут можно пойти в сторону специализированных агентов с персональными наборами инструментов


      1. Mintavrus
        09.09.2026 17:13

        Что вы имеете ввиду? О каких специализированных агентах идёт речь и что за "персональные наборы инструментов"? В чем отличие от того подхода, что я описал?


  1. MaxEkb77
    09.09.2026 17:13

    Квен Флэш перевернул конечно все, вчера смотрел spark-2,5 очень достойно


  1. tplogin
    09.09.2026 17:13

    Можно использовать еще одну/две/три/четыре карту, подключенную через дополнительный PCIe x4 или слот M2 через Oculink в режиме pipeline parallelism.
    Некоторые материнские платы (особенно для AMD) поддерживают бифуркацию PCIe = x4 x4 x4 x4 или x8 x8 - к слоту PCIe с помощью пассивной платы за 1500 руб. можно подключить до 4-х устройств через Oculink.
    С квантованием кеша в программировании делать нечего, постоянно будут ошибки синтаксиса.


    1. nikulin_krd
      09.09.2026 17:13

      Если использовать turboquant то не будет никаких ошибок))


  1. Harvester666999
    09.09.2026 17:13

    Думаю тоже локально попробовать, на сколько хорошая конфигурация для этого и на что можно рассчитывать?

    • Процессор: Intel Core i7-13700K.

    • Материнская плата: Gigabyte Z790 Aorus Master.

    • Видеокарта: NVIDIA GeForce RTX 4090 (Gigabyte Aero OC).

    • Оперативная память: комплект 64GB DDR5 G.Skill Trident Z5 с частотой 6000 МГц.


    1. Mashinow Автор
      09.09.2026 17:13

      Можете попробовать модели из статьи. На ртх4090 будет запас по враму 8гб. Его можно потратить на более сильный квант, либо улучшить контекст/точность кэша. Скорость генерации будет примерно в полтора-два раза выше, чем в статье. Если ОЗУ 64гб, можно ещё Qwen-3.8-Flash-Next попробовать в 3, 4 квантах


    1. Mintavrus
      09.09.2026 17:13

      Самый лучший вариант - продать rtx4090 и на вырученные деньги купить 2х rtx3090.

      На 48 ГБ VRAM уже можно более-менее нормально работать. Запускать модель qwen3.8-27b-q8_k_xl с MTP, с максимальным контекстом 256k, с Vision и квантованием кэша q8_0. Как раз займет 46,5 ГБ из 48. Скорость будет от 1800 (с 0 токена) до 600 (на 250k-том токене) префил и от 80 до 60 токен/с генерация.


      1. AcckiyGerman
        09.09.2026 17:13

        Можно пойти еще дальше, не покупать 2x rtx3090 по 1200$ текущей цены, а купить 4x rtx3080 20Gb по 600$ из Китая, получив почти вдвое больше vram (80вместо 48). Конечно придётся еще потратиться на мать и БП, но подходящие DDR4 матери с 4мя PCIe x4 не так уж и дороги - после майнеров их куча на рынке.


        1. chesser76
          09.09.2026 17:13

          На майнерских платах pcie как правило в режиме х1 а это очень медленно для работы с LLM. Нужна хорошая серверная плата.


          1. tplogin
            09.09.2026 17:13

            Oculink PCIe 4.0 X4 доступен на многих материнках через M.2. Цена вопроса примерно 4500 руб. за все девайсы и кабели и еще стоимость отдельного БП.


      1. tplogin
        09.09.2026 17:13

        Если человек захочет работать с картинками и видео, то 4090 ему очень пригодится.


    1. max-daniels
      09.09.2026 17:13

      У меня RTX 4090 и мой конфиг на данный момент такой:

      1. Модель Qwen3.8-27B-GSQ-RCO-GGUF на IQ3_S c MTP весом 11.8 Gb.

      2. Экспериментальный форк лламы https://github.com/spiritbuun/buun-llama-cpp. Что в нем есть:

        2.1. Технология VBR(Variable Bit-Rate KV Cache), которая динамически меняет квантизацию KV-кэша в зависимости от его заполненности. Я так понял когда кэш заполнен немного - используется F16, потом снижается потихоньку(f16 → turbo8 → turbo4 → turbo3_tcq → turbo2_tcq → turbo1_tcq). Там еще вроде можно явно указывать сколько сжирать памяти по KV-кэшу, а он подстроит под него размер окна контекста и его квантизацию.

        2.2. Возможность свапа Vision и MTP в памяти. Т.е. когда нужен Vision - MTP отключается. И наоборот. Это экономит память, если нужен MTP и Vision. У меня VRAM занят максимум на 22Гб вместе с браузером на -c 131072.

        2.3. Умеет грузить кастомные тензоры GSQ(см. название модели).

      3. CLI. Лично я использую Qwen-Code(https://github.com/QwenLM/qwen-code).

      P.S. Если не нужен Vision, то думаю лучше юзать какой-нибудь стандартный Qwen3.8-27B-UD-Q4_K_S от unsloth.


      1. nikulin_krd
        09.09.2026 17:13

        А зачем держать мультимодальный прожектор в VRAM? Он прекрасно укладывается в оперативу и не нужно переключение между MTP и mmproj


    1. tplogin
      09.09.2026 17:13

      Установите LMStudio, она работает на базе llama.cpp, там очень гибкие настройки. Только учтите, что там по умолчанию для скачанных моделей выделяется место для KV-кеша с учетом параллельной работы (несколько запросов одновременно) - это увеличивает необходимое место для кеша в разы.


  1. DerTosser
    09.09.2026 17:13

    А почему бы не использовать для локального инференса видеокарты nVidiaTesla v100 32gb, которые на авито по 50-60к рублей стоят? Там и память HBM2 c шиной 4096bit.


    1. nikulin_krd
      09.09.2026 17:13

      Потому что это древнее железо и чтобы заставить его работать надо пройти 7 кругов ада


      1. DerTosser
        09.09.2026 17:13

        Древнее, да, но цена и объём памяти очень вкусные. Если цель не игры и графика, то для отдельно стоящей машинки соотношение цена/качество оптимальное. Было бы интересно узнать в чём заключаются круги ада. Драйвера?


        1. kenomimi
          09.09.2026 17:13

          Версии драйверов, библиотек, и самое главное, что не поддерживает современные кванты - не факт, что нужная модель будет под такую карту. v100 стоит брать только тогда, когда уже определен рабочий стек, и он точно под нее подходит.


          1. DerTosser
            09.09.2026 17:13

            Что значит версии библиотек и не поддерживает кванты? Хотите сказать что стандартный GGUF запущенный на koboldcpp нуждается в особенной видеокарте и сторонних библиотеках?


            1. nikulin_krd
              09.09.2026 17:13

              То и значит. Та версия которая поддерживает новые модели например llama.cpp собрана с использованием нового nvidia api, в котором вырезана поддержка старья типа v100 и без кочерги в анале вы не заставите ее работать


              1. DerTosser
                09.09.2026 17:13

                Хорошо, вот расклад: сейчас работает AMD RX 570 8Gb. Есть вариант взять V100. Что ещё можно взять на 32Gb VRAM при бюджете 50-60к ? Предположу что ничего. Ну так V100 наверное лучше чем ничего (и чем имеющийя AMD) или я ошибаюсь?


    1. AlexTheCleaner
      09.09.2026 17:13

      Там пропускная способность памяти в два раза ниже чем у 5090. И даже меньше чем у M5 Ultra - где-то на уровне М5 Мах. Электричество жреть, скорости не даеть...


      1. DerTosser
        09.09.2026 17:13

        Электричество жрёт 300 Вт против 450 Вт у RTX 4090. Это много? В отличие от игр, нейросети потребляют только в период выполнения запроса, загрузка не постоянная. Это для датацентров, где их пользуют сотни/тысячи да ещё и без простоя, то актуально, но никак для домашнего компа. Я предполагаю что у локального инференса узкое место не пропускная способность памяти, а её количество, а у домашних пользователей ещё и цена. Здесь и есть точка пересечения оптимума. Вот мне и интересно в чём адовые сложности использования подобных видях. Если их нет или они банальны как настройка своего VPS, то для сисадмина это семечки. Ну а сравнивать дешёвую видяху с M5, это уж извините. Если есть деньги на М5, то как бы и вопросов нет уже. Но их нет (денег).


      1. brammator
        09.09.2026 17:13

        ...тудыть её в качель!


    1. remzalp
      09.09.2026 17:13

      там есть определённые проблемы с моделями не f16, современный квант fp8 я так понимаю уже не заведётся


      1. nikulin_krd
        09.09.2026 17:13

        Там есть проблема в том что софт собран под новый апи где в100 вырезан нахоен


      1. DerTosser
        09.09.2026 17:13

        Вы про использование vLLM или llama.cpp ?


    1. MountainGoat
      09.09.2026 17:13

      У v100 архитектура устаревшая, не имеет некоторых инструкций. Не стоит связываться никому, кто не сможет сам написать с нуля аналог llama.cpp под свои нужды.


  1. AlexNecro
    09.09.2026 17:13

    Это имеет вообще хоть какой-то практический смысл, или она умеет только алгоритмы из учебника на js/py?


    1. dimonz80
      09.09.2026 17:13

      Как ни странно, имеет. Если поведение по дефолту не устраивает, можно в контекст подгрузить доку/примеры по интересующей технологии/ЯП/whatever. Для агентного вайбкодинга может не хватить контекста, но для чатика/плана волне ок.


  1. northrop
    09.09.2026 17:13

    Интересно, а что можно запустить на i9 64gb RAM и Nvidia 2060 с 6gb Vram?


    1. orthoxerox
      09.09.2026 17:13

      Третьих героев.


      1. gxcreator
        09.09.2026 17:13

        И поспать


    1. krendelbok
      09.09.2026 17:13

      У себя на древнем ноуте запускаю Ornith 1.5 35B с вигрузкой експертов в рам. 25-30 t/s выдает с dflash спекулятивной моделькой


    1. MountainGoat
      09.09.2026 17:13

      Картинки генерировать вполне можно.


  1. strokoff
    09.09.2026 17:13

    Подскажите, пожалуйста. 3090ti + 32gb ram что оптимально будет?


    1. edyapd
      09.09.2026 17:13

      В 24ГБ влазит Qwen3.8-27B-Q4 с KV кешем в Q8_0 и контекстом 128к


  1. eldog
    09.09.2026 17:13

    Балуюсь иногда с Ollama, но у меня 3080 10Gb (+ 96 гб обычной памяти, но это я так понимаю пофиг). Влезает qwen2.5:7b-instruct.

    Первые проблемы не с моделью, а с обвязкой, заставить работать вижуалстьудию или Copilot CLI. Последнее обновление вижуалстудии улучшило интергацию, теперь по крайней мере друг друга понимают. Но запускать агента для локальной модели и менять самостоятельно всё ещё не умеет, предлагает копипастить.


    1. tplogin
      09.09.2026 17:13

      Я так понял, что с агентом можно параллельно в Visual Studio Code работать с этим же проектом. Сам еще не пробовал такой вариант.


      1. eldog
        09.09.2026 17:13

        Я пробовал раньше и (с той же моделью) было так же криво как и в вижуалстудии. Ровно то же самое. Но, конечно, жизнь не стоит на месте, может и там есть какой-то прогресс.


        1. tplogin
          09.09.2026 17:13

          Не, сейчас тот же Kilo умеет редактировать файлы.


    1. MountainGoat
      09.09.2026 17:13

      С вашим железом стоит баловаться MoE моделями.


    1. Klm992
      09.09.2026 17:13

      Пришлось авторизоваться впервые за много лет.

      Попробуй модели gemma4

      А именно qat версии, e4b, 12b, 26b-a4b

      Сам мучаюсь rx 6700xt с 12гб

      Но пока остановился все таки на ornith 1.5 35b a3b apex mtp I Quality. Весит 23.7 гб. На 60к контекста забирает 30гб озу и 5гб врам. Пока не подобрал параметры чтобы по максимуму использовать врам в первую очередь. Параметры слоев в гпу и цпу на максимум поставил. Кэш в q8.


  1. JunkieEnjoyer
    09.09.2026 17:13

    Подскажите карты от амд и нвидии примерно одного класса сильно разнятся? Как сильно наличие куды улучшает работу ии? Имею 6950XT 16gb vram, пока в комментах и примерах только нвидиевские карты вижу


  1. steus_au
    09.09.2026 17:13

    интересный вариант 3080 мод с 20gb (она в цене 5060ti) - я на на одной запускаю iq4 c 131к и kv кэш q_8, до 60tps, на двух таких картах получается полный контекст в q5 и кэш f16 и с вижен - но скорость падает до 40tps - зато действительно держит контекст


    1. tplogin
      09.09.2026 17:13

      Тут в другой теме был комментарий, что у кого-то 2080 22 Гб поработала недолго.


      1. steus_au
        09.09.2026 17:13

        все может быть, эти карты "горячие", я режу их до 200ватт и всеравно они до 70С греются, да, ну или можно две 5060ti - будет чуть медленнее но 200k должно поместиться. надо эксперементировать, это модель наверное первая которую реально использовать для повседневных задач локально


        1. Foggy4
          09.09.2026 17:13

          у меня на 5070ti+5060ti на Qwen3.8 27B Q4_M помещается только 190К контекста в квантовании Q8_0. Возможно если для системного вывода видео использовать какую-то третью видеокарту, то 200К влезет. По скорости на полном контексте ~30t\s выдают, на незаполненном ~50t\s


        1. MountainGoat
          09.09.2026 17:13

          и всеравно они до 70С греются,

          Так они намеренно греются, их любимая температура 75 и они стремятся туда попасть, разгоняясь по-чёрному если ниже.


  1. dimonz80
    09.09.2026 17:13

    Чувствую себя каким-то ущербным, гоняя qwen3.5-9b на 5080 16Gb в качестве быстрой (~120 tps) помогайки.


  1. fantomchek
    09.09.2026 17:13

    Gemma4 26b тоже неплохо себя чувствует на локальной машине с небольшой vram


  1. Agubigubaga
    09.09.2026 17:13

    Также имеется более умный Qwen3.8-Next‑Flash, но он требует не менее 64гб ОЗУ для нормальной работы и его ТПС на моем железе держится в районе 20, что не удовлетворяет требованиям скорости.

    Это прикол какой то? 20 токенов в сек. для такой огромной модели на таком железе это очень много, прям дофига. Это же 120b модель (хоть и превью). И кто вообще квантует контекст до q4? Буквально везде написано, что это максимально убивает качество. Минимальный квант для контекста - q8. У меня на RX7800xt через lmstudio при адекватных настройках (50000 контекст c q8 квантом, flash attention, все слои на gpu) модель Qwen3.8–27B‑IQ4_XS кое как выдаёт болезненные 13-15 ткс. Квантование q3 при этом довольно бесполезно, качество слишком сильно падает, возникают постоянные проблемы с toolcall.


    1. Mashinow Автор
      09.09.2026 17:13

      Это прикол какой то? 20 токенов в сек. для такой огромной модели на таком железе это очень много

      Это в идеальных условиях на пустом контексте, потом просядет до 10-15. Мне кажется для такого класса задач лучше облачного провайдера с нормальной скоростью запустить, либо купить железо помощнее.

      Кто вообще квантует контекст до q4?

      К сожалению q8 значительно больше врам потребляет, это выбрано как компромисс по памяти. Я тестировал turboquant, сейчас форк с ним dflash не поддерживает и содержит много недостатков от апстрима.

      В целом недостатки квантованного кеша проявляются на заполненном контексте в районе 100-150к, на 90к это не так заметно.