Вышло 2 модели prism-ml/Ternary-Bonsai-27B-gguf и prism-ml/Bonsai-27B-gguf
Модели представлены в 2-битном и 1-битном вариантах и занимают всего 7,2 и 3,8 ГБ соответственно. Но самое интересное здесь не размер, а качество после столь агрессивного сжатия. По заявленным результатам, 2-битная версия сохраняет около 95% качества FP16, а 1-битная - примерно 90%.
Благодаря столь компактному размеру 1-битную модель можно запускать даже на смартфонах. Например, на iPhone 17 Pro Max скорость генерации достигает примерно 11 токенов в секунду.
Для запуска потребовался форк PrismML-Eng/llama.cpp. На RTX 3090 мне удалось получить около 60 токенов в секунду. Скорость вполне достойная, однако потребление видеопамяти меня не устроило: при контексте в 256 тысяч токенов 2-битная версия заняла около 18 ГБ VRAM. В это значение входят примерно 3 ГБ, используемые Windows 11.
Я привык работать с TurboQuant версиями llama.cpp, которые заметно эффективнее расходуют память, при использовании параметров: -ctk tbqp3 -ctv tbq3 объём памяти занимаемый контекстом, сокращается в 4.71 раза. При этом качество такого сжатия контекста, согласно результатам тестов, оказывается примерно на 8% выше, чем у F16.
Скрытый текст

Для этого я добавил поддержку 2-битного квантования Q2 из форка PrismML-Eng/llama.cpp в AmesianX/TurboQuant, которым пользовался ранее, Q1 кстати заработал сразу в форке TurboQuant.
Впрочем, переносил код не вручную, основную работу поручил нейросети, в данном случае GPT-5.6 Sol. На внесение изменений ушло около 15 минут, ещё примерно полчаса заняла компиляция CUDA-сборки. И что самое приятное - это сработало!
С 2-битной моделью и контекстом в 256 тысяч токенов потребление VRAM составляет около 12 ГБ. Правда, здесь есть небольшой нюанс: к этому значению нужно прибавить ещё 1-3 ГБ видеопамяти, которые использует Windows 11. Снизить потребление можно, перейдя на Linux или уменьшив размер контекста.
В случае с 1-битной моделью потребление составляет около 8 ГБ VRAM при том же контексте в 256 тысяч токенов.
Свой вариант форка я опубликовал на GitHub: jarkevithwlad/turboquant-prismml-cuda. В репозитории также доступна готовая сборка для видеокарт RTX 30-й серии и новее. Владельцам более старых GPU потребуется собрать проект самостоятельно на целевой системе.
С включённым TurboQuant скорость генерации снизилась до 45–50 токенов в секунду. При этом модель точнее работает с контекстом и потребляет меньше памяти. Поддержка DSpark - спекулятивного декодирования, для этой модели в моём форке отсутствует.
Форк не подходит для запуска на CPU, Vulkan и других бэкендах: TurboQuant в текущей реализации работает только с CUDA.
Сервер llama.cpp запускается следующей командой:
llama-server.exe -c 256000 -m "путь до Ternary-Bonsai-27B-Q2_0.gguf" --mmproj "путь до mmproj.gguf" --port 8080 --no-context-shift -ctk tbqp3 -ctv tbq3
Комментарии (22)

kox
16.07.2026 17:20Ну я к тому что и квант кеша у меня 8, у вас то явно мельче квант,

jarkevithwlad Автор
16.07.2026 17:20ну у турбокванта почти в 5 раз меньше размер, а у вас в 2 раза из за q8 и ещё дополнительно в 3 раза меньше из за 90к
p.s. сейчас проверил при 90к у меня потребление 10gb + 3gb-win11 (на 2 битной модели) + у меня замеры с mmproj (для распознавания изображений)
p.s.s. 90к без mmproj потребление 9gb +3gb-win11 (на 2 битной модели)

sergeym69
16.07.2026 17:20А смысл, эти модели сами по себе туповатые, Q1 сваливается в loop, на сложной задаче, Q2 немного умнее но тоже тупит и не может исправить ошибки в созданном коде.

Tdaa1
16.07.2026 17:20Я тоже не понимаю на каких задачах автор тестирует качество и достигает 90-95%... Примеров нет, так что это просто слова. Бумага все стерпит)))

jarkevithwlad Автор
16.07.2026 17:20я серьёзных тестов не делал, просто просил сделать html портфолио и за первый ответ там была 1 ошибка, на второй оно исправило её, так что может, хоть и сложность была не большая
p.s. специально сделал ещё раз тесты на моих основных локальных моделях, да промпт не самый показательный но вы можете и сами это сделать лучше..
p.s.s. все тесты через обычный чат llama.cpp (server)

jojozuka
16.07.2026 17:20Эта модель на 3090 влезает в кванте 4. Было бы интересно выпихнуть что-то по мощнее, чем и так уже впихнулось :-)

jarkevithwlad Автор
16.07.2026 17:2027b и q5 квант влазит, проблема в том что модели лучше уже значительно больше и требуют 400+gb ram/vram

perebour
16.07.2026 17:20Этот аттракцион извращения осталось догнать до полбита квантования, и с радостным гиканьем запускать на пульте от микроволновки - смотрите, работает!
Появилась новая группа странных людей с потребительским барахлом, которые всеми силами хотят закатиться в ИИ несмотря ни на что.
Но ведь с практической действительностью все эти потуги не имеют ничего общего.
95% точности в промышленных вещах - это фатальный писец.
А на поговорить ведь достаточно и гигачата

Worst_su
16.07.2026 17:20Как говорят в /ai/
Особо терпеливые могут использовать даже подкачку и запускать модели, квантованные до
8 5 4 3 20,58 бит, на кофеварке с подкачкой на микроволновку.

umbral
16.07.2026 17:20Хобби и домашних животных тоже осудить и запретить? Или только с железками ковыряться взрослому человеку должно быть зазорно?

freykun
16.07.2026 17:20За то, что скрестили Turbo Quant и призму — огромное спасибо! Сам давно привык к Turbo Quant.
Несколько вопросов по настройке:
Накатывали ли вы чат-шаблон (
chat template)?Проставляли ли какие-то параметры температуры и других аргументов при запуске?
Результаты по потреблению VRAM (на RTX 4090, стандартная
prism.mlllama.cpp):f16 (два кэша): ~21.4 ГБ VRAM для контекста 200.000 токенов.
q8 (два кэша): ~18.9 ГБ VRAM для контекста 262.144 токенов.
Системный базовый уровень: Windows 11 23H2 без фоновых задач «кушает» ~1.7 ГБ VRAM. Большинство приложений вынесено на встройку, чтобы минимизировать системную нагрузку.
Команда запуска:
./llama-server.exe -m "E:/0.Model_Vault/LLM/prism-ml/Ternary-Bonsai-27B-gguf/Ternary-Bonsai-27B-Q2_0.gguf" \ -fa on \ -b 2048 -ub 2048 \ --port 8080 \ --cache-type-k q8_0 \ --cache-type-v q8_0 \ -ngl 99 \ -c 262144 \ -np 1 \ --metrics \ --jinja --chat-template-file "E:\0.Model_Vault\chat_template.jinja" \ --slot-prompt-similarity 0.85 -dio --no-mmap
jarkevithwlad Автор
16.07.2026 17:20chat template пробовал, но разницы не заметил и даже не знаю нужен ли он этой модели по хорошему (не собираюсь использовать её в всяких cli, только чат)
параметры температуры и других аргументов при запуске не выставлял, но в редми модели такие рекомендацииСкрытый текст

kox
Тс, как то много памяти для KV кеша у вас жрет эта модель. Я на rtx 5060 ti 16gb крутил эту модель Qwen3.6-27B-UD-IQ3_XXS с квантованным кешем q8 90к, вся модель с кешем влезла в VRAM и еще 380 мегабайт свободно осталось. Правда у меня монитор подключен к встройке, так что еще отсюда экономия. С MTP получалось 45-65 ток/сек. Вот и не пойму- вроде в кванте который вы описываете, учитывая сколько весят веса, там должно влезть 256к, да еще и место остаться и без турбокванта. Или я что-то не понимаю?
jarkevithwlad Автор
а вы попробуйте у себя выставить контекст 256к думаю будет большое потребление (самому интересно какое), всё же ваши 90 это почти в 3 раза меньше
vagon333
У меня на тестах в 16GB VRAM на RTX A5000 влезло 129К контекста,
а больше: out of memory.
Но, кстати, модели довольно умные.
По моим внутренним 80 тестам лажанулись всего на 6,
да и то при исправленном промпте прошли все 80.
Я заменил свою старую модель на Ternary-Bonsai-27B.