Еще несколько лет назад NVIDIA Tesla V100 ассоциировалась прежде всего с дата‑центрами и суперкомпьютерами. Сегодня эти списанные ускорители V100 SXM2 на 16 ГБ массово попадают на вторичный рынок, и для энтузиаста локального ИИ они выглядят неожиданно интересно. Особенно это касается версии V100 SXM2 на 32 ГБ.

Почему именно NVIDIA Tesla V100
У меня возникла простая идея: а почему бы вместо одной современной и дорогой игровой видеокарты собрать сервер на двух или четырех бывших серверных ускорителях. В результате получается от 64 до 128 ГБ видеопамяти, высокая пропускная способность и возможность использовать NVLink (попарно). При этом сами модули V100 сейчас можно найти по цене, несопоставимой с современными топовыми GPU. Например, актуальные предложения на V100 SXM2 16 ГБ на маркетплейсах встречаются примерно от $100–150 за модуль, хотя цена сильно зависит от состояния и года выпуска.

Важная оговорка: V100 — это архитектура Volta 2017 года. Такая видеокарта не будет быстрее современных RTX во всех задачах. Игровая производительность примерно как у Radeon 6800XT или 5060Ti. Но нужно сказать, что данная видеокарта лишена ряда новых возможностей, например, не поддерживает трассировку, не поддерживает Frame Generation (DLSS 3/4).

Но в локальном инференсе LLM ситуация интереснее: здесь огромное значение имеют объем и пропускная способность памяти, а не только поколение Tensor‑ядер. Поэтому современный сервер на базе NVIDIA V100 SXM2 в ряде нейросетевых сценариев действительно способен конкурировать с гораздо более дорогими видеокартами, стоя при этом в несколько раз дешевле. В ряде задач, такая видеокарта остается на уровне RTX 3090Ti. Конечно, многое зависит от конкретной сборки и версии платы (те же NVIDIA V100 SXM2 с памятью 32 ГБ будут эффективнее работать с маленькими моделями, такими как Qwen3.8–27B, которые полностью помещаются в VRAM). А если использовать четыре V100 по 32 ГБ, получаем конфигурацию с 128 ГБ HBM2, что уже открывает возможность запуска моделей, которые на одной потребительской видеокарте просто не помещаются, хотя и стомость в таком случае начинает «кусаться».

Что такое V100 SXM2
NVIDIA Tesla V100 построена на архитектуре Volta и оснащена 5120 CUDA‑ядер и 640 Tensor‑ядер. Версия SXM2 получила 32 ГБ HBM2 с пропускной способностью 900 ГБ/с. Заявленная производительность Tensor‑операций достигает 125 TFLOPS, а максимальное энергопотребление составляет 300 Вт. Для связи нескольких ускорителей используется NVLink с пропускной способностью до 300 ГБ/с. Для сравнения, GeForce RTX 3090 имеет 24 ГБ GDDR6X и пропускную способность памяти около 936 ГБ/с, а RTX 5070 — 12 ГБ GDDR7 и 672 ГБ/с. RTX 4070 Ti располагает 12 ГБ GDDR6X. То есть V100 выглядит устаревшей по архитектуре, но ее 32 ГБ HBM2 остаются весьма серьезным ресурсом для локальных нейросетей.

У V100 существовали две основные версии: PCIe и SXM2. Для домашней сборки логичнее смотреть именно на SXM2. При сборке и настройке стоит уделить внимание установке драйверов и приложений. Так, Например, в актуальной ветке PyTorch начиная с 2.11 готовые CUDA 12.8/12.9-бинарники больше не включают поддержку Volta; для V100 рекомендуется использовать сборки с CUDA 12.6 либо собирать PyTorch самостоятельно с поддержкой sm_70. Это один из главных минусов V100 в 2026 году: железо дешевое, но программная совместимость уже требует внимания. Если говорить про специальный мезонинный разъём SXM2, то у Tesla V100 их сразу два: один требуется для обмена по PCIe, а второй используется для стыковки с другими видеокартами по шине. При выборе адаптера обращайте внимание на возможность подключения NVLink — далеко не у всех таких адаптеров второй разъём SXM2 распаивается/выводится на край платы для подстыковки NVLink Bridge. Это еще один важный момент, на который стоит обратить внимание при подборе конфигурации будущего ИИ‑сервера.

Моя конфигурация ИИ‑сервера
Сам модуль SXM2 не вставляется в стандартный PCIe‑разъем. Нужна переходная плата. На текущий день таких плат достаточно много, встречаются как в конфигурации на одну, две и даже четыре Tesla V100. Как правило, в стандартный PCIe‑разъем эти платы подключаются через различные райзеры и PCIe‑адаптеры. Отмечу, что такие адаптеры вполне могут «резать шину» — мне встречались варианты не только для PCIe х16, но и для PCIe х8. Такие конфигурации накладывают ограничения на используемые материнские платы, так что и этот момент не оставляем без внимания.

Самый простой, на мой взгляд, вариант — это использование адаптеров под NVIDIA Tesla V100 SXM2 для прямой установки в PCIe‑разъем, например, с воздушным охлаждением. На фотографии как раз такой вариант, с «кулерами» от RTX 4090. Кстати, на фотографии видно еще и установленный NVLink мост, объединяющий видеокарты. Вот только стоимость переходников сейчас может оказаться сопоставимой с ценой самой V100.

Охлаждение — главная проблема домашней V100
На мой взгляд, воздушное охлаждение — это достаточно экстремальное решение. У серверной V100 нет привычного игрового кулера. NVIDIA рассчитывала на установку таких модулей в сервер с мощным теплообменником‑радиатором и направленным воздушным потоком. При TDP 300 Вт одна карта выделяет столько тепла, сколько достаточно производительная игровая видеокарта. Две V100 — уже 600 Вт только на GPU. Четыре — 1200 Вт. У меня еще и пара Xeon Е5-2680 с TDP 120 Вт на каждый. Поэтому вариант «поставлю маленький радиатор и вентилятор от процессора» подходит далеко не всегда. Для эффективного охлаждения в таких случаях используются массивные медные или алюминиевые радиаторы с тепловыми трубками и отдельными вентиляторами, с посадочными размерами как у серверных решений.

И если для тестовой сборки воздушное охлаждение может быть оправданным, то для работы сборки из двух или четырех карт наиболее разумный вариант охлаждения — это СЖО (системы жидкостного охлаждения), особенно в случае, если сервер должен будет работать круглосуточно рядом с человеком. На фотографии пример NVIDIA Tesla V100 с установленным водоблоком под СЖО.

V100 имеет ровную поверхность кристалла и выпускаются решения с водоблоками, рассчитанными на SXM2. Вот пример тестовой сборки с типовой системой СЖО на две секции и с креплением аля LGA 115х. Такое решение не только тише по сравнению с «турбинкой» воздушного охлаждения, но и позволяет отвести ~ 300 Вт тепла при работе видеокарты.

Сервер на двух V100 SXM2
Для домашнего использования я бы начинал именно с двух ускорителей. Получаем: 2 × 16 ГБ = 32 ГБ VRAM для запуска таких локальных моделей, как Qwen3.8–27B и Gemma4-26b. В случае со старшей версией V100 получаем 2 × 32 ГБ = 64 ГБ VRAM и теоретически: 2 × 900 = 1800 ГБ/с суммарной пропускной способности памяти при использовании NVLink. Не забываем и про оперативную память самого ПК. Да и про вопросы с питанием не забываем — тестовая сборка, как на фото, потребляет около 1 кВт.

Сколько стоит такая система
Теперь самое интересное — экономика. По текущим предложениям V100 SXM2 32 ГБ можно найти примерно за $100–150 за модуль. Переходник SXM2→PCIe может стоить около $220. Для RTX 5070 ориентир сейчас составляет около $550–570 за карту. RTX 4070 Ti на вторичном рынке и в актуальных предложениях находится примерно от $680. RTX 3090 на текущем рынке заметно дороже исторических цен: «заточенная» под ИИ карта с памятью 24 Гб на вторичном рынке может стоить и более $1000. Конечно, все это весьма условно — цены зависят не только от валютного курса, но и от спроса/предложения. Для расчета возьмем не только GPU, но полноценную систему с учетом корпуса, систем охлаждения, материнской платы, CPU и памяти:
Конфигурация |
GPU |
Переходники |
Платформа и охлаждение |
Итого |
2× V100 16 ГБ |
~$240 |
~$240 |
~$900 |
~$1400 |
2× V100 32 ГБ |
~$460 |
~$240 |
~$900 |
~$1600 |
4× V100 32 ГБ |
~$920 |
~$480 |
~$1300 |
~$2700 |
4× RTX 5070 |
~$2240 |
— |
~$1250 |
~$3490 |
4× RTX 4070 Ti |
~$2730 |
— |
~$1250 |
~$3980 |
4× RTX 3090 |
~$6000 |
— |
~$1500 |
~$6700 |
Это оценочная стоимость, но она позволяет сравнить варианты конфигураций и сделать вывод. Я для себя вывод сделал и собираю домашний сервер на базе V100. К слову, в этой таблице не учтены доставка, таможенные платежи, возможный ремонт бывших в употреблении V100, а также затраты на сборку и расходники (термопаста и прочее). Для грубой оценки можно поделить условный агрегированный throughput на стоимость системы (очень условно):
Конфигурация |
Условный throughput |
Стоимость |
Токенов/с на $1000 |
2× V100 |
144 |
$1600 |
90 |
4× V100 |
288 |
$2700 |
107 |
4× RTX 5070 |
320 |
$3490 |
92 |
4× RTX 4070 Ti |
308 |
$3980 |
77 |
4× RTX 3090 |
200 |
$6700 |
30 |
Что показали тесты Qwen3.8
Отдельный интерес представляют локальные LLM типа Qwen3.8–27B и Gemma4-26b (и аналогичные им). Для V100 32 ГБ можно достичь результата около 36,6 токена/с при Q4_K_M. При этом модель требует примерно 24 ГБ VRAM и может полностью размещаться на V100 32 ГБ. К слову, современные LLM‑фреймворки умеют распределять модель между несколькими ускорителями. При этом NVLink существенно уменьшает стоимость обмена данными между GPU по сравнению с обычным PCIe. То есть, если у вас нет необходимости запускать более тяжеловесные модели и Qwen3.8–27B/Gemma4-26b вам будет достаточно, то вполне можно остановиться на сервере с парой V100 16 ГБ. Я использую связку Qwen3.8 + Ollama + OpenCode. В зависимости от ситуации, далее в связке идет MCP и целевое приложение. Например, можно генерировать 3D модели с помощью Blender MCP или создавать скетчи в Arduino CLI.

Вместо итога
Если смотреть на такую систему глазами пользователя, который не занимается промышленным обучением нейросетей, а запускает локальные LLM, ретушь и генеративные задачи для бытовых вопросов, то впечатление получается необычным. Две V100 на 32 ГБ позволяют не думать о том, хватит ли 12 или 16 ГБ памяти. Модель можно загрузить на один GPU либо распределить между двумя. А две V100 на 16 ГБ пока остаются самым бюджетным вариантом для домашнего ИИ сервера. Стоит отметить ряд моментов, которые могут остановить пользователей от подобной экономии:
Эти карты б/у, в основной своей массе 2017–2018 года (это версии, которые подешевле, а если более свежие, но там стоимость быстро приближается к современным видеокартам), то есть можно вполне получить «убитую» и «попасть» на ремонт.
Для работы эти карты требуют модифицированный драйвер Nvidia. Далеко не на всех системах удается настроить без конфликтов и без «костылей». На Linux‑системах, к слову, похожая ситуация.
Высокое потребление: система с четырьмя V100 по потреблению может превышать 1.5 кВт, а система с двумя V100 — приближается к 1 кВт.
Соответственно, высокое тепловыделение. Это приводит к сложностям с установкой системы охлаждения, к высокому шуму при работе, определенным рискам с перегревом системы.
Две карты по 16 Гб с NVLink — это не то же самое, что одна карта на 32 Гб. Соответственно, две карты по 32Гб с NVLink — это не то же самое, что одна карта на 64 Гб. Современные нейросети поддерживают разделение памяти: если модель Qwen3.8–27B целиком не помещается в видеопамять вашей видеокарты V100 16 ГБ, то Ollama автоматически загружает часть слоев в VRAM одной видеокарты, а часть — в VRAM второй видеокарты. То же самое касается больших моделей, когда остальные слои загружаются в системную RAM. Но от такого страдает скорость генерации. Это также нужно учитывать.
Играть на таких картах можно, но большого смысла нет — они «заточены» именно под ИИ: обучение и генерация. Ну и в целом RTX 5070, RTX 4070 Ti, RTX 4090 и RTX 3090 обладают преимуществами в разных современных вычислительных задачах.

Вот только Tesla V100 дает для энтузиаста то, что сложно получить дешево: можно получить максимум GPU‑памяти и нейросетевой производительности за ограниченный бюджет, это один из самых интересных вариантов вторичного рынка. Несколько Tesla V100 + NVLink позволяют собрать систему, по объему GPU‑памяти и возможностям многокарточной работы приближающуюся к гораздо более дорогим решениям. Для домашней ИИ‑станции это уже достаточно интересная конфигурация: можно запускать модели, которые требуют больше 24–32 ГБ памяти, не покупая профессиональный ускоритель стоимостью в несколько тысяч долларов. Именно поэтому четыре V100 могут оказаться заметно более мощной платформой для больших моделей, несмотря на более старую архитектуру. Особенно приятно, что после покупки базовой платформы можно постепенно наращивать систему: у меня в планах после тестирования пары V100 добавить еще одну (получается третью по счету V100 32 Гб). Возможно, при наличии подходящей материнской платы — получится перейти и к сборке из четырех таких видеокарт. Планирую выкладывать тесты и результаты работы в связке с OpenCode/Android Studio/ArduinoCLI/Blender и так далее, тем более сейчас есть с чем сравнить. Если интересно — напишите, могу подробнее рассказать про настройку драйверов и связок Qwen3.8 + Ollama + OpenCode или Gemma4-26b + Ollama + OpenCode. Также приглашаю обсудить ваш опыт по созданию домашних ИИ‑станций и по оптимизации генераций с большими моделями. Статья большая, если заметили опечатку, просто напишите мне, и я исправлю.
Комментарии (121)

Z55
20.09.2026 05:42Модели развиваются очень быстро. Сегодня вы можете запускать квен 3.8, а завтра какой-нибудь квен 4.0 будет выдавать полтокена в минуту. И стенд становится бесполезным, а карты - никому не нужными

Lexus08 Автор
20.09.2026 05:42Не думаю.
Скорее оптимизируют большие модели для запуска на домашних GPU (смотрите квантование LLM)

Talos13
20.09.2026 05:42квантование квантованием, а всякие flash attention на старых поколениях не поддерживаются... ну и будет идти условно как с Doom - на тесте на беременность запускаем, но в здравом уме кто так будет играть? тоже засматривался на p100, v100, но как будто в переплату за 5060 вложено как раз то время, что тратится на налаживание охлада и нервы вокруг этого всего. Не считаете?
в любом случае спасибо за опыт, было интересно

Kreatifchk
20.09.2026 05:42На v100 даже без flash attention всё очень неплохо работает.

Talos13
20.09.2026 05:42неплохо - понятие растяжимое... я и на ддр4 на гемма4 26б десяток токенов в секунду получаю, но вот докупать что то тензорное все равно хочу)

DerTosser
20.09.2026 05:42Казалось бы уже прошла четверть 21 века, компьютеры, технологии, нейросети, хабр - авангард it-прогресса, а на деле всё то же сборище мифов древней греции, передаваемое из уст в уста. Ну вот же: раз, два. Дальше искать стало лень, а уверен есть ещё. Видеокарта это хардварный универсальный вычислитель, а все алгоритмы находятся в софте, как он написан так и будет считать. Устареть может только его вычислительная мощность, форм-фактор и всё. Во все эти легенды о неподдерживаемых квантованиях и прочих сугубо софтверных вещах я больше не верю, если не доказано ссылками что это так на самом деле. Впредь, пожалуйста подтверждайте утверждения, не превращая их в городские легенды.

Talos13
20.09.2026 05:42Вольта физически не поддерживает аппаратное асинхронное копирование данных в shared memory (cp.async), которое появилось только в Ampere. Из-за этого все подобные порты под CC 7.0 - не более чем эмуляция с диким оверхедом по памяти. как я изначально сказал:
будет идти условно как с Doom - на тесте на беременность запускаем, но в здравом уме кто так будет играть?
вот спеки Ampere и Volta, или ссылки автора архитектур для вас не доказательства?
https://images.nvidia.com/content/volta-architecture/pdf/volta-architecture-whitepaper.pdf
Во все эти легенды о неподдерживаемых квантованиях
А пассаж про "неподдерживаемые квантования" вы вообще сами придумали и сами же бросились опровергать. Я ничего подобного не утверждал. без дословного цитирования такие выпады не несут достаточно объективности чтобы считаться серьёзными.
p.s. ваша вторая ссылка есть просто инструкция к первой, так что, сдаётся мне, не лень дальше искать было, а гипотеза просто резко обрела границы =)

Lexus08 Автор
20.09.2026 05:425060 маловато будет и по объему VRAM и по шине данных.
я смотрел RTX5070Ti.
так вот, одна V100 на 32 Гб будет выгоднее, чем RTX5070Ti в плане работы с моделями типа qwen 3.8-27b и gemma 4 26b. Они полностью помещаются в VRAM (у RTX5070Ti чуть не хватает, нужно vram offloading делать, это снижает скорость работы.
Производительность и вычисления (FP32): RTX 5070 Ti достигает показателя 43,9 Тфлопс, что примерно в 2,8 раза превышает производительность V100 (15,7 Тфлопс).По цене одна V100 на 32 Гб стоит примерно в три раза дешевле RTX5070Ti.
Вот тут есть жирный плюс двух V100 - их можно спарить в мост NVLink. там есть нюансы работы именно с NVLink, но в целом современные LLM и провайдеры умеют распределять VRAM. У RTX 40хх/50хх такую фичу выпилили

Lexus08 Автор
20.09.2026 05:42По поводу 5060. У 5060 3840 CUDA ядер, 120 тензорных ядер, всего 8 Гб VRAM, под совсем слабые и Flash модели) У Tesla V100 5120 CUDA ядер, 640 тензорных ядер, 16 Гб VRAM. Вполне нормально работают Qwen 3 (14B), Phi-4 (14B), Gemma 3 (12B). Про мост NVLink на пару Tesla V100 я уже говорил выше - это штатная функция. По цене - 5060 стоит как 4-5 штук Tesla V100. Если рассматривать 5060ti то разница еще ощутимее. Я для себя решил собирать сервер именно на Tesla V100, сначала две с NVLink, потом можно еще докупить и поставить.

Talos13
20.09.2026 05:42спасибо! пища для размышлений

Lexus08 Автор
20.09.2026 05:42вы меня заинтересовали. наверное есть смысл взять 5060 (лучше 5060 Ti) и сравнить с V100. вот прямо на одних и тех же моделях.
Учитывая, что я хотел в сервер помимо пары V100 поставить еще что-то, то вполне нормальный вариант. Модель будет загружаться в V100, а сами вычисления распределяться

RTFM13
20.09.2026 05:42Вполне нормально работают Qwen 3 (14B), Phi-4 (14B), Gemma 3 (12B).
Контекст
Живу в тёплом климате (дневная температура всё еще под 30). Решил поиграться с нейронками. Киловаттная печка тянет за собой кондей, которые вместе тянут за собой инвертер и батарейку для СЭС. На рабочей станции стоит 3060Ti 8GB половину из которых выедает десктоп. По этому на десктопе нормально работают только совсем игрушечные 2B/4B модели.
Есть достаточно мощный и холодный домашний сервер. Но места в нём совсем мало.
Не совсем ожиданным решением стала ADA2000 16GB которая на 12B/14B моделях работает вполне сносно (в моём понимании), благо вся видеопамять полностью в распоряжении ollama, при этом совершенно холодная, бесшумная и влезла в ултракомпактный корпус (сама карта low profile). Суммарное потребление сервера выходит порядка 150Вт в пике. А т.к. кроме карты я не покупал абсолютно ничего, то вышло достаточно бюджетно.

Lexus08 Автор
20.09.2026 05:42хотя есть и минусы.
это потребляемая мощность (5060 вдвое меньше "жрет"), у 5060 сильно свежее архитектура (тензорные ядра 5th Gen with FP4/FP8), хотя не все очевидно, например, у V100 есть поддержка вычислений FP16/FP32).

Talos13
20.09.2026 05:42вот потому и спрашиваю собственно, мне тоже совсем не все очевидно. вроде 5060 это архитектура на годы вперед, сегодня вот такую штуку показали - https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf грубо говоря стоит ждать новых способов квантования, с другой стороны отдавать x3-x4 за потребительскую карту ради только архитектуры-новизны и ещё и с низкой пропускной способностью... когда v100 p100 есть бу даже с гарантией прямо с цодов, nvlink, огромная п/с и огромная память.
в общем потому ваш материал важен не просто как "я сделал, и у меня действительно получилось", а потому что он реальная инструкция + реальный опыт, и есть над чем подумать, и есть пошагово что делать в случае выбора для себя этого варианта
p.s. я про Ti изначально говорил, всё интересное от 16 гб само собой, но сути это шибко по вопросам архитектур не меняет, для тех кто будет перечитывать топик позже

Lexus08 Автор
20.09.2026 05:42вроде 5060 это архитектура на годы вперед, сегодня вот такую штуку показали
я боюсь сейчас будут еще и еще дорожать, а бытовые карты "ужмут" с узкой шиной (как раньше было с шинами 64 и 128 бит) и медленной VRAM на 8 Гб.
Остальное оставят под ИИ с резким разрывом в цене.Уже и сейчас такой разрыв в цене заметен на карты с 24 Гб VRAM

Talos13
20.09.2026 05:42100%, туда и движемся.
вы меня заинтересовали. наверное есть смысл взять 5060 (лучше 5060 Ti) и сравнить с V100. вот прямо на одних и тех же моделях.
Учитывая, что я хотел в сервер помимо пары V100 поставить еще что-то, то вполне нормальный вариант. Модель будет загружаться в V100, а сами вычисления распределяться
было бы очень интересно почитать, если есть возможность. я буквально последние два месяца мечусь и не решаюсь что-то конкретное взять просто из за всех вышеизложенных мной сомнений - новое но дорого, или старое но крутое. хочется всех зайцев и не по цене однушки в подмосковье, конечно же, но выбирать приходиться из того что есть =)

Lexus08 Автор
20.09.2026 05:42по цене однушки в подмосковье,
это вот прямо верное замечание. я когда начал считать сборку на RTX5090 слегка приземлил ожидания

N1tr0xx
20.09.2026 05:42Это не совсем так работает). Модели развиваются, да. Но развиваются они в основном посредством качественных изменений микро-архитектуры и поднятия "интеллектуальной плотности", то есть достижения эквивалентного результата с меньшими затратами на инференс.

ioccy
20.09.2026 05:42Вот только не понимаю, почему за пустой кусок текстолита хотят 10 тыс.

tsukasa_mixer
20.09.2026 05:42Причем пару месяцев назад видел их по 700₽ а щас эти же уже под 5к+

Lexus08 Автор
20.09.2026 05:42адаптеры разные есть. там для х4/х8 разъемов и с поддержкой NVLink мостов или без

evgeniy_kudinov
20.09.2026 05:42Спасибо, интересно про такое почитать. Хоть у меня уже есть «домовой», но хочется помощнее и подешевле по цене для экспериментов. Хотелось бы более детальнее про железо (всё, включая водянку) и про ПО (сборки из исходников). Можно серию статей про поэтапную сборку системы для домашнего применения.

Lexus08 Автор
20.09.2026 05:42есть мысль взять еще одну V100 для тестов с eGPU адаптером.
вот такая приблуда есть с USB4, по идее должно работать. Если драйверы получится корректно настроить.


Javian
20.09.2026 05:42На Хабре были в мае-июне статьи про V100 с подробностями сборки, работы. Например
https://habr.com/ru/articles/1041610/
https://habr.com/ru/articles/1030918/
https://habr.com/ru/articles/1039198/
0xBADC0FFE
20.09.2026 05:42Пусть статья не несет новизны, но свежие комментарии почитать интересно. Лично меня больше интересует что можно делать на локальных LLM, они же тупые, единственное преимущество это приватность и возможность пощупать расцензурированные модели.

kabas
20.09.2026 05:42актуальная тема. сами тоже думаем сделать небольшую сборку для офиса и выбираем. Заранее спасибо за более подробную про железо и софт. По вашему сценарию работы - какие задачи, сколько пользователей одновременно работает, как часто требуется вмешательство/контроль после запуска в рабочем режиме постоянного использования ?

Lexus08 Автор
20.09.2026 05:42мне интересно локальное обучение (условно чертежи-спецификации подсунуть, V100 умеет в обучение), и потом генерировать новое с соблюдением секъюрности.
работать можно из консоли - ресурсов от процессора требует не так много, в основном грузится в VRAM сама модель.
По поводу контроля - смотря какие задачи. У меня не все получается, например, локальная генерация в Blender слабовата (делает, но упрощенно), более простые задачи делает нормально. Можно подключить тот же автокад через LISP, либо другой CAD с поддержкой MСP

RomanDrDev
20.09.2026 05:42А неттопы на Ryzen AI Max+ 395 не более перспективные в этом плане?

NeoCode2
20.09.2026 05:42Присоединяюсь к вопросу. У меня лично к покупке какого-бы то ни было б/у какое-то неприятие, а тут покупка достаточно дорогого б/у, да еще и возня с нестандартными драйверами, охлаждением и прочим. А коробочка Ryzen AI - все-же потенциально приобретение на будущее. Еще из плюсов - она портативна (буквально портативнее ноутбука) и вполне может быть использована просто как обычный ПК, а не только для ИИ. Из минусов - все говорят что нужна CUDA, и еще скорость доступа к памяти ниже. Про CUDA - ну я не знаю, почему этот вопрос до сих пор не решили, тем более сейчас в эпоху вайбкодинга. Как по мне так Тьюринг-полноты вычислителя должно быть достаточно, остальное - вопросы скорости работы. И вот тут вроде как действительно может быть медленнее чем видеокарта. Но наверное нужны отзывы от реальных владельцев, лучше них никто не скажет.

slonopotamus
20.09.2026 05:42Немного упрощая, с LLM всё упирается в память. Объём определяет какую модель вы в принципе сможете запустить. А пропускная способность памяти определяет скорость работы.
Примеры:
RTX 5090: 32GB, 1800GB/s
Ryzen AI Max+ 395: 128GB, 250GB/s
Mac M3 Ultra: 512GB, 800GB/s
NVidia H200: 140GB, 4800GB/s
Здесь можно заметить что Ryzen AI Max+ очень медленный по сравнению с другими вариантами. Запустить на нём можно много чего, но оно будет еле ползать.
Ну и стоимость примерно растёт как O(объём*скорость).
Ещё есть интересный момент с тем как разработчики моделей принимают решение о том какого размера будет модель. Я думаю что они отталкиваются от целевого железа, на котором эту модель предполагается запускать. Qwen 27B не просто так имеет такой размер. Она в наиболее популярном квантовании Q4 как раз хорошо помещается в очень распространённый среди энтузиастов 32GB GPU, потому что это потолок, который можно получить на 1 GPU потребительского сегмента. Имея нестандартное количество памяти, может так получиться, что для вас просто нет подходящей модели, они будут или слишком маленькие, или наоборот слишком большие.

Vlad_06
20.09.2026 05:42Ryzen AI работает весьма неспешно, но вполне приемлемо для личного использования. Gemma4-26 q8 дает инференс около 40 т/с. Его основной плюс - это возможность держать в памяти одновременно несколько моделей. CUDA нет, работает Vulcan.
Еще Intel Arc B60 (24Gb) - скорость примерно сопоставима с Ryzen AI. Но тихая и холодная.

Voiddancer
20.09.2026 05:42У меня всего-лишь 370 ai, 64гб памяти, но не думаю что разница будет существенной с 395ым. Все очень упирается в медленный ddr5 и тот же qwen3.8 27b я еле-еле вытягиваю 15т/с и ниже по мере наполнения контекста. А свежих moe моделей нет.

slabnoff
20.09.2026 05:42Как-то немного, но минимально приемлимо. Это с mtp?
А moe-вариант qwen3.6-35b какую скорость показывает?

Voiddancer
20.09.2026 05:42Вам только кажется, что это приемлемо. Гемма 4 сегодня выдавала до 40т в пике, со средним в 25. Квен пока не могу проверить.

slabnoff
20.09.2026 05:42Мне так-то не очень приемлимо для opencode и 30-40 т/с. Поэтому сижу на qwen3.6/3.8-35b с 75-90 т/с, только для сложных задач переключаюсь на 27b. Но 15-20 т/с - минимально приемлимый порог для чата. То есть посмотреть на модельуже можно, я в этом смысле.

dkeiz
20.09.2026 05:42на 395 память в два раза быстрее, точнее каналов в два раза больше, разница была бы в 30 т/с. Добавляем MTP, получаем до 40-50т/с и контекст в 200к для мультиагентов. Уже не так плохо.

nidalee
20.09.2026 05:42Не будет там таких цифр. Там на 60к уже меньше 20 т\с, на 200к оно вообще будет всю ночь думать - проверено на практике.

dkeiz
20.09.2026 05:42https://www.reddit.com/r/StrixHalo/comments/1vwm4p3/qwen38_27b_new_record_on_strix_halo_52_tokens_per/
за что купил, за то продал.тестовое оно все

nidalee
20.09.2026 05:42Это 32к контекст с огромным количеством костылей. На 90к уже 23 т\с, дальше вообще грусть и тоска.

dkeiz
20.09.2026 05:42Они были перспективны год назад, но год назад под них не было моделей. Сейчас модели есть под 200gb железо, это уже ryzen 495, но ценник не гуманный, выйдут вот-вот.

Lexus08 Автор
20.09.2026 05:42по неттопам - могу сравнить работу NPU от Ryzen и Intel.
пока предварительно - там разные задачи. NPU для экономии ресурсов и для работы в фоне с простыми задачами (например, фильтры в фотошопе при пакетной ИИ-обработке).
а тут все таки более серьезные вопросы)

iwram
20.09.2026 05:42Долго думал, стоит ли брать v100 в модификации корпуса rtx5090 - такие в среднем продают за 62 тысячи рублей. Взял. Никто не пишет прошумящие дроссели, они шумят практически у всех. По окладу нет проблем, но в api не можешь регулировать скорость вентиляторов - есть "ручной" спрятан за платой и можно крутить :) - шум в закрытом корпусе на уровне 35-40 дбм. Сейчас интересно смотрится PG199 - типа аналог A100 но только на 32гб, пишут что они стояли в автопилотах Теслы и обладают такой же скоростью как оригинальные A100 - но я не проверял, только видел, цены в среднем от 140 до 200 тысяч, в зависимости от наглости продавца - не рискнул.
По V100 в нагрузке, такая картина
+-----------------------------------------------------------------------------------------+ | NVIDIA-SMI 580.178.04 Driver Version: 580.178.04 CUDA Version: 13.0 | +-----------------------------------------+------------------------+----------------------+ | GPU Name Persistence-M | Bus-Id Disp.A | Volatile Uncorr. ECC | | Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. | | | | MIG M. | |=========================================+========================+======================| | 0 Tesla V100-SXM2-32GB Off | 00000000:03:00.0 Off | 0 | | N/A 54C P0 248W / 300W | 31245MiB / 32768MiB | 96% Default | | | | N/A | +-----------------------------------------+------------------------+----------------------+ +-----------------------------------------------------------------------------------------+ | Processes: | | GPU GI CI PID Type Process name GPU Memory | | ID ID Usage | |=========================================================================================| | 0 N/A N/A 2166 C ...local/lib/ollama/llama-server 31242MiB | +-----------------------------------------------------------------------------------------+Делать даунвольт до 260 не рекомендую, ollama будто зависает и перезапускают модель в случаях когда используется более половины памяти, если выделено 300 ватт, то таких проблем не наблюдал. Облачные V100 кстати показывают 250 ватт - соответственно по моим тестам в долгую показывают результат qwen3.8:27b 20-22 t\s против локальной v100 28-30 t\s. Брать или нет, смотрите сами, также стоит подсчитать затраченное электричество - в зависимости от использования 20 долларовая подписка в определенных случаях будет смотреться привлекательнее.

Spiritschaser
20.09.2026 05:422080 22Гб не рассматривали?

slabnoff
20.09.2026 05:42Я рассматривал. Одна такая вк не очень интересный вариант - 27b и 35b варианты qwen лезут только в экстремальных квантованиях и с ограничением контекста.
Очень интересный вариант две 2080 с мостиком nvlink. Получаем и прирост скорости относительно v100 32gb и нормальный cuda и работающий flash attention и нормальный охлад и запас памяти ощутимый для более точных квантований. Правда с драйверами есть нюансы, но вроде нормально решаемые.

Spiritschaser
20.09.2026 05:42прирост скорости относительно v100 32gb
Всё-таки они быстрее?
У меня варианты: купить V100 32 на PCI, или городить на 2 карты 2080, новый БП и всё такое.
slabnoff
20.09.2026 05:42Одна - дохловатая, но не убогая. Две просто - также дохловатые. Две с nvlink и отстроенной на tensor parallelizm системой - быстрые. Цифры получаются по тестам уровня 3090.
У меня сейчас в паре с 5060ти стоит tesla t10 - вариант 2080ти для geforce now - подрезана шина памяти до 256 бит, урезан тдп до 150 ватт, но памяти штатно 16 гб. На ии-задачах где-то на 10-15% медленнее 5060ти. Думаю 2080ти 22 гб должна показывать скорость на уровне 5060ти.

iwram
20.09.2026 05:42Нет. Смотрел именно в 32 гб, чтобы уместить. Купил только после того как погонял в облаке и посмотрел цены на аренду, очень сильно растут.

zasyadko
20.09.2026 05:42А можно информацию по префилу? Генерация это хорошо. Но она обычно в агентном режиме в сессии занимает буквально 1%, поэтому всегда более интересна скорость префила если в модель отправить контекста около 200к токенов

sshmakov
20.09.2026 05:42От 350 т/сек до 150 при увеличении контекста. 200к совсем грустно, приходится отключать у харнесса таймаут ожидания потока.
Qwen3.8 Q4 M с MTP
Впрочем, я допускаю, что еще не все резервы настройки исчерпаны

orefkov
20.09.2026 05:42Хм, то есть всё это дело с четырьмя картами можно запихать в иммерсионную жидкость и помогать отапливать дом? А такие “домашние ИИ фермы” ещё в пулы не объединяются, чтобы напрокат мощности сдавать?

Lexus08 Автор
20.09.2026 05:42А такие “домашние ИИ фермы” ещё в пулы не объединяются, чтобы напрокат мощности сдавать?
так это по сути китайцы разбирают свои ИИ сервера , которые уже 8-9 лет отработали и отогревали что то ))
обратите внимание, основная масса дешевых V100 с пометкой 2017-2018 год выпуска

Uncommon_file
20.09.2026 05:42Анализируя кучу статей на Хабре по теме такой сборки и пытая Гемини гугла вопросами, пришёл к выводу, что сборка на v100 изжила своё из-за малой производительности для современных моделей и большой жадности перепродаванов всей обвязки на которой нужно поднимать эту сборку.
2 RTX 3090 по рентабельности и возможностям смотрятся куда более перспективнее. На них можно хотя бы обучать некоторые модели.
В какой-то другой статье высказали правильный на мой взгляд вывод: решения на tesla v100 - как входной билет на базе простых текстовых моделей. То есть, купил, попробовал, через 2 года выбросил, ибо запросы моделей и пользователей растут, а железо не молодеет.

riky
20.09.2026 05:42Только 2 3090 сейчас стоят 240 тыс. Несколько месяцев назад когда стоили в 2 раза меньше то да.

rPman
20.09.2026 05:42по деньгам лучше 4x 5060ti 16gb (или более старые БУ 4060ti 16gb), они в разы дешевле но потребуют серверную материнку (у китайцев готовую железку под atx блок питания можно найти за 100-130т.р.)
p.s. кстати для маленьких моделей типа qwen3.8-27b широкая шина pcie не так уж и нужна, даже 1x более чем достаточно, если веса полностью в памяти и использовать layer разделение (хотя я пользуюсь tensor для 2x gpu и железки утилизируются на 100%, т.е. скорости pcie 4 хватает), а значит можно и десктопные материнки использовать.

Lexus08 Автор
20.09.2026 05:42по деньгам лучше 4x 5060ti 16gb
ни 50хх серия, ни 40хх серия не умеют объединяться мостом NVLink.
тут нужно смотреть что то уровня 3090 на 24 Gb VRAM, пару с мостом NVLink

nidalee
20.09.2026 05:42Для LLM не нужен nvlink. Но шина на 5060 слишком убогая, чтобы всерьез рассматривать ее вместо v100

trump-card
20.09.2026 05:42Через PCI-E будут объединяться. Надо чтобы MB поддерживала

Lexus08 Автор
20.09.2026 05:42Через PCI-E будут объединяться
там скорость обмена данных несколько ниже, чем NVLink

Mintavrus
20.09.2026 05:42Медленнее, и что? У меня две RTX3090 вообще в PCIE v3.0 воткнуты, но это не мешает им в режиме tensor для максимально качественной квантованной модели qwen3.8-27b-q8_k_xl выдавать 1500 (550 при использованном контексте >220k) токен/сек промпт процессинга и 75 токен/сек генерации (50 токен/сек при использованном контексте >220k)

nidalee
20.09.2026 05:42В правильно сконфигурированной локальной среде для ллм карты (почти) не обмениваются данными (0-10% прироста скорости). Карты делят между собой слои (--split-mode layer) и пересылают друг-другу activation tensor, а не перетасовывают слои между собой - это было бы неюзабельно. Исключение - какие-то комичные конфигурации типа двух карточек на одном x4 или что-то вроде того.
Для vllm/slang и прочих "вас много я одна" картина может меняться, но это не кейс для домашнего использования.
Конкретно 3090 могут быть исключением (130-170% от tensor вместо split), но с 3090 сами знаете какая ситуация, а более простые карты (серверная некрота с авито) nvlink не раскроют, поэтому тут не "карта уровня 3090 против аналогов", а "3090 против аналогов".

Lexus08 Автор
20.09.2026 05:42То есть, купил, попробовал, через 2 года выбросил, ибо запросы моделей и пользователей растут, а железо не молодеет.
ну не выбросил, а перепродал дальше, на вырученные деньги купил что то свежее.
2 RTX 3090
мне показывает цены 100+ за одну. А тут пара. Еще и комп соответствующий (БП, охлаждение). там тысяч 300 на круг.
с V100 можно уложиться в 100 тысяч.
на V100 тоже можно обучение делать

vagon333
20.09.2026 05:42А у меня зато бесшумно. :)
На полке стоят 3 Dell Precision с NVIDIA RTX A5000, 16 GB и ещё несколько с RTX A2000, 4 GB.
Распознавание речи, генерации речи, Routing для домашнего AI Assistant, OCR, работает прекрасно на локальных машинах.
А остальные AI задачи через вызовы на Groq, OpenAI, Anthropic и китайских AI API хостеров.
Lexus08 Автор
20.09.2026 05:42тут выше писали, что альтернативой такому ПК может стать подписка за $20.

vagon333
20.09.2026 05:42Спасибо за очевидность.
Активных подписок на AI API Services у меня свыше 10, но есть задачи на моделях, хостинг для которых онлайн найти сложно.
Не далее как сейчас тестирую классификацию документов на модели, которая экономит время и деньги, но пока не предлагается AI API провайдерами.Кстати, и этот ответ надиктовал на локальном Whisper с последующей постобработкой другой моделью форматирования русскоязычного текста, потому что Whisper на русском языке зачастую лажает.

LuciusWill
20.09.2026 05:42Да. Тема занятная. Но надо учитывать важный фактор — технологическое устаревание и прекращение поддержки этих карточек индустрией и софтом. Развиваются новые технологии в железе. Они используются в библиотеках и фреймворках, на которых строятся новые модели. Эти карточки не поддерживают новые технологии. Соответственно, постепенно поддержка этих старых карточек уходит из софта. Через лет 5 новые модели уже просто нельзя будет запустить на этих устаревших карточках. Либо можно будет, но с лютыми костылями и просадками в производительности. Но в итоге, со временем, и костыли перестанут работать. Поддержка этих видеокарт уходит и их популярность падает.
Эти видеокарты имеют смысл если вам не надо будет использовать самые последние модели. Помните про это.

RigelGL
20.09.2026 05:42Поддержка V* и P* прекратилась этим летом, последние драйвера 585, куда 13. Так что видеокарты ещё актуальны при цене 10-50 т.р.. Одна 3090 стоит дороже чем сборка на V100, а предлагает только 24 гб.
Существующий софт отлично работает на этих gpu, так что V100/P100 можно использовать как обычную видеокарту, а монитор подключить к материнке.

DerTosser
20.09.2026 05:42У V100 существовали две основные версии: PCIe и SXM2. Для домашней сборки логичнее смотреть именно на SXM2.
И чем это лучше заводской PCIe версии? Нужно возиться с недешёвыми адаптерами которые могут порезать шину. Сборка оказывается дороже чем монолитная карта. В чём же преимущество, если в итоге всё равно весь этот колхоз вставляется в тот же PCIe разъём?

sshmakov
20.09.2026 05:42PCIe меньше было выпущено, поэтому их сложнее найти, и, как правило, они с 16 Gb

Lexus08 Автор
20.09.2026 05:42ну как минимум ценой. Я заводские PCIe версии видел в продаже всего несколько раз, это не массовый товар, цены ломят такие, что проще действительно 5060Ti взять
а SXM2 версия стоит 9-10 тысяч у китайцев на таобао

x10der
20.09.2026 05:42Что-то у вас низкая скорость генерации, видимо без MTP запускаете?. У меня сервер тоже на 2-х V100 16Гб, с моделью qwen3.8 27b в квантовании Q5_K_M получается около 50 т/с (при генерации кода до 60 доходит). Обработка промпта в районе 600-700 т/с, вполне терпимо.

Вообще, очень доволен этими картами, даже заказал еще одну. Единственный минус - охлаждение. Я брал с турбинами сразу в напечатанных корпусах, под нагрузкой они шумят как самолет. Пришлось турбинки подключить через регуляторы напряжения XL4015E и уменьшить power limit карт до 150 Вт. В планах поменять на водяное охлаждение, чтобы избавиться от шума вообще.

RigelGL
20.09.2026 05:42Я сделал переходник из картона, он пропускает больше воздушного потока от кулера, чем напечатанный на 3д принтере, и позволяет держать < 80°С при 250 Вт. Регулировку оборотов сделал через FanControl, в простое кулер почти не слышно.

exadmin
20.09.2026 05:42У меня две P100 (по 16Gb) с турбинами в напечатанных корпусах. Я системник отвез на дачу и включаю его удаленно через Zigbee-реле по требованию. Тот еще самолет :)

p0isk
20.09.2026 05:42А ведь помимо nVidia c CUDA есть ещё Radeon с Vulkan. И карточки, например, mi50 instinct на 16 и 32 ГБ или даже BC-250 со всеми разблокированными (ну, кому как повезёт) ядрами.

kox
20.09.2026 05:42У V100 существовали две основные версии: PCIe и SXM2.
Три версии- забыли упомянуть SXM3- она вместо 12 вольт силового питания требует 48 вольт. Платы-переходники для SXM3 значительно дороже переходников под SXM2.

serg52
20.09.2026 05:42Я примерно по такой же логике несколько месяцев назад считал локальный сервер под LLM.
Для одного активного пользователя экономика обычно не сходится: API того же DeepSeek слишком дешёвый. Смысл появляется, когда такая машина работает не как персональный ПК, а как общий AI-узел на несколько человек и разные задачи.
Днём код и локальные модели для разработчиков, между запросами OCR, транскрибация, нормализация, ночью несрочные агентные задачи и пакетная обработка. Поставил задачу в очередь и лёг спать.
Как пример Ryzen AI Max+ 395 интересен сочетанием 128 ГБ общей памяти и 100–150 Вт потребления. За два года 24/7 это примерно 1,8-2,6 МВт/ч, тогда как старый сервер на 2-4 V100 легко съест 17-26 МВт/ч (за 2 года).
То есть только электричество такого V100-сервера за два года порядка 150-210 тыс. ₽ при 8 ₽/кВт/ч (за 2 года). А если ещё покупать сам сервер, карты, БП и охлаждение, по совокупным затратам уже можно приблизиться к двум современным машинам на Ryzen AI Max+ 395.
Поэтому старые Tesla имеют смысл прежде всего тогда, когда их практически бесплатно отдали из ДЦ вместе с инфраструктурой. Если всё покупать и собирать с нуля, компактная современная машина, расшаренная на несколько пользователей и задач, выглядит рациональнее.
Облачный API при этом я бы всё равно оставил для сложных и срочных запросов.

aboba123321b
20.09.2026 05:42Почему была выбрана ollama? Она очень медленная, попробуйте вместо нее llama.cpp, если хотите бОльшую скорость

TimopheyIvanov
20.09.2026 05:42Никто не пишет, что покупка Tesla V100 - это лотерея с возможным печальным. Эти карты майнили и работали на серверах в режиме 24\7 по полной загрузке. У многих карт, даже может быть у большинства, уже началась деградация памяти HBM2 - их же не просто так вытаскивают из серверов. Наверняка у многих карт уже есть накопленные ошибки ECC, но ушлые китайцы научились обнулять ошибки ECC и приезжает она покупателю девственно чистой. А после небольших нагрузок появляются ошибки REG ECC и память HBM2 продолжает деградировать. Спросите у продавца проверку и тест карты - он вам покажет статичную картинку обнуленных ошибок. Даже если сейчас нет ошибок, то они появятся через день, неделю, месяц - просто загрузите в нужный момент модель для работы, а она выдаст ошибку. Так что, подумайте, нужен ли вам этот списанный хлам?

Lexus08 Автор
20.09.2026 05:42спрашивал статистику по V100 32 Гб. Пишут про 20% отказов (то есть каждая пятая умирает у пользователя). У меня есть предположение, что они собирают из дохлых полуживые методом перепайки памяти HBM2. У V100 32 Гб там модули с двух сторон

AlexAV1000
20.09.2026 05:42что они собирают из дохлых полуживые методом перепайки памяти HBM2.
Ну что за бред?

helpmeiminhell
20.09.2026 05:42Я тоже задался подобный вопросом и по итогу пришел к двум AMD RX 7900 XTX, работающих с llama.cpp. К этому я шел постепенно: изначально у меня была одна RX 6900 XT. Ее заменил на 7900 XTX. Показалось мало. Взял платформу для eGPU, подключив к ней 6900 XT через OcuLink (PCIe 4.0 x4). Показалось недостаточно - из-за x4 шины и в целом меньшей производительности у 6900 XTX основная 7900 XTX не могла раскрыть свой потенциал, т.к. ей приходилось ждать пока другая карта закончит свои вычисления. В этом случае приходилось перераспределять слои таким образом, чтобы они размещались преимущественно на 7900 XTX. Мне это тоже не понравилось, потому я взял вторую 7900 XTX. Хоть теперь обе карты были одинаковыми по производительности, но шина x4 давала о себе знать. Начал смотреть в сторону HEDT-процессоров, таких как Threadripper, у которых есть куча линий PCIe. Нашел на вторичке комплект AMD 3970x и мат. плату к нему. Ну и плюс блоки питания на 1.5+ кВт, т.к. видеокарты в исполнении от Sapphire на постоянной могут есть 400-500 Вт, а в пике "доедать" и до 700 Вт.
И вот смотрю я на то, сколько я потратил на всё это, и вижу, что +/- за эту же стоимость можно было взять готовое решение с 4-мя V100 по 32 Гб в sxm2 исполнении на воздушном охлаждении и внешним адаптером на PCIe. Но я пока так и не понял расстраиваться мне или нет. В той же Qwen3.8 с MTP и split-mode=tensor на prefill я получаю до 1200 t/s, на генерацию от 60-80 t/s. при больших контекстах там и до в среднем до 40 падает. Это при том, что карты работают в x16 + x8, т.к. первая карта закрывает собой второй слот с x16. Жду каркас и райзеры, чтобы эти карты разнести и подключить их в режиме x16 + x16.
С другой стороны, 48 Гб видеопамяти - это как-будто ни туда, ни сюда. Большинство моделей, что я вижу, обычно параметрами помещаются в одну видеокарту до 32 Гб, либо кол-во параметров уходит за 100 млрд, а это уже другие масштабы. Остается только радоваться увеличенному контексту да квантованию получше.

Lexus08 Автор
20.09.2026 05:42крайне интересно.
особенно про eGPU

helpmeiminhell
20.09.2026 05:42Я тогда исходил из того, что у меня было под рукой. А под рукой у меня был Intel I9 10-го поколения с его 20 линиями. На мою мат. плату две видеокарты не влезли бы. К тому же, вторая из них работала бы по шине PCIe 3.0 x4 через чипсет. Думаю, было бы совсем грустно. А так я подключил док-станцию по OcuLink через переходник на M2 NVME. По итогу обе карты работали с процом напрямую.

Lexus08 Автор
20.09.2026 05:42sxm2 исполнении на воздушном охлаждении
в такой бюджет можно и "водянку" заложить.
будет потише))

Lexus08 Автор
20.09.2026 05:42С другой стороны, 48 Гб видеопамяти - это как-будто ни туда, ни сюда. Большинство моделей, что я вижу, обычно параметрами помещаются в одну видеокарту до 32 Гб, либо кол-во параметров уходит за 100 млрд, а это уже другие масштабы.
все так, только я решил с парой V100 на 16 Гб начать.

Mintavrus
20.09.2026 05:4248 гигабайт VRAM сейчас - это самый оптимальный размер. Как раз 47 ГБ занимает на 2х картах модель Qwen3.8-27b-q8_k_xl с контекстом 262k, Vision и квантованием кэша q8_0.

sshmakov
20.09.2026 05:42Для тех, кто смотрит в сторону V100 и б/у железа, надо отметить, что карты Tesla работают толька на материнках, у которых в BIOS есть опция "Аbove 4G decoding".

chesser76
20.09.2026 05:42Хорошая статья, спасибо! Но перейти на V100 она меня не сподвигла. Все таки карта старая, и может быть уже скоро уйдет из поддержки. Ну а потребление добивает радужную картинку. 300 ватт это перебор для домашней системы. Сам я изначально имел неплохой комп на АМ5, купленный еще до кризиса. Но в итоге перешел на 1700, именно на этом сокете я нашел материнку (единственную бытовую в линейке!!!) у которой полный набор pcie - 1 шт. 5.0 х16 и 4 шт. 4.0 х4. Один pcie 4.0 блокируется первой видяшкой, и его можно использовать только если все видяшки вынести на отдельное крепление + удлинители. В итоге я вынес 3ю видяшку на удлинитель и получилась отлично продуваемая система - открытый корпус. Итого 3 видяшки 16+16+12 = 44 гб. В основном работаю на 35В моделях. По моще 180+180+170 которые я еще уменьшаю командой до 150 ватт. БП 750 ватт не напрягается. И почти полная тишина при работе...

trump-card
20.09.2026 05:42Тоже задумывался о своём серваке. У меня уже есть основа на Supermicro H12 SSL-i, AMD Epyc 7542, RAM 128Gb. Прошерстил reddit и Авито, пришёл к выводу, что две 3090 самый лучший вариант. Пока думал, они подорожали за 120К. Платить 120К за б/у с неизвестным прошлым не захотел. TeslaV100, P40, AMD MI50, MI100, ... - всё это уже не стоит вложений на мой взгляд.Пришёл к выводу, что надо вложить сотни тысяч, чтобы получить компромисный (so-so) во многом вариант. Решил, что подожду годик, всё таки должно что-то появиться доступное. А пока пользуюсь провайдерами.

iatethelogs
20.09.2026 05:42хорошая статья! V100 - интересная карта, но редкая и все таки дорогая. за 100 баксов не найдешь их.

tomskiyleonid
20.09.2026 05:42вариант с радеон ми50 тоже довольно интересный. но, требует еще более внимательного отношения к пайторчу, у меня работает на 6.2 версии.

Fardeadok
20.09.2026 05:42Травоядная графомания нейрослопами. Автор обтекает вопрос скорости и в какой сервер пихать со звукоизоляцией. Ради 30 т/с вся эта возня? При том что дешевый опенроутер выдает 500 т/с в однопоточном режиме. Так возьмите старые 1080ti, 2060 12gb если хотите поиграться.
Ситуация 1: все накупили старья и радуются что буковки выползают на экран со скоростью подвальных БЭСМ
Ситуация 2: сложиться деньгами с друганами, знакомыми, коллегами и взять чтото нормальное в пять раз быстрее
klpkw
После быстрого поиска в этих ваших eBay и Авито у меня сложилось впечатление, что речь там идет про 350-500 долларов, но уж никак не 150-200
tsukasa_mixer
На ozon от 10к ₽
balamutang
"от" это сильно сказано.
потом еще купить переходники все эти, охлаждайку и тд и все это для того чтобы навсегда остаться на cuda 12.6.
для прода старье, для энтузиастов и дорого и почти старьё.
Lexus08 Автор
Я на таобао брал, есть плюс минус по такой же цене на озоне и вб
SerJ_82
Чат ГПТ говорит что Tesla P40 24 Gb вроде как нормальный вариант для старого сервера Интел (два Xeon 5600 2х6 ядер + 110 ГБ DDR3). Или есть лучше варианты? Цена довольно бюджетная
Lexus08 Автор
Tesla P40 сильно медленнее.
по деньгам выгоднее V100 брать, там и архитектура свежее и память шустрая.
ближайшая свежая "тесла" от двух лямов стоит".
Kano
10к стоят 16 гигвые версии, за 32 гб цена будет в районе 50к
Lexus08 Автор
да, 40к на таобао. но нужно охлаждение и SXM2 адаптер на PCIe
Lexus08 Автор
про охлаждение я не просто так написал. там 300 Вт дури, это или большая воздушная система охлаждения (типа как у RTX4090, шумная и нужна медная площадка-переходник под крепление на рамку GPU) или водянка на 300 Вт. Если две карты - две водянки или кастомная.
ну и блок питания нужен киловатт+ (два Xeon 5600 2х6 ядер тоже прожорливые)