
Привет, Хабр! На связи Илья Мартысь из Рег.облака. Видеокарты RTX 5090 и RTX PRO 6000 Blackwell собраны на одном кристалле. Разница в цене — почти вчетверо.
Объяснить ее одним словом «профессиональная» не выйдет. Причин три: объем памяти, ECC и лицензионное соглашение на драйвер. Последняя вообще не про железо, но именно она решает, попадет карта в стойку или нет. Заодно расскажу, почему A100 2020 года до сих пор в работе, хотя рядом стоят карты втрое быстрее.
Навигация по тексту:
Один чип, две разные карты
RTX 5090 и RTX PRO 6000 Blackwell собраны на одном кристалле GB202. Ключевая разница между ними — в объеме видеопамяти: 32 ГБ против 96. Розничная цена при этом отличается почти вчетверо: около 4 500 долларов за игровую карту и около 16 000 за профессиональную.
Утроили память, а цена выросла сильнее. Но дело не только в объеме VRAM. У RTX PRO 6000 больше CUDA-ядер — 24 064 против 21 760 у RTX 5090, то есть примерно на 10,6%, — и выше частота: 2617 МГц против 2410 МГц. При этом по сравнению с трехкратной разницей в объеме памяти прирост вычислительных характеристик выглядит относительно небольшим. На цену также влияют тип памяти и другой класс обвязки на плате. Но в конечном счете платят не столько за сами дополнительные гигабайты и ядра, сколько за задачи, которые такая конфигурация позволяет решать.
Где заканчиваются 32 ГБ
При 32 ГБ RTX 5090 закрывает дообучение методом LoRA на моделях примерно до 7 млрд параметров в BF16. Полное дообучение даже семимиллиардной модели в полной точности требует около 80 ГБ и в эти рамки уже не укладывается. С моделями на 70 млрд параметров вопрос закрывается совсем: в 32 ГБ они не помещаются ни при какой разумной точности. Ограничение вылезает и раньше — на длинном контексте, где KV-кэш при окне от 8 000 токенов съедает почти всю память, оставшуюся после загрузки весов.
Интересный момент: на моделях, которые целиком влезают в 32 ГБ, RTX 5090 работает на 10–15 % быстрее профессиональной карты за счет более высоких частот. То есть в своей нише игровая карта не просто дешевле, она еще и быстрее. Вопрос только в том, насколько эта ниша совпадает с вашей задачей.
ECC — то, чего не видно, пока не станет поздно
В RTX PRO 6000 Blackwell стоит память с коррекцией ошибок, в RTX 5090 ее нет. ECC находит и исправляет однобитные сбои на лету. Без нее сбой памяти во время обучения тихо портит веса модели, никак себя не проявляя.
Разница между «упало с ошибкой» и «отработало и выдало мусор» тут принципиальная. В играх и монтаже сбой памяти в худшем случае даст артефакт на экране или вылет. В обучении вы получите чекпоинт после двух суток расчета, который выглядит нормальным, проходит без единой ошибки в логах и при этом хуже, чем должен быть. Найти причину постфактум почти нереально.
Игровую карту в стойку не поставить, даже если она справится
Здесь причина уже не техническая. В лицензии на драйверы GeForce есть отдельный пункт: программное обеспечение GeForce и Titan лицензировано только для использования на принадлежащем вам оборудовании GeForce или Titan и не лицензировано для развертывания в дата-центре.
Пункт появился в конце 2017 года. Формулировка тогда звучала так: развертывание в дата-центре не разрешено, за исключением обработки блокчейна. NVIDIA объяснила это тем, что GeForce и Titan изначально не проектировались под требования дата-центра — с его нагрузкой 24/7 и высокой плотностью оборудования в стойках.
Формально ограничение касается драйвера, а не самой карты. Но без фирменного драйвера железо не раскрывает свои возможности, поэтому на практике это серьезно ограничивает использование GeForce в дата-центрах.
Есть и более приземленная причина. RTX 5090 потребляет до 575 Вт при 32 ГБ VRAM, а RTX PRO 6000 Blackwell — около 600 Вт при 96 ГБ. Разница в энергопотреблении небольшая, тогда как памяти у профессиональной карты втрое больше. Для дата-центра, где в одной стойке работают сразу несколько ускорителей, это критично: каждый дополнительный ватт превращается в тепло, которое нужно отвести, а возможности стойки по питанию и охлаждению ограничены. Поэтому при одинаковом порядке энергопотребления профессиональная карта позволяет разместить значительно больше видеопамяти на ту же мощность и тепловой бюджет.
A100 — карта не новая, но списывать рано
A100 вышла в 2020 году. По меркам рынка ускорителей это уже история, и логично было бы ждать, что ее вытеснили новые поколения. Но происходит другое.
Речь здесь именно про A100 80 GB — существует и версия на 40 GB, но мы ее не закупали. Сейчас A100 80 GB арендуется примерно на 40–60% дешевле H100 80 GB. При этом на обучении трансформерных моделей H100 может быть быстрее примерно в три-четыре раза, хотя стоимость часа у нее примерно вдвое выше.
Считать нужно не стоимость часа, а стоимость задачи целиком. Если расчет упирается не в чистую скорость вычислений, а в объем памяти или в пропускную способность канала до данных, разрыв в производительности между поколениями схлопывается, а разрыв в цене остается. Для инференса и дообучения моделей среднего размера это обычно так и работает.
То есть A100 остается интересной не потому, что конкурирует с H100 по пиковой производительности, а потому, что для части задач дает более выгодное соотношение стоимости аренды и достаточной производительности.
Подведем итоги
Разница между игровой и профессиональной картой складывается не из одного параметра. Это объем памяти, который определяет, какие модели вообще помещаются на GPU; ECC, снижающий риск ошибок в долгих вычислениях; лицензионные ограничения на использование GeForce в дата-центрах; и эффективность размещения в стойке. RTX 5090 потребляет до 575 Вт при 32 ГБ VRAM, а RTX PRO 6000 Blackwell — до 600 Вт при 96 ГБ. То есть при почти одинаковом тепловом и энергетическом бюджете профессиональная карта дает втрое больше памяти.
Если задача помещается в 32 ГБ, расчеты короткие, а GPU стоит в рабочей станции, RTX 5090 часто будет рациональнее по цене и в некоторых сценариях — быстрее. Но для крупных моделей, многочасовых расчетов и плотного размещения ускорителей в дата-центре картина меняется. Здесь важны уже не только частота и производительность одной карты, а объем памяти, надежность и результат, который можно получить на единицу питания и охлаждения. Поэтому в научных расчетах, рендеринге или AI профессиональная карта может оказаться эффективнее всей системы, даже если по отдельным характеристикам игровая выглядит быстрее.