Часть 1.1 · Дополнение к «Карточному домику из GPU» · Следом — часть 2: «Рынок вычислений в России, Казахстане и Беларуси»
Сколько живёт GPU под нагрузкой ИИ? В комментариях к той статье читатель @vladf бросил пруфы: по данным CNN, обучающие GPU живут 18 месяцев–3 года; Princeton CITP оценивает 1–2 года при загрузке 60–70%. Проверил глубже — картинка вышла жёстче, чем в статье. Спасибо ему за внимание к вопросу: сам я на этот разрыв не смотрел.
Физика. Компания Meta обучала модель Llama 3 на кластере из 16 384 видеокарт H100 (статья Meta). За 54 дня непрерывной работы кластер 419 раз неожиданно останавливался — и в трети случаев (148 отказов) виноват был именно GPU. Если отказы продолжаются с той же частотой, за год выходит из строя около 9% парка, за три года — примерно каждый четвёртый.
Наука добавляет: на университетском суперкомпьютере Delta 1 (NCSA, Университет Иллинойса) инженеры два с половиной года собирали статистику отказов на 1056 картах A100 и H100 — 11,7 млн GPU-часов наблюдений (статья на arXiv). Вывод: память H100 деградирует в 3,2 раза быстрее, чем у A100. Архитектор Alphabet добавляет: при типичной для дата-центров загрузке 60–70% видеокарта живёт один-два года, максимум три. Причины — тепловая и электрическая деградация.
Бухгалтерия. Владельцы крупных облаков — Amazon, Microsoft и Google — амортизируют GPU в течение пяти-шести лет: Amazon начал продлевать сроки ещё в 2020-м, к 2023-му все три компании перешли на шестилетний график. Инвестор Майкл Бёрри, прославившийся предсказанием ипотечного кризиса 2008 года, оценивает недоамортизацию в $176 млрд за 2026–2028: Oracle, по его прикидке, к 2028-му завышает прибыль на 26,9%. Barclays уже режет прогнозы прибыли AI-компаний до 10% из-за реалистичной амортизации.
Вторая жизнь существует — по крайней мере, коммерчески. CoreWeave перезаключала контракты по своим H100 2022 года — даже они сохранили 95% исходной цены (Introl, вторичный рынок GPU). Azure выводила из работы карты K80 и P100 — те прослужили семь-девять лет. А двухлетняя б/у H100 на вторичном рынке уходит за 70–85% цены новой. SiliconANGLE резюмирует: фабрики ИИ «гнутся, но не ломают» шестилетние предположения о сроке службы.
Правда, у этой цены есть оговорка: 95% зафиксированы на момент подписания, а не гарантируют службу до конца срока. Исследование Delta 1 показывает: кластеру нужен запас карт около 5% — просто чтобы переживать отказы. Доживёт ли перезаключённый контракт до конца срока — рынок ещё не показал.
Но Princeton льёт холодную воду на весь каскад: вторичный рынок не поглотит масштаб. Речь о блоге Центра информационной политики Принстонского университета — исследователи разбирают экономику вторичного рынка GPU. Цифры показывают: выручка NVIDIA перевалила за $115+ млрд в год. А рынок тех, кто готов покупать её вчерашние карты, — крошечная доля от этих денег. Большинству компаний проще арендовать готовый инференс, чем строить своё. И финальная арифметика: если электричество для старой H100 обходится дороже, чем рынок платит за её инференс, остаточная стоимость стремится к нулю — независимо от графика амортизации.
Что из этого практически следует. Если строите систему — берите класс карт под задачу: инференсу фронтир не нужен, а двухлетняя б/у H100 работает и стоит 70–85% новой. Если считаете рынок — базой берите 1–3 года реальной службы, а не шесть лет из отчётности: разрыв уже измерен, Burry оценивает недоамортизацию в $176 млрд за три года. И закладывайте запас карт около 5% на отказы — это не перестраховка, это норма, показанная на 11,7 млн GPU-часов наблюдений.
Планируйте по реальному сроку жизни железа — а не по бухгалтерскому.
Источники
Первичные данные:
Meta — The Llama 3 Herd of Models (кластер 16 384 H100, 419 срывов, 148 отказов GPU)
Университет Иллинойса / IBM — Story of Two GPUs: Delta 1, 11,7 млн GPU-часов (arXiv 2503.11901)
CITP Princeton — Lifespan of AI Chips: The $300 Billion Question (15.10.2025) и A Note on the Secondary Market (18.12.2025)
Покрытие и контекст:
Tom’s Hardware — Datacenter GPU service life: one to three years, по архитектору Alphabet
TrendForce — Datacenter GPUs May Have an Astonishingly Short Lifespan of Only 1 to 3 Years
Yahoo Finance — Michael Burry warns of $176 billion depreciation understatement (10.11.2025)
SiliconANGLE — Resetting GPU depreciation: AI factories bend, don’t break useful life assumptions (22.11.2025)
Introl — Secondary GPU Markets: Buying and Selling Used AI Hardware (CoreWeave H100 — 95% цены)
Связанная серия:
Карточный домик из GPU: архитектура neocloud-пузыря (ч. 1) — опубликована 19.09
Часть 2 «Рынок вычислений в России, Казахстане и Беларуси» — в подготовке
ToxaBes
Мне, получается, пока везет, 2 карты 6й год пашут в создании ML-систем. Возможно, потому-что сразу поставил водяное охлаждение вообще всей системы.
BugM
Две это не статистика. Статистика начинается хотя бы с тысячи карт.
ToxaBes
Или с тысячи пользователей карт. С этой стороны не смотрели? Или отказы у карт начинаются только когда они собираются вместе?
BugM
С пользователей собрать достоверную статистику сложно. У всех разное охлаждение, разные котики с разной шерстью, разное использование. В данных слишком много шума будет.
ToxaBes
Я просто поделился своей статистикой, если другие пользователи также поделятся может она и соберется.
boofer_obmena Автор
Везение, режим или охлаждение — без деталей не разберёшься, а детали интересные. Что за карты, если не секрет? Под какой нагрузкой живут — обучением, инференсом, экспериментами рывками? И водянка стоит именно на картах или на всём контуре сразу? Ваш шестой год — это как раз та практика, которой в статье не хватает: вся статистика там из дата-центров с непрерывной нагрузкой, домашние режимы — отдельная история.
ToxaBes
RTX A6000 48Gb и RTX A5000 24Gb, 128Gb RAM, Threadripper 3970X, 8 NVME. Водяное охлаждение: видеокарты, проц, память, NVME диски, южной мост и VRM на матери. Разнесено в 3 контура со своими помпами и радиаторами. Контура герметичны (1.5 атм держит), но все равно в каждую колбу раз в 3 месяца подливаю жижу, куда испаряется непонятно.
Нагрузка практически постоянная, но рваная: от обучения/дообучения моделей под проекты до тестирования новых подходов и имаго-кодинга. Две карты позволяют параллелить инференс (харнесс) и обучение.
На выходных, если не нужно обучать что-то сутками переползаю на винду поковырять UE, он тоже неплохо грузит. Как-то так.
boofer_obmena Автор
Спасибо за детали — это уже не «повезло», это система: профессиональный класс карт, рваная нагрузка вместо непрерыва и три герметичных контура. Кстати, ваш шестой год красиво ложится в статью: Azure выводила K80 и P100 после семи-девяти лет службы — похоже, профессиональные карты при хорошем охлаждении доживают до преклонного возраста, просто фронтир их не спрашивает. А жижа — она и у всех так: медленно диффундирует сквозь стенки шлангов, поэтому контуры герметичны, но не паронепроницаемы. Малозаметная утечка, а не магия.
ToxaBes
Про испарение жижи через шланги не знал, спасибо за информацию.