Сегодня open source моделями никого не удивишь. Но в январе 2025 года небольшая китайская компания DeepSeek за один день обвалила американский фондовый рынок.
Всё началось с того, что 20 января DeepSeek выкладывает R1 под MIT-лицензией. Дальше исследователи начали тестировать на своих задачах и подтверждать, что модель работает. Уже 26 января приложение DeepSeek выходит на первое место в App Store США, обогнав ChatGPT. А 27 января акции Nvidia падают на 17% — $589 млрд капитализации за один день, крупнейшее однодневное падение в истории фондового рынка США. Nasdaq теряет около 3%. За Nvidia идут Broadcom, Oracle, Microsoft, Google. Суммарная просадка рынка — примерно $1 трлн. Дженсен Хуанг лично теряет $21 млрд состояния. Важно учесть контекст, что буквально за неделю до этого анонсировали Stargate с вложениями до полутриллиона долларов в дата-центры, OpenAI собирал раунд на $40 млрд. Обе цифры стояли на уверенности, что количество видеокарт даёт преимущество, которое нельзя обесценить за семь дней.
А кто вообще такие DeepSeek? Оказалось, что это не стартап, а дочернее подразделение квантового хедж-фонда High-Flyer из Ханчжоу. Лян Вэньфэн основал High-Flyer в феврале 2016 года с двумя однокурсниками по Чжэцзянскому университету — Сюй Цзинем и Чжэн Давэем. Фонд торговал по сигналам от моделей глубокого обучения и под это строил собственные кластеры: в 2019-м Fire-Flyer I на 1100 GPU за 200 млн юаней, в 2021-м Fire-Flyer II — около 10 000 A100 за миллиард юаней. Карты купили за год до того, как США в октябре 2022 ограничили их экспорт в Китай. Знакомые Ляна тогда считали эту покупку чудачеством.
В апреле 2023 фонд объявляет о создании отдельной исследовательской структуры для работы над AGI. В июле DeepSeek регистрируется как юрлицо. Финансирование — целиком деньги фонда, внешних инвесторов нет.

Нельзя не упомянуть, что релиз 20 января 2025 года — далеко не первый для компании. Пока OpenAI показывала GPT-4 Turbo, в ноябре 2023-го вышли DeepSeek Coder и DeepSeek LLM 67B. В мае 2024-го — V2, первая модель с MLA. В декабре 2024-го — V3. И только потом R1. То есть компания работала над своими моделями уже несколько лет.
Отправная точка всей технической части — ограничение. У DeepSeek были H800: те же H100 с урезанной пропускной способностью интерконнекта, примерно 400 ГБ/с NVLink против 900. Это прямой артефакт экспортного контроля, чип специально порезали под китайский рынок. Дальше почти всё, что сделала команда, — ответ на это ограничение.
Технические решения
MLA (Multi-head Latent Attention). Пока модель генерирует ответ, она держит в памяти карты всё, что уже прочитала, — это KV-кэш. Он растёт вместе с длиной контекста и съедает память, на которой можно было бы обслуживать других пользователей. MLA хранит его в сжатом виде: вместо полных векторов — компактное представление, из которого нужное восстанавливается на лету. Кэш падает до единиц процентов от обычного. На одной карте помещается в разы больше одновременных запросов, отсюда и цена. Появилась в V2 в мае 2024 — тогда DeepSeek поставила 1 юань за миллион входных токенов и запустила ценовую войну в Китае.
-

Принцип MLA DeepSeekMoE. В модели 671 млрд параметров, но над каждым токеном работает только 37 млрд. Роутер выбирает несколько узких экспертов под конкретный токен, плюс пара общих включена всегда. Стоимость считается по активным параметрам, качество — по всем. Проблема таких схем в том, что роутер быстро находит несколько любимых экспертов и заваливает их работой, пока остальные простаивают. Обычно это исправляют штрафом в функции потерь, но штраф тянет модель в сторону от основной задачи. DeepSeek вместо этого подкручивает смещения: перегруженный эксперт становится для роутера чуть менее привлекательным. Нагрузка выравнивается, целевая функция остаётся чистой.

Принцип DeepSeekMoE FP8 на всём цикле обучения. Обычно модель учат в 16 битах, а в 8 сжимают уже готовую. DeepSeek училась в 8 битах с самого начала, оставив высокую точность только там, где без неё ломается сходимость. Вдвое меньше памяти и вдвое меньше данных гоняется между узлами кластера — а узкое место было именно там.
-
DualPipe. На большом кластере карты регулярно стоят и ждут данные от соседей. DualPipe перестраивает порядок работы так, чтобы, пока считается одна часть батча, другая в это же время передавалась. Простой на медленном канале почти исчезает.

Принцип DualPipe PTX вместо CUDA. CUDA — стандартный уровень, на котором пишут код для видеокарт; распределением вычислительных блоков внутри чипа занимается компилятор. DeepSeek спустилась на уровень ниже, в PTX — это фактически ассемблер для карт NVIDIA — и вручную развела блоки: эти считают, эти передают данные. Работа, которой не занимаются, пока канал между картами не стал бутылочным горлышком.
Итог: 2,788 млн GPU-часов H800 на финальный прогон V3. При $2 за GPU-час — $5,576 млн. Отсюда и появилась знаменитая цифра про «обучение за 6 миллионов».
Здесь нужна оговорка, которую в январе почти никто не сделал: это стоимость финального прогона. Ни исследования, ни неудачные эксперименты, ни сбор данных, ни зарплаты, ни амортизация кластера в неё не входят. SemiAnalysis оценивал суммарные вложения группы примерно в $1,6 млрд.
Поверх V3 для R1 добавилось два решения.
-
GRPO вместо PPO. Убрали value-модель, то есть примерно половину памяти RL-пайплайна. Преимущество считается относительно группы сэмплов на один промпт, а не через отдельный критик.

GRPO вместо PPO R1-Zero. Чистый RL вообще без supervised fine-tuning. Рассуждение возникло само: модель научилась перепроверять решения и тратить больше токенов на сложные задачи, не увидев ни одного размеченного примера цепочки рассуждений.
По данным, раскрытым в статье в Nature в сентябре 2025: R1-Zero — 648 H800 в течение 198 часов, R1 — 648 H800 около 80 часов, сборка SFT-датасета — примерно 5000 GPU-часов. Итого $294 тыс. на RL-этап.
Но главное здесь не цифры, а то, что почти каждая оптимизация есть ответ на конкретный дефицит железа. Лаборатории с неограниченным доступом к H100 не переписывали коммуникационные ядра на PTX, потому что им это было не нужно. Дефицит произвёл инженерию, которую избыток не производит.
Бизнес решения
Кроме того, были и бизнес решения, которые привели компанию к успеху.
Открытая публикация как канал дистрибуции. У китайской компании не было доступа к американскому рынку через продажи, партнёрства или предустановку. Веса под MIT и полный технический отчёт решили эту задачу за неделю: модель оказалась в стеке у всех, кто её скачал. К сентябрю 2025 — 10,9 млн скачиваний на Hugging Face.
Цена. $0,55 за миллион входных токенов и $2,19 за выходные против $15 и $60 у o1. Разрыв в 27 раз. Это не маркетинговый демпинг, а прямое следствие MLA и разреженной активации — себестоимость инференса действительно была другой.
Отсутствие венчурных денег. Финансирование целиком от фонда. Нет дедлайнов по выручке, нет продуктового роадмапа, нет обязательства показывать метрики следующему раунду. Лян мог несколько лет оплачивать чистое исследование без коммерческого результата.
Кадровая политика. Молодые PhD из китайских вузов вместо переманивания ветеранов из американских лабораторий. Плоская структура, доступ к кластеру без согласований, отсутствие KPI. Дешевле — и, что важнее, даёт людей, которые не воспроизводят чужие подходы по инерции.
Peer review. В сентябре 2025 R1 стала первой крупной LLM, прошедшей научное рецензирование; статья вышла на обложке Nature. Для компании без бренда это способ конвертировать техническую работу в институциональное доверие, которое иначе покупается годами.
Выводы
За красивым релизом стояло девять лет работы. Кластеры под квант-торговлю с 2019 года, собственные модели с 2016-го, больше года публичных релизов до R1. Компанию знали — те, кто следил за китайскими лабораториями, читали отчёт по V2 ещё в мае 2024-го. Массовой её сделал один релиз, попавший в момент, когда рынок был к нему уязвим.
Рынок при этом переоценил допущение, а не технологию. Допущение звучало как «количество видеокарт - это конкурентное преимущество». Nvidia отыграла падение за несколько месяцев — спрос на GPU не упал, он перераспределился в сторону инференса. Но «у нас больше карт» с тех пор не работает как аргумент в инвестиционной презентации.
Главное последствие января 2025 года это то, что после открытых релизов стало заметно больше: все увидели, что скачиваемая модель — рабочий вариант. Сегодня есть DeepSeek V4, Kimi K3, GLM-5.3, Qwen, и разрыв с закрытым фронтиром на большинстве прикладных задач измеряется единицами процентов.
На этом живёт половина продуктовых команд. Открытые веса дают то, чего не даёт API: цену, при которой сходится юнит-экономика, дообучение под свой домен и данные, которые не уходят наружу. До января 2025-го выбрать открытую модель означало сознательно взять качество похуже ради экономии, но сейчас каждый сам выбирает решение.
Спасибо, что дочитали. Если тема близка — у меня есть телеграм-канал, там пишу про то, что сейчас в работе: как выбираю архитектуру, что не взлетело и какие получились цифры.