
Китайская Moonshot AI запустила Kimi K3 — новую флагманскую модель на 2,8 триллиона параметров с контекстным окном в миллион токенов. На платформе компании уже можно ознакомиться с полной документацией, а в чат-приложении модель доступна бесплатно — правда, после нескольких ответов выдает предупреждение о перегруженных серверах и предложение оплатить подписку. Веса модели будут опубликованы в ближайшие дни.
По собственным оценкам Moonshot, по общему уровню интеллекта K3 уступает лишь двум моделям в мире — Claude Fable 5 от Anthropic и GPT-5.6 Sol от OpenAI. Все остальные, включая Claude Opus 4.8, новинка обходит.
Достигается это размером: K3 стала первой открытой моделью, достигшей масштаба 2,8 триллиона параметров. И это не раздутая версия K2, а заметно переработанная архитектура. В основе лежит Kimi Delta Attention, гибридный механизм линейного внимания, дополненный так называемыми Attention Residuals — остаточными связями для внимания. По задумке обе технологии помогают информации не теряться при прохождении через длинные последовательности и глубокие слои — критично, когда контекст растягивается до миллиона токенов. Разреженность MoE-архитектуры довели до предела: из 896 экспертов на каждый токен активируются лишь 16. В сумме, по оценке Moonshot, масштабирование K3 примерно в 2,5 раза эффективнее, чем у K2: та же вычислительная мощность дает больший прирост качества. Зрение у модели нативное: она принимает изображения и видео без внешних адаптеров.

На GDPval-AA v2, где модели решают задачи из 44 профессий в девяти отраслях, K3 набирает 1687 баллов — обходя Claude Opus 4.8 Max с его 1600, но уступая Fable 5 Max и GPT-5.6 Sol Max. На AA-Briefcase, закрытом бенчмарке Artificial Analysis по длинным агентным задачам, — второе место в мире и победа уже над GPT-5.6 Sol Max. А на BrowseComp, проверяющем умение искать труднодоступную информацию в вебе, K3 в одиночном агентном режиме показала рекордные 91,2 балла — без сжатия контекста и прочих ухищрений, просто за счет миллионного окна.
В API цена составляет $3 за миллион входящих токенов ($0,3 при попадании в кэш) и $15 — исходящих. Это уже почти уровень западных флагманов, относительно собственной линейки Moonshot подняла цены в разы. K2.6 стоила $0,6 на входе и $2,5 на выходе, июньская K2.7 Code — $0,95 и $4.
Ставки для Moonshot высоки. K2.6 весной была самой популярной открытой моделью в мире, пока в конце июня корону не отобрала GLM-5.2 от Z.ai, а на подходе еще и финальная версия DeepSeek V4. K3 — попытка вернуть лидерство за счет роста размера модели. Ранее этот трюк срабатывал: по статистике компании, за последние 12 месяцев модели Kimi девять раз обновляли рекорд размера среди открытых моделей.
По данным Financial Times, параллельно с запуском Moonshot привлекает новый раунд при оценке $31,5 млрд — при том что еще в мае компания оценивалась в $20 млрд, а январский раунд на $500 млн прямо предназначался на вычислительные мощности и разработку K3. Для инвесторов ставка понятна: открытые китайские модели подбираются к закрытым западным вплотную, и каждый новый релиз сокращает разрыв — а вместе с ним и аргументы платить за фронтир премиальную цену.
Стоит добавить, что все приведенные цифры — замеры самой Moonshot: техотчет не опубликован, независимых проверок пока нет, а вендоры традиционно показывают бенчмарки, на которых выглядят лучше всего. Веса задерживаются, но вряд ли надолго — как только они выйдут, у сообщества впервые появится модель класса, который еще недавно был исключительно закрытым, — пусть и такая, что для самостоятельного запуска понадобится не Mac Studio, а полноценный кластер.
P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.
Комментарии (71)

eeglab
16.07.2026 16:25Вообще реально, платная китайская модель??? Честно не верю, что она прямо уровня fable: kimi и minimax никогда не были сильно умными, максимум sonnet 3.5 - несмотря на все бенчи , личный опыт показывает, что они все же отстают. По моему пока топ сейчас только DS, GLM и Qwen

Ingref
16.07.2026 16:25MiniMax - это твёрдый середняк между GLM и DeepSeek-V4-Pro в плане цены и качества. Kimi и Qwen - это, конечно, хорошо, но когда дело доходит до цен, то они сливают всухую Минимаксу. Кстати, у дипсика с недавнего времени есть клон-конкурент MiMo, который скопировал его прайс один в один. Всё это очень воодушевляет, но в то же время, глядя на цену оперативки, думаю, что придётся делать апгрейд сейчас, потому что через год всё будет ещё дороже...

Juzujka
16.07.2026 16:25Недавно я как раз распробовал MiMo 2.5 Pro. Приятно удивил способностями и ценой, сравнивал я с DeepSeek V4 Pro.

Juzujka
16.07.2026 16:25Вот не пойму, чем Qwen так хорош? За последние два месяца я от него существенной пользы не добился. От GLM тоже. DeepSeek V4 Pro + Flash решают задачи лучше, чем GLM, Qwen и какие-то ещё. Кажется с Qwen 3.6 я на неё перешёл.
Но недавно попробовал MiMo V2.5 Pro. Она оказалась лучше DeepSeek V4. Для сложной отладки с пониманием Embedded.
Задачи у меня в последние месяцы были в основном для Embedded Espressif ESP32-S3 + LVGL + FreeRTOS.
М.б. Qwen , GLM, Kimi для этих задач плохо подходят?

SabMakc
16.07.2026 16:25MiMo V2.5 Pro и DeepSeek V4 Pro лично у меня ярко проявили “lost-in-the-middle” на относительно небольшом контексте (на вскидку, около 100к-200к), банально поперепутав факты из контекста (а это была работа с отчетом - там эти факты были важны). В коде тоже получается будет терять и путать информацию.
На коротких задачах в чате мне MiMo V2.5 Pro очень понравилась - четко и по делу код написала, с 1й попытки по промту вида “сделай зашибись” (ни один другой китаец так не смог - приходилось подправлять код доп. вопросами). Но в агентской работе я мнение поменял.
Пока остановился на Kimi, Minimax и GLM.

xsepsisx
16.07.2026 16:25На коротких задачах в чате мне MiMo V2.5 Pro очень понравилась - четко и по делу код написала, с 1й попытки по промту вида “сделай зашибись” (ни один другой китаец так не смог - приходилось подправлять код доп. вопросами). Но в агентской работе я мнение поменял.
Вот это удвою. MiMo - мастер строить иллюзии о своих интеллектуальных способностях. Что-то быстро поискать по объемному репозиторию, написать саммари - тут вообще без вопросов, делает чётко и детально. Но как прилетает задача писать код - энтузиазм тает на глазах. Видно, что агент топчется на месте, совершая какие-то глупые ошибки, игнорирует запрос и т.д. При том в бенчмарках среди китайских коллег всегда выглядит достаточно привлекательно.

shut-down-now
16.07.2026 16:25>Вышла Kimi K3 — по мощности модель уступает только Fable 5
сколько стоит железо, чтобы у себя запустить это самое "уступает только Fable 5"? а потом ещё и выяснить что это 3.14здёжь

BugM
16.07.2026 16:25Долларов 10-20 в час. А что?

jarkevithwlad
16.07.2026 16:25а ещё и веса не выложили (возможно позже)

Politura
16.07.2026 16:25Будет через пару недель:
The full model weights will be released by July 27, 2026

Inkor
16.07.2026 16:25Если нативная четырех битовая квантизация как в прошлых кими используется, то нужно как минимум полтора терабайта видеопамяти, если хочешь на весь миллион контекста, то наверное и все два терабайта, но тут уже трудно сказать без знания конкретного устройства архитектуры.

Absamad
16.07.2026 16:25А сколько стоит железо чтобы запустить fable 5 ?
Это модель конкурент fable, гпт 5.6 sol и т.д., а не Qwen 3.6 35b a3b
Никто и позиционирует её как модель, которую можно запустить локально на пользовательском ПК
А вот вот в мощном дата центре пожалуйста
Да и то, модель сильно меньше и очень сильно легче чем её конкуренты
По поводу fable на знаю, но вокруг гпт 5.6 sol ходят слухи вокруг 4.4 триллиона параметров
И скорее всего она не лёгкая moe модель
В общем это личная новость, т.к. провайдеров будет много и модель не заблочат одним днём, как это было с fable
И это очень мощный знак антропикам и опен АИ, что не стоит долго держать у себя передовые модели, т.к. в любой момент может выйти не менее мощный конкурент( да еще и открытый )

opusmode
16.07.2026 16:25Типа там постоянно выходит «китайский, мощный конкурент», который или дистилят или конкурент только в бенчах
Пробуешь на дюбом произвольном проекте и китайцы сливают прям сильно

Dhwtj
16.07.2026 16:25Потискал. Дал задачу перевода 10.000 строк с C# (хорошего кода, не легаси) на Rust с заменой ORM и библиотек но без изменений бизнес логики. Вполне достойно. Только медленно. Часа 2 ушло, но почти без моего вмешательства.
Дождусь 6x speed (для новой версии ещё не доступно) и побегу за кошельком

runaway_llm Автор
16.07.2026 16:25Она и в обычном диалоге очень медленная, хотя как пишет - понравилось.

Dhwtj
16.07.2026 16:25Ой
Я случайно на 2 такие задачи (с телефона) слил всю месячную квоту moderato (20$). Оказывается, на телефоне нет 4 часовой и недельной квоты.
Ничего себе расход!
А в режиме 6х speed тогда и на одну такую задачу не хватило бы.

Dhwtj
16.07.2026 16:25Кстати, по задачам фронт энда Кими пробил стратосферу https://arena.ai/leaderboard/code/webdev

Arioch
16.07.2026 16:25в плюсах - реально лучше память. Я пока могу сказать, что "при разговоре на отвлеченные темы" К3 показала себя лучше и точнее. Случайно сам собой получился мини-тест пару месяцев назад.
Просто начинаешь разговор с "почему у Ланцелота не получилось убить дракона и жениться на Эльзе?" - ни Дипсик, ни к2.6 вообще не отдупляли о чем речь и впаривали мне, что Frozen в цикл о круглом столе не входит. Qwen опознал Шварца, но притормаживал немного путался. К3 как минимум сразу узнала контекст.
В минусах - забесплатно только 10 запросов в месяц, если это не временное, чтобы просто сбить ажиотаж и переждать волну, то это п...ц.
это просто постоять в сторонке полюбоваться.

jojozuka
16.07.2026 16:25Запустил свой личный бенчмарк кодинга. Выглядит круто - сама кодит, сама тестирует, находит ошибки, правит, перетестирует, снова правит, ещё раз тестирует, добавляет расширенные тесты на ситуациях, о которых не говорилось - в итоге выдаёт рабочий код. Это мощная заявка.

shut-down-now
16.07.2026 16:25>сама кодит, сама тестирует, находит ошибки, правит, перетестирует, снова правит, ещё раз тестирует
по описанию - говно. клава уже давно с первого раза рабочий код рожает

kexibq_cbo
16.07.2026 16:25круто, теперь преступники с деньгами получили доступ к нормальному ИИ, отличная новость. Чтобы запустить эту махину нужен сервер за 3.000.000$

doox911
16.07.2026 16:25Так почему open source? Где скачать её можно?

holgw
16.07.2026 16:25почему open source?
Потому что Kimi – это (все еще) модель с открытыми весами.
Где скачать её можно?
Пока нигде. Разрабы открыли доступ к модели, но общедоступных файлов для скачивания пока нет. По официальным обещаниям – выложат 27.07.2026.

polk1l0
16.07.2026 16:25Про qwen 3.7 opensource ничего не слышно?

Vedomir
16.07.2026 16:25Там сменилось руководство, ушло несколько ключевых руководителей и специалистов и они отказались от публикации открытых моделей. Тут вопрос в том, как закрытые-то модели будут дальше развиваться после таких изменений.
Хотя мне это семейство очень нравится, если не агентов брать, а чат, так вообще самое лучшее китайское и не особо отличается от западных (хотя возможно это просто пройденный уже этап и общий стандарт для всех).

MountainGoat
16.07.2026 16:25Цена у DeepSeek на кодинге будет в СТО раз меньше. Потому что чек складывается на ~90% из cache read. А cache read у kimi 3 $0.30/1M, а у DeepSeek Pro $0.0036/1M
Так что если даже DeepSeek нужно в три, пять раз больше шагов, он всё равно победитель по цене.

SabMakc
16.07.2026 16:25DeepSeek сам по себе тупит на длинных контекстах (lost-in-the-middle во всей красе). Так что далеко не эталон.

Ingref
16.07.2026 16:25"Тупит" в большинстве случаев просто означает увеличение времени на решение задачи. Он её всё равно решит, просто не за 5 минут, а за 5 часов. И вопрос тут только в том, готов ли человек заплатить за скорость. И нужна ли эта скорость вообще.

SabMakc
16.07.2026 16:25В моем случае модель путала данные из контекста (я составлял отчет). И это было крайне критично. Я не против “больше вызовов” - тот же Minimax M3 так и делает (иногда в разы больше вызовов делает на ту же задачу). Но Minimax M3 хотя бы не путается в данных.
Поэтому Minimax M3 я продолжу использовать, хотя он явно звезд с неба не хватает (хотя как исполнитель - очень даже ничего). А вот с Deepseek V4 Pro (как и с MiMo V2.5 Pro) - буду крайне осторожным. Хотя тот же MiMo V2.5 Pro очень классно в чате код пишет (при минимуме контекста).

Varowlord4
16.07.2026 16:25Я пытался использовать их прошлую модель K2.7, она могла полчаса генерировать "улучшенный" код, который в итоге просто ломал всю логику микросервиса....


aikendo
Китайцы совсем берега попутали, 15 $ за output - это неадекватно дорого. По-моему опыту подписок, Kimi - худшая подписка, как и GLM. А если брать по API, то Kimi 2.6-2.7 просто дико пожирает токены. Она может рассуждать по несколько часов над задачей. Я даже не стану тестировать это.
liquidgel
Так уж вышло что в них не вливают миллиарды по мутным схемам за которые не надо отчитываться как в OAI и Антропиков, приходится зарабатывать
corolorn
Мы просто не знаем об этих схемах…
german25avenue
А мне как пользователю какая разница? Одни раздувают бюджеты на обучении, другие в наглую до обучаются на этих же нейронках. Демпинг у китайцев закончился, как и моё использование.
Ingref
Пересаживаетесь на Алису, надо полагать?
xsepsisx
Зачем? Сейчас у западников лимиты сбрасываются по КД, а на ГПТ Луне (xhigh) практически любую задачу можно решать, как трактор пашет, при условно низкой трате лимитов. За те же условные $20, при которых GLM работает 30 минут и ложится баиньки до следующего 5 часового речарджа.
Varowlord4
Если модель решает вашу задачу быстро и дешево, вообще без разницы чей это апи, ток следить за расходом токенов, чтобы не улететь в минус)
LinkToOS
Да, у них своего оборудования нет. Все крутится в ЦОД-ах Алибабы в основном. Так что они не могут произвольно цену устанавливать.
jarkevithwlad
кстати случайно наткнулся на подписку на минимакс, а там:
1.7млр токенов на месяц, за 20$
achekalin
Ценник да, а вот качество работы у GLM вроде получше.
Но я согласен с недавно прочитанной чьей-то мыслью, что у GLM просто токены в кеше тарифицируют как обычные, а отсюда и странные оценки расхода - т.е. это по сути проблема биллинга, которую, вероятно, чинить владельцы пока не считают нужным.
SabMakc
Там достаточно объемная подписка - это да. Но эти 1.7млр токенов, судя по всему, далеко не генерация. И даже не чтение контекста.
Они не дают деталей, но это “типичный запрос агента в 50к токенов, 34к таких запросов”. Т.е. почти все - кеш, новых данных - пара сотен токенов, генерация - около сотни токенов.
Но подписка очень объемная. А сама модель minimax-m3 сильно недооценена, я бы сказал. Она заметно лучше Deepseek-V4-Pro и MiMo-V2.5-Pro. Может и уступает GLM-5.2, но вот на счет kimi-k2.7-code я не уверен (хотя kimi-k2.7-code раза в 2.5 больше).
m0tral
Она хуже Kimi однозначно, ну и я все же упираюсь в 5ч лимиты, когда начинаю активно работать
SabMakc
Лично мне не удавалось приблизиться к лимитам. Особенно когда удалил из запросов агента ручное управление кешем - автоматический кеш работает сильно лучше, потребление стало в разы меньше.
Obito
Они ещё и планируют выпустить Minimax M3 Pro с 2.7T параметров, практически как у Kimi K3.
Ingref
Проблема kimi-k2.7-code - всего 260к контекст. У Минимакса с этим всё чётко - честный миллион. При этом он дешевле.
SabMakc
Да, бывало буквально пара итераций агента - и контекст закончился. Поиск в интернете очень сжирает контекст - но это не очень релевантный пример.
Но как правило, мне 260к контекста хватает на задачи кодинга (сужу по minimax m3, который, по моим наблюдениям, даже несколько активнее тулзы использует, чем конкуренты).
xsepsisx
МиниМакс - хорошая рабочая лошадка, но откровений от неё не ждите. Можно отдавать ей план от более продвинутых коллег, тогда она будет послушно его исполнять. Ну и тарифы с переходом на токен план испортились всё равно. Раньше была позапросная тарификация, и вот тогда реально накрывали барский стол за $10 (1500/15000 - 5ч/неделя).
SabMakc
Позапросная тарификация - это не жизнеспособно. Просто потому что нет стимула для пользователя держать контекст в тонусе. Рано или поздно они это бы все равно убрали.
Текущая тарификация не сильно хуже (если не брать что подорожал минимальный план в 2 раза). Но запросов не сказать что сильно меньше стало - если не раздувать контекст во всяком случае.
nightvich
На текущий момен minimax - лучшее по соотношению цена-качество.
Pirokar
С токенами полностью согласен, деньги тратит похлеще опуса
ontop
В моем случае Kimi 2.6 прекрасно себя показала 4 месяца назад как альтернатива GPT5.4.
Брал на Opencode. Самая нормальная подписка. Потом эта модель появилась бесплатно на Windsufr, который сегодня стал Devin и с нормальным ускорением. То есть на Devin генерация Kimi был очень быстрой, даже там где последний много думал, что на самом деле хорошо.
Потом благополучно был заменён на GLM5.2, который тоже пока бесплатен на Devin. Но Grok4.5 на Cursor мне нравится больше, но благо обе модели хорошие исполнители, когда GPT5.6 Sol пишет подробные планы, но Grok еще и картинки понимает.
DeepSeekV4 PRO не плохая была, когда вышел Kimi2.6, но обе хуже GLM5.2. Знакомый разработчик говорит, что DeepSeek был замечен в сливах информации, потому компании его избегают как огня и других китайских моделей.
playermet
У кого как. Месяц назад примерно статья была, где человек сравнивал GLM 5.2 и Opus 4.8. Результаты были такие:
unih
с тестами спорить сложно, но когда у меня как - то закончился Opus, я попытался в GLM
по ошушению - тупее и это чувствуется; лучше дипсика, но тупее опуса. Может я просто не умею ее готовить
Ingref
Так речь не про качество, а про соотношение цены и качества.
CadMan
Да. Точно такая же ситуация была. Что мне понравилось в GLM, так то что я схематически прикинул дизайн приложения и он практически со второго подхода всё сделал полностью.
И это было лучше и более грамотно собрано за любого сонета.
Опуса4.8 держу исключительно как оркестратора
Absamad
Не соглашусь
Пользовался подпиской Кими, за 40 баксов
Купил ее за 2к рублей
Лититов там было достаточного много, примерно половина от лимитов опен аи, если пересчитывать на использование гпт 5.5, на подписке за 100 баксов
А так конечно да, опен аи и антропики, дают очень хорошие лимиты на своих подписках
Например подписка за 100 баксов, если использовать весь лимит кажду неделю, даёт:
У опен аи 3500 баксов эквивалента апи
У антропик 2000
А подписка да 200 баксов соответственно 14000 и 8000
Я ещё так пересчитал, с учётом того, что мне дали пару сбросов, а ещё делали 3 сброса лимитов за последнюю неделю ( успевал тратить почти весь лимит, подписка 200 баксов )
То взодит, что за месяц потрачу около 2.5млн рублей апи эквивалента)
Китайцы конечно такого себе позволить не могут
Как делились инфой мимо, у них себестоимость на моделях 2.5 и 2.5 про, сейчас соответствует их цене ( когда они цены опустили в 4 раза )
SabMakc
MiMo - скорее исключение из правил. Да, проверял их недавно - цены выходят 1-в-1 как по API (а для минимального тарифа даже чуть хуже). В чем смысл подписки я так и не понял. Только ради ночных (по Пекину) скидок (20%) и TTS/ASR моделей?
Тот же Minimax дает очень большой пакет токенов в подписке.
Absamad
У минимакса мелкие модели
Во времена 2.7, они давали лимит в 15к запросов в неделю, с окном 1.5к за 5 часов
Это конечно было очень щедро
Но у них модели небольшие
2.7 была вроде на 230b, с активацией 10b и контекстом 200к
Т.е. мягко говоря не самой мощной
Это была самая слабая модель, которой я пользовался
С минимакса перешёл на Кими 2.6, это был уже другой уровень, на голову выше
Можно было уже модели доверять длительные задачи, без постоянного контроля и без мысли, вот если сейчас на 5 мин отойду, модель натворит делов
Затем перешёл на гпт 5.5, модель снова оказалась на голову выше
Я уже мог просто дать ей задачу и пойти заниматься другими проектами
Модель легко держала ведь и шла к ней
Без глупых циклов и т.д.
Сейчас пользуюсь 5.6 sol, альтернатив за эту стоимость ей не вижу
Даже если Кими считать конкурентом, то она выходит во много раз дороже
SabMakc
Использую minimax m3 - и, пускай к ней есть замечания, но работает она очень неплохо. Особенно если с нуля попросить что-то сделать. Т.е. продуктовое видение у minimax m3 какое-никакое есть. По размеру уже раза в 2 больше чем minimax m2.7.
Максимум претензий - контекст текущего разговора отражается в комментариях и документации в целом (вот зачем мне знать, что у тебя была задача ускорить функцию и во сколько раз ты это сделал в комментариях в коде к этой функции?). Но это я и у других замечал.
И minimax очень склонен искать обходные пути - артефакты от прошлых сессий с решением задачи, ответы других LLM и т.д. Может и ничего страшного, но это чаще мешает, чем помогает.
Dhwtj
Скоро добавят регулируемый уровень рассуждений и уровень усилий
Dhwtj
Добавили
Granulex
Сравнивать стоит не цену за токен, а цену за решённую задачу. По ценнику Kimi скорее демпингует: 15 $ за output – это уровень Sonnet 5, у Opus 4.8 – 25 $, у Fable 5 – все 50 $. Реальная проблема та, что вы сами назвали: модель, которая рассуждает часами, сжигает столько токенов, что итоговый чек за задачу выходит выше, чем у более дорогой, но экономной модели.