Китайская Moonshot AI запустила Kimi K3 — новую флагманскую модель на 2,8 триллиона параметров с контекстным окном в миллион токенов. На платформе компании уже можно ознакомиться с полной документацией, а в чат-приложении модель доступна бесплатно — правда, после нескольких ответов выдает предупреждение о перегруженных серверах и предложение оплатить подписку. Веса модели будут опубликованы в ближайшие дни.

По собственным оценкам Moonshot, по общему уровню интеллекта K3 уступает лишь двум моделям в мире — Claude Fable 5 от Anthropic и GPT-5.6 Sol от OpenAI. Все остальные, включая Claude Opus 4.8, новинка обходит.

Достигается это размером: K3 стала первой открытой моделью, достигшей масштаба 2,8 триллиона параметров. И это не раздутая версия K2, а заметно переработанная архитектура. В основе лежит Kimi Delta Attention, гибридный механизм линейного внимания, дополненный так называемыми Attention Residuals — остаточными связями для внимания. По задумке обе технологии помогают информации не теряться при прохождении через длинные последовательности и глубокие слои — критично, когда контекст растягивается до миллиона токенов. Разреженность MoE-архитектуры довели до предела: из 896 экспертов на каждый токен активируются лишь 16. В сумме, по оценке Moonshot, масштабирование K3 примерно в 2,5 раза эффективнее, чем у K2: та же вычислительная мощность дает больший прирост качества. Зрение у модели нативное: она принимает изображения и видео без внешних адаптеров.

На GDPval-AA v2, где модели решают задачи из 44 профессий в девяти отраслях, K3 набирает 1687 баллов — обходя Claude Opus 4.8 Max с его 1600, но уступая Fable 5 Max и GPT-5.6 Sol Max. На AA-Briefcase, закрытом бенчмарке Artificial Analysis по длинным агентным задачам, — второе место в мире и победа уже над GPT-5.6 Sol Max. А на BrowseComp, проверяющем умение искать труднодоступную информацию в вебе, K3 в одиночном агентном режиме показала рекордные 91,2 балла — без сжатия контекста и прочих ухищрений, просто за счет миллионного окна.

В API цена составляет $3 за миллион входящих токенов ($0,3 при попадании в кэш) и $15 — исходящих. Это уже почти уровень западных флагманов, относительно собственной линейки Moonshot подняла цены в разы. K2.6 стоила $0,6 на входе и $2,5 на выходе, июньская K2.7 Code — $0,95 и $4.

Ставки для Moonshot высоки. K2.6 весной была самой популярной открытой моделью в мире, пока в конце июня корону не отобрала GLM-5.2 от Z.ai, а на подходе еще и финальная версия DeepSeek V4. K3 — попытка вернуть лидерство за счет роста размера модели. Ранее этот трюк срабатывал: по статистике компании, за последние 12 месяцев модели Kimi девять раз обновляли рекорд размера среди открытых моделей.

По данным Financial Times, параллельно с запуском Moonshot привлекает новый раунд при оценке $31,5 млрд — при том что еще в мае компания оценивалась в $20 млрд, а январский раунд на $500 млн прямо предназначался на вычислительные мощности и разработку K3. Для инвесторов ставка понятна: открытые китайские модели подбираются к закрытым западным вплотную, и каждый новый релиз сокращает разрыв — а вместе с ним и аргументы платить за фронтир премиальную цену.

Стоит добавить, что все приведенные цифры — замеры самой Moonshot: техотчет не опубликован, независимых проверок пока нет, а вендоры традиционно показывают бенчмарки, на которых выглядят лучше всего. Веса задерживаются, но вряд ли надолго — как только они выйдут, у сообщества впервые появится модель класса, который еще недавно был исключительно закрытым, — пусть и такая, что для самостоятельного запуска понадобится не Mac Studio, а полноценный кластер.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.

Комментарии (71)


  1. aikendo
    16.07.2026 16:25

    Китайцы совсем берега попутали, 15 $ за output - это неадекватно дорого. По-моему опыту подписок, Kimi - худшая подписка, как и GLM. А если брать по API, то Kimi 2.6-2.7 просто дико пожирает токены. Она может рассуждать по несколько часов над задачей. Я даже не стану тестировать это.


    1. liquidgel
      16.07.2026 16:25

      Так уж вышло что в них не вливают миллиарды по мутным схемам за которые не надо отчитываться как в OAI и Антропиков, приходится зарабатывать


      1. corolorn
        16.07.2026 16:25

        Мы просто не знаем об этих схемах…


      1. german25avenue
        16.07.2026 16:25

        А мне как пользователю какая разница? Одни раздувают бюджеты на обучении, другие в наглую до обучаются на этих же нейронках. Демпинг у китайцев закончился, как и моё использование.


        1. Ingref
          16.07.2026 16:25

          Пересаживаетесь на Алису, надо полагать?


          1. xsepsisx
            16.07.2026 16:25

            Зачем? Сейчас у западников лимиты сбрасываются по КД, а на ГПТ Луне (xhigh) практически любую задачу можно решать, как трактор пашет, при условно низкой трате лимитов. За те же условные $20, при которых GLM работает 30 минут и ложится баиньки до следующего 5 часового речарджа.


            1. Varowlord4
              16.07.2026 16:25

              Если модель решает вашу задачу быстро и дешево, вообще без разницы чей это апи, ток следить за расходом токенов, чтобы не улететь в минус)


      1. LinkToOS
        16.07.2026 16:25

        Да, у них своего оборудования нет. Все крутится в ЦОД-ах Алибабы в основном. Так что они не могут произвольно цену устанавливать.


    1. jarkevithwlad
      16.07.2026 16:25

      кстати случайно наткнулся на подписку на минимакс, а там:

      1.7млр токенов на месяц, за 20$


      1. achekalin
        16.07.2026 16:25

        Ценник да, а вот качество работы у GLM вроде получше.

        Но я согласен с недавно прочитанной чьей-то мыслью, что у GLM просто токены в кеше тарифицируют как обычные, а отсюда и странные оценки расхода - т.е. это по сути проблема биллинга, которую, вероятно, чинить владельцы пока не считают нужным.


      1. SabMakc
        16.07.2026 16:25

        Там достаточно объемная подписка - это да. Но эти 1.7млр токенов, судя по всему, далеко не генерация. И даже не чтение контекста.

        Они не дают деталей, но это “типичный запрос агента в 50к токенов, 34к таких запросов”. Т.е. почти все - кеш, новых данных - пара сотен токенов, генерация - около сотни токенов.

        Но подписка очень объемная. А сама модель minimax-m3 сильно недооценена, я бы сказал. Она заметно лучше Deepseek-V4-Pro и MiMo-V2.5-Pro. Может и уступает GLM-5.2, но вот на счет kimi-k2.7-code я не уверен (хотя kimi-k2.7-code раза в 2.5 больше).


        1. m0tral
          16.07.2026 16:25

          Она хуже Kimi однозначно, ну и я все же упираюсь в 5ч лимиты, когда начинаю активно работать


          1. SabMakc
            16.07.2026 16:25

            Лично мне не удавалось приблизиться к лимитам. Особенно когда удалил из запросов агента ручное управление кешем - автоматический кеш работает сильно лучше, потребление стало в разы меньше.


        1. Obito
          16.07.2026 16:25

          Они ещё и планируют выпустить Minimax M3 Pro с 2.7T параметров, практически как у Kimi K3.


        1. Ingref
          16.07.2026 16:25

          Проблема kimi-k2.7-code - всего 260к контекст. У Минимакса с этим всё чётко - честный миллион. При этом он дешевле.


          1. SabMakc
            16.07.2026 16:25

            Да, бывало буквально пара итераций агента - и контекст закончился. Поиск в интернете очень сжирает контекст - но это не очень релевантный пример.

            Но как правило, мне 260к контекста хватает на задачи кодинга (сужу по minimax m3, который, по моим наблюдениям, даже несколько активнее тулзы использует, чем конкуренты).


      1. xsepsisx
        16.07.2026 16:25

        МиниМакс - хорошая рабочая лошадка, но откровений от неё не ждите. Можно отдавать ей план от более продвинутых коллег, тогда она будет послушно его исполнять. Ну и тарифы с переходом на токен план испортились всё равно. Раньше была позапросная тарификация, и вот тогда реально накрывали барский стол за $10 (1500/15000 - 5ч/неделя).


        1. SabMakc
          16.07.2026 16:25

          Позапросная тарификация - это не жизнеспособно. Просто потому что нет стимула для пользователя держать контекст в тонусе. Рано или поздно они это бы все равно убрали.

          Текущая тарификация не сильно хуже (если не брать что подорожал минимальный план в 2 раза). Но запросов не сказать что сильно меньше стало - если не раздувать контекст во всяком случае.


      1. nightvich
        16.07.2026 16:25

        На текущий момен minimax - лучшее по соотношению цена-качество.


    1. Pirokar
      16.07.2026 16:25

      С токенами полностью согласен, деньги тратит похлеще опуса


    1. ontop
      16.07.2026 16:25

      В моем случае Kimi 2.6 прекрасно себя показала 4 месяца назад как альтернатива GPT5.4.

      Брал на Opencode. Самая нормальная подписка. Потом эта модель появилась бесплатно на Windsufr, который сегодня стал Devin и с нормальным ускорением. То есть на Devin генерация Kimi был очень быстрой, даже там где последний много думал, что на самом деле хорошо.

      Потом благополучно был заменён на GLM5.2, который тоже пока бесплатен на Devin. Но Grok4.5 на Cursor мне нравится больше, но благо обе модели хорошие исполнители, когда GPT5.6 Sol пишет подробные планы, но Grok еще и картинки понимает.

      DeepSeekV4 PRO не плохая была, когда вышел Kimi2.6, но обе хуже GLM5.2. Знакомый разработчик говорит, что DeepSeek был замечен в сливах информации, потому компании его избегают как огня и других китайских моделей.


    1. playermet
      16.07.2026 16:25

      У кого как. Месяц назад примерно статья была, где человек сравнивал GLM 5.2 и Opus 4.8. Результаты были такие:


      1. unih
        16.07.2026 16:25

        с тестами спорить сложно, но когда у меня как - то закончился Opus, я попытался в GLM
        по ошушению - тупее и это чувствуется; лучше дипсика, но тупее опуса. Может я просто не умею ее готовить


        1. Ingref
          16.07.2026 16:25

          Так речь не про качество, а про соотношение цены и качества.


        1. CadMan
          16.07.2026 16:25

          Да. Точно такая же ситуация была. Что мне понравилось в GLM, так то что я схематически прикинул дизайн приложения и он практически со второго подхода всё сделал полностью.

          И это было лучше и более грамотно собрано за любого сонета.

          Опуса4.8 держу исключительно как оркестратора


    1. Absamad
      16.07.2026 16:25

      Не соглашусь

      Пользовался подпиской Кими, за 40 баксов

      Купил ее за 2к рублей

      Лититов там было достаточного много, примерно половина от лимитов опен аи, если пересчитывать на использование гпт 5.5, на подписке за 100 баксов

      А так конечно да, опен аи и антропики, дают очень хорошие лимиты на своих подписках

      Например подписка за 100 баксов, если использовать весь лимит кажду неделю, даёт:

      У опен аи 3500 баксов эквивалента апи

      У антропик 2000

      А подписка да 200 баксов соответственно 14000 и 8000

      Я ещё так пересчитал, с учётом того, что мне дали пару сбросов, а ещё делали 3 сброса лимитов за последнюю неделю ( успевал тратить почти весь лимит, подписка 200 баксов )

      То взодит, что за месяц потрачу около 2.5млн рублей апи эквивалента)

      Китайцы конечно такого себе позволить не могут

      Как делились инфой мимо, у них себестоимость на моделях 2.5 и 2.5 про, сейчас соответствует их цене ( когда они цены опустили в 4 раза )


      1. SabMakc
        16.07.2026 16:25

        MiMo - скорее исключение из правил. Да, проверял их недавно - цены выходят 1-в-1 как по API (а для минимального тарифа даже чуть хуже). В чем смысл подписки я так и не понял. Только ради ночных (по Пекину) скидок (20%) и TTS/ASR моделей?

        Тот же Minimax дает очень большой пакет токенов в подписке.


        1. Absamad
          16.07.2026 16:25

          У минимакса мелкие модели

          Во времена 2.7, они давали лимит в 15к запросов в неделю, с окном 1.5к за 5 часов

          Это конечно было очень щедро

          Но у них модели небольшие

          2.7 была вроде на 230b, с активацией 10b и контекстом 200к

          Т.е. мягко говоря не самой мощной

          Это была самая слабая модель, которой я пользовался

          С минимакса перешёл на Кими 2.6, это был уже другой уровень, на голову выше

          Можно было уже модели доверять длительные задачи, без постоянного контроля и без мысли, вот если сейчас на 5 мин отойду, модель натворит делов

          Затем перешёл на гпт 5.5, модель снова оказалась на голову выше

          Я уже мог просто дать ей задачу и пойти заниматься другими проектами

          Модель легко держала ведь и шла к ней

          Без глупых циклов и т.д.

          Сейчас пользуюсь 5.6 sol, альтернатив за эту стоимость ей не вижу

          Даже если Кими считать конкурентом, то она выходит во много раз дороже


          1. SabMakc
            16.07.2026 16:25

            Использую minimax m3 - и, пускай к ней есть замечания, но работает она очень неплохо. Особенно если с нуля попросить что-то сделать. Т.е. продуктовое видение у minimax m3 какое-никакое есть. По размеру уже раза в 2 больше чем minimax m2.7.

            Максимум претензий - контекст текущего разговора отражается в комментариях и документации в целом (вот зачем мне знать, что у тебя была задача ускорить функцию и во сколько раз ты это сделал в комментариях в коде к этой функции?). Но это я и у других замечал.

            И minimax очень склонен искать обходные пути - артефакты от прошлых сессий с решением задачи, ответы других LLM и т.д. Может и ничего страшного, но это чаще мешает, чем помогает.


    1. Dhwtj
      16.07.2026 16:25

      Она может рассуждать по несколько часов над задачей

      Скоро добавят регулируемый уровень рассуждений и уровень усилий


      1. Dhwtj
        16.07.2026 16:25

        Добавили


    1. Granulex
      16.07.2026 16:25

      Сравнивать стоит не цену за токен, а цену за решённую задачу. По ценнику Kimi скорее демпингует: 15 $ за output – это уровень Sonnet 5, у Opus 4.8 – 25 $, у Fable 5 – все 50 $. Реальная проблема та, что вы сами назвали: модель, которая рассуждает часами, сжигает столько токенов, что итоговый чек за задачу выходит выше, чем у более дорогой, но экономной модели.


  1. eeglab
    16.07.2026 16:25

    Вообще реально, платная китайская модель??? Честно не верю, что она прямо уровня fable: kimi и minimax никогда не были сильно умными, максимум sonnet 3.5 - несмотря на все бенчи , личный опыт показывает, что они все же отстают. По моему пока топ сейчас только DS, GLM и Qwen


    1. Ingref
      16.07.2026 16:25

      MiniMax - это твёрдый середняк между GLM и DeepSeek-V4-Pro в плане цены и качества. Kimi и Qwen - это, конечно, хорошо, но когда дело доходит до цен, то они сливают всухую Минимаксу. Кстати, у дипсика с недавнего времени есть клон-конкурент MiMo, который скопировал его прайс один в один. Всё это очень воодушевляет, но в то же время, глядя на цену оперативки, думаю, что придётся делать апгрейд сейчас, потому что через год всё будет ещё дороже...


      1. Juzujka
        16.07.2026 16:25

        Недавно я как раз распробовал MiMo 2.5 Pro. Приятно удивил способностями и ценой, сравнивал я с DeepSeek V4 Pro.


    1. Juzujka
      16.07.2026 16:25

      Вот не пойму, чем Qwen так хорош? За последние два месяца я от него существенной пользы не добился. От GLM тоже. DeepSeek V4 Pro + Flash решают задачи лучше, чем GLM, Qwen и какие-то ещё. Кажется с Qwen 3.6 я на неё перешёл.

      Но недавно попробовал MiMo V2.5 Pro. Она оказалась лучше DeepSeek V4. Для сложной отладки с пониманием Embedded.

      Задачи у меня в последние месяцы были в основном для Embedded Espressif ESP32-S3 + LVGL + FreeRTOS.

      М.б. Qwen , GLM, Kimi для этих задач плохо подходят?


      1. SabMakc
        16.07.2026 16:25

        MiMo V2.5 Pro и DeepSeek V4 Pro лично у меня ярко проявили “lost-in-the-middle” на относительно небольшом контексте (на вскидку, около 100к-200к), банально поперепутав факты из контекста (а это была работа с отчетом - там эти факты были важны). В коде тоже получается будет терять и путать информацию.

        На коротких задачах в чате мне MiMo V2.5 Pro очень понравилась - четко и по делу код написала, с 1й попытки по промту вида “сделай зашибись” (ни один другой китаец так не смог - приходилось подправлять код доп. вопросами). Но в агентской работе я мнение поменял.

        Пока остановился на Kimi, Minimax и GLM.


        1. xsepsisx
          16.07.2026 16:25

          На коротких задачах в чате мне MiMo V2.5 Pro очень понравилась - четко и по делу код написала, с 1й попытки по промту вида “сделай зашибись” (ни один другой китаец так не смог - приходилось подправлять код доп. вопросами). Но в агентской работе я мнение поменял.

          Вот это удвою. MiMo - мастер строить иллюзии о своих интеллектуальных способностях. Что-то быстро поискать по объемному репозиторию, написать саммари - тут вообще без вопросов, делает чётко и детально. Но как прилетает задача писать код - энтузиазм тает на глазах. Видно, что агент топчется на месте, совершая какие-то глупые ошибки, игнорирует запрос и т.д. При том в бенчмарках среди китайских коллег всегда выглядит достаточно привлекательно.


  1. ampir-nn
    16.07.2026 16:25

    Эта модель стоит денег



    1. VKAT0N
      16.07.2026 16:25

      Не впечатлила, даже бесплатно не пользуюсь.


  1. shut-down-now
    16.07.2026 16:25

    >Вышла Kimi K3 — по мощности модель уступает только Fable 5

    сколько стоит железо, чтобы у себя запустить это самое "уступает только Fable 5"? а потом ещё и выяснить что это 3.14здёжь


    1. BugM
      16.07.2026 16:25

      Долларов 10-20 в час. А что?


      1. jarkevithwlad
        16.07.2026 16:25

        а ещё и веса не выложили (возможно позже)


        1. Politura
          16.07.2026 16:25

          Будет через пару недель:

          The full model weights will be released by July 27, 2026

          https://www.kimi.com/blog/kimi-k3


      1. shut-down-now
        16.07.2026 16:25

        >Долларов 10-20 в час

        спасибо, я лучше с клавой дружить буду


    1. Ingref
      16.07.2026 16:25

      Для теста-то можно и API купить.


    1. Inkor
      16.07.2026 16:25

      Если нативная четырех битовая квантизация как в прошлых кими используется, то нужно как минимум полтора терабайта видеопамяти, если хочешь на весь миллион контекста, то наверное и все два терабайта, но тут уже трудно сказать без знания конкретного устройства архитектуры.


      1. Inkor
        16.07.2026 16:25

        А по стоимости, ну...


    1. Absamad
      16.07.2026 16:25

      А сколько стоит железо чтобы запустить fable 5 ?

      Это модель конкурент fable, гпт 5.6 sol и т.д., а не Qwen 3.6 35b a3b

      Никто и позиционирует её как модель, которую можно запустить локально на пользовательском ПК

      А вот вот в мощном дата центре пожалуйста

      Да и то, модель сильно меньше и очень сильно легче чем её конкуренты

      По поводу fable на знаю, но вокруг гпт 5.6 sol ходят слухи вокруг 4.4 триллиона параметров

      И скорее всего она не лёгкая moe модель

      В общем это личная новость, т.к. провайдеров будет много и модель не заблочат одним днём, как это было с fable

      И это очень мощный знак антропикам и опен АИ, что не стоит долго держать у себя передовые модели, т.к. в любой момент может выйти не менее мощный конкурент( да еще и открытый )


      1. opusmode
        16.07.2026 16:25

        Типа там постоянно выходит «китайский, мощный конкурент», который или дистилят или конкурент только в бенчах

        Пробуешь на дюбом произвольном проекте и китайцы сливают прям сильно


  1. Dhwtj
    16.07.2026 16:25

    Потискал. Дал задачу перевода 10.000 строк с C# (хорошего кода, не легаси) на Rust с заменой ORM и библиотек но без изменений бизнес логики. Вполне достойно. Только медленно. Часа 2 ушло, но почти без моего вмешательства.

    Дождусь 6x speed (для новой версии ещё не доступно) и побегу за кошельком


    1. runaway_llm Автор
      16.07.2026 16:25

      Она и в обычном диалоге очень медленная, хотя как пишет - понравилось.


    1. Dhwtj
      16.07.2026 16:25

      Ой

      Я случайно на 2 такие задачи (с телефона) слил всю месячную квоту moderato (20$). Оказывается, на телефоне нет 4 часовой и недельной квоты.

      Ничего себе расход!

      А в режиме 6х speed тогда и на одну такую задачу не хватило бы.


  1. Dhwtj
    16.07.2026 16:25

    Кстати, по задачам фронт энда Кими пробил стратосферу https://arena.ai/leaderboard/code/webdev


  1. jojozuka
    16.07.2026 16:25

    Интересно, она на китайских картах, как Дипсик? Или пока на нвидии?


  1. Arioch
    16.07.2026 16:25

    в плюсах - реально лучше память. Я пока могу сказать, что "при разговоре на отвлеченные темы" К3 показала себя лучше и точнее. Случайно сам собой получился мини-тест пару месяцев назад.

    Просто начинаешь разговор с "почему у Ланцелота не получилось убить дракона и жениться на Эльзе?" - ни Дипсик, ни к2.6 вообще не отдупляли о чем речь и впаривали мне, что Frozen в цикл о круглом столе не входит. Qwen опознал Шварца, но притормаживал немного путался. К3 как минимум сразу узнала контекст.

    В минусах - забесплатно только 10 запросов в месяц, если это не временное, чтобы просто сбить ажиотаж и переждать волну, то это п...ц.
    это просто постоять в сторонке полюбоваться.


  1. jojozuka
    16.07.2026 16:25

    Запустил свой личный бенчмарк кодинга. Выглядит круто - сама кодит, сама тестирует, находит ошибки, правит, перетестирует, снова правит, ещё раз тестирует, добавляет расширенные тесты на ситуациях, о которых не говорилось - в итоге выдаёт рабочий код. Это мощная заявка.


    1. m0tral
      16.07.2026 16:25

      Она с 2.6 так делает, но что 2.6 что и 2.7, она может зациклиться и тратить токены впустую


      1. izogfif
        16.07.2026 16:25

        Для этого нужно вторую нейронку натравливать на вывод первой, чтоб ловила циклы и вовремя останавливала ту.


    1. shut-down-now
      16.07.2026 16:25

      >сама кодит, сама тестирует, находит ошибки, правит, перетестирует, снова правит, ещё раз тестирует

      по описанию - говно. клава уже давно с первого раза рабочий код рожает


  1. kexibq_cbo
    16.07.2026 16:25

    круто, теперь преступники с деньгами получили доступ к нормальному ИИ, отличная новость. Чтобы запустить эту махину нужен сервер за 3.000.000$


  1. doox911
    16.07.2026 16:25

    Так почему open source? Где скачать её можно?


    1. holgw
      16.07.2026 16:25

      почему open source?

      Потому что Kimi – это (все еще) модель с открытыми весами.

      Где скачать её можно?

      Пока нигде. Разрабы открыли доступ к модели, но общедоступных файлов для скачивания пока нет. По официальным обещаниям – выложат 27.07.2026.


    1. Dhwtj
      16.07.2026 16:25

      Через 2 недели опубликуют


  1. polk1l0
    16.07.2026 16:25

    Про qwen 3.7 opensource ничего не слышно?


    1. Vedomir
      16.07.2026 16:25

      Там сменилось руководство, ушло несколько ключевых руководителей и специалистов и они отказались от публикации открытых моделей. Тут вопрос в том, как закрытые-то модели будут дальше развиваться после таких изменений.

      Хотя мне это семейство очень нравится, если не агентов брать, а чат, так вообще самое лучшее китайское и не особо отличается от западных (хотя возможно это просто пройденный уже этап и общий стандарт для всех).


  1. MountainGoat
    16.07.2026 16:25

    Цена у DeepSeek на кодинге будет в СТО раз меньше. Потому что чек складывается на ~90% из cache read. А cache read у kimi 3 $0.30/1M, а у DeepSeek Pro $0.0036/1M

    Так что если даже DeepSeek нужно в три, пять раз больше шагов, он всё равно победитель по цене.


    1. SabMakc
      16.07.2026 16:25

      DeepSeek сам по себе тупит на длинных контекстах (lost-in-the-middle во всей красе). Так что далеко не эталон.


      1. Ingref
        16.07.2026 16:25

        "Тупит" в большинстве случаев просто означает увеличение времени на решение задачи. Он её всё равно решит, просто не за 5 минут, а за 5 часов. И вопрос тут только в том, готов ли человек заплатить за скорость. И нужна ли эта скорость вообще.


        1. SabMakc
          16.07.2026 16:25

          В моем случае модель путала данные из контекста (я составлял отчет). И это было крайне критично. Я не против “больше вызовов” - тот же Minimax M3 так и делает (иногда в разы больше вызовов делает на ту же задачу). Но Minimax M3 хотя бы не путается в данных.

          Поэтому Minimax M3 я продолжу использовать, хотя он явно звезд с неба не хватает (хотя как исполнитель - очень даже ничего). А вот с Deepseek V4 Pro (как и с MiMo V2.5 Pro) - буду крайне осторожным. Хотя тот же MiMo V2.5 Pro очень классно в чате код пишет (при минимуме контекста).


  1. Varowlord4
    16.07.2026 16:25

    Я пытался использовать их прошлую модель K2.7, она могла полчаса генерировать "улучшенный" код, который в итоге просто ломал всю логику микросервиса....