В отпуске есть время подумать и исследовать. Я натолкнулся на несколько вещей и открытий для себя. Оказалось, что мне как программисту перестали быть нужны самые умные и дорогие ИИ‑модели. Оказывается, есть такой параметр «Cost per Task», и по этому параметру на первое место вырвалась модель GPT-5.6 Luna (max).

При этом, если вы пользуетесь Codex, она самая тупая в списке моделей. Artificial Analysis Intelligence Index у нее всего 38. Для сравнения, у самой умной GPT-6 Astra (max) этот индекс равен 53. В итоге цена выполненной Luna задачи составляет $0.18 против $3.26 у Astra. Разница почти в 20 раз.

Как я понимаю, бенчмарк «Cost per Task» высчитывается так: когда ставится нормальная, грамотно описанная задача, замеряется, сколько токенов было потрачено на ее выполнение. То есть не в формате «из ХЗ сделаю ТЗ», а в формате, когда в хорошо заданном вопросе уже содержится половина ответа.

Я сначала не поверил, что так и есть, и стал работать, используя самую тупую модель Luna в линейке. И знаете, какие меня ожидали результаты? У меня перестали кончаться 5-часовые лимиты и недельные лимиты. На тарифе за 20 баксов в месяц, Карл!:)

Притом что я программист, Codex не водит меня по кругу, и мне не требуется переключаться на более умную модель, чтобы она все‑таки смогла выполнить задачу, о которой я прошу уже в пятый раз. Я вижу, как многие вайбкодеры‑непрограммисты всегда выходят из ситуации: если ИИ водит тебя по кругу, включи более умную модель, и она точно решит проблему. Да, это правда: для неквалифицированных программистов это работает, а для квалифицированных лишено смысла, если они, конечно, не обленились и вообще не выключили мозг.

То есть ситуация такая: даже самые дешевые и самые тупые фронтирные модели стали достаточно умными. Если ты разбираешься в теме, их уровня хватает за глаза. Похоже, гонка за тем, у кого модель умнее, подходит к концу. Но я столкнулся с другой проблемой: скоростью.

Особенно это заметно на DeepInfra и OpenRouter. Сейчас средняя скорость генерации на более‑менее нормальных моделях составляет 25–50 токенов в секунду. Даже Luna у меня в Codex выполняет задачу в среднем за 5–15 минут. Для агентского режима это очень медленно. Это начинает раздражать.

Если взять модель DeepSeek‑V4.1-Flash напрямую через API DeepSeek, скорость там достигает 300 токенов в секунду. Заметьте: задача выполняется не за 5 минут, а меньше чем за минуту. А если задача тяжелая, вместо 15 минут уходит всего 5. Когда ты программист, ты запускаешь задачу и хочешь, чтобы ИИ выполнил ее как можно быстрее. Так гораздо комфортнее, чем ждать 5–15 минут. При этом Artificial Analysis Intelligence Index у DeepSeek‑V4.1-Flash равен 40, что на 2 пункта выше, чем у Luna.

В общем, следующим этапом развития агентского ИИ становится скорость. На текущий момент китайские модели выигрывают. Но, как я понял, нас ждут сюрпризы от американских LLM‑провайдеров. У Anthropic, вроде, с этим проблемы, но OpenAI, похоже, скоро получит дата‑центры, где скорость будет измеряться тысячами токенов в секунду. Представьте: раньше вы ставили задачу и ждали минуты, а теперь все готово за 10–30 секунд. Бизнес со скоростью мысли:) Только придумал, подумал, а результат уже можно проверять:)

Вы же помните, какой была гонка за размером контекстного окна? «У нас 65 тыс. токенов!» «У нас 250 тыс.!» «У нас полмиллиона!» «У нас контекст размером в 1 млн токенов!» Так вот, ребята, я думаю, гонка завершена. Дальше наращивать его смысла нет. Кстати, именно с ростом контекста и появились ИИ‑агенты для кодинга, которые в цикле, решая задачу, итеративно наращивали контекст и успевали за 20–30 циклов сделать что‑то полезное, дойдя до 500 тыс. или 1 млн токенов.

Сейчас главная проблема в том, что ИИ‑агент при каждой новой задаче заново изучает код и правила работы с репозиторием, чтобы выполнить вашу задачу. 80% его работы уходит на то, чтобы заново разобраться, что тут происходит, и только 20% составляют правки в коде. А все это из‑за долбаного контекстного окна в 1 млн токенов, которое приходится постоянно сбрасывать в ноль и начинать заново. То есть у всех уже пришло понимание, что в идеале нужна некая долгосрочная память. Тогда контекстное окно становится бесконечным.

То есть, если модели не требуется из‑за переполнения контекстного окна начинать с нуля, получается, что чем дольше модель работает с кодовой базой, тем больше у нее накапливается общее представление о том, где что находится в этом проекте. В общем, давай stateful LLM, надоели твои stateless LLM! И, кстати, такие работы уже ведутся, и есть несколько проектов. В общем, рынок созрел, и, я думаю, это будет следующим этапом, а не увеличение контекстного окна до 2 или 3 млн токенов.

Кстати, вопрос. А у вас как трансформировались привычки программирования в связи с последними событиями? Например, из‑за того, что мне перестали быть нужны крутые средства IDE, я перестал оплачивать подписки JetBrains и перешел на Zed IDE. Он бесплатный, поддерживает шорткаты, как у JetBrains, и я, по сути, использую его, чтобы смотреть diff кода и навигироваться в дереве исходников.

И, кстати, я что‑то все меньше использую Codex или Claude Code: они тянут слишком много лишнего и раздувают контекст, что отвлекает LLM от задачи. Перешел на Pi harness. У него минимальный набор тулов: редактирование кода, запуск команд и так далее. В итоге в среднем один самый простой запрос к LLM, типа «привет», у Pi занимает 3 тыс. токенов. У Codex 18 тыс., у Claude Code 30 тыс. Тут даже неважно, что меньше. Важно, что модель хуже понимает задачу, отвлекаясь на более раздутый контекст.

А у вас какой стек в итоге образовался? И вообще, как думаете, что дальше будет? Чего ждать от ИИ‑продуктов в сфере программирования? Куда дальше все идет?

Комментарии (74)


  1. Dhwtj
    17.09.2026 11:08

    Для агентского режима это очень медленно. Это начинает раздражать. Если взять модель DeepSeek-V4.1-Flash напрямую через API DeepSeek, скорость там достигает 300 токенов в секунду

    Для агентского режима с четкой проверкой можно. В остальных случаях - брезгую: столько вранья давно не видел.


    1. jorgvonfrundsberg
      17.09.2026 11:08

      А есть какая-то корреляция между измеримой скоростью  токенов в секунду и количеством вранья?


      1. Ka463
        17.09.2026 11:08

        Есть реальная польза от агентского режима с многоступенчатой доказательной проверкой, ловится куча багов, пустышек, обещаний и т.д, это работает на любой модели, а разницы из за скорости генерации я не разу не замечал.


        1. jorgvonfrundsberg
          17.09.2026 11:08

          Спрошу по-другому - агентский режим на локальной модели с, допустим 12Гб видео и 64Гб оперативки будет работать, пусть и неспеша, но без такого же количества вранья как в упомянутом DeepSeek-V4.1-Flash ?


          1. Ka463
            17.09.2026 11:08

            Скажем так, гарантии я не дам, потому что работаю на своем собственном агенте, а что возьмете вы и как настроите я не знаю, а от агентского контура зависит все.

            А на счет DeepSeek-V4.1-Flash, у меня он сейчас как раз подключен, как облачная модель, и вот наблюдение, я ему кинул ссылку на статью, и сказал, хочу то что в статье но с своим блэкджеком, к вечеру полный функционал был готов, в агентском режиме он работает на ура.


            1. igumnov Автор
              17.09.2026 11:08

              О чем и говорю. Luna модель от OpenAI на том же уровне. Притом если ее попросить вместо DeepSeek-V4.1-Flash будет результат в 5 раз дольше ждать.


              1. Ka463
                17.09.2026 11:08

                Это я еще не нативный API от дипсика взял,а пользую облачную ollama, там все несколько тормознее =)


          1. Ka463
            17.09.2026 11:08

            Вот кстати если интересно, как работает режим проверки, это дипсик 4.1, режим работы swarm когда есть оркестратор и воркер, и вот как раз воркер закончил работу и прислал отчет оркестратору, а тот не поверил ему, и не зря, нашел косяки и отправил воркера исправлять, без моего вмешательства в работу агента.


            1. Z55
              17.09.2026 11:08

              Вот кстати если интересно, как работает режим проверки

              Расскажите по подробней, где этот режим? Какой-то дополнительный агент?


              1. IlyaStroynov
                17.09.2026 11:08

                вы всегда можете в промте задать типа "создай план, делегируй исполнение субагенту, его результат провалидируй(тут тоже опция - через независимого агента-ревьюера)". я такую механику сразу в AGENTS.md зашил, чтобы ни одно решение по проекту не принималось без проверки независимым агентом с моделью другого семейства, чем агент-исполнитель


              1. Ka463
                17.09.2026 11:08

                Вам нужен режим где основной агент делегирует работу суб-агенту, а сам оценивает его работу


      1. Dhwtj
        17.09.2026 11:08

        Статистическая есть. Логической связи нет


    1. TimurZhoraev
      17.09.2026 11:08

      А были ли внешние инструменты - тот же Qdrant+BAAI-m3 эбмеддер, сейчас в облачных сервисах полно этого добра. Делается векторная БД, затем чанкуется любой даташит что под руку попал (включая код с коммент-промпт форматом - не пренебрегайте этим!) и модель всё делает почти так как руками, хоть Алиса хоть Сбер. Мне очень всё это дело помогло сделать микро-проект с PWM/ADC/UART/I2C/SPI с DMA, все адекватные конечные автоматы с фоллбеками и обработчиками ошибок, практически на уровне main(){} с таймерами миниатюрная RTOS, полное понимание проблем RMW с гонкой данных и всё это впихнуть в 64 к флеша и 20к озушки, прочих вкусных протокольных внешних микрух а-ля SPI дисплейчик, мультиплексоры I2C и умные драйверы шаговых. Плюс ещё скиллы соответствующие и промпт-инъекции чтобы направить в нужное русло ну и конечно же md-саммари с хорошей цепочкой и контрольным выводом, плюс питонячьи тесты (уже давно отодвинул Matlab) и тестирующие C-обёртки. Практически можно не использовать stdlib а генерировать printf/scanf по месту и прочие парсеры, умещаясь в килобайты как на каком-нибудь спектруме, самое невероятное - практически отпала необходимость искать чьи-либо библиотеки (!) для периферии, шрифтов, рендеров итд, всё генерируется по месту, остаётся только что-то вроде HAL/SPL на уровне спецификаций регистров управления. Вообщем это добротный джун/миддл с опытом работы 50+ лет в отрасли, начиная от Z80 и до GPU/FPGA.