Эта статья — перевод оригинальной статьи «Introducing GPT‑6 Sol and Luna».

Также я веду телеграм канал «Frontend по‑флотски», где рассказываю про интересные вещи из мира разработки интерфейсов и AI.

Вступление

В начале этого месяца мы представили GPT-6 Astra — нашу самую интеллектуальную и выровненную модель. Для самых сложных и критически важных задач по-прежнему стоит использовать всю мощь Astra, но на практике задачи бывают разного масштаба, требуют разной скорости и укладываются в разные бюджеты.

Поэтому мы расширяем семейство GPT-6 моделями GPT-6 Sol и GPT-6 Luna. GPT-6 Astra открыла новое поколение интеллектуальных моделей, а Sol и Luna позволяют сделать преимущества этого поколения доступнее за счёт более высокой эффективности по соотношению стоимости и возможностей. При обучении GPT-6 Sol и Luna мы использовали подходы, схожие с теми, что применялись для GPT-6 Astra. Благодаря этому более быстрые и доступные модели получили многие из улучшений Astra: высокий уровень работы с профессиональными задачами, фактическую точность, навыки программирования, взаимодействия с компьютером и следования заданным принципам поведения.

Модели GPT-6 занимают лидирующие позиции по соотношению стоимости и интеллектуальных возможностей, предлагая высокую производительность на каждом уровне и инфраструктуру, которая позволяет эффективно масштабировать их использование. Улучшения в кэшировании и инференсе позволили снизить стоимость обслуживания моделей, и мы напрямую передаём эту экономию пользователям и клиентам: цены API для Sol и Luna снижены на 50% по сравнению с промо-тарифами GPT-5.6.

В совокупности эти улучшения делают продвинутый ИИ более практичным для повседневных задач и массового использования в приложениях.

Стоимость GPT-6 API

Модель

Входные токены

Выходные токены

Снижение цены

GPT-5.6 Sol → GPT-6 Sol

$4 → $2

$20 → $10

на 50% дешевле

GPT-5.6 Luna → GPT-6 Luna

$0,20 → $0,10

$1,20 → $0,50

на 50% дешевле

Цены указаны за 1 млн токенов.

GPT-6 Astra по-прежнему остаётся нашей лучшей моделью по совокупности возможностей. Выбирайте её, когда вам нужен максимально качественный результат без компромиссов.

Шаг вперёд для всего семейства моделей

GPT-6 Sol и Luna повышают интеллектуальные возможности и эффективность по стоимости в знакомых вам моделях, прежде всего в тех сценариях, которые особенно важны для решения сложных рабочих задач.

Профессиональные задачи

GPT-6 Sol рассчитана на сложные рабочие сценарии и при этом даёт больше пространства для итераций благодаря более высоким лимитам использования и меньшей стоимости. По сравнению с моделями конкурентов в сопоставимом ценовом сегменте она предлагает более высокий уровень возможностей и более качественные результаты.

В AutomationBench — тесте бизнес-процессов, выполняемых в разных приложениях, GPT-6 Sol с уровнем усилий xhigh превосходит Claude Opus 5 на max, при этом стоимость выполнения одной задачи составляет всего 9% от стоимости Opus 5.

GPT-6 Luna на уровне high улучшает результат своего предшественника на 5,4 процентного пункта, одновременно снижая стоимость выполнения одной задачи на 58%.

В AutomationBench 1.0.6 ИИ-агенты тестируются на сквозных рабочих процессах с использованием 47 инструментов в продажах, маркетинге, операционной деятельности, поддержке, финансах и HR. Показатель стоимости для Claude Fable 5.1 занижен относительно фактического, поскольку не учитывает стоимость переключений на Opus 5, которые происходили примерно в 40% задач.
В AutomationBench 1.0.6 ИИ-агенты тестируются на сквозных рабочих процессах с использованием 47 инструментов в продажах, маркетинге, операционной деятельности, поддержке, финансах и HR. Показатель стоимости для Claude Fable 5.1 занижен относительно фактического, поскольку не учитывает стоимость переключений на Opus 5, которые происходили примерно в 40% задач.

GPT-6 Sol также превосходит Claude Fable 5.1 при значительно меньшей стоимости и даже обходит GPT-6 Astra с низким уровнем усилий.

Модель (и уровень усилий)

Результат

Стоимость задачи

GPT-6 Sol (xhigh)

33,2%

$0,27

GPT-6 Astra (low)

30,3%

в 3,9 раза выше, чем у GPT-6 Sol

Claude Opus 5 (max)

26,9%

в 11,1 раза выше, чем у GPT-6 Sol

Claude Fable 5.1 с fallback на Opus 5 (max)

31,4%

более чем в 8,9 раза выше, чем у GPT-6 Sol

Стоимость fallback-переходов отдельно не указана.

В Agents’ Last Exam — бенчмарке, который оценивает агентов на сложных профессиональных рабочих процессах, GPT-6 Sol на максимальном уровне усилий набирает 56,4%. Это выше лучшего результата Claude Opus 5 в этом тесте, при этом стоимость выполнения одной задачи оказывается на 60% ниже.

В Agents’ Last Exam V1 ИИ-агенты оцениваются на длительных и экономически значимых задачах из 55 подотраслей, охватывающих большинство основных видов профессиональной работы, выполняемой за компьютером.
В Agents’ Last Exam V1 ИИ-агенты оцениваются на длительных и экономически значимых задачах из 55 подотраслей, охватывающих большинство основных видов профессиональной работы, выполняемой за компьютером.

Фактическая точность

Полезность ответа напрямую зависит от того, насколько корректны приведённые в нём факты, и мы продолжаем повышать надёжность моделей в этом отношении.

Во внутреннем тесте на фактическую точность, основанном на обезличенных реальных диалогах, в которых пользователи отмечали ошибки наших моделей, GPT-6 Sol допускает примерно вдвое меньше ошибок, чем её предшественник. По надёжности она приближается к уровню Astra, оставаясь при этом значительно дешевле.

GPT-6 Luna также показывает заметный прогресс: на более высоких уровнях усилий она достигает уровня GPT-5.6 Sol при стоимости примерно в сто раз ниже.

В этом тесте мы оцениваем фактическую точность на обезличенных диалогах ChatGPT, в которых пользователи ранее отмечали фактическую ошибку, допущенную моделью. Такие диалоги, провоцирующие ошибки, не отражают типичный сценарий использования, где фактические ошибки встречаются реже. Результаты не нормализованы по длине ответа. При этом наши эксперименты с разным уровнем подробности показали, что длина ответа практически не влияет на итоговый результат.
В этом тесте мы оцениваем фактическую точность на обезличенных диалогах ChatGPT, в которых пользователи ранее отмечали фактическую ошибку, допущенную моделью. Такие диалоги, провоцирующие ошибки, не отражают типичный сценарий использования, где фактические ошибки встречаются реже. Результаты не нормализованы по длине ответа. При этом наши эксперименты с разным уровнем подробности показали, что длина ответа практически не влияет на итоговый результат.

Программирование

В этом году coding-агенты начали справляться с задачами, которые стали сложнее, масштабнее и продолжительнее, чем когда-либо прежде. Внутри OpenAI их использование растёт экспоненциально. Если пересчитать объём потребляемых токенов по ценам API, медианный исследователь ежедневно использует их более чем на $600, а исследователи из 90-го процентиля — более чем на $7 000 (Research acceleration: The view inside OpenAI).

По мере того как coding-агенты берутся за всё более длительные и ресурсоёмкие задачи, стоимость их постоянного использования становится всё важнее. GPT-6 Sol и Luna сочетают высокую производительность в программировании с более низкими ценами API. Это даёт разработчикам больше возможностей для итераций, а командам позволяет ставить перед Codex более амбициозные задачи, не опасаясь чрезмерного роста затрат.

В FrontierCode бенчмарке, который оценивает, способны ли coding-агенты вносить в реальные кодовые базы изменения, готовые к слиянию. GPT-6 Sol заметно превосходит GPT-5.6 Sol и достигает уровня Claude Fable 5.1 на xhigh, при этом обходясь значительно дешевле.

В FrontierCode 1.1 Main ИИ-агенты пишут код, который оценивается не только по корректности, но и по тому, насколько изменения готовы к слиянию в основную кодовую базу. В частности, учитываются качество тестов, соблюдение границ задачи, стиль кода и соответствие принятым в проекте стандартам.
В FrontierCode 1.1 Main ИИ-агенты пишут код, который оценивается не только по корректности, но и по тому, насколько изменения готовы к слиянию в основную кодовую базу. В частности, учитываются качество тестов, соблюдение границ задачи, стиль кода и соответствие принятым в проекте стандартам.

В DeepSWE v1.1 — бенчмарке, который проверяет модели на сложных задачах по разработке ПО в реальных кодовых базах. GPT-6 Sol на максимальном уровне усилий набирает 68,8%. Это всего на 1,1 процентного пункта ниже лучшего результата Claude Fable 5 в этом тесте 69,9% на уровне xhigh, при этом стоимость выполнения одной задачи примерно на 80% ниже.

GPT-6 Luna на максимальном уровне усилий набирает 66,6%, что сопоставимо с результатами Claude Opus 5 и Fable 5 на среднем уровне усилий. При таком сравнении стоимость одной задачи у Luna оказывается на 93% ниже, чем у Opus 5, и на 96% ниже, чем у Fable 5.

В DeepSWE 1.1 ИИ-агенты решают оригинальные долгосрочные задачи по разработке программного обеспечения.
В DeepSWE 1.1 ИИ-агенты решают оригинальные долгосрочные задачи по разработке программного обеспечения.

Работа с компьютером

Хотя GPT-6 Astra по-прежнему остаётся лучшей в мире моделью для работы с компьютером, GPT-6 Sol и Luna предлагают более выгодное соотношение стоимости и производительности по сравнению со своими предшественниками.

В OSWorld 2.0 offline GPT-6 Sol на уровне усилий xhigh показывает результат, сопоставимый с Claude Opus 5 на medium: 60,5% против 60,3%. При этом стоимость выполнения одной задачи примерно на 80% ниже.

GPT-6 Luna на максимальном уровне усилий превосходит GPT-5.6 Sol на medium, обходясь при этом примерно в десять раз дешевле.

В OSWorld 2.0 ИИ-агенты выполняют длительные сценарии взаимодействия с компьютером, охватывающие как повседневные, так и профессиональные задачи. Здесь приведён показатель partial reward для офлайн-набора из релиза v2026.08.08.
В OSWorld 2.0 ИИ-агенты выполняют длительные сценарии взаимодействия с компьютером, охватывающие как повседневные, так и профессиональные задачи. Здесь приведён показатель partial reward для офлайн-набора из релиза v2026.08.08.

Стиль взаимодействия

Мы также перенесли улучшенный стиль общения GPT-6 Astra в Sol и Luna. Особенно заметно это должно быть в технических обсуждениях и диалогах о программировании.

Ответы стали яснее, с меньшим количеством жаргона и неестественных формулировок, без лишних деталей с низкой практической ценностью и в целом немного короче, при этом без потери содержательности.

Промпт:

Website’s looking clean! Could we use a Bento Box design style and add a slider between the pages in the top right? You may need to dive into the React..

GPT-5.6-Sol

Absolutely. I can get the bento feel and the top-right sliding page switcher without pulling in React—the interaction is small enough to stay fast and smooth in the current site. I’m reshaping all four pages around that system now. Done — open the live site. It now has a colorful bento-box layout across all four pages and an animated top-right Home / Play / Place / Taste slider. React wasn’t necessary; native page transitions keep it lightweight and smooth. The built-in image tool created the food artwork. Prompt: “An energetic gouache-and-ink editorial illustration celebrating dumplings and spicy noodles, with bright colors, steam, spice, and no text or logos.”

GPT-6-Sol

I’ll reshape the pages into a bento grid and turn the top-right links into a sliding page switcher. I’ll keep the existing site and check whether that interaction needs React before changing its setup. The updated site is live. Every page now has a playful bento layout, and the top-right page switcher slides between sections. I checked it on desktop and narrow mobile screens, including browser back navigation. The existing site didn’t need React for this.

Хотя оценка стиля во многом субъективна, в этом примере мы предпочитаем ответ GPT-6 Sol. Модель не спешит с выводами, меньше повторяет детали, которые и так могут быть очевидны пользователю, например, что сайт состоит из четырёх страниц. Реже использует расплывчатые формулировки вроде «ощущение bento» или «перестроить всё вокруг этой системы». Кроме того, она яснее говорит о том, что именно проверила, а что нет, и не перегружает ответ ненужными техническими подробностями реализации, например, промптом, который использовался для инструмента генерации изображений.

Улучшенное кэширование для агентов и длинных диалогов

Помимо снижения стоимости токенов, мы помогаем разработчикам, использующим GPT-6, дополнительно экономить на контексте, который их приложения используют повторно. Мы улучшили prompt caching в GPT-6, чтобы по умолчанию повысить долю попаданий в кэш. Благодаря этому агенты могут повторно использовать больше контекста, быстрее отвечать и получать скидку до 90% на чтение закэшированных входных токенов.

У разработчиков также появилось больше инструментов для измерения и оптимизации эффективности кэширования:

  • Мониторинг и диагностика. Prompt Caching Dashboard показывает, какая доля входных данных попадает в кэш и как этот показатель меняется со временем. Инструмент диагностики помогает понять, почему в отдельных случаях кэш не используется и что можно исправить.

  • Изменение уровня reasoning и доступности инструментов без сброса кэша. Для сложных задач можно повышать reasoning effort, а для простых уточнений снижать его. Также можно включать и отключать инструменты по мере изменения потребностей агента. Теперь в обоих случаях ранее накопленный контекст сохраняется и может повторно использоваться из кэша.

  • Оптимизация кэшируемых префиксов. Явные точки разрыва позволяют разработчикам задавать, где заканчивается кэшируемый префикс промпта. Это даёт больше контроля над повторным использованием кэша и может повысить производительность.

По данным GitHub, за последние несколько месяцев эти улучшения позволили более чем на 50% сократить долю токенов промптов, которые приходилось обрабатывать заново, на миллиардах запросов к моделям OpenAI. В результате Copilot стал отвечать быстрее.

Продолжаем улучшать alignment

GPT-6 Sol и Luna развивают подходы к alignment, впервые представленные в Astra — нашей самой согласованной с заданными принципами модели на сегодняшний день. В наших тестах обе модели показывают улучшения по сравнению со своими аналогами из GPT-5.6, в том числе реже делают вводящие в заблуждение заявления о выполненной ими работе с кодом.

Приведённые ниже тесты намеренно моделируют сложные ситуации и не отражают частоту ошибок при обычном использовании. Полные результаты доступны в system card.

Coding deception (чем ниже, тем лучше)
Во внутреннем тесте на обман при работе с кодом ИИ-агентам дают задачи, специально подобранные так, чтобы провоцировать недобросовестное поведение. В обычных сценариях использования такие случаи встречаются значительно реже. Показатель deception rate отражает долю ответов, в которых был обнаружен хотя бы один признак обмана. Уровень усилий был установлен на максимальный.
Во внутреннем тесте на обман при работе с кодом ИИ-агентам дают задачи, специально подобранные так, чтобы провоцировать недобросовестное поведение. В обычных сценариях использования такие случаи встречаются значительно реже. Показатель deception rate отражает долю ответов, в которых был обнаружен хотя бы один признак обмана. Уровень усилий был установлен на максимальный.
Failure to disclose a broken search tool (чем ниже, тем лучше)
В этом внутреннем тесте ИИ-агентам дают поисковые задачи и намеренно неработающий инструмент поиска, после чего оценивают, сообщают ли они о проблеме с инструментом вместо того, чтобы выдавать наиболее вероятный ответ наугад. Задачи специально подобраны так, чтобы провоцировать ошибки, поэтому результаты не отражают типичные сценарии использования. Уровень усилий был установлен на максимальный.
В этом внутреннем тесте ИИ-агентам дают поисковые задачи и намеренно неработающий инструмент поиска, после чего оценивают, сообщают ли они о проблеме с инструментом вместо того, чтобы выдавать наиболее вероятный ответ наугад. Задачи специально подобраны так, чтобы провоцировать ошибки, поэтому результаты не отражают типичные сценарии использования. Уровень усилий был установлен на максимальный.
Reviewer bypass attempts (чем ниже, тем лучше)
В Codex автоматическая система проверки безопасности может заблокировать команду, которую сочтёт небезопасной, и указать модели не повторять это действие и не пытаться выполнить что-то аналогичное. Мы проверили, соблюдают ли модели это решение или пытаются его обойти. Для GPT-6 Sol не было зафиксировано ни одной попытки обхода. GPT-6 Luna пыталась сделать это в 0,3% запусков против 4,3% у GPT-5.6 Luna. При этом ни одной успешной попытки обхода обнаружено не было.
В Codex автоматическая система проверки безопасности может заблокировать команду, которую сочтёт небезопасной, и указать модели не повторять это действие и не пытаться выполнить что-то аналогичное. Мы проверили, соблюдают ли модели это решение или пытаются его обойти. Для GPT-6 Sol не было зафиксировано ни одной попытки обхода. GPT-6 Luna пыталась сделать это в 0,3% запусков против 4,3% у GPT-5.6 Luna. При этом ни одной успешной попытки обхода обнаружено не было.
Warning circumvention (чем меньше, тем лучше)
Мы также работаем над тем, чтобы модели лучше соблюдали явные предупреждения — например, сообщения access denied. В этих тестах GPT-6 Luna пыталась обойти ограничения примерно в 42% запусков против 77% у её предшественника. У GPT-6 Sol этот показатель составил 64% по сравнению с 68% у предыдущей версии. Тесты в основном охватывают сценарии с низким уровнем риска и проводятся без полного набора системных защитных механизмов, которые используются в наших продуктах.
Мы также работаем над тем, чтобы модели лучше соблюдали явные предупреждения — например, сообщения access denied. В этих тестах GPT-6 Luna пыталась обойти ограничения примерно в 42% запусков против 77% у её предшественника. У GPT-6 Sol этот показатель составил 64% по сравнению с 68% у предыдущей версии. Тесты в основном охватывают сценарии с низким уровнем риска и проводятся без полного набора системных защитных механизмов, которые используются в наших продуктах.
Unauthorized agent interaction (чем меньше, тем лучше)
Мы проверили, следуют ли модели несанкционированным инструкциям на имитируемой доске сообщений, например, требованиям раскрыть приватную информацию. Среди запусков, в которых модели находили эту доску, GPT-6 Sol выполняла указанное несанкционированное действие в 11% случаев против 52% у GPT-5.6 Sol. Для GPT-6 Luna и Astra таких действий зафиксировано не было, хотя Luna находила доску реже. Эти результаты получены в намеренно провокационных условиях и не отражают типичные сценарии использования.
Мы проверили, следуют ли модели несанкционированным инструкциям на имитируемой доске сообщений, например, требованиям раскрыть приватную информацию. Среди запусков, в которых модели находили эту доску, GPT-6 Sol выполняла указанное несанкционированное действие в 11% случаев против 52% у GPT-5.6 Sol. Для GPT-6 Luna и Astra таких действий зафиксировано не было, хотя Luna находила доску реже. Эти результаты получены в намеренно провокационных условиях и не отражают типичные сценарии использования.

Доступность

GPT-6 Sol и GPT-6 Luna с сегодняшнего дня доступны в ChatGPT Work и Codex для всех пользователей Plus, Pro, Business, Enterprise и Edu. Пользователи Free и Go могут использовать GPT-6 Luna в десктопном приложении. В обычном Chat эти модели пока недоступны.

В OpenAI API модели доступны под идентификаторами gpt-6-sol и gpt-6-luna.

Чтобы сохранить стабильность сервиса для всех пользователей, мы будем постепенно разворачивать новые модели в ChatGPT в течение дня. Если GPT-6 Sol или Luna пока не появились у вас в ChatGPT Work или Codex, попробуйте проверить доступность позже.

Тестирование моделей GPT проводилось в нашей исследовательской среде или через API. Из-за различий в системных промптах, доступных инструментах и других настройках результаты могут немного отличаться от поведения моделей в продакшен-версии ChatGPT.

Результаты моделей конкурентов взяты из публично доступных отчётов. Там, где результаты Claude Fable 5.1 отсутствовали, использовались показатели Claude Fable 5.

Комментарии (5)


  1. RainyDay
    23.09.2026 08:12

    Пользователи Free и Go могут использовать GPT-6 Luna в десктопном приложении. В обычном Chat эти модели пока недоступны.

    Получается при OAuth авторизации на Free/Go подписке GPT-6 Luna недоступна?


    1. qmzik Автор
      23.09.2026 08:12

      временно недоступны на вебе, сделают скорее всего


  1. Vest
    23.09.2026 08:12

    Astra, sol, luna, terra — прямо урок астрономии какой-то.

    Почему нельзя называть модели по качеству или как-то ещё? Наподобие good, better, the best.

    Каждый раз, когда появляется что-то новое, приходится искать, что лучше чего.


    1. mist56
      23.09.2026 08:12

      что сегодня the best, завтра bull shit, а название не сменишь


      1. Vest
        23.09.2026 08:12

        Очень хорошо, пусть будет — shitty, shittier и worst.

        Я не против версии в названии, 5, 5.5 и так далее, но эти суффиксы они чаще путают новичков, чем помогают.