VCLVibe Coding LabИИ в работе — без VPN
Подписаться
НейросетиНовостиСтатус нейросетейДоступ из РФ
РАЗДЕЛЫ
ТуториалыАвтоматизацииИнструментыВайбкодинг
БИБЛИОТЕКИ
ПромптыШаблоныMCP-серверыГлоссарийПодписаться в Telegram
ГлавнаяНовостиGPT-5.6 Luna подешевела на 80%: OpenAI режет цены на модели
НовостьЦеныgpt-5-6

GPT-5.6 Luna подешевела на 80%: OpenAI режет цены на модели

VCL
Редакция
Vibe Coding Lab
30 июля 2026обновлено 30.07
3 мин чтения
КОРОТКО

OpenAI объявила о снижении цен: GPT-5.6 Terra подешевела на 20%, GPT-5.6 Luna - на 80%, до $0.20 за млн входящих и $1.20 за млн исходящих токенов. Это дешевле Gemini 3.1 Flash-Lite и в пять раз дешевле Claude Haiku 4.5. Оптимизацию инфраструктуры провела сама модель GPT-5.6 Sol.

OpenAI 30 июля 2026 опубликовала подробный разбор того, как GPT-5.6 Sol оптимизировала собственную инфраструктуру обслуживания - и сразу объявила о крупных снижениях цен на всё семейство GPT-5.6.

Что изменилось в ценах

GPT-5.6 Terra стала дешевле на 20%.

GPT-5.6 Luna - главная новость: цена упала на 80%, до $0.20 за млн входящих токенов и $1.20 за млн исходящих.

Для сравнения, по данным Simon Willison: Google Gemini 3.1 Flash-Lite стоит $0.025/$1.50, а Claude Haiku 4.5 от Anthropic - $1/$5. Luna теперь дешевле Gemini по выходу и в пять раз дешевле Haiku по входу. Willison уже перевёл свой демо-сайт agent.datasette.io с Gemini 3.1 Flash-Lite на Luna.

Также появился новый режим Sol - 2.5x Faster (более быстрый режим инференса).

Как GPT-5.6 Sol оптимизировала саму себя

OpenAI использовала GPT-5.6 Sol не просто для написания кода, а для реальной работы над производственной инфраструктурой. Три направления:

Ядра GPU. Sol автономно переписывала production kernels - код, который выполняет математические операции модели - на языках Triton и Gluon (оба open-source, поддерживаются OpenAI). Модель находила операции, которые можно предвычислить, избежать или распараллелить. Итог: снижение сквозных затрат на обслуживание на 20%.

Спекулятивное декодирование. Sol спроектировала и прогнала сотни экспериментов по архитектуре черновой модели, самостоятельно вмешивалась при сбоях оборудования и нестабильности обучения. Результат - рост эффективности генерации токенов более чем на 15%.

KV-кэширование. Оптимизация батчинга, шардинга и управления кэшем под конкретные рабочие нагрузки (прежде всего Sol в Codex).

Что оптимизировали в оркестрации

Помимо работы с GPU, OpenAI переработала Rust-слой оркестрации для многошаговых задач в Codex и ChatGPT Work.

Два ключевых решения:

  • Deferred discovery - инструменты, навыки и плагины подключаются только когда нужны. Выходные данные инструментов ограничены 10 000 токенов по умолчанию, чтобы контекст не раздувался без причины.
  • Prompt caching - вся история, видимая модели, хранится как append-only. Это сохраняет префикс промпта и позволяет переиспользовать уже вычисленные данные, поддерживая высокий cache hit rate.

Насколько это быстро по историческим меркам

По данным Latent Space, аналитик Nicdunz подметил показательное сравнение: GPT-5.4 full на режиме xhigh набирал 51 балл в бенчмарке AA’s Cost per Task - ровно столько же, сколько сегодня набирает Luna max. При этом GPT-5.4 стоил $2.50/$15, а Luna сейчас - $0.20/$1.20. За примерно четыре месяца OpenAI продаёт мартовский флагманский интеллект примерно в 13 раз дешевле.

Год назад Latent Space зафиксировал падение стоимости интеллекта уровня GPT-4 на 1000x за 18 месяцев. Текущие темпы, по их оценке, соответствуют аннуализированному показателю около 2000x в год. Сами авторы оговариваются: публичные бенчмарки вроде AA частично «натренированы», так что цифру стоит воспринимать с поправкой.

Что это значит

Если ты используешь недорогую модель для агентных задач, массовой обработки текста или API-интеграций - Luna по $0.20/$1.20 уже дешевле практически всего на рынке среди закрытых моделей. Это не абстрактный прайс-лист: Simon Willison переключил реальный продакшн-сайт с Gemini Flash-Lite на Luna сразу после объявления.

Для пользователей из России: доступ к API OpenAI по-прежнему требует отдельного решения вопроса с оплатой и доступом - официально карты РФ не принимаются. Пока ситуация не изменилась, следи за обновлениями в разделе «Доступ».

Источники: OpenAI, 30 июля 2026 · Latent Space · Simon Willison, 30 июля 2026

OpenAI · 30 июля
Свежие новости — в Telegram
Главное за день — коротко, без воды.
Подписаться