VCLVibe Coding LabИИ в работе — без VPN
Подписаться
НейросетиНовостиСтатус нейросетейДоступ из РФ
РАЗДЕЛЫ
ТуториалыАвтоматизацииИнструментыВайбкодинг
БИБЛИОТЕКИ
ПромптыШаблоныMCP-серверыГлоссарийПодписаться в Telegram
ГлавнаяНовостиDeepSeek-V4-Flash-0731: Responses API, 1 млн токенов контекста и интеграция с Codex
НовостьАпдейтDeepSeek

DeepSeek-V4-Flash-0731: Responses API, 1 млн токенов контекста и интеграция с Codex

VCL
Редакция
Vibe Coding Lab
31 июля 2026обновлено 31.07
3 мин чтения
КОРОТКО

31 июля DeepSeek выпустила DeepSeek-V4-Flash-0731 - обновление для API. Архитектура и 284 млрд параметров не изменились, но модель заметно прибавила в агентных задачах и кодинге. Ключевые новшества: Responses API, параллельные вызовы инструментов, контекст до 1 млн токенов, совместимость с Codex CLI и VS Code.

31 июля DeepSeek тихо, но конкретно обновила свою лёгкую модель: вышла DeepSeek-V4-Flash-0731 - API-версия с новыми возможностями для агентных сценариев и разработки.

Что изменилось

Архитектура осталась прежней: 284 млрд параметров, из которых при обработке каждого токена активируется около 13 млрд (MoE-подход). Прирост получен за счёт дообучения - через reinforcement learning и дистилляцию на этапе post-training, без изменений в структуре модели.

Обновление касается только API. Веб-версия, мобильное приложение и V4-Pro пока остаются на предыдущих моделях.

Что добавили

  • Responses API - нативная поддержка того типа интерфейса, который используют современные агентные системы.
  • Параллельные вызовы инструментов (parallel tool calls).
  • Контекст до 1 млн токенов.
  • Уровни рассуждения: low, high и max.
  • Полная совместимость с Codex CLI, расширением для VS Code и другими инструментами на базе Responses API - подключается через единый конфигурационный файл.

По сути, V4-Flash теперь можно напрямую использовать как backend для агентных приложений, IDE-плагинов и автоматизированных пайплайнов без дополнительной адаптации.

Бенчмарки по данным DeepSeek

Компания опубликовала собственные результаты тестирования:

  • TerminalBench 2.1 - 82,7
  • DeepSWE - 54,4
  • NL2Repo - 54,2
  • DSBench-FullStack - 68,7
  • Cybergym - 76,7

По внутренним сравнениям DeepSeek, V4-Flash опережает GLM-5.2 и DeepSeek V4-Pro Preview в ряде агентных и кодинговых задач и приближается к уровню Claude Opus 4.8. Примечательно, что лёгкая модель обходит более тяжёлую V4-Pro-Preview на нескольких бенчмарках - при том, что V4-Pro оперирует 1,6 трлн параметров и активирует 49 млрд на токен.

По данным Finance, в сценариях с контекстом в миллион токенов у V4-Pro вычислительная нагрузка на токен (FLOPs) снижается до 27%, а KV-кэш - до 10% по сравнению с предыдущим поколением V3.2. Это следствие той же гибридной архитектуры внимания (CSA + HCA), которую используют обе модели.

Скорость против качества

Стоимость вывода токенов, по предварительным оценкам DeepSeek, осталась примерно на уровне предыдущей версии V4-Flash. Это делает модель привлекательной для длинных агентных задач по сравнению с дорогими frontier-моделями.

Но у лёгких моделей - например, GPT-5.6 Luna - сохраняется преимущество по скорости ответа и общему времени решения задач. Что выгоднее, зависит от конкретного сценария.

По данным Finance, DeepSeek также анонсировала введение тарифов с пиковыми и непиковыми часами: пиковые часы - 9:00-12:00 и 14:00-18:00 по пекинскому времени, стоимость в пик - x2. Точная дата внедрения не указана.

Что дальше

Обновление V4-Pro ожидается в ближайшие дни, а полноценный релиз новой версии DeepSeek-V4-Pro запланирован на начало августа. Кроме того, DeepSeek намекнула на скорый выпуск собственного агента - но технических подробностей о нём пока нет.

Что это значит

Если ты строишь агентный пайплайн или просто хочешь подключить мощную модель к своему IDE - V4-Flash-0731 стоит попробовать прямо сейчас. Responses API и совместимость с Codex снижают порог входа до минимума: существующие инструменты на базе Codex-протокола подключаются без переписывания интеграций.

Контекст в 1 млн токенов открывает сценарии с большими кодовыми базами, длинными логами и многошаговыми агентными цепочками - там, где раньше приходилось обрезать входные данные или дробить задачу вручную.

Источник: Habr / BotHub, 31 июля

Habr · 31 июля
Свежие новости — в Telegram
Главное за день — коротко, без воды.
Подписаться