DeepSeek-V4-Flash-0731: Responses API, 1 млн токенов контекста и интеграция с Codex
31 июля DeepSeek выпустила DeepSeek-V4-Flash-0731 - обновление для API. Архитектура и 284 млрд параметров не изменились, но модель заметно прибавила в агентных задачах и кодинге. Ключевые новшества: Responses API, параллельные вызовы инструментов, контекст до 1 млн токенов, совместимость с Codex CLI и VS Code.
31 июля DeepSeek тихо, но конкретно обновила свою лёгкую модель: вышла DeepSeek-V4-Flash-0731 - API-версия с новыми возможностями для агентных сценариев и разработки.
Что изменилось
Архитектура осталась прежней: 284 млрд параметров, из которых при обработке каждого токена активируется около 13 млрд (MoE-подход). Прирост получен за счёт дообучения - через reinforcement learning и дистилляцию на этапе post-training, без изменений в структуре модели.
Обновление касается только API. Веб-версия, мобильное приложение и V4-Pro пока остаются на предыдущих моделях.
Что добавили
- Responses API - нативная поддержка того типа интерфейса, который используют современные агентные системы.
- Параллельные вызовы инструментов (parallel tool calls).
- Контекст до 1 млн токенов.
- Уровни рассуждения: low, high и max.
- Полная совместимость с Codex CLI, расширением для VS Code и другими инструментами на базе Responses API - подключается через единый конфигурационный файл.
По сути, V4-Flash теперь можно напрямую использовать как backend для агентных приложений, IDE-плагинов и автоматизированных пайплайнов без дополнительной адаптации.
Бенчмарки по данным DeepSeek
Компания опубликовала собственные результаты тестирования:
- TerminalBench 2.1 - 82,7
- DeepSWE - 54,4
- NL2Repo - 54,2
- DSBench-FullStack - 68,7
- Cybergym - 76,7
По внутренним сравнениям DeepSeek, V4-Flash опережает GLM-5.2 и DeepSeek V4-Pro Preview в ряде агентных и кодинговых задач и приближается к уровню Claude Opus 4.8. Примечательно, что лёгкая модель обходит более тяжёлую V4-Pro-Preview на нескольких бенчмарках - при том, что V4-Pro оперирует 1,6 трлн параметров и активирует 49 млрд на токен.
По данным Finance, в сценариях с контекстом в миллион токенов у V4-Pro вычислительная нагрузка на токен (FLOPs) снижается до 27%, а KV-кэш - до 10% по сравнению с предыдущим поколением V3.2. Это следствие той же гибридной архитектуры внимания (CSA + HCA), которую используют обе модели.
Скорость против качества
Стоимость вывода токенов, по предварительным оценкам DeepSeek, осталась примерно на уровне предыдущей версии V4-Flash. Это делает модель привлекательной для длинных агентных задач по сравнению с дорогими frontier-моделями.
Но у лёгких моделей - например, GPT-5.6 Luna - сохраняется преимущество по скорости ответа и общему времени решения задач. Что выгоднее, зависит от конкретного сценария.
По данным Finance, DeepSeek также анонсировала введение тарифов с пиковыми и непиковыми часами: пиковые часы - 9:00-12:00 и 14:00-18:00 по пекинскому времени, стоимость в пик - x2. Точная дата внедрения не указана.
Что дальше
Обновление V4-Pro ожидается в ближайшие дни, а полноценный релиз новой версии DeepSeek-V4-Pro запланирован на начало августа. Кроме того, DeepSeek намекнула на скорый выпуск собственного агента - но технических подробностей о нём пока нет.
Что это значит
Если ты строишь агентный пайплайн или просто хочешь подключить мощную модель к своему IDE - V4-Flash-0731 стоит попробовать прямо сейчас. Responses API и совместимость с Codex снижают порог входа до минимума: существующие инструменты на базе Codex-протокола подключаются без переписывания интеграций.
Контекст в 1 млн токенов открывает сценарии с большими кодовыми базами, длинными логами и многошаговыми агентными цепочками - там, где раньше приходилось обрезать входные данные или дробить задачу вручную.
Источник: Habr / BotHub, 31 июля