Kimi K3: 2,8 трлн параметров, открытые веса и тест с пеликаном
Китайская Moonshot AI выпустила Kimi K3 - 2,8 трлн параметров, уже доступна через сайт и API. Открытые веса обещаны к 27 июля 2026. По бенчмаркам обходит Claude Opus 4.8 max и GPT-5.5 high, но уступает Claude Fable 5 и GPT-5.6 Sol. Цена - $3/$15 за млн токенов.
Moonshot AI объявила о выходе Kimi K3 - самой большой модели в открытом доступе на сегодня. Разбираем цифры, цены и почему тест с пеликаном оказался неожиданно информативным.
Что такое Kimi K3
Kimi K3 - новая модель от китайской лаборатории Moonshot AI, анонсированная 16 июля 2026. Moonshot описывают её как «наиболее мощную модель на сегодня» с 2,8 трлн параметров.
Лаборатория позиционирует K3 как первую «open 3T-class» модель (округляя 2,8 трлн до 3). До этого крупнейшей была DeepSeek V4 Pro с 1,6 трлн параметров - K3 больше почти вдвое.
Модель уже работает через сайт kimi.com и API. Открытые веса обещаны к 27 июля 2026.
Бенчмарки: где K3 выигрывает, а где нет
По собственным данным Moonshot, K3 обходит Claude Opus 4.8 max и GPT-5.5 high, но уступает Claude Fable 5 и GPT-5.6 Sol.
Независимая оценка от Artificial Analysis добавляет деталей:
- На закрытом тесте долгосрочных задач K3 набрал Elo 1547 - это +732 пункта относительно Kimi K2.6 и второе место после Claude Fable 5.
- Стоимость задачи - $0,94, что близко к GPT-5.6 Sol ($1,04) и примерно вдвое дешевле Claude Opus 4.8 ($1,80).
- K3 использует на 21% меньше выходных токенов, чем K2.6 - модель стала заметно эффективнее.
Отдельный результат: K3 занял первое место на Arena.ai в категории Frontend Code, обойдя даже Claude Fable 5.
Цены - рекорд для китайских лабораторий
Kimi K3 стоит $3 за млн входных токенов и $15 за млн выходных. Это уровень Claude Sonnet серии от Anthropic.
Для сравнения: предыдущая Kimi K2.6 стоила $0,95/$4. Рост цены существенный - и это первый раз, когда китайская лаборатория выходит на такую ценовую отметку.
Тест с пеликаном: зачем он вообще нужен
Саймон Уиллисон (автор материала) уже 21 месяц проверяет новые модели одним и тем же промптом: «Generate an SVG of a pelican riding a bicycle». Он сам признаёт, что это никогда не был особо хорошим бенчмарком - начиналось как шутка о том, как сложно сравнивать модели.
Первый год тест неплохо коррелировал с реальным качеством моделей. Сейчас эта связь в основном исчезла: например, GLM-5.2 рисует пеликана лучше, чем Claude Fable 5, хотя по общим возможностям это совсем другой уровень.
Главный пробел теста - он вообще не затрагивает то, что сейчас важнее всего: агентные вызовы инструментов и надёжность в длинных разговорах.
Что тест всё же показал про K3
Несмотря на ограничения, прогон через пеликана дал несколько конкретных наблюдений о Kimi K3.
Модель сейчас имеет только один уровень «мышления» - max. И это чувствуется: на простой промпт с пеликаном она потратила 13 241 reasoning-токен и выдала 3417 токенов ответа. Итог - 25 центов за одну картинку. Для простой задачи это дорого.
Как «Generate an SVG of a pelican riding a bicycle» превратилось в 95 входных токенов? Токенизаторы OpenAI и Anthropic считают этот текст как 10-30 токенов. Kimi K3 на простое «hi» тратит 86 токенов - значит, у модели, вероятно, есть скрытый системный промпт примерно на 85 токенов. Сама модель его раскрывать отказалась.
Визуальные возможности работают хорошо: когда Уиллисон скормил K3 уже отрендеренный SVG с просьбой описать картинку, модель выдала детальное и точное alt-текстовое описание - и стоило это 0,6 цента.
Сама по себе картинка с пеликаном у K3 заметно лучше, чем у Kimi 2.5.
Зачем вообще делать такой тест
Уиллисон объясняет свою логику честно. Тест - это «hello world» для работы с моделью: если пеликан есть, значит, он реально запустил промпт через модель. Параллельно получаешь грубую оценку стоимости и нагрузки на reasoning для простой задачи, плюс проверяешь, умеет ли модель генерировать корректный SVG и понимает ли базовую геометрию (особенно актуально для небольших моделей).
Большинство пеликанов он гонит через свой инструмент LLM CLI - это ещё и способ убедиться, что свежие модели поддерживаются в его плагинах. Для K3 использовал OpenRouter с плагином llm-openrouter, чтобы не регистрировать отдельный ключ Moonshot API.
Что это значит для тебя
Kimi K3 - реальный вариант, если тебе нужна мощная модель с большим контекстом и ты готов платить уровень Claude Sonnet. По цене задачи она ближе к GPT-5.6 Sol, чем к бюджетным моделям.
Открытые веса к 27 июля - важная деталь: если лаборатория выполнит обещание, это будет крупнейшая публично доступная модель для локального запуска. Правда, 2,8 трлн параметров на домашнем железе не запустить - речь про серверные сетапы.
Единственный уровень reasoning «max» без возможности снизить - это ограничение прямо сейчас. Дорого для лёгких задач, нет гибкости. Следи за апдейтами: другие лаборатории обычно добавляют уровни effort позже.
Источник: Simon Willison, simonwillison.net, 16 июля 2026 - https://simonwillison.net/2026/Jul/16/kimi-k3/#atom-everything