VCLVibe Coding LabИИ в работе — без VPN
Подписаться
НейросетиНовостиСтатус нейросетейДоступ из РФ
РАЗДЕЛЫ
ТуториалыАвтоматизацииИнструментыВайбкодинг
БИБЛИОТЕКИ
ПромптыШаблоныMCP-серверыГлоссарийПодписаться в Telegram
Главная→Новости→GigaChat 2 Max с памятью на связях против Claude Opus 5 без неё: замер 7 моделей
НовостьНовостьGigaChatYandexGPTClaude

GigaChat 2 Max с памятью на связях против Claude Opus 5 без неё: замер 7 моделей

VCL
Редакция
Vibe Coding Lab
24 августа 2026обновлено 24.08
4 мин чтения
КОРОТКО

Замер на 100 вопросах по корпусу из 4618 задач: GigaChat 2 Max с памятью на связях отвечает верно в 57% случаев, YandexGPT Pro 5.1 - в 61%, Claude Opus 5 с обычным поиском - в 41%. Вывод: на этом классе задач слой памяти даёт больше, чем смена модели на более дорогую.

Автор конструктора баз данных Интеграм опубликовал на Habr замер семи языковых моделей на задаче, которая встречается в любой команде разработки: пришла жалоба - найди изменение, которое эту проблему уже закрывало.

Что именно измеряли

Корпус - реальный рабочий проект: 4618 задач и изменений на русском языке. Проверочный набор - 100 вопросов, правильный ответ известен заранее из истории проекта. Проверка автоматическая: сверяется номер, без ИИ-судьи, результат не «плывёт» между прогонами.

Всего 2310 обращений к моделям: 7 моделей умножить на четыре режима (по 30 + 100 + 100 + 100 вопросов). Режимы одинаковые для всех:

  • none - без контекста, проверка что ответы не зашиты в веса
  • kw - 12 фрагментов от поиска по совпадению слов
  • vecmory - память на связях (типизированные рёбра между записями)
  • mc - 12 фрагментов, правильный ответ гарантированно среди них

Сравниваются модели, а не поисковики.

Ключевые числа из таблицы

При наивном поиске (kw) все семь моделей лежат в коридоре 32-42%. Claude Opus 5 - 41%, GigaChat 2 Max - 40%, YandexGPT Pro 5.1 - 42%. Разрыв между «дорогой» и «дешёвой» моделью почти не виден, потому что упирается не в качество модели, а в то, доехал ли нужный факт до неё в контексте.

Память на связях добавляет каждой модели 14-27 пунктов. Примечательно: дорогой Opus выигрывает от неё больше (+27 пунктов), чем GigaChat 2 Max (+17). Слой одинаково нужен и тем, кто уже сидит на флагмане.

Главный результат: GigaChat 2 Max с памятью - 57%, Claude Opus 5 с обычным поиском - 41%. Пользователь, который мигрирует «на модель посильнее», на этом классе задач получил бы от памяти больше, чем от смены модели - дешевле и внутри своего контура.

Важная оговорка из источника: Claude Opus 5 с той же памятью даёт 68% - больше всех в замере. Разрыв между моделями при одинаковом контексте - 18 пунктов (68% против 57%) - памятью не закрывается.

Про деньги

В таблице есть колонка «₽/верный» - стоимость всех вызовов, делённая на число верных ответов. Промахи в знаменатель не попадают, но заплачено и за них: это цена результата, а не удачного запроса. Числа берутся по факту со шлюза, не из прайса.

Самая выгодная модель из семи - младшая gigachat-2: 0.21 ₽ за верный ответ против 1.85 ₽ у gigachat-2-max и 1.66 ₽ у Opus 5. По точности она отстаёт от gigachat-2-max на шесть пунктов (51% против 57%), но эти шесть пунктов обходятся почти в девять раз дороже. Для потоковых задач, где ошибку ловит следующий шаг, выбор не очевиден.

Аномалия с младшей моделью

Самое неожиданное в таблице: у gigachat-2 контрольный режим (mc, 42%) хуже режима с памятью (51%), хотя в контрольном правильный ответ гарантированно лежит перед моделью среди двенадцати кандидатов.

Причина: младшая GigaChat в 31% случаев называет номер, которого в контексте не было. Выдаёт конкретный номер уверенно - в режиме, где правильный ответ прямо перед ней.

Для сравнения в том же режиме: Claude Opus 5 не галлюцинирует ни разу (0%), YandexGPT Pro 5.1 - в 1% случаев, GigaChat 2 Max - в 2%. Это не «русские модели вообще», это конкретная младшая модель - и это та часть проблемы, которую никакой поиск не лечит.

Отсюда практическое правило: чем слабее модель, тем важнее отдавать ей мало и точно. Три точных факта работают лучше двенадцати похожих. Гонка за полнотой поиска (recall) для слабых моделей контрпродуктивна - им нужна точность выдачи (precision).

Что такое память на связях

Это типизированные рёбра между записями: «эту проблему закрыло вот это изменение», «за этой задачей последовала вон та», «здесь речь про тот же объект». Хранится в обычном PostgreSQL, без расширений.

Поиск по смыслу (векторный) сам по себе даёт 46% попаданий нужного документа в выдачу; вместе со связями - 84%. Разница целиком в структуре, а не в модели.

Идею слоя памяти подсказал сам ИИ-агент: он регулярно упирался в уже решённые задачи и однажды предложил хранить не переписку, а связи «жалоба → изменение, которое её закрыло».

Честность про замер

Автор сам вынес наверх разбор потенциальной слабости методики: память ходит по ссылкам «эта задача закрыта этим изменением», а правильный ответ в замере определяется по тем же ссылкам. Замер мог бы не отличать «память хорошо ищет» от «памяти заранее подсказали». В статье есть отдельный вклад каждого компонента на том же наборе из 100 вопросов.

Что это значит

Если у тебя задачи из серии «где мы это уже чинили» или «какое изменение закрыло вот эту жалобу» - прежде чем платить за более дорогую модель, посмотри на слой памяти. По этому замеру прирост от структурированного контекста перекрывает прирост от апгрейда модели на том же корпусе.

Если работаешь с российскими моделями (GigaChat, YandexGPT) и не хочешь зависеть от зарубежных API - результаты показывают, что при правильно выстроенной памяти они конкурентны на конкретных рабочих классах задач.

И отдельно: если используешь слабую модель для потоковых задач - следи за галлюцинациями при длинных контекстах. gigachat-2 в этом замере показала, что больше контекста может означать хуже результат.

Источник: Habr, 24 августа - https://habr.com/ru/articles/1073448/

Habr · 24 августа ↗
Свежие новости — в Telegram
Главное за день — коротко, без воды.
Подписаться