Агенты Cursor пересобрали SQLite с нуля по мануалу и прошли все тесты
Cursor дал рою ИИ-агентов 835-страничный мануал SQLite и попросил написать базу данных на Rust с нуля - без исходников, без тестов, без интернета. За 4 часа агенты прошли 73-85% тестов, позже - все 100%. Стоимость варьировалась от $1 339 до $10 565 в зависимости от выбора моделей.
20 июля 2026 года Cursor опубликовал исследовательский пост «Agent swarms and the new model economics» - и он быстро разлетелся по Hacker News. История выглядит громко, но детали интереснее заголовка.
Что именно сделал Cursor
Команда дала рою агентов 835-страничный мануал SQLite. Никакого исходного кода, никакого бинарника SQLite, никакого тестового набора, никакого доступа в интернет. Задача - написать базу данных на Rust с нуля.
После каждого запуска результат проверялся через sqllogictest - официальный тестовый набор SQLite с миллионами запросов и известными правильными ответами. Агентам не говорили, что этот набор вообще существует.
За четыре часа новые запуски проходили от 73% до 85% тестов. До 100% каждая конфигурация добралась уже после четырёхчасовой отметки - Cursor честно об этом написал.
Как работает рой
Архитектура делит работу на два типа агентов.
Планировщики (planner agents) работают на дорогих фронтирных моделях - в частности, на Opus 4.8 - и разбивают большой проект на небольшие задачи. Исполнители (worker agents) работают на более дешёвых моделях - в частности, на Composer 2.5 - и реализуют конкретные кусочки.
Планировщик не засоряет контекст кодом. Исполнитель не тратит контекст на архитектурные решения. Логика простая, и она работает.
Чем новый запуск отличается от старого
Цифры здесь говорят сами за себя.
Старый запуск на Grok 4.5 за первые два часа накопил больше 70 000 merge conflicts и был остановлен досрочно. Новый за четыре часа дал меньше 1 000 merge conflicts.
Старый Grok 4.5 разрос до 54 Rust crates, включая три отдельных SQL-пакета. Новый остановился на 9 crates с самого начала и не отклонялся.
В миксе Fable 5 оба роя в итоге прошли полный тест, но старый написал 64 305 строк кода движка, новый - 9 908 строк. Это разница в шесть раз. Меньше строк автоматически не значит лучше, но 54 крейта и три SQL-пакета в одном проекте - признак того, что что-то пошло сильно не так.
Деньги - это и есть главная история
Cursor запустил несколько комбинаций моделей и опубликовал стоимость каждой:
- $1 339 - Opus 4.8 как планировщик + Composer 2.5 как исполнители
- $10 565 - GPT-5.5 делает всё в одиночку
Это не рядом стоящие цифры. Разница почти в восемь раз.
При этом в гибридном запуске Opus + Composer планировщик производил небольшую долю токенов, но съедал примерно две трети стоимости. Исполнители делали большинство токенов за оставшуюся треть.
Вывод прямой: дорогую модель незачем сажать за набор кода. Она нужна там, где нужно принять решение. Дальше - дешёвые исполнители с чёткими инструкциями. Нормальные команды разработчиков работают именно так.
Контекст, который стоит знать
В июне 2026 года Reuters сообщил, что SpaceX договорилась о покупке Anysphere - материнской компании Cursor - в сделке на $60 млрд акциями. По данным Forbes, закрытие ожидается в третьем квартале 2026 года.
Компания в процессе такой сделки заинтересована в публикации результатов, показывающих продукт с хорошей стороны. Исследование от этого не становится ложью, но делает важным чтение мелкого шрифта.
Честное ограничение
SQLite - нетипичный выбор для такого эксперимента. У него есть 835-страничный мануал, который чётко описывает поведение системы. Большинство корпоративного ПО так не устроено.
Внутренний биллинговый сервис, полуживой после двух реорганизаций. Система прав доступа, реальная спецификация которой живёт в продакшн-инцидентах и Slack-тредах, которые никто не экспортировал. Это другие существа.
Следующий интересный тест - не очередная хорошо задокументированная система. А сможет ли тот же рой выжить в реальном легаси: запутанном, недоспецифицированном, полном решений, которые никто не записал.
Что это значит
Если ты занимаешься разработкой, автоматизацией или управляешь техническими проектами - главная идея здесь не «ИИ написал базу данных». Главная идея: гибрид дорогой модели-планировщика и дешёвых исполнителей даёт результат сопоставимого качества в семь раз дешевле, чем один дорогой агент.
Это меняет то, как стоит думать о стоимости ИИ-задач. Не «какая модель самая умная», а «где нужен дорогой ум, а где хватит дешёвых рук».
Источник: Startup Fortune, 21 июля 2026 - ссылка. Первоисточник: пост Cursor «Agent swarms and the new model economics», опубликован 20 июля 2026 года.