Команда AI-редактора Cursor поделилась подробным анализом своей мультиагентной системы, которая достигала впечатляющих 1000 коммитов в час и выполняла 10 миллионов вызовов инструментов за неделю без нагрузки на человека. Основой для тестирования стал веб-браузер, разработанный на языке Rust.
Процесс создания рабочей архитектуры оказался непростым. Первоначальная задача с равными ролями для агентов провалилась: они путались в блокировках и состоянии, сохраняя лишь низкую производительность. Вторая модель с разделением на роли «планировщик — исполнитель — воркеры — судья» работала лучше, но оказалась излишне жесткой и зависела от самого медленного из воркеров.
Финальная архитектура схожа с традиционной командой разработчиков, где корневой планировщик управляет задачами и создает подпланировщиков. Воркеры выполняют конкретные задачи в своих копиях репозитория и передают детальные отчеты о ходе работы.
Важно отметить, что требование к 100% точности коммитов замедляло процесс — незначительные ошибки приводили к остановке системы, поэтому был введен допустимый процент ошибок. К тому же качество инструкций оказывалось важнее, чем модель. Ограничения помогали сосредоточиться на приоритетных задачах. Исследователь Уилсон Лин подчеркивает, что к модели нужно относиться как к новому сотруднику, что требует времени для адаптации к конкретной кодовой базе.