Компания Cursor поделилась итогами своего эксперимента по масштабированию автономных кодинг-агентов. В ходе тестирования разработчики запустили сотни агентов параллельно на одном проекте, которые на протяжении нескольких недель написали свыше миллиона строк кода. Основной задачей было выяснить, способны ли агенты справляться с задачами, требующими месяцы работы от команд разработчиков. Проблема координации оказалась ключевой: когда агенты получили равный статус и самостоятельно распределяли задачи, лишь двадцать из них показали высокую производительность, в то время как остальные ожидали освобождения блокировок. Введение иерархии, где планировщики исследуют код и создают задачи, а воркеры их реализуют, решило эту проблему. Для проверки системы агенты на базе GPT-5.2 были задействованы для разработки браузера с нуля. За неделю они сгенерировали более трех миллионов строк кода, включая движок рендеринга на Rust. CEO Cursor, Майкл Труэлл, отметил, что браузер справляется с простыми сайтами, хотя до уровня WebKit или Chromium еще далеко. Важным выводом стало то, что правильные промпты важнее выбора модели. Несмотря на текущие недостатки, результаты эксперимента показывают, что масштабирование автономных агентов — это рабочая схема.