Разработчики компании Cursor представили результаты эксперимента, в рамках которого были протестированы автономные кодинг-агенты. Они запускали сотни агентов параллельно на одном проекте, которые работали на протяжении нескольких недель и написали свыше миллиона строк кода. Основная цель заключалась в том, чтобы выяснить, возможно ли ускорить решение задач, которые традиционно требуют месяцы работы команд разработчиков.
Однако, координация оказалась главной проблемой: когда агенты имели одинаковый статус и свободно делили задачи, двадцать из них показали эффективность двух-трех, в то время как остальные ожидали завершения блокировок. Без иерархии агенты предпочитали простые задачи, избегая более сложных. В итоге команда внедрила разделение ролей: планировщики исследуют код и формируют задачи, а воркеры занимаются их выполнением.
В ходе эксперимента агентам на базе GPT-5.2 было поручено разработать браузер с нуля. За неделю они сгенерировали более трех миллионов строк кода. Движок рендеринга был написан на Rust и включает в себя парсинг HTML, каскадные стили CSS, разметку и виртуальную машину JavaScript. По словам CEO Cursor Майкла Труэлла, браузер успешно обрабатывает простые сайты, хотя ему еще далеко до конкурентов, таких как WebKit и Chromium.
GPT-5.2 показала лучшие результаты в долгосрочных задачах, оставаясь сфокусированной и следуя инструкциям. В то время как Opus 4.5 часто останавливалась раньше, чем требовалось. При этом различные модели лучше подходят для разных ролей: GPT-5.2 более эффективна в планировании, чем специализированная на коде GPT-5.1-codex.
Главный вывод команды: важность промптов превышает выбор модели или архитектуры. Координация множества агентов, избегание ошибок и поддержание фокуса в течение недель потребовали большого количества экспериментов с инструкциями. Несмотря на то что система ещё не идеальна и требует периодических перезапусков, результаты эксперимента показали, что масштабирование работает лучше, чем ожидалось.