Полгода назад в продукте был один автотест, а сейчас их 878. Заметная часть написана командой ИИ-агентов внутри харнесса со специализированными ролями. Новый инструмент не попадает в систему без RED/GREEN-доказательства пользы: сначала красный тест, потом зелёный код, и только после этого инструмент остаётся в пайплайне разработки.
В схеме, где код генерируют агенты, самой дефицитной компетенцией оказалось тестирование. Без проверки автоматизация быстро наращивает объём, но не гарантирует надёжность. RED/GREEN-цикл задаёт жёсткий фильтр — в харнесс попадает только то, что реально улучшает качество, а не просто добавляет строки в репозиторий тестов без проверки.
Рост с одного до 878 тестов показывает, что агентный подход масштабируется, если роль тестировщика встроена в архитектуру харнесса, а не добавлена сверху. В материале на Хабре автор рассказывает, как устроен харнесс из специализированных ролей и почему новый инструмент не попадает в него без RED/GREEN-доказательства пользы. Следить за тем, как роли распределяют ответственность и как проходит валидация каждого нового инструмента перед включением в систему, где код пишут агенты.
