Гонка SWE-bench требует оценки, ориентированной на производство
Тесты агентов кодирования, такие как SWE-bench, остаются полезными сигналами, но контекст репозитория, безопасность и качество проверки определяют производственную ценность.
Конкуренция вокруг SWE-bench и связанных с ним оценок агентов кодирования продолжает обеспечивать видимую систему показателей для выпусков моделей. Эти тесты измеряют полезные возможности, особенно когда агенту необходимо понять проблему и изменить реальную базу кода. Они не в полной мере отражают среду компании. Частные зависимости, нечеткие требования, разрешения на развертывание, правила безопасности и стоимость проверки изменения могут существенно изменить результат. Используйте общедоступные тесты, чтобы составить список инструментов, а затем запустите частный оценочный пакет, созданный на основе репрезентативных заявок. Измеряйте принятые запросы на включение, регрессии, затраченное время и усилия по проверке человеком.
SWE-bench, Coding agents, Benchmarks, Software engineering
Nederland, Netherlands, NL, TripleZero iT, AI
TripleZero iT, Nederland