La carrera por el banco SWE necesita una evaluación centrada en la producción
Los puntos de referencia de agentes de codificación como SWE-bench siguen siendo señales útiles, pero el contexto del repositorio, la seguridad y la calidad de la revisión determinan el valor de producción.
La competencia en torno a las evaluaciones de SWE-bench y agentes de codificación relacionados continúa proporcionando un cuadro de mando visible para los lanzamientos de modelos. Estos puntos de referencia miden capacidades útiles, especialmente cuando un agente debe comprender un problema y modificar una base de código real. No representan completamente el entorno de una empresa. Las dependencias privadas, los requisitos poco claros, los permisos de implementación, las reglas de seguridad y el costo de revisar un cambio pueden alterar drásticamente el resultado. Utilice puntos de referencia públicos para seleccionar herramientas y luego ejecute un conjunto de evaluación privado creado a partir de tickets representativos. Mida las solicitudes de extracción aceptadas, las regresiones, el tiempo transcurrido y el esfuerzo de revisión humana.
SWE-bench, Coding agents, Benchmarks, Software engineering
Nederland, Netherlands, NL, TripleZero iT, AI
TripleZero iT, Nederland