La corsa alla panchina SWE necessita di una valutazione orientata alla produzione
I benchmark degli agenti di codifica come SWE-bench rimangono segnali utili, ma il contesto del repository, la sicurezza e la qualità delle revisioni determinano il valore della produzione.
La competizione attorno al banco SWE e alle relative valutazioni degli agenti di codifica continua a fornire una scorecard visibile per il rilascio dei modelli. Questi benchmark misurano capacità utili, soprattutto quando un agente deve comprendere un problema e modificare una base di codice reale. Non rappresentano pienamente l'ambiente di un'azienda. Dipendenze private, requisiti poco chiari, autorizzazioni di distribuzione, regole di sicurezza e il costo della revisione di una modifica possono alterare drasticamente il risultato. Utilizza benchmark pubblici per selezionare gli strumenti, quindi esegui una suite di valutazione privata creata da ticket rappresentativi. Misura le richieste pull accettate, le regressioni, il tempo trascorso e lo sforzo di revisione umana.
SWE-bench, Coding agents, Benchmarks, Software engineering
Nederland, Netherlands, NL, TripleZero iT, AI
TripleZero iT, Nederland