Cursa SWE-bench are nevoie de o evaluare orientată spre producție
Benchmark-urile agenților de codificare, cum ar fi SWE-bench, rămân semnale utile, dar contextul depozitului, securitatea și calitatea revizuirii determină valoarea producției.
Competiția în jurul evaluărilor SWE-bench și a agenților de codificare aferente continuă să ofere un punctaj vizibil pentru lansările de modele. Aceste benchmark-uri măsoară capabilitățile utile, mai ales atunci când un agent trebuie să înțeleagă o problemă și să modifice o bază de cod reală. Ele nu reprezintă pe deplin mediul unei companii. Dependențe private, cerințe neclare, permisiuni de implementare, reguli de securitate și costul revizuirii unei modificări pot modifica în mod dramatic rezultatul. Folosiți benchmarkuri publice pentru a lista instrumente, apoi rulați o suită de evaluare privată construită din bilete reprezentative. Măsurați cererile de tragere acceptate, regresiile, timpul scurs și efortul uman de revizuire.
SWE-bench, Coding agents, Benchmarks, Software engineering
Nederland, Netherlands, NL, TripleZero iT, AI
TripleZero iT, Nederland