Wyścig na stanowiskach SWE wymaga oceny nastawionej na produkcję
Testy porównawcze agentów kodujących, takie jak SWE-bench, pozostają użytecznymi sygnałami, ale kontekst repozytorium, bezpieczeństwo i jakość recenzji determinują wartość produkcji.
Konkurencja wokół testów SWE-bench i powiązanych ocen agentów kodujących w dalszym ciągu zapewnia widoczną kartę wyników w przypadku wypuszczania modeli. Te testy porównawcze mierzą przydatne możliwości, zwłaszcza gdy agent musi zrozumieć problem i zmodyfikować rzeczywistą bazę kodu. Nie reprezentują one w pełni otoczenia firmy. Prywatne zależności, niejasne wymagania, uprawnienia do wdrażania, zasady bezpieczeństwa i koszt przeglądu zmiany mogą radykalnie zmienić wynik. Skorzystaj z publicznych testów porównawczych, aby utworzyć krótką listę narzędzi, a następnie uruchom prywatny pakiet ewaluacyjny zbudowany na podstawie reprezentatywnych zgłoszeń. Mierz zaakceptowane żądania ściągnięcia, regresje, upływ czasu i wysiłek włożony w weryfikację manualną.
SWE-bench, Coding agents, Benchmarks, Software engineering
Nederland, Netherlands, NL, TripleZero iT, AI
TripleZero iT, Nederland