AI / Software engineering
2026-05-23
SWE-bench
Coding agents
Benchmarks
Software engineering
מירוץ הספסל של SWE זקוק להערכה מבוססת ייצור
אמות מידה של סוכני קידוד כמו SWE-bench נותרו איתותים שימושיים, אבל הקשר של מאגר, אבטחה ואיכות סקירה קובעים את ערך הייצור.
התחרות סביב SWE-bench והערכות קשורות של סוכני קידוד ממשיכה לספק כרטיס ניקוד גלוי לשחרור מודלים. אמות מידה אלה מודדות יכולות שימושיות, במיוחד כאשר סוכן חייב להבין בעיה ולשנות בסיס קוד אמיתי. הם אינם מייצגים באופן מלא את הסביבה של חברה. תלות פרטית, דרישות לא ברורות, הרשאות פריסה, כללי אבטחה והעלות של סקירת שינוי יכולים לשנות את התוצאה באופן דרמטי. השתמש במדדים ציבוריים לרשימת כלים, ולאחר מכן הפעל חבילת הערכה פרטית הבנויה מכרטיסים מייצגים. מדוד בקשות משיכה מקובלות, רגרסיות, זמן שחלף ומאמץ ביקורת אנושי.
SWE-bench, Coding agents, Benchmarks, Software engineering
Nederland, Netherlands, NL, TripleZero iT, AI
TripleZero iT, Nederland