Robocikowo>ROBOCIKOWO
Ocena jakości

Coding Agent Index

2026AktywnyOpublikowano: 23 września 2026Aktualizacja: 23 września 2026Opublikowany
Wskaźnik zbiorczy Artificial Analysis dla agentów kodujących: prosta średnia z DeepSWE v1.1, Terminal-Bench 4.0 i SWE-Atlas-QnA.
Kluczowa innowacja
Sprowadza ocenę agenta kodującego do jednej liczby, uśredniając trzy benchmarki mierzące różne aspekty inżynierii oprogramowania — implementację, pracę w terminalu i rozumienie repozytorium.
Kategoria
Ocena jakości
Poziom abstrakcji
System
Poziom operacji
Środowisko agentoweSystem
Zastosowania
Porównywanie agentów kodujących jedną metrykąRanking modeli pod kątem pracy nad kodemWybór modelu do środowiska agentowegoŚledzenie postępu zdolności inżynieryjnych modeli

Jak działa

Agenta uruchamia się na trzech benchmarkach składowych. DeepSWE v1.1 odpowiada za zdolność implementacyjną, Terminal-Bench 4.0 za pracę w środowisku terminalowym, a SWE-Atlas-QnA za rozumienie repozytorium kodu. Wyniki cząstkowe są uśredniane bez ważenia — wszystkie trzy składniki wchodzą do indeksu z równym udziałem. Prostota agregacji jest świadoma: pozwala odtworzyć wartość indeksu z publikowanych wyników cząstkowych i sprawdzić, który składnik odpowiada za zmianę pozycji modelu w rankingu.

Rozwiązany problem

Agenty kodujące ocenia się wieloma benchmarkami, z których każdy mierzy inny wycinek pracy; wyniki bywają sprzeczne i trudne do porównania między modelami. Indeks rozwiązuje ten problem porządkowo — daje jedną, jawnie zdefiniowaną liczbę, której skład można sprawdzić.

Komponenty

DeepSWE v1.1Składnik implementacyjny

Mierzy zdolność agenta do realizacji zadań programistycznych typu software engineering.

Terminal-Bench 4.0Składnik terminalowy

66 zadań w środowisku terminalowym obejmujących inżynierię oprogramowania, administrację systemem i przetwarzanie danych; ocena pass/fail przez zestaw testów, pass@1 uśrednione z 3 powtórzeń.

SWE-Atlas-QnASkładnik rozumienia repozytorium

Sprawdza, na ile agent rozumie strukturę i zawartość repozytorium kodu, a nie tylko potrafi pisać poprawne fragmenty.

Implementacja

Pułapki implementacyjne
Uśrednianie maskuje profil zdolnościŚrednia

Dwa modele o tym samym indeksie mogą mieć zupełnie różne profile — jeden mocny w terminalu i słaby w rozumieniu repozytorium, drugi odwrotnie.

Rozwiązanie:Zawsze czytaj wyniki cząstkowe obok indeksu, zwłaszcza przy wyborze modelu do konkretnego zastosowania.
Zmiana wersji zmienia skalęŚrednia

Indeks jest wersjonowany (v1.5), a podmiana benchmarku składowego przesuwa wartości — wyniki z różnych wersji nie są wprost porównywalne.

Rozwiązanie:Porównuj wyłącznie wyniki z tej samej wersji indeksu i podawaj numer wersji przy cytowaniu.

Ewolucja

2026
Wersja v1.5 wskaźnika
Punkt przełomowy

Artificial Analysis opisuje Coding Agent Index jako średnią z DeepSWE v1.1, Terminal-Bench 4.0 i SWE-Atlas-QnA.