Robocikowo>ROBOCIKOWO
Ocena jakości

AutomationBench-AA

2026AktywnyOpublikowano: 23 września 2026Aktualizacja: 23 września 2026Opublikowany
Uruchamiana przez Artificial Analysis wersja benchmarku automatyzacji przepływów SaaS: 657 zadań z narzędziami REST API, ocena pass/fail i wykrywanie naruszeń barierek.
Kluczowa innowacja
Ocenia automatyzację procesów biznesowych przez rzeczywiste wywołania narzędzi REST API z obiektywną punktacją pass/fail, a dodatkowo wykrywa naruszenia barierek bezpieczeństwa — nie tylko to, czy zadanie się udało, ale czy agent nie zrobił po drodze czegoś niedozwolonego.
Kategoria
Ocena jakości
Poziom abstrakcji
System
Poziom operacji
Środowisko agentoweSystem
Zastosowania
Ocena agentów do automatyzacji procesów biznesowychTestowanie użycia narzędzi REST API przez modelePomiar przestrzegania barierek bezpieczeństwaSkładowa Artificial Analysis Intelligence Index

Jak działa

Model dostaje zadanie z jednej z domen biznesowych i zestaw narzędzi wystawionych jako REST API. Wykonuje ciąg wywołań, dążąc do zrealizowania przepływu pracy. Wynik jest binarny: zadanie zaliczone albo nie, bez ocen częściowych i bez sędziego opartego na modelu. Równolegle system sprawdza, czy w trakcie wykonania doszło do naruszenia barierek — czyli czy agent wykonał operację, której nie powinien. Łącznie zestaw obejmuje 657 zadań, a zagregowany wynik wchodzi z wagą 5% do Artificial Analysis Intelligence Index.

Rozwiązany problem

Deklaracje o „agentach automatyzujących procesy biznesowe" trudno zweryfikować, bo sukces zależy od konkretnego środowiska narzędziowego i od tego, czy agent nie łamie po drodze reguł organizacji. AutomationBench-AA daje powtarzalne środowisko z prawdziwymi wywołaniami REST API i jawnym rejestrem naruszeń barierek.

Komponenty

657 zadań z domen biznesowychZbiór testowy

Zadania odwzorowujące przepływy pracy w oprogramowaniu SaaS, rozłożone na różne obszary działalności firmy.

Narzędzia REST APIŚrodowisko wykonania

Model działa przez rzeczywiste wywołania API, a nie przez symulowany opis narzędzi.

Wykrywanie naruszeń barierekDruga oś oceny

Niezależnie od zaliczenia zadania rejestruje się, czy agent wykonał operację niedozwoloną.

Implementacja

Pułapki implementacyjne
Binarna punktacja bez ocen częściowychŚrednia

Agent, który wykonał 90% przepływu i potknął się na ostatnim wywołaniu, dostaje zero — wyniki bywają przez to skokowe.

Rozwiązanie:Analizuj rozkład porażek po krokach, nie tylko zagregowany odsetek zaliczeń.
Mylenie z AutomationBenchŚrednia

AutomationBench-AA to instancja uruchomieniowa Artificial Analysis; wyniki nie muszą być wprost porównywalne z wynikami raportowanymi na samym AutomationBench.

Rozwiązanie:Przy cytowaniu wyniku zawsze podawaj, czy pochodzi z wariantu -AA, czy z benchmarku źródłowego.

Ewolucja

2026
Włączenie do Artificial Analysis Intelligence Index
Punkt przełomowy

AutomationBench-AA wchodzi do indeksu z wagą 5%, obejmując 657 zadań z narzędziami REST API.