Robocikowo>ROBOCIKOWO
Ocena jakości

AA-LCR (Artificial Analysis Long Context Reasoning)

2026AktywnyOpublikowano: 23 września 2026Aktualizacja: 23 września 2026Opublikowany
Benchmark Artificial Analysis mierzący rozumowanie na długim kontekście: 100 pytań wymagających przeczytania ok. 100 tys. tokenów i połączenia informacji z wielu fragmentów dokumentów.
Kluczowa innowacja
Nie sprawdza samego odnalezienia igły w stogu siana, lecz wymusza scalenie informacji z wielu miejsc stutysięcznotokenowego wejścia i wyciągnięcie z nich wniosku.
Kategoria
Ocena jakości
Poziom abstrakcji
System
Poziom operacji
InferencjaModel
Zastosowania
Ocena realnej użyteczności długiego okna kontekstuPorównywanie modeli pod kątem pracy na obszernych dokumentachSkładowa Artificial Analysis Intelligence IndexWybór modelu do analizy dokumentacji i raportów

Jak działa

Każde pytanie jest osadzone w zestawie dokumentów o łącznej długości około 100 tysięcy tokenów według tokenizatora cl100k_base. Odpowiedź nie znajduje się w jednym miejscu — model musi odnaleźć kilka istotnych fragmentów rozrzuconych po wejściu, powiązać je ze sobą i wyprowadzić wniosek. Odpowiedzi ocenia sprawdzarka równoważności oparta na modelu GPT, która porównuje wynik modelu z odpowiedzią wzorcową; punktacja to pass@1, czyli liczy się pierwsza próba. Zestaw obejmuje 100 pytań, a wynik wchodzi z wagą 5% do Artificial Analysis Intelligence Index.

Rozwiązany problem

Deklarowane okna kontekstu rosną szybciej niż realna zdolność modeli do korzystania z nich. Popularne testy typu „igła w stogu siana" sprawdzają jedynie odnalezienie pojedynczego faktu, co model może zrobić bez rozumienia całości. AA-LCR wymusza scalenie rozproszonych przesłanek, czyli to, co faktycznie odróżnia użyteczny długi kontekst od nominalnego.

Komponenty

Zestaw dokumentów ~100 tys. tokenówMateriał wejściowy

Długość mierzona tokenizatorem cl100k_base; przesłanki potrzebne do odpowiedzi są celowo rozproszone po wielu fragmentach.

100 pytań wymagających integracjiZadania testowe

Pytania skonstruowane tak, by pojedynczy fragment nie wystarczał do udzielenia poprawnej odpowiedzi.

Sprawdzarka równoważności (GPT)Ocena odpowiedzi

Porównuje odpowiedź modelu z wzorcem; punktacja pass@1 bez powtórzeń.

Oficjalna

Implementacja

Pułapki implementacyjne
Zależność od tokenizatoraNiska

Długość wejścia liczona jest cl100k_base; modele o innym tokenizatorze zobaczą inną liczbę własnych tokenów dla tego samego tekstu.

Rozwiązanie:Traktuj „100 tys. tokenów" jako miarę długości tekstu, nie jako obciążenie okna kontekstu konkretnego modelu.
Sędzia oparty na modeluŚrednia

Ocena przez sprawdzarkę GPT wnosi własny szum i może inaczej traktować odpowiedzi poprawne merytorycznie, lecz inaczej sformułowane.

Rozwiązanie:Interpretuj niewielkie różnice punktowe między modelami ostrożnie, w granicach szumu sędziego.

Ewolucja

2026
Wersja v1.1 z wagą 5% w Intelligence Index
Punkt przełomowy

AA-LCR w wersji v1.1 obejmuje 100 pytań i wchodzi do Artificial Analysis Intelligence Index z wagą 5%.