Robocikowo>ROBOCIKOWO
Ocena jakości

HellaSwag

2019AktywnyOpublikowano: 24 sierpnia 2026Aktualizacja: 24 sierpnia 2026Opublikowany
Benchmark commonsense NLI: wybór najbardziej sensownego z 4 zakończeń zdania/zdarzenia. Trywialny dla ludzi (>95%), trudny dla wczesnych modeli (<48%).
Kluczowa innowacja
Skalując metodę Adversarial Filtering, stworzono benchmark commonsense NLI trywialny dla ludzi (>95%), lecz bardzo trudny dla ówczesnych modeli SOTA (<48%), pokazując, że benchmarki powinny ewoluować adwersarialnie razem z modelami.
Kategoria
Ocena jakości
Poziom abstrakcji
Wzorzec
Poziom operacji
Ewaluacja (runtime)Po-trening
Zastosowania
Ewaluacja wnioskowania zdroworozsądkowego LLMBenchmarking modeli językowychElement pakietów ewaluacyjnych (lm-evaluation-harness, Open LLM Leaderboard)Pomiar commonsense NLIPorównywanie modeli w trybie few-shot / zero-shot

Jak działa

Każdy przykład zawiera kontekst (ctx, złożony z ctx_a i ctx_b) oraz listę czterech możliwych zakończeń; dokładnie jedno jest poprawne (pole label 0–3). Poprawne zakończenie pochodzi z oryginalnego źródła (ActivityNet lub WikiHow), a dystraktory są generowane maszynowo i selekcjonowane przez Adversarial Filtering: trenuje się dyskryminator do odróżniania tekstu ludzkiego od maszynowego, zachowuje wygenerowane przykłady oszukujące model i iteruje, aż zbiór jest trudny dla modeli, lecz łatwy dla ludzi (weryfikacja przez adnotatorów). Model oceniany jest trafnością wyboru poprawnego zakończenia; ewaluacja obejmuje kategorie in-domain oraz zero-shot (aktywności niewidziane w treningu).

Rozwiązany problem

Wcześniejsze benchmarki commonsense (np. SWAG) zostały szybko wysycone przez modele wstępnie trenowane jak BERT, co utrudniało pomiar rzeczywistego wnioskowania zdroworozsądkowego. HellaSwag tworzy trudne, adwersarialne przykłady, które pozostają łatwe dla ludzi, przywracając rozdźwięk człowiek–model jako miarę postępu.

Komponenty

Kontekst i cztery zakończeniaFormat zadania wielokrotnego wyboru

Format zadania: kontekst (ctx_a + ctx_b) oraz cztery kandydujące zakończenia, z których jedno jest poprawne (label 0–3).

Adversarial FilteringMechanizm generowania dystraktorów

Paradygmat zbierania danych: zespół dyskryminatorów iteracyjnie selekcjonuje maszynowo generowane błędne odpowiedzi trudne dla modeli, lecz absurdalne dla ludzi.

Źródła kontekstu (ActivityNet, WikiHow)Domeny danych źródłowych

Konteksty pochodzą z opisów filmów ActivityNet Captions oraz instrukcji WikiHow; obejmują kategorie in-domain i zero-shot.

Ewolucja

Oryginalny paper · 2019 · ACL 2019 · Rowan Zellers
HellaSwag: Can a Machine Really Finish Your Sentence?
Rowan Zellers, Ari Holtzman, Yonatan Bisk, Ali Farhadi, Yejin Choi
2018
SWAG — poprzednik HellaSwag

Zellers i in. wprowadzają SWAG, benchmark commonsense NLI zbudowany metodą Adversarial Filtering.

2019
Publikacja HellaSwag (ACL 2019)
Punkt przełomowy

Trudniejszy następca SWAG: dłuższe konteksty i przykłady z ActivityNet oraz WikiHow; ludzie >95%, modele SOTA <48%.

2023
GPT-4 osiąga 95,3% — wysycenie benchmarku
Punkt przełomowy

GPT-4 (marzec 2023) osiąga 95,3%, blisko poziomu ludzkiego 95,6%, praktycznie wysycając zadanie.

Hiperparametry (konfigurowalne osie)

Liczba kandydujących zakończeńWysoka

Każdy przykład ma 4 możliwe zakończenia, z których jedno jest poprawne.

4Stała wartość w HellaSwag
Tryb ewaluacji (zero-shot / few-shot)Średnia

Powszechnie ewaluowany w trybie zero-shot lub 10-shot w pakietach typu lm-evaluation-harness.

10-shotUstawienie na Open LLM Leaderboard