Ramy LLM360 wymagają udostępnienia: (1) kodu treningowego i przepisu, (2) pełnego zbioru danych treningowych wraz z kolejnością przetwarzania, (3) wszystkich pośrednich checkpointów zapisywanych w trakcie treningu, (4) hiperparametrów oraz (5) logów, metryk i wyników pośrednich analiz (Analysis360). Dzięki temu dowolna osoba może odtworzyć lub wznowić trening, przeanalizować zachowanie modelu na kolejnych checkpointach i zbudować na pośrednich stanach modelu.
Większość modeli określanych jako „open-source” udostępnia wyłącznie finalne wagi i skrótowy raport, co uniemożliwia odtworzenie treningu, audyt danych oraz badanie dynamiki uczenia i zjawisk emergentnych. LLM360 rozwiązuje ten brak transparentności, publikując komplet artefaktów potrzebnych do pełnej reprodukcji i analizy.
Pełny kod używany do pre-treningu wraz z przepisem: architekturą, hiperparametrami i konfiguracją uruchomienia, umożliwiający wierne powtórzenie treningu.
Kompletne dane treningowe wraz z kolejnością/sekwencją ich podawania modelowi, co umożliwia audyt danych oraz dokładne odtworzenie tej samej trajektorii uczenia.
Wszystkie pośrednie stany wag zapisywane w trakcie treningu (nie tylko finalny checkpoint), pozwalające badać dynamikę uczenia, zjawiska emergentne i wznawiać trening od dowolnego punktu.
Zapisane metryki, krzywe uczenia i logi z przebiegu treningu, dokumentujące zachowanie modelu i procesu optymalizacji w czasie.
Towarzyszący projekt/repozytorium udostępniający analizy pośrednich checkpointów i wyników, wspierające badania nad zachowaniem modelu na kolejnych etapach treningu.
Oficjalna
Praca arXiv:2312.06550 definiuje standard „w pełni otwartego” LLM i wprowadza dwa pierwsze modele 7B wraz z pełnym zestawem artefaktów treningowych.
K2-65B (1,4 bln tokenów, Apache 2.0) osiąga wyniki porównywalne z Llama 2 70B przy ok. 35% mniejszym budżecie obliczeniowym; rozwijany wspólnie przez MBZUAI, Petuum i LLM360, z publikacją wszystkich artefaktów.
Zespół LLM360 kontynuuje prace jako IFM (start maj 2025), przenosząc oficjalną organizację Hugging Face do IFM i rozwijając m.in. rodzinę K2 Horizon; modele na licencji Apache 2.0, dane pod licencjami typu ODC-BY.