Robocikowo>ROBOCIKOWO
Qwen3-32B

Qwen3-32B

32B · Rodzina: Qwen
Gęsty model językowy 32,8B parametrów z rodziny Qwen3 (Alibaba), z hybrydowym trybem myślenia i kontekstem do 128K.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceLLMModel rozumowania📁 Qwen
Okno kontekstowe
128K (natywnie 32 768, do 131 072 z YaRN)
tokenów
Parametry
32.8B (31.2B non-embedding)
parametrów
Data premiery
29 kwietnia 2025
Dostęp:DownloadAPIHostedWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

Qwen3-32B to największy gęsty (dense) model językowy w rodzinie Qwen3 opracowanej przez zespół Qwen w Alibaba Cloud, udostępniony 29 kwietnia 2025 roku na licencji Apache 2.0.

Architektura

Model ma 32,8 mld parametrów (31,2 mld bez warstwy embeddingów) i 64 warstwy transformera z dekoderem. Wykorzystuje Grouped Query Attention w konfiguracji 64 głowic zapytań (Q) i 8 głowic klucz/wartość (KV), SwiGLU, rotacyjne osadzenia pozycji (RoPE), RMSNorm z prenormalizacją oraz QK-Norm. W stosunku do Qwen2 usunięto bias w projekcjach QKV. Model natywnie obsługuje kontekst 32 768 tokenów, rozszerzalny do 131 072 tokenów metodą YaRN.

Tryby myślenia

Cechą charakterystyczną Qwen3 jest hybrydowy tryb pracy: tryb myślenia (thinking) do złożonego rozumowania, matematyki i kodowania oraz tryb bez myślenia (non-thinking) do szybkiego dialogu. Tryby można przełączać dynamicznie w zależności od zapytania lub szablonu rozmowy.

Trening

Model wstępnie wytrenowano na około 36 bilionach tokenów obejmujących 119 języków i dialektów, a następnie poddano wieloetapowemu post-treningowi (SFT z długimi łańcuchami rozumowania oraz uczenie ze wzmocnieniem). Qwen3-32B ma silne zdolności agentowe i integracji z narzędziami zewnętrznymi. Wagi udostępniono na licencji Apache 2.0.

Klasyfikacja
LLMModel rozumowania
Rodzina: Qwen
Dostęp i wdrożenie
PobieranieAPIHostowane
LokalnieChmura
Wagi: Open source
Kluczowe parametry
📏 Kontekst: 128K (natywnie 32 768, do 131 072 z YaRN)
🧩 Parametry: 32.8B (31.2B non-embedding)
Narzędzia · ✓ Fine-tuning
📥 Wejście: tekst

Specyfikacja techniczna

Okno kontekstowe
128K (natywnie 32 768, do 131 072 z YaRN)
tokenów
Parametry
32.8B (31.2B non-embedding)
parametrów
Licencja
Apache 2.0
Wymagania sprzętowe
Wagi w BF16 ok. 65 GB; inferencja na 1 GPU zwykle wymaga kwantyzacji (INT4/AWQ/GPTQ) lub 2+ GPU klasy A100/H100 80 GB.
Funkcje:Używanie narzędziFine-tuning
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
textcode

Możliwości i zastosowania

Natywne możliwości modelu
Rozumowanie
Zdolność modelu do wieloetapowego wnioskowania logicznego, rozwiązywania złożonych problemów i rozkładania zadań na kroki.
Kategoria: reasoning
Programowanie
Generowanie, uzupełnianie, wyjaśnianie i debugowanie kodu w wielu językach programowania.
Kategoria: coding
Wielojęzyczność
Rozumienie i generowanie tekstu w wielu językach oraz tłumaczenie między nimi.
Kategoria: language
Długi kontekst
Przetwarzanie bardzo długich danych wejściowych (dziesiątki–setki tysięcy tokenów) przy zachowaniu spójności.
Kategoria: language
Wywoływanie funkcji
Natywne wsparcie dla ustrukturyzowanego wykorzystania narzędzi, umożliwiające przepływy pracy oparte na agentach.
Kategoria: planning

Wyniki benchmarków

14 benchmarków
MMLU
accuracy · Qwen3-32B-Base
83.61%
📄 technical_report
MMLU-Redux
accuracy · Qwen3-32B-Base
83.41%
📄 technical_report
MMLU-Pro
accuracy · Qwen3-32B-Base
65.54%
📄 technical_report
SuperGPQA
accuracy · Qwen3-32B-Base
39.78%
📄 technical_report
BIG-Bench Hard (BBH)
accuracy · Qwen3-32B-Base
87.38%
📄 technical_report
GPQA
accuracy · Qwen3-32B-Base
49.49%
📄 technical_report
GSM8K
accuracy · Qwen3-32B-Base
93.40%
📄 technical_report
MATH
accuracy · Qwen3-32B-Base
61.62%
📄 technical_report
EvalPlus
accuracy · Qwen3-32B-Base
72.05%
📄 technical_report
MultiPL-E
accuracy · Qwen3-32B-Base
67.06%
📄 technical_report
MBPP
accuracy · Qwen3-32B-Base
78.20%
📄 technical_report
CRUX-O
accuracy · Qwen3-32B-Base
72.50%
📄 technical_report
MGSM
accuracy · Qwen3-32B-Base
83.06%
📄 technical_report
MMMLU
accuracy · Qwen3-32B-Base
83.83%
📄 technical_report

Cennik

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)