Robocikowo>ROBOCIKOWO
Qwen3-14B

Qwen3-14B

3-14B · Rodzina: Qwen
Model językowy Qwen3-14B od Alibaba (14,8 mld param., Apache 2.0) z hybrydowym trybem myślenia. Kontekst 128K, 119 języków, silny w matematyce, kodowaniu i zadaniach agentowych.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceLLMModel rozumowaniaModel używający narzędzi📁 Qwen
Okno kontekstowe
128K
tokenów
Parametry
14.8B
parametrów
Max output
32 768
tokenów
Data premiery
29 kwietnia 2025
Dostęp:DownloadAPIHostedWdrożenie:💻 Lokalnie☁ Cloud📱 Na urządzeniu

Przegląd

Qwen3-14B to post-trenowany (instruct) model językowy z rodziny Qwen3 opracowany przez Qwen Team w Alibaba Group i opublikowany 29 kwietnia 2025 r. na licencji Apache 2.0. Jest to gęsty model (dense) o 14,8 mld parametrów (13,2 mld bez embeddingów), zbudowany na 40 warstwach Transformer z GQA (40 głów Q, 8 głów KV). Model wchodzi w skład serii Qwen3, obejmującej modele gęste 0,6B–32B oraz MoE 30B–235B.

Hybrydowy tryb myślenia

Kluczową cechą Qwen3 jest obsługa dwóch trybów w ramach jednego modelu: tryb myślenia (thinking mode, enable_thinking=True) — model generuje rozumowanie krok po kroku wewnątrz bloku <think>…</think>, a następnie finalną odpowiedź; oraz tryb non-thinking (enable_thinking=False) — odpowiedź bezpośrednia, bez jawnego rozumowania. Tryb można zmieniać dynamicznie przez flagi /think i /no_think w promptcie lub parametr enable_thinking w chat template. Dla trybu myślenia zalecane: Temperature=0,6, TopP=0,95, TopK=20. Dla trybu non-thinking: Temperature=0,7, TopP=0,8, TopK=20.

Architektura i pretrening

Architektura opiera się na Transformerze z GQA, SwiGLU, RoPE i RMSNorm, z dodanym QK-Norm dla stabilności treningu i bez QKV-bias. Model obsługuje 32K tokenów kontekstu natywnie, rozszerzalne do 131 072 przez YaRN (w praktyce prezentowane jako 128K). Pretrening objął ok. 36 bilionów tokenów w trzech etapach: bazowy (ok. 30T), etap wzmocnienia STEM/kodu (ok. 5T) oraz etap długiego kontekstu.

Post-trening

Post-trening Qwen3 obejmował 4 etapy: (1) Long-CoT cold start — fine-tuning na danych chain-of-thought z matematyki, kodu i STEM; (2) Reasoning RL — reinforcement learning z regułowymi nagrodami (GRPO); (3) Thinking Mode Fusion — integracja trybu non-thinking przez SFT na danych mixed CoT + instrukcje; (4) General RL — RL na 20+ ogólnych zadaniach (instruction following, format, agent). Mniejsze modele gęste były częściowo trenowane przez dystylację wiedzy (strong-to-weak) od większych modeli Qwen3.

Wielojęzyczność i możliwości agentowe

Model obsługuje 119 języków i dialektów, obejmujących rodziny indoeuropejskie, sinotybetańskie, afroazjatyckie, austronezyjskie i inne. W zakresie zastosowań agentowych Qwen3-14B integruje się z zewnętrznymi narzędziami przez MCP (Model Context Protocol), obsługując wywoływanie funkcji zarówno w trybie myślenia, jak i non-thinking. Zalecanym frameworkiem agentowym jest Qwen-Agent.

Klasyfikacja
LLMModel rozumowaniaModel używający narzędzi
Rodzina: Qwen
Dostęp i wdrożenie
PobieranieAPIHostowane
LokalnieChmuraNa urządzeniu
Wagi: Open source
Kluczowe parametry
📏 Kontekst: 128K
🧩 Parametry: 14.8B
Narzędzia · ✓ Fine-tuning
📥 Wejście: tekst

Specyfikacja techniczna

Okno kontekstowe
128K
tokenów
Parametry
14.8B
parametrów
Max output tokens
32 768
tokenów na odpowiedź
Licencja
Apache 2.0
Wymagania sprzętowe
GPU z ~32 GB VRAM dla BF16 (14,8 mld param., 40 warstw), lub ~12 GB z kwantyzacją Q4. Zalecane Flash Attention 2. Obsługa: Transformers (>=4.51.0), vLLM (>=0.8.5), SGLang (>=0.4.6.post1), llama.cpp, Ollama, LMStudio.
Funkcje:Używanie narzędziFine-tuning
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
textcode

Możliwości i zastosowania

Natywne możliwości modelu
Rozumowanie
Zdolność modelu do wieloetapowego wnioskowania logicznego, rozwiązywania złożonych problemów i rozkładania zadań na kroki.
Kategoria: reasoning
Programowanie
Generowanie, uzupełnianie, wyjaśnianie i debugowanie kodu w wielu językach programowania.
Kategoria: coding
Wielojęzyczność
Rozumienie i generowanie tekstu w wielu językach oraz tłumaczenie między nimi.
Kategoria: language
Długi kontekst
Przetwarzanie bardzo długich danych wejściowych (dziesiątki–setki tysięcy tokenów) przy zachowaniu spójności.
Kategoria: language
Rozumowanie wieloetapowe
Prowadzenie wieloetapowego toku rozumowania w długich, złożonych zadaniach.
Kategoria: reasoning
Rozumowanie matematyczne
Zdolność modelu do rozwiązywania zadań matematycznych wymagających wieloetapowego rozumowania — równania, dowody, kombinatoryka, geometria, rachunek różniczkowy, zadania konkursowe.
Kategoria: reasoning
Zdolności agentowe
Zdolność modelu do autonomicznego planowania i wykonywania wieloetapowych zadań poprzez sekwencyjne użycie narzędzi, utrzymywanie kontekstu i adaptację do wyników pośrednich.
Kategoria: planning
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Wywoływanie funkcji
Natywne wsparcie dla ustrukturyzowanego wykorzystania narzędzi, umożliwiające przepływy pracy oparte na agentach.
Kategoria: planning
Wyjście strukturyzowane
Generowanie danych w ustrukturyzowanych formatach, np. JSON.
Kategoria: structured_generation
Modelowanie języka
Zdolność przewidywania kolejnych tokenów i generowania spójnego tekstu w języku naturalnym na podstawie poprzedzającego kontekstu.
Kategoria: language

Wyniki benchmarków

10 benchmarków
MMLU
accuracy · 5-shot, model bazowy Qwen3-14B-Base
81.05%
📅 14 maj 2025📄 Qwen3 Technical Report, Table 5 (arXiv 2505.09388)
MMLU-Pro
accuracy · 5-shot CoT, model bazowy Qwen3-14B-Base
61.03%
📅 14 maj 2025📄 Qwen3 Technical Report, Table 5 (arXiv 2505.09388)
GPQA
accuracy · model bazowy Qwen3-14B-Base
39.90%
📅 14 maj 2025📄 Qwen3 Technical Report, Table 5 (arXiv 2505.09388)
MATH
accuracy · 4-shot CoT, model bazowy Qwen3-14B-Base
62.02%
📅 14 maj 2025📄 Qwen3 Technical Report, Table 5 (arXiv 2505.09388)
GSM8K
accuracy · 4-shot CoT, model bazowy Qwen3-14B-Base
92.49%
📅 14 maj 2025📄 Qwen3 Technical Report, Table 5 (arXiv 2505.09388)
MGSM
accuracy · 8-shot CoT, wielojęzyczna matematyka, model bazowy Qwen3-14B-Base
79.20%
📅 14 maj 2025📄 Qwen3 Technical Report, Table 5 (arXiv 2505.09388)
BBH (BIG-Bench Hard)
accuracy · 3-shot, model bazowy Qwen3-14B-Base
81.07%
📅 14 maj 2025📄 Qwen3 Technical Report, Table 5 (arXiv 2505.09388)
MBPP
pass@1 · 3-shot, kodowanie, model bazowy Qwen3-14B-Base
73.40%
📅 14 maj 2025📄 Qwen3 Technical Report, Table 5 (arXiv 2505.09388)
EvalPlus
pass@1 · kodowanie, model bazowy Qwen3-14B-Base
72.23%
📅 14 maj 2025📄 Qwen3 Technical Report, Table 5 (arXiv 2505.09388)
MultiPL-E
pass@1 · kodowanie wielojęzyczne, model bazowy Qwen3-14B-Base
61.69%
📅 14 maj 2025📄 Qwen3 Technical Report, Table 5 (arXiv 2505.09388)

Cennik

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)