Robocikowo>ROBOCIKOWO
Platforma AIAI-natywny

vLLM

Szybka, otwartoźródłowa (Apache 2.0) biblioteka i serwer do inferencji oraz serwowania modeli LLM; słynie z PagedAttention i continuous batching.

Producent:University of California, BerkeleyOn-Premises · Chmura zarządzana · Edge · Hybrydowy
vLLM
Robotics-Ready

Opis

vLLM to szybka i łatwa w użyciu, otwartoźródłowa biblioteka do inferencji oraz serwowania dużych modeli językowych, udostępniona na licencji Apache 2.0. Powstała w Sky Computing Lab na UC Berkeley, a obecnie jest rozwijana przez społeczność liczącą ponad 2000 kontrybutorów z uczelni i firm na całym świecie (od 2025 jako projekt hostowany przez PyTorch Foundation).

Kluczową innowacją jest PagedAttention — efektywne zarządzanie pamięcią dla danych klucz-wartość mechanizmu uwagi. vLLM stosuje continuous batching z chunked prefill i prefix caching, udostępnia serwer API zgodny z OpenAI (oraz Anthropic Messages API i gRPC), obsługuje kwantyzację (FP8, MXFP8/MXFP4, NVFP4, INT8, INT4, GPTQ/AWQ, GGUF, compressed-tensors) i inferencję rozproszoną (równoległość tensorowa, potokowa, danych, ekspertów i kontekstu).

Obsługuje szeroki wachlarz sprzętu: układy GPU NVIDIA i AMD, procesory x86/ARM/PowerPC oraz wyspecjalizowane akceleratory.

Ekosystem deweloperskiEkosystem DeweloperskiZasoby wspierające programistów: dostępne biblioteki SDK, wspierane języki programowania oraz funkcje infrastrukturalne i metody wdrażania modeli.

Typ API
RESTgRPC
Społeczność i zasoby
Biblioteka szablonów
Szybki start
Dokumentacja API
Samouczki

ŹródłaArchiwum DokumentacjiScentralizowana baza linków do oficjalnych źródeł, instrukcji technicznych, repozytoriów oraz notatek wydawniczych (release notes).

Dane zweryfikowane: 28 sie 2026