Robocikowo>ROBOCIKOWO
Agenci

Context Engineering

2025AktywnyOpublikowano: 10 września 2026Aktualizacja: 10 września 2026Opublikowany
Dyscyplina doboru i utrzymywania optymalnego zestawu tokenów w oknie kontekstowym LLM podczas inferencji — następca prompt engineeringu dla agentów AI.
Kluczowa innowacja
Przeniesienie punktu ciężkości z formułowania pojedynczego promptu na ciągłe zarządzanie całą zawartością okna kontekstowego (instrukcje, narzędzia, historia, pobrane dane) jako ograniczonym zasobem podczas każdego cyklu inferencji agenta.
Kategoria
Agenci
Poziom abstrakcji
Paradygmat
Poziom operacji
Środowisko agentoweInferencjaOrkiestracja
Zastosowania
Agenci AI działający w długim horyzoncie czasowymAsystenci kodujący (coding agents)Systemy RAG i wyszukiwanie agentoweWieloetapowe przepływy agentów korzystających z narzędziZarządzanie pamięcią i historią konwersacji w chatbotachArchitektury wieloagentowe (agent koordynujący + sub-agenci)

Jak działa

Context engineering łączy kilka technik stosowanych w każdym cyklu inferencji: (1) system prompt na właściwej „wysokości” — dość konkretny, by sterować zachowaniem, i dość elastyczny, by zostawić modelowi heurystyki; (2) minimalny, jednoznaczny zestaw narzędzi zamiast rozdętych bibliotek; (3) różnorodne, kanoniczne przykłady few-shot zamiast wyliczania przypadków brzegowych; (4) just-in-time retrieval — agent utrzymuje lekkie identyfikatory (ścieżki, URL-e, zapytania) i ładuje dane dopiero w momencie potrzeby (progresywne ujawnianie); (5) compaction — streszczanie historii przed osiągnięciem limitu okna, z zachowaniem decyzji architektonicznych i nierozwiązanych wątków; (6) structured note-taking / pamięć poza oknem kontekstowym dla spójności w długim horyzoncie; (7) architektury sub-agentów o czystym kontekście, zwracających skondensowane podsumowania (zwykle 1000–2000 tokenów) do agenta koordynującego.

Rozwiązany problem

Rozwiązuje degradację jakości odpowiedzi agentów LLM wynikającą z przeładowanego, źle dobranego lub nieaktualnego kontekstu. W miarę wydłużania okna kontekstowego rośnie „context rot” i kwadratowy koszt uwagi (O(n²)), a model gubi istotne informacje; context engineering porządkuje, przycina i dynamicznie dostarcza tylko potrzebne tokeny.

Komponenty

Instrukcje systemoweUstala reguły i ramy działania agenta w każdym cyklu inferencji.

Trwałe instrukcje definiujące zachowanie agenta, sformułowane na właściwej „wysokości” — dość konkretne, by sterować, i dość ogólne, by zostawić modelowi heurystyki.

Oficjalna

Definicje narzędziUmożliwia agentowi działanie na świecie zewnętrznym bez zaśmiecania kontekstu.

Samowystarczalny, jednoznaczny zestaw narzędzi; należy unikać rozdętych zestawów o nakładających się funkcjach.

Oficjalna

Przykłady few-shotKalibruje format i styl odpowiedzi modelu.

Różnorodne, kanoniczne przykłady ilustrujące oczekiwane zachowanie, zamiast wyczerpującej listy przypadków brzegowych.

Oficjalna

Historia konwersacjiZapewnia ciągłość i pamięć krótkoterminową agenta.

Dotychczasowy przebieg interakcji, zarządzany strategiami kuracji (przycinanie, compaction) aby nie przekroczyć budżetu uwagi.

Dane pobierane dynamicznieDostarcza tylko potrzebne w danym momencie fakty (progresywne ujawnianie).

Informacje ładowane w czasie działania na podstawie lekkich identyfikatorów (ścieżki, URL-e, zapytania) zamiast wstępnego wgrywania całego kontekstu.

Oficjalna

Pamięć zewnętrzna i notatkiUtrzymuje wiedzę agenta ponad limit pojedynczego okna kontekstowego.

Trwałe notatki i stan zapisywane poza oknem kontekstowym, przywoływane w razie potrzeby dla spójności w długim horyzoncie.

Oficjalna

Implementacja

Pułapki implementacyjne
Context rotWysoka

Nadmierne wypełnianie okna kontekstowego pogarsza trafność przywoływania informacji przez model.

Rozwiązanie:Utrzymuj minimalny, wysokosygnałowy kontekst; stosuj compaction i just-in-time retrieval.
Rozdęty zestaw narzędziŚrednia

Zbyt wiele nakładających się narzędzi zwiększa liczbę tokenów i pomyłki w wyborze narzędzia.

Rozwiązanie:Ogranicz zestaw do samowystarczalnych, jednoznacznych narzędzi.
Zagubione w środku (lost-in-the-middle)Wysoka

Informacje umieszczone w środku długiego kontekstu są przywoływane rzadziej niż te na początku i końcu.

Rozwiązanie:Umieszczaj kluczowe informacje na krańcach kontekstu i skracaj balast.
Nieaktualny kontekst po compactionŚrednia

Agresywne streszczanie może usunąć szczegóły potrzebne później (np. nierozwiązane błędy, decyzje).

Rozwiązanie:Zachowuj decyzje architektoniczne i otwarte wątki; utrwalaj je w pamięci zewnętrznej.
Zatruwanie kontekstu (context poisoning)Wysoka

Wstrzyknięcie błędnych lub złośliwych treści do kontekstu utrwala je w kolejnych turach agenta.

Rozwiązanie:Waliduj i izoluj pobierane dane; ograniczaj zaufanie do treści zewnętrznych.

Ewolucja

Oryginalny paper · 2025 · Anthropic Engineering (blog), 29 września 2025 · Prithvi Rajasekaran
Effective context engineering for AI agents
Prithvi Rajasekaran, Ethan Dixon, Carly Ryan, Jeremy Hadfield
2020
Few-shot prompting w GPT-3

Umieszczanie przykładów w kontekście jako sposób sterowania modelem — wczesny prekursor kuracji kontekstu.

2022
Era prompt engineeringu (ChatGPT)

Nacisk na sformułowanie pojedynczego promptu; fundament, który context engineering później uogólnił.

2023
RAG i rozszerzanie kontekstu

Dynamiczne wstrzykiwanie pobranej wiedzy do kontekstu spopularyzowało zarządzanie zawartością okna.

2025
Sformalizowanie terminu „context engineering”
Punkt przełomowy

Termin spopularyzowany w połowie 2025 (Tobi Lütke, Andrej Karpathy), a LangChain opisał go w tekście „The rise of context engineering” (23 czerwca 2025).

2025
Przewodnik Anthropic dla agentów AI
Punkt przełomowy

Anthropic sformalizował praktyki (system prompt na właściwej wysokości, just-in-time retrieval, compaction, notatki, sub-agenci) w przewodniku z 29 września 2025.

Hiperparametry (konfigurowalne osie)

Budżet okna kontekstowegoKrytyczna

Docelowa liczba tokenów utrzymywana w kontekście; niższy budżet ogranicza context rot kosztem mniejszej ilości informacji.

8k–32k tokenówTypowy zakres dla agentów zadaniowych.
200k+ tokenówDuże okna wymagają silniejszej kuracji.
Strategia pobieraniaWysoka

Wybór między wstępnym wgraniem kontekstu a pobieraniem just-in-time.

just-in-timeŁadowanie danych na żądanie z lekkich identyfikatorów.
upfront (RAG)Wstępne pobranie i wstrzyknięcie fragmentów.
Próg compactionWysoka

Poziom wypełnienia okna, przy którym uruchamiane jest streszczanie historii.

~80% oknaCzęsty próg wyzwalania compaction.
Rozmiar zestawu narzędziŚrednia

Liczba i granularność narzędzi udostępnionych agentowi; zbyt duży zestaw powoduje bloat i błędy wyboru.

5–15 narzędziZwykle wystarczające dla agenta zadaniowego.
Liczba przykładów few-shotŚrednia

Ile kanonicznych przykładów umieścić w kontekście, by skalibrować zachowanie bez marnowania budżetu tokenów.

2–5 przykładówRóżnorodne, kanoniczne, nie brzegowe.
Strategia pamięciWysoka

Sposób utrwalania stanu i notatek poza oknem kontekstowym oraz reguły ich przywoływania.

structured note-takingNotatki zapisywane do pliku/pamięci zewnętrznej.
Liczba sub-agentówŚrednia

Ilu wyspecjalizowanych sub-agentów o czystym kontekście koordynuje agent nadrzędny.

1–N sub-agentówKażdy zwraca podsumowanie 1000–2000 tokenów.

Złożoność obliczeniowa

Złożoność czasowa: O(n² · d). Złożoność przestrzenna: O(n · d · L).

Wąskie gardło obliczeniowe

Uwaga po długim kontekście i pamięć KV-cache

Wraz z długością kontekstu rosną koszt uwagi (kwadratowo) i zajętość KV-cache (liniowo), co ogranicza efektywny „budżet uwagi” modelu.

Zależy od
Długość okna kontekstowegoLiczba warstw i głów uwagi

Paradygmat wykonania

Tryb główny
Warunkowy

Zawartość kontekstu jest dobierana warunkowo, zależnie od stanu zadania i zapytania.

Wzorzec aktywacji
Zależne od wejścia
Tryby dodatkowe
Rzadki
Mechanizm routingu

Agent decyduje w czasie działania, które dane załadować i które fragmenty historii zachować lub streścić, zamiast ładować wszystko z góry.

Równoległość

Poziom równoległości
Częściowo równoległy

Architektury sub-agentów zrównoleglają pracę, zwracając skondensowane podsumowania do agenta koordynującego.

Zakres
Inferencja
Ograniczenia
!Kuracja kontekstu odbywa się sekwencyjnie w kolejnych cyklach inferencji agenta, ale sub-agenci mogą pracować równolegle z izolowanym kontekstem.

Wymagania sprzętowe

Podstawowe

To praktyka projektowa na poziomie oprogramowania i orkiestracji, niezależna od konkretnego sprzętu.

Dobry fit

Ograniczanie długości kontekstu zmniejsza zajętość KV-cache i koszt uwagi na GPU podczas inferencji.