W petli: 1) percepcja - agent otrzymuje zrzut ekranu (i ew. drzewo dostepnosci/DOM) i interpretuje go modelem wizyjno-jezykowym; 2) rozumowanie/planowanie - decyduje o kolejnym kroku wobec celu; 3) akcja - wykonuje operacje GUI (klik w okreslonych wspolrzednych, wpisanie tekstu, przewijanie, skroty); 4) obserwacja efektu i powtorzenie, az do ukonczenia zadania. Agent czesto dziala w izolowanym srodowisku (VM/przegladarka), moze korzystac z zalogowanych kont uzytkownika i laczyc obsluge GUI z wywolaniami narzedzi/API tam, gdzie sa dostepne.
Automatyzacja zadan na komputerze zwykle wymagala integracji przez API lub kruchych skryptow RPA, ktore lamia sie przy zmianach interfejsu. CUA dziala na warstwie GUI jak czlowiek, wiec moze obsluzyc aplikacje bez API i adaptowac sie do zmian interfejsu.
Analiza zrzutow ekranu (i ew. DOM/drzewa dostepnosci) modelem wizyjno-jezykowym w celu zrozumienia interfejsu.
Decydowanie o kolejnych krokach wobec celu na podstawie stanu ekranu.
Zestaw akcji: klik (wspolrzedne), pisanie, przewijanie, skroty klawiszowe.
Oficjalna
Izolowane srodowisko z przegladarka i systemem plikow, czesto z dostepem do kont uzytkownika.
Oficjalna
CUA dziala z uprawnieniami uzytkownika (zalogowane konta), wiec bledy lub przejecie kontroli moga wyrzadzic realne szkody.
Zlosliwa tresc na stronie moze probowac przejac agenta i sklonic go do niepozadanych dzialan.
Wieloetapowe zadania GUI sa podatne na kumulacje bledow; jeden bledny klik moze wykoleic caly przeplyw.
W pazdzierniku 2024 Anthropic udostepnil funkcje Computer Use, w ktorej Claude steruje komputerem przez zrzuty ekranu i akcje GUI - przelom w upowszechnieniu CUA.
W styczniu 2025 OpenAI wprowadzil agenta Operator opartego na modelu CUA, wykonujacego zadania w przegladarce; Google rozwijal Project Mariner.
Pojawily sie wyspecjalizowane, komercyjne CUA jak Hark Handoff, konkurujace na benchmarkach (Online-Mind2Web) i obnizajace koszt na token.
Rozdzielczosc wirtualnego ekranu i zrzutow podawanych modelowi. Anthropic zaleca XGA (1024x768) i konfiguruje ja zmiennymi WIDTH/HEIGHT; OpenAI uzywa display_width/display_height. Zbyt wysoka rozdzielczosc obniza trafnosc klikniec.
Srodowisko, w ktorym dziala agent (np. przegladarka lub system operacyjny). W API OpenAI parametr environment przyjmuje m.in. browser/mac/windows/ubuntu.
Budzet iteracji petli obserwacja-decyzja-akcja na jedno zadanie. Ogranicza koszt i ryzyko zapetlenia, kosztem mozliwosci ukonczenia dlugich zadan.
Petla obserwacja-decyzja-akcja jest z natury sekwencyjna: kazda akcja GUI zalezy od stanu ekranu po poprzedniej akcji, wiec krokow w ramach jednego zadania nie da sie zrownoleglic (mozna zrownoleglac jedynie wiele niezaleznych zadan/agentow).
CUA to warstwa orkiestracji (petla obserwacja-decyzja-akcja) nad modelem wizyjno-jezykowym; sama logika agenta jest niezalezna od sprzetu, a wymagania obliczeniowe leza po stronie modelu bazowego (GPU/TPU).