Kwestia tego, w jaki sposób agent AI podejmuje kolejne decyzje, sięga samego rdzenia jego architektury. U podstaw leży tak zwana pętla percepcja–planowanie–działanie, w której program najpierw rejestruje informacje z otoczenia, następnie analizuje dostępne możliwości, a wreszcie wykonuje wybraną akcję. Cały ten obieg powtarza się wielokrotnie, aż do uzyskania zamierzonego efektu.
Sercem tego procesu jest model językowy, który pełni rolę własnego głosu doradczego agenta. To on interpretuje polecenia użytkownika, dzieli złożone zadanie na drobniejsze podzadania i sugeruje kolejność ich wykonania. Otoczenie modelu stanowią dodatkowe narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent wywołuje wtedy, gdy potrzebuje konkretnych danych spoza swojej wiedzy treningowej.
Interesującym elementem architektury jest tak zwana pamięć operacyjna, w której agent trzyma kontekst bieżącego zadania. Dzięki niej nie gubi wątku nawet wtedy, gdy proces rozciąga się na wiele etapów i wymaga przełączania między różnymi źródłami informacji. To właśnie ta zdolność odróżnia agenta od prostego skryptu, który wykonuje jedynie z góry zapisaną listę poleceń.
Osobną sprawą pozostaje sposób oceny własnych działań. Dobrze zbudowany agent potrafi zidentyfikować, że otrzymany wynik odbiega od zamierzonego, i cofnąć się do poprzedniego etapu, by podjąć próbę alternatywnej ścieżki. Taka autokorekta przybliża działanie maszyny do ludzkiego nawyku weryfikowania własnej pracy przed jej oddaniem.