Kwestia tego, w jaki sposób agent AI podejmuje kolejne decyzje, sięga samego serca jego architektury. U podstaw leży tak zwana pętla percepcja–planowanie–działanie, w której program najpierw odbiera informacje z otoczenia, następnie rozkłada na czynniki dostępne możliwości, a wreszcie realizuje wybraną akcję. Cały ten cykl powtarza się wielokrotnie, aż do uzyskania zamierzonego efektu.
Sercem tego procesu jest model językowy, który pełni rolę wewnętrznego głosu doradczego agenta. To on odczytuje instrukcje użytkownika, rozbija złożone zadanie na drobniejsze podzadania i proponuje kolejność ich realizacji. Otoczenie modelu stanowią pomocnicze narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent wywołuje wtedy, gdy potrzebuje konkretnych danych spoza swojej wiedzy treningowej.
Ciekawym elementem architektury jest tak zwana pamięć operacyjna, w której agent trzyma kontekst bieżącego zadania. Dzięki niej nie gubi wątku nawet wtedy, gdy procedura rozkłada się na kilka etapów i wymaga przeskakiwania między różnymi źródłami informacji. To dokładnie ta zdolność wyróżnia agenta od podstawowego skryptu, który odtwarza jedynie z góry zapisaną listę poleceń.
Osobną sprawą pozostaje mechanizm ewaluacji własnych działań. Dobrze zbudowany agent potrafi rozpoznać, że otrzymany wynik nie zgadza się od oczekiwanego, i wrócić do poprzedniego etapu, by spróbować alternatywnej ścieżki. Taka samokorekta przybliża działanie maszyny do ludzkiego zwyczaju weryfikowania własnej pracy przed jej oddaniem.