Kwestia tego, w jaki sposób agent AI podejmuje kolejne decyzje, sięga samego rdzenia jego architektury. U podstaw leży tak zwana pętla percepcja–planowanie–działanie, w której program najpierw odbiera informacje z otoczenia, następnie rozkłada na czynniki dostępne możliwości, a wreszcie realizuje wybraną akcję. Cały ten cykl powtarza się wielokrotnie, aż do uzyskania zamierzonego efektu.
Trzonem tego procesu jest model językowy, który odgrywa rolę własnego głosu doradczego agenta. To on odczytuje instrukcje użytkownika, dzieli złożone zadanie na mniejsze podzadania i proponuje kolejność ich wykonania. Otoczenie modelu stanowią pomocnicze narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent wywołuje wtedy, gdy wymaga konkretnych danych spoza swojej pamięci treningowej.
Interesującym elementem architektury jest tak zwana pamięć robocza, w której agent przechowuje tło bieżącego zadania. Dzięki niej nie gubi wątku nawet wtedy, gdy procedura rozciąga się na kilka etapów i wymaga przeskakiwania między różnymi źródłami informacji. To dokładnie ta umiejętność odróżnia agenta od podstawowego skryptu, który odtwarza jedynie wcześniej zapisaną listę poleceń.
Oddzielną kwestią pozostaje sposób ewaluacji własnych działań. Odpowiednio zbudowany agent jest w stanie rozpoznać, że otrzymany wynik nie zgadza się od zamierzonego, i wrócić do wcześniejszego etapu, by podjąć próbę alternatywnej ścieżki. Taka autokorekta przybliża działanie maszyny do ludzkiego zwyczaju weryfikowania własnej pracy przed jej oddaniem.