Zagadnienie tego, w jaki sposób agent AI podejmuje kolejne decyzje, dotyczy samego serca jego architektury. U podstaw leży tak zwana pętla odbieranie–układanie planu–wykonywanie, w której program najpierw odbiera informacje z otoczenia, następnie rozkłada na czynniki dostępne możliwości, a wreszcie wykonuje wybraną akcję. Cały ten obieg powtarza się kilkakrotnie, aż do uzyskania zamierzonego efektu.
Sercem tego procesu jest model językowy, który odgrywa rolę własnego głosu doradczego agenta. To on odczytuje instrukcje użytkownika, dzieli złożone zadanie na drobniejsze podzadania i proponuje kolejność ich wykonania. Otoczenie modelu stanowią dodatkowe narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent wywołuje wtedy, gdy wymaga konkretnych danych spoza swojej pamięci treningowej.
Interesującym elementem architektury jest tak zwana pamięć robocza, w której agent trzyma kontekst bieżącego zadania. Dzięki niej nie traci nici nawet wtedy, gdy procedura rozkłada się na wiele etapów i wymaga przełączania między różnymi źródłami informacji. To dokładnie ta umiejętność wyróżnia agenta od prostego skryptu, który odtwarza jedynie z góry zapisaną listę poleceń.
Oddzielną kwestią pozostaje sposób ewaluacji własnych działań. Dobrze skonstruowany agent potrafi zidentyfikować, że otrzymany wynik nie zgadza się od oczekiwanego, i wrócić do poprzedniego etapu, by podjąć próbę innej ścieżki. Taka samokorekta zbliża działanie maszyny do ludzkiego nawyku weryfikowania własnej pracy przed jej złożeniem.