PivotOPD od NVIDIA učí vícekrokové AI agenty napravovat klíčové chyby
Metoda PivotOPD učí vícekrokové AI agenty předcházet zásadním raným chybám a zotavit se z nich.
V kostce:
- PivotOPD porazil 13 metod na ALFWorld, WebShop a Search QA.
- Zotavil se ze 72,7 % zopakovaných klíčových chyb.
- Testován byl na studentských modelech Qwen3-1.7B a Qwen3-8B.
Výzkumníci z NVIDIA, Princeton University a University of Maryland představili metodu PivotOPD pro učení vícekrokových agentů s velkými jazykovými modely. Metoda založená na on-policy distillation učí agenta vyhnout se své nejzávažnější rané chybě a zotavit se, když k ní přesto dojde. Podle zdroje Marktechpost dosáhla nejlepšího průměru proti 13 základním metodám na testovacích sadách ALFWorld, WebShop a Search-based QA u studentů s modely Qwen3-1.7B a Qwen3-8B.
PivotOPD je trénovací metoda, nikoli model, a po tréninku nepřidává žádné náklady na inferenci. Trénink probíhal na uzlech s čipy H100 od společnosti NVIDIA, takže vycvičený agent běží všude, kde běží jeho základní model. Kód metody zatím nebyl zveřejněn; jeho vydání je podle zdroje připravováno.
Klíčovým pojmem metody je takzvaná pivotní chyba, tedy krok, který prodlužuje nejkratší zbývající cestu k dokončení úkolu, nebo činí úkol neřešitelným. V sadě ALFWorld ji měří symbolický oracle v každém kroku. Podle zdroje obsahovalo takovou chybu 59 % neúspěšných běhů, konkrétně 155 z 262, u modelů Qwen3-8B, Qwen3-30B-A3B a Qwen3-235B-A22B.
První pivotní chyba přicházela brzy, typicky v mediánu mezi 8. a 12. krokem z 30; po ní agenti promarnili dalších 18 až 21 kroků bez zotavení. Při opakování neúspěšných běhů modelu Qwen3-8B zvýšila oprava pivotního kroku úspěšnost z 8 % na 59 %. I ponechání chyby a vynucení správné akce v následujících dvou krocích vedlo k úspěšnosti 58 %, což ukazuje, že zotavení je možné a naučitelné.
Standardní on-policy distillation tuto slabinu podle zdroje téměř neřeší. Snížila sice celkovou míru selhání na ověřovacích datech ze 79 % na 56 %, ale podíl selhání po pivotním kroku klesl jen z 51 % na 49 %. Správná akce měla v pivotních krocích pravděpodobnost pod 1 %, takže ji několik vzorkovaných běhů zřídka zachytí. Podobnou slepou skvrnu má i učení z odměny za výsledek, kde je při samých neúspěšných bězích relativní výhoda nulová.
PivotOPD proto přidává ke skupinovému posilovanému učení tři prvky spojené v jediné aktualizaci PPO. Větší učitelský model zpětně čte průběh a výsledek, navrhuje kandidátní kroky a pojmenovává ideální akci, přičemž za pivotní se považuje krok, v němž se akce studenta liší. Podle zdroje se takto detekované pivoty shodují s oraclem v sadě ALFWorld do jednoho kroku v průměru v 77,8 % neúspěšných běhů.
Na detekci navazuje preventivní destilace s reverzní KL divergencí a destilace zotavení s dopřednou KL divergencí. Zmrazená kopie studenta, které je nápovědou předána ideální akce, přehodnocuje vlastní odpověď studenta a odtahuje ho od provedené chyby. Po každém pivotu učitel pojmenuje akci pro zotavení až na K kroků, nápovědou vedený vlastní učitel vytvoří odpovědi pro zotavení a student bez nápovědy se na nich učí. Učitel pojmenovává pouze akce, cíle na úrovni tokenů pocházejí z vlastní rozdělené distribuce studenta s nápovědou.
S menším studentem s modelem Qwen3-1.7B dosáhl PivotOPD v průměru 73,7 % na sadě ALFWorld, o 5,5 bodu více než metoda SDAR, a 44,5 % na Search-based QA, o 5,9 bodu více než metoda RLSD. Na sadě WebShop překonal metodu RLSD o 1,2 bodu ve skóre a o 14,1 bodu v úspěšnosti, kde dosáhl 76,6 %. S větším studentem s modelem Qwen3-8B dosáhl 93,0 % na ALFWorld, 47,4 % na Search-based QA a 81,9 % úspěšnosti na WebShopu s náskokem nejméně 1,8 bodu. I když byl učitelem samotný model Qwen3-8B, metoda zvítězila na všech třech sadách nejméně o 1,5 bodu, v průměru o 3,9 bodu.
Nejvýraznější je rozdíl ve schopnosti zotavení. Napříč 72 opakovanými pivotními chybami se PivotOPD zotavil v 72,7 % případů, zatímco základní model v 8,3 %, standardní OPD ve 20,3 % a varianta pouze s prevencí ve 45,8 %. Průměrně potřeboval 9,7 kroku k zotavení oproti optimálním 6,2 kroku. Na sadě SWE-Bench Verified se student postavený na modelu Nemotron-3.5-SFT vedený učitelem s modelem Nemotron-3-Super zlepšil z 62,8 % na 66,0 %, zatímco standardní OPD dosáhl 63,0 % a učitel 73,0 %.
Nevýhodou je závislost na prostředích umožňujících opakování a na učiteli, jehož pivoty se v 77,8 % shodují s oracle. Na sadě ALFWorld se studentem 1.7B na čtyřech GPU H100 činí dodatečné náklady tréninku proti GRPO 12,4 % při K = 1, ale 94,2 % při K = 2, protože pozdější kroky zotavení vyžadují opakování v prostředí. Zvolený rozpočet byl K = 2 na ALFWorld a K = 1 na WebShop a Search-based QA. Slabým místem zůstává výsledek 55,9 % na úlohách Look v ALFWorld s menším studentem proti 83,9 % u metody SOD.
Co to znamená: Pro firmy metoda ukazuje, že u vícekrokových agentů nestačí optimalizovat jen výslednou úspěšnost, ale je třeba cíleně trénovat prevenci a zotavení z raných chyb. Audit implementace by měl sledovat, jak často agent po chybě pokračuje bez nápravy, jak je trénink závislý na opakovatelném prostředí a zda dodatečné náklady tréninku odpovídají zisku v úspěšnosti a stabilitě běhů.
Zdroje:
