V kostce:

  • AAR zlepšil výkon na všech 10 benchmarcích bez úbytku celkového výkonu.
  • Nejlepší metoda AAR překonala lidské experty v průměru do 6 hodin.
  • Náklady AAR činí 4 USD/hodinu oproti 150 USD/hodinu u lidí.

Anthropic publikoval studii popisující systém Automated Alignment Researcher (AAR), který autonomně zlepšuje AI modely na deseti benchmarcích zaměřených na nesprávně sladěné chování. Výzkum vedený Anthropic Fellow Chen Yueh-Hanem ukázal, že automatizovaný systém dosahuje lepších výsledků než zkušení lidští výzkumníci již během šesti hodin a to za zlomek nákladů.

Systém v každé 30minutové iteraci vyhledává dostupnou literaturu, navrhuje metodu a trénuje model pomocí této metody. Efektivní přístupy si zachovává, neefektivní odstraňuje, což umožňuje rychlý a rozsáhlý provoz. Na všech deseti benchmarcích AAR zlepšil výkonnost bez jakékoli degradace celkového výkonu modelu.

Podle studie nejlepší metoda AAR překonala návrhy zkušených lidí v průměru do šesti hodin. „Lidsky vedené výzkumné směry nevedou k silnějšímu výkonu,“ uvádí text práce. Srovnání nákladů je také výrazné: AAR stojí přibližně 4 USD za hodinu API inference, zatímco lidští výzkumníci vyžadují 150 USD za hodinu.

Autoři upozorňují na několik omezení. Automatizovaný systém funguje pouze v míře, v jaké benchmarky odrážejí skutečné cíle zarovnání, a i tak zůstává významná práce na jejich zřizování a údržbě · nehledě na udržování a rozšiřování literatury, z níž automatizovaní výzkumníci čerpají.

Co to znamená: Automatizovaný výzkum zarovnání se stává prakticky využitelným, což urychlí odstraňování rizik AI modelů a sníží náklady na bezpečnostní audity. Firmy by měly sledovat dostupnost takových nástrojů pro vlastní red‑teaming a validaci modelů před nasazením.

Zdroje: