V kostce:
- Claude vede 26 % výzkumu a vývoje Anthropicu, plně autonomně neběží nic.
- Přes 90 % prací probíhá ve spolupráci s AI, před půlrokem to byl zlomek procenta.
- Firma slibuje metriky zveřejňovat pravidelně, aby tempo vývoje bylo vidět zvenčí.
Anthropic ve čtvrtek zveřejnil novou sadu měření, která ukazují, jak velkou část vývoje umělé inteligence už dělá umělá inteligence sama. Podle firemního blogu Claude vede 26 % výzkumných a vývojových prací společnosti, tedy dokáže většinu úkolu dokončit od začátku do konce na základě obecného zadání, zatímco člověk dohlíží. Plně autonomně, bez člověka ve smyčce, neběží žádná měřená část práce. Podíl prací, na kterých AI alespoň spolupracuje pod vedením člověka, přesahuje 90 %. Informovala o tom agentura Reuters.
Čísla vznikla novým indexem automatizace výzkumu. Anthropic sestavil zdola katalog přibližně 15 000 drobných úkolů z interních záznamů, každý týden v červenci náhodně vybral pětinu lidí z týmů kolem vývoje modelů a nechal agenta Claude sepsat, na čem pracovali. Nezávislý posuzovatel Claude pak každý úkol zařadil na šestistupňovou škálu automatizace AL0 až AL5 od neziskové organizace Epoch AI. Stupeň AL4 znamená, že AI vede, stupeň AL3 že spolupracuje. Shoda posuzovatele s lidskými experty byla 59 % přesně a 97 % v rámci jednoho stupně, což zhruba odpovídá shodě lidí mezi sebou.
Tempo je strmé. Zatímco na začátku roku se podíl pohyboval kolem jednoho procenta, do srpna vystoupal na 26 %. Anthropic zároveň popsal dohled nad agenty: v srpnu pracovalo na interní platformě přibližně 30 000 agentů, každá jejich akce prochází online kontrolou před provedením a offline kontrolou po něm. Z více než miliardy rozhodnutí za měsíc jich monitor zablokoval asi jedno ze 47 000, tedy 0,002 %. Přibližně 100 000 přepisů týdně míří k dalšímu posouzení a asi 50 nejzávažnějších případů týdně končí u člověka.
Třetí metrika sleduje výpočetní výkon. Ve vzorkovaném týdnu v červenci šlo na bezpečnostní práci asi 6 % výkonu určeného na výzkum a vývoj a asi 12 % výkonu, který spotřeboval výzkum řízený samotnou AI. Firma upozorňuje, že jde o konzervativní odhady, protože práci, která posouvá bezpečnost i schopnosti stejnou měrou, počítá mezi schopnosti.
Anthropic slibuje metriky zveřejňovat pravidelně a vyzývá ostatní laboratoře, aby dělaly totéž podle veřejné metodiky s ověřením nezávislou stranou. Měření má veřejnosti, expertům i vládám ukázat, jak rychle se AI podílí na stavbě své další generace, a případně posloužit jako podklad pro pravidla o testovacích oknech před nasazením nových modelů do dalšího výzkumu.
Co to znamená: Firmy, které staví na AI agentech, by měly počítat s tím, že dohled se stává samostatnou disciplínou s měřitelnými parametry: pokrytím kontrol, rychlostí posouzení a mírou eskalací. Při výběru dodavatele se ptejte, jak tyto metriky vypadají u něj, a u vlastních agentických nasazení zaveďte stejné tři ukazatele dřív, než počet agentů přeroste možnost ruční kontroly.
Zdroje: