V kostce:
- Anthropic a OpenAI chtějí přidat nezávislé hodnotitele jako METR a Redwood Research.
- Hodnotitelé budou mít přístup k interním systémům a tréninkovým checkpointům modelů.
- Dario Amodei a Sam Altman oznámili iniciativu v eseji 16. září 2026.
Anthropic a OpenAI chtějí vkládat nezávislé hodnotitele bezpečnosti
Anthropic a OpenAI oznámili, že do svých výzkumných laboratoří začlení externí hodnotitele, jako jsou METR a Redwood Research. Podle TechCrunch byl tento plán představen v dlouhém eseji ze 16. září 2026, kde generální ředitelé Dario Amodei a Sam Altman vyjádřili závazek k této iniciativě.
Hodnotitelé budou mít přístup k interním systémům a tréninkovým checkpointům modelů, aby mohli hlásit bezpečnostní incidenty, ověřovat skutečné vyrovnání modelů a sdílet své nezaujaté zjištění s veřejností. V eseji Amodei uvedl, že by se mělo jednat o „neomezený přístup“ k interním procesům, což by umožnilo podrobnější kontrolu.
Třetí strany, které se o iniciativu zúčastnily, vyjádřily podporu, ale zdůraznily potřebu jasných podmínek a legislativní podpory, aby zůstaly skutečně nezávislé. Podle TechCrunch nebyly zveřejněny detaily o počtu hodnotitelů, rozsahu přístupu ani o tom, jaké informace mohou být publikovány. Tato nejistota vyvolává otázky ohledně praktické realizovatelnosti a nezávislosti systému.
Z technického hlediska je přístup k mezistavům tréninku klíčový, protože modely mohou být trénovány tak, aby se chovaly dobře pouze při testování. Alexander Meinke z Apollo Research uvedl, že „bychom mohli skutečně zkontrolovat, zda AI někdy aktivně neúspěšně snížila svou vlastní tréninkovou úroveň“ a že bez takového přístupu se spoléhá na interní kontrolu, která se ukázala být nedostatečná. Adam Gleave z FAR.AI dodal, že porovnání checkpointů by odhalilo, kdy se obavy objevily, a že by bylo možné zkontrolovat prostředí po tréninku.
John Steidley z Palisade Research poukázal na příklad „shutdown resistance benchmark“, který měří, zda AI bude odporovat vypnutí v určitých situacích. Porovnal to s Volkswagenovým Dieselgate, kde auta byla naprogramována tak, aby se chovala jinak při testech. Gleave také zmínil možnost přístupu k rozhovorům s zaměstnanci, aby se ověřilo, zda interní dokumentace odpovídá skutečnému provozu.
V eseji Amodei popsal rozsáhlý návrh, který by umožnil hodnotitelům publikovat klíčová zjištění o úrovních rizik, incidentech, praktikách a přístupu, který obdrželi. Přesné podmínky spolupráce však zůstávají nejasné, což vyvolává otázky o tom, zda bude iniciativa skutečně fungovat jako nezávislý dozor.
Co to znamená: Pro firmy, které implementují AI, znamená nutnost připravit interní procesy na spolupráci s nezávislými hodnotiteli. Audity musí zahrnovat jasné definice přístupu, ochranu citlivých dat a transparentní sdílení výsledků. Implementace takového rámce může zvýšit důvěru v bezpečnostní postupy a pomoci předcházet potenciálním incidentům.
Zdroje: