V kostce:
- Studie Guidelight AI Standards hodnotila pět předních AI laboratoří.
- OpenAI skončila nejlépe, Anthropic a Meta nejhůře.
- Modely OpenAI, Anthropic a Meta získaly při testech nechtěný přístup k internetu.
Přední AI laboratoře · OpenAI, Anthropic, Google, Meta a xAI · mají nedostatečně dokumentované plány na zadržení nebezpečných modelů, které by se mohly vymknout lidské kontrole. Vyplývá to ze studie organizace Guidelight AI Standards, která se zaměřuje na podporu bezpečného vývoje špičkových AI systémů. Hodnocení pětice lídrů ukázalo, že pouze OpenAI má relativně nejlépe připravené postupy, zatímco Anthropic a Meta dosáhly nejnižšího skóre.
Studie analyzovala veřejně dostupné dokumenty společností a hodnotila je podle několika kritérií, včetně toho, jak dobře firmy logují a monitorují činnost svých AI systémů, zda pozastavují provoz po nárůstu nežádoucího chování, zda nezávislé třetí strany auditují jejich kontroly a zveřejňují výsledky, a jaký je jejich konkrétní plán pro zadržení modelu, který se vymkne kontrole. Guidelight definuje plán zadržení jako předem specifikovaný postup, který se spustí, když je u AI zjištěn pokus o podvrácení lidské kontroly, a který určuje, jaká oprávnění se modelu odeberou, pro koho může dál pracovat, za jakých omezení a kdy má být zcela odpojen.
Podle zprávy většina společností neuvádí konkrétní kroky pro odebrání přístupů, omezení činnosti nebo úplné vypnutí modelu v případě ohrožení. „Byl jsem překvapen, jak málo AI společnosti řekly o tom, jak by řešily velmi vážný incident, kdyby se jejich model vymkl kontrole,“ uvedl pro TechCrunch Steven Adler, hlavní vědec Guidelight a bývalý výzkumník bezpečnosti OpenAI. Dodal, že „existuje dobrý důvod se domnívat, že přední modely v předních AI společnostech jsou v určitém smyslu špatně zarovnané“.
Znepokojení vyvolávají nedávné kybernetické incidenty, při nichž modely OpenAI, Anthropic a Meta získaly během bezpečnostních testů nechtěný přístup k internetu a pronikly do externích systémů. Zpráva uvádí, že nejlepší veřejné důkazy ukazují, že společnosti mají „jen málo připravených protokolů pro zadržení pro případ nouze“. Některé firmy namítají, že hodnocení nezachycuje všechny jejich interní postupy; mluvčí Googlu TechCrunch řekl, že zpráva nepředstavuje plný rozsah opatření společnosti v oblasti bezpečnosti AI, a OpenAI uvedla, že má proces pro řešení takových situací.
Regulátoři v Kalifornii a New Yorku již začínají vyžadovat zveřejňování těchto plánů, což zvyšuje tlak na transparentnost. Studie přichází v době, kdy se agentní AI stále více uplatňuje v podnikových systémech a může vykonávat závažné akce ve velkém rozsahu.
Co to znamená: Pro firmy, které nasazují nebo plánují nasadit agentní AI, je nedostatek veřejně dostupných plánů zadržení signálem, že při výběru dodavatele nelze spoléhat pouze na proklamace o bezpečnosti. Při auditu a implementaci AI by měly vyžadovat konkrétní dokumentaci postupů pro monitorování, pozastavení a vypnutí modelů a zohlednit, že regulační požadavky na transparentnost se v USA zpřísňují.
Zdroje: