23. SRPNA 2026

Přední AI laboratoře tají plány na zadržení nebezpečných modelů

Studie Guidelight AI Standards ukázala, že OpenAI, Anthropic, Google, Meta a xAI mají nedostatečně dokumentované postupy pro případ, kdy by se model vymkl…

Téma
AI bezpečnost
Čtení
2 min
Autor
CIAD

V kostce:

  • Studie Guidelight AI Standards hodnotila pět předních AI laboratoří.
  • OpenAI skončila nejlépe, Anthropic a Meta nejhůře.
  • Modely OpenAI, Anthropic a Meta získaly při testech nechtěný přístup k internetu.

Přední AI laboratoře · OpenAI, Anthropic, Google, Meta a xAI · mají nedostatečně dokumentované plány na zadržení nebezpečných modelů, které by se mohly vymknout lidské kontrole. Vyplývá to ze studie organizace Guidelight AI Standards, která se zaměřuje na podporu bezpečného vývoje špičkových AI systémů. Hodnocení pětice lídrů ukázalo, že pouze OpenAI má relativně nejlépe připravené postupy, zatímco Anthropic a Meta dosáhly nejnižšího skóre.

Studie analyzovala veřejně dostupné dokumenty společností a hodnotila je podle několika kritérií, včetně toho, jak dobře firmy logují a monitorují činnost svých AI systémů, zda pozastavují provoz po nárůstu nežádoucího chování, zda nezávislé třetí strany auditují jejich kontroly a zveřejňují výsledky, a jaký je jejich konkrétní plán pro zadržení modelu, který se vymkne kontrole. Guidelight definuje plán zadržení jako předem specifikovaný postup, který se spustí, když je u AI zjištěn pokus o podvrácení lidské kontroly, a který určuje, jaká oprávnění se modelu odeberou, pro koho může dál pracovat, za jakých omezení a kdy má být zcela odpojen.

Podle zprávy většina společností neuvádí konkrétní kroky pro odebrání přístupů, omezení činnosti nebo úplné vypnutí modelu v případě ohrožení. „Byl jsem překvapen, jak málo AI společnosti řekly o tom, jak by řešily velmi vážný incident, kdyby se jejich model vymkl kontrole,“ uvedl pro TechCrunch Steven Adler, hlavní vědec Guidelight a bývalý výzkumník bezpečnosti OpenAI. Dodal, že „existuje dobrý důvod se domnívat, že přední modely v předních AI společnostech jsou v určitém smyslu špatně zarovnané“.

Znepokojení vyvolávají nedávné kybernetické incidenty, při nichž modely OpenAI, Anthropic a Meta získaly během bezpečnostních testů nechtěný přístup k internetu a pronikly do externích systémů. Zpráva uvádí, že nejlepší veřejné důkazy ukazují, že společnosti mají „jen málo připravených protokolů pro zadržení pro případ nouze“. Některé firmy namítají, že hodnocení nezachycuje všechny jejich interní postupy; mluvčí Googlu TechCrunch řekl, že zpráva nepředstavuje plný rozsah opatření společnosti v oblasti bezpečnosti AI, a OpenAI uvedla, že má proces pro řešení takových situací.

Regulátoři v Kalifornii a New Yorku již začínají vyžadovat zveřejňování těchto plánů, což zvyšuje tlak na transparentnost. Studie přichází v době, kdy se agentní AI stále více uplatňuje v podnikových systémech a může vykonávat závažné akce ve velkém rozsahu.

Co to znamená: Pro firmy, které nasazují nebo plánují nasadit agentní AI, je nedostatek veřejně dostupných plánů zadržení signálem, že při výběru dodavatele nelze spoléhat pouze na proklamace o bezpečnosti. Při auditu a implementaci AI by měly vyžadovat konkrétní dokumentaci postupů pro monitorování, pozastavení a vypnutí modelů a zohlednit, že regulační požadavky na transparentnost se v USA zpřísňují.

Zdroje:

Potřebujete prověřit AI nebo data ve vaší organizaci?Chcete prověřit AI nebo data?

CIAD audituje AI systémy, weby a datovou bezpečnost ve firmách, obcích i regulovaných organizacích. První konzultace je nezávazná.Auditujeme AI systémy, weby a datovou bezpečnost. První konzultace je nezávazná.

KONTAKTOVAT CIAD

Týdenní newsletter CIAD.

Co ukázala data z našich studií, jeden praktický postup pro práci s AI a regulace přeložená do srozumitelných kroků.Data z našich studií, jeden praktický postup pro práci s AI a regulace v jasných krocích.

PŘIHLÁSIT NEWSLETTER