V kostce:
- 315 320 šifrovaných bloků analyzováno, 367 PII a 182 přihlašovacích údajů získáno
- Útok funguje u Anthropic, OpenAI a Google díky vyměnitelnosti bloků napříč modely
- Čtyři vektory: anti-distilace, masivní extrakce dat, nebezpečné uvažování, neviditelné prompt-injekce
Výzkumníci odhalili architektonickou zranitelnost u poskytovatelů velkých jazykových modelů, kteří vracejí klientům šifrované bloky krok‑po‑kroku (chain‑of‑thought). Tyto bloky jsou vzájemně kompatibilní napříč sezeními, uživateli i modely jednoho poskytovatele, což umožňuje dešifrovací jailbreak: vložením trace z výkonného modelu do slabšího modelu stejného dodavatele se získá plaintext bez prolomení silnějšího modelu. Útok byl demonstrován u Anthropic, OpenAI a Google.
Poskytovatelé modelů skrývají uvažování svých systémů, aby chránili duševní vlastnictví a omezili úniky informací. Místo uložení trace na serveru jej vrátí klientovi jako šifrovaný text, který klient posílá zpět s každým dalším požadavkem. Výzkumníci zjistili, že šifrované bloky jsou plně vyměnitelné napříč různými sezeními, uživateli a modely v ekosystému jednoho dodavatele. Tuto kompatibilitu zneužili k vytvoření škálovatelného dešifrovacího jailbreaku: vloží‑li útočník zašifrovaný trace z silného, dobře chráněného modelu do slabšího a méně chráněného modelu stejného poskytovatele, ten ho zdekóduje a vypíše v plaintextu, aniž by byl přímo prolomen silnější model.
Zranitelnost otevírá čtyři odlišné vektory útoku. První obchází anti‑distilační mechanismy a umožňuje extrakci proprietárního uvažování modelu, což bylo prokázáno u tří hlavních poskytovatelů. Druhý vektor vede k masivní extrakci soukromých dat: vývojáři často sdílejí logy sezení veřejně, aniž by věděli, že šifrované bloky obsahují citlivé informace. Při analýze 315 320 bloků získaných ze veřejných repozitářů výzkumníci obnovili 367 artefaktů osobně identifikovatelných informací (PII) a 182 přihlašovacích údajů. Třetí vektor odhaluje nebezpečné informace skryté v procesu uvažování, i když finální, viditelný výstup modelu bezpečně odmítne škodlivý požadavek. Čtvrtý umožňuje neviditelné prompt‑injekce vložené přímo do šifrovaných bloků, které mohou otrávit veřejné agentní nasazení.
Autoři po zodpovědném oznámení navrhují kryptografické a systémové mitigace pro zabezpečení klientských chain‑of‑thought dat. Mezi doporučení patří vazba šifrovaných bloků na konkrétní sezení a model, aby se zabránilo jejich přenositelnosti, a serverové uchovávání trace místo vrácení klientovi.
Co to znamená: Firmy využívající LLM API musí počítat s tím, že šifrované chain‑of‑thought bloky nejsou bezpečné kontejnery. Audity by měly ověřovat, zda poskytovatel vázal trace na konkrétní sezení a model, a zda nejsou logy se šifrovanými bloky nechtěně sdíleny ve veřejných repozitářích. Implementace vlastních kontrol integrity trace a monitorování anomálií v přenosu bloků mezi modely snižuje riziko odcizení PII, přihlašovacích údajů i proprietárního uvažování.
Zdroje: