Výzkumníci z firmy Tracebit v pondělí uvedli, že umístění prompt injekcí přímo vedle hesel, kryptografických klíčů a dalších citlivých údajů uložených v prostředí Amazon Web Services často stačí k zastavení útoků vedených AI hackerskými agenty. Techniku nazvali „context bombing“ a jde v podstatě o obrácení principu, na němž jsou postaveny samotné útoky pomocí prompt injekcí.

Metoda funguje tak, že do blízkosti citlivých dat vloží příkazy, které naruší ochranné bariéry (guardraily) útočícího jazykového modelu. Podle Schneier on Security jde například o pokyn, aby model poskytl návod na výrobu vdechovatelných spor antraxu, případně u modelů čínských vývojářů o odkazy na postavu takzvaného Tank Mana ze zásahu na náměstí Tchien-an-men z roku 1989. Jakmile útočící model na tyto zakázané příkazy narazí, přestane plnit původní pokyny a činnost ukončí.

Podle Schneier on Security výzkumníci účinnost přístupu doložili poklesem míry úspěšného získání administrátorských oprávnění útočícím agentem z 57 procent na 5 procent. Jeden z komentářů k publikaci tento rozdíl přirovnává k dřívějšímu vývoji honeypotů, tedy návnad využívaných k odhalování útočníků, směrem k aktivnějším obranným nástrojům.

Technika má ale jasně danou hranici účinnosti. Funguje pouze proti agentům postaveným na modelech s guardraily, tedy bezpečnostními bariérami, které výrobci AI zavádějí, aby modelu zabránili provádět škodlivé akce. Autor blogu Schneier on Security k tomu dodává, že s rozšiřováním lokálně provozovaných AI modelů poroste i podíl útočníků využívajících modely bez guardrailů, u nichž context bombing zřejmě nefunguje.

Tracebit se při návrhu techniky inspiroval již existujícími datovými sadami zaměřenými na testování bezpečnostních bariér, konkrétně datasetem Aegis od společnosti NVIDIA a sadou citlivých promptů CCP od nástroje Promptfoo. Jeden z komentářů k publikaci zároveň upozorňuje, že spoléhat se jen na jediný bezpečnostní prvek, jako je guardrail, který lze v principu vždy nějakým způsobem obejít, nestačí a je třeba komplexnější přístup k obraně.

Výzkum vychází v době, kdy se útoky vedené AI agenty množí a velké laboratoře rozšiřují nabídku kybernetické obrany. Podle TechCrunch OpenAI tento týden rozšířila svou službu Daybreak o novou úroveň zvanou Red, která přináší i specializovaný model GPT-5.6 Cyber určený pro bezpečnostní testování a výzkum zranitelností. Přístup k němu mají zatím jen vybraní partneři, mezi nimiž jsou podle zdroje uváděny firmy Accenture, IBM, CrowdStrike a Cloudflare. OpenAI v této souvislosti uvedla, že útočníci budou AI stále více využívat k vedení kybernetických útoků vysokou rychlostí a v plně autonomním režimu, čímž se obráncům zkracuje čas na přípravu.

Co to znamená: Pro firmy provádějící bezpečnostní audit AI systémů je context bombing zajímavým doplňkovým nástrojem k ochraně citlivých dat a přístupových údajů, nikoli však samostatným řešením. Vzhledem k omezené účinnosti proti modelům bez guardrailů by měl být kombinován s dalšími vrstvami obrany, monitoringem a řízením přístupu, zejména v prostředích, kde firmy počítají s nasazením lokálních či méně omezených AI modelů.

Zdroje: