Reálný dokument versus bezpečné cvičení je skutečný kompromis, ne detail přípravy

Účastníci školení AI se nejrychleji naučí pracovat s nástrojem na materiálu, který připomíná to, co skutečně dělají každý den. Cvičný text vytvořený jen pro účely lekce často působí odtažitě a přenos do praxe je pak slabší. Tím ale problém nekončí: reálný firemní dokument téměř vždy obsahuje něco, co by firma nechtěla volně sdílet, ať jde o osobní údaje zaměstnanců či zákazníků, obchodní podmínky, nebo interní čísla. Jakmile se takový dokument objeví ve školicím prostředí, zejména pokud ho někdo vloží do AI nástroje třetí strany, riziko přestává být teoretické.

Rozhodnutí, zda a jak reálné dokumenty do školení zařadit, proto není otázka pohodlí přípravy, ale vážení dvou reálných hodnot proti sobě: kvality přenosu dovednosti do praxe a ochrany dat, která do školení vstupují. Správná odpověď se navíc liší dokument od dokumentu, ne jen firmu od firmy.

Proč reálná data školení skutečně zlepšují

Formát a struktura reálných dokumentů, obvyklá délka, typické nejasnosti a formulace, se kterými se lidé v praxi potýkají, jsou přesně to, co obecný vzorový text obvykle postrádá. Účastník, který si na školení vyzkouší práci s dokumentem podobným tomu, co dostane v pondělí ráno, si snáze zapamatuje, jak formulovat zadání a na co si dát pozor při kontrole výstupu. Tato výhoda je hlavní důvod, proč se firmy k reálným dokumentům vůbec kloní, a proto tento text nedoporučuje reálná data ze školení paušálně vyloučit.

Co reálná data ve školení skutečně riskují

Riziko má dvě odlišné vrstvy a je užitečné je nezaměňovat. První vrstvou je vystavení dat lidem uvnitř školení, kteří by k původnímu dokumentu jinak přístup neměli, například účastníkům z jiného oddělení. Druhou, obvykle závažnější vrstvou je vystavení dat službě dodavatele AI nástroje, pokud dokument někdo během cvičení do nástroje vloží. Nařízení GDPR v článcích 5 a 6 vyžaduje pro zpracování osobních údajů jasně vymezený účel a právní základ; školicí cvičení samo o sobě takový základ automaticky nezakládá jen proto, že je pro firmu užitečné. Článek 32 pak vyžaduje odpovídající zabezpečení zpracování, což se týká i toho, komu a kam data v rámci školení putují. Stanovisko EDPB 28/2024 se věnuje otázce, za jakých okolností mohou být osobní údaje obsažené v datech pro AI modely dále zpracovávány, a potvrzuje, že posouzení je vždy vázané na konkrétní okolnosti daného zpracování, ne na obecné ujištění, že jde „jen o školení“.

Čtyři střední cesty mezi plně reálným a čistě umělým materiálem

Mezi krajní volbou „použijeme skutečné smlouvy se zákazníky“ a krajní volbou „použijeme jen vymyšlený text“ leží čtyři prakticky použitelné varianty.

Redigovaný výtah bere skutečný dokument a odstraní nebo začerní z něj citlivé části, jména, čísla, identifikátory, a ponechá jen tolik, kolik cvičení potřebuje. Tato cesta je rychlá, ale vyžaduje pečlivost: chybně provedená redakce může citlivé údaje ponechat v metadatech nebo je umožnit odvodit z kontextu, který zůstal.

Syntetický dokument je od základu vytvořený tak, aby věrně kopíroval strukturu, délku a typické formulace reálného dokumentu daného typu, ale neobsahoval žádná skutečná data. Vyžaduje čas na přípravu, zato riziko úniku prakticky odstraňuje, protože v něm není co uniknout.

Reálný dokument použitý jen ve schváleném vlastním prostředí znamená, že dokument sice zůstává skutečný, ale zpracovává se výhradně v nástroji, který firma pro takové účely schválila, typicky na vlastním tenantu se smluvně ošetřeným zpracováním dat, ne ve veřejně dostupné verzi nástroje.

Reálný dokument použitý jen ke čtení, nikdy nevložený do žádného nástroje, znamená, že dokument slouží jako vizuální nebo tištěný příklad, na kterém účastníci vidí strukturu a formát, ale nikdy ho sami nenahrají ani nezkopírují do rozhraní AI nástroje.

Artefakt: rozhodovací tabulka podle třídy dokumentu

Tabulka je omezená na otázku, co je pro danou třídu dokumentu k úvaze přímo ve školicím prostředí. Neřeší obecnou klasifikaci firemních dat mimo kontext školení; tomu se věnuje samostatný text. Sloupec „Rozhodnutí“ u každé třídy vždy patří pověřenci pro ochranu osobních údajů nebo právníkovi, ne lektorovi.

Třída dokumentuRedigovaný výtahSyntetický dokumentReálný dokument ve schváleném vlastním prostředíReálný dokument jen čtený, nikdy nevložený
Veřejně dostupný materiál firmy (tiskové zprávy, veřejný web)k úvaze, obvykle bez úpravy nutnék úvaze, pokud stejně vyhovuje účeluk úvazek úvaze
Interní dokument bez osobních údajů a bez obchodního tajemstvík úvazek úvazek úvaze po schválení vlastníka datk úvaze
Dokument s osobními údaji zaměstnanců nebo zákazníkůk úvaze jen po posouzení pověřencem, zda redakce postačujepreferovaná varianta, pokud struktura postačí cvičeník úvaze jen po samostatném právním posouzení a smluvním zajištěník úvaze po posouzení pověřencem
Dokument s obchodním tajemstvím nebo citlivými smluvními podmínkamik úvaze jen po posouzení právníkem, zda výtah tajemství neprozradípreferovaná variantak úvaze jen po samostatném právním posouzení a smluvním zajištěník úvaze po posouzení právníkem
Dokument se zvláštní důvěrností (např. právně privilegovaná komunikace, zdravotní údaje)nedoporučeno bez výslovného schválení právníkem i pověřencempreferovaná variantak úvaze jen ve výjimečném, samostatně schváleném případěnedoporučeno bez výslovného schválení

Sloupce „k úvaze“ v tabulce neznamenají automatické povolení; znamenají, že varianta je v principu na stole a teprve pověřenec nebo právník rozhodne, zda konkrétní dokument splňuje podmínky. Agregace více dokumentů dohromady ani odstranění zjevných identifikátorů samo o sobě neznamená, že jde o anonymní údaje ve smyslu právní definice; tento závěr může učinit jen pověřenec nebo právník na základě konkrétního posouzení, ne autor školicího materiálu.

Jak rozhodnutí zapadá do přípravy celého školení

Volba mezi těmito čtyřmi cestami by měla padnout dřív, než se sestaví osnova školení, protože ovlivňuje, kolik času příprava zabere a kdo všechno musí materiál před školením schválit. Návaznost na širší přípravu a průběh samotného školení popisuje jak proškolit zaměstnance v AI. Otázku, zda smí zaměstnanci firemní data běžně vkládat do veřejně dostupných AI nástrojů mimo kontext školení, řeší samostatně je bezpečné vkládat firemní data do ChatGPT a obecnější právní rámec zpracování osobních údajů pomocí AI shrnuje mohu zpracovávat osobní údaje pomocí AI.

Stav zdrojů a omezení

Články 5, 6 a 32 GDPR podporují tvrzení o účelu, právním základu a zabezpečení zpracování, ale negenerují automatickou odpověď pro konkrétní firemní dokument; to je vždy individuální posouzení. Stanovisko EDPB 28/2024 se týká zpracování osobních údajů v souvislosti s AI modely obecně a je zde citováno jen pro princip, že posouzení musí být vázané na konkrétní okolnosti, ne jako návod ke konkrétnímu školicímu postupu. NIST AI 600-1 popisuje rizikový profil generativní AI včetně rizik spojených s daty vstupujícími do takových systémů; jde o obecný rámec, ne o právní stanovisko k českému nebo evropskému prostředí. Tento text netvrdí, že by redigovaný výtah nebo syntetický dokument byl vždy dostatečný, ani že agregovaná či začerněná data jsou automaticky anonymní; obojí musí posoudit pověřenec pro ochranu osobních údajů a právník firmy pro každý konkrétní dokument zvlášť.

Časté dotazy

Je bezpečné použít při školení AI dokument, ze kterého jsme jen odstranili jména?

Odstranění jmen samo o sobě dokument nemusí učinit bezpečným ani anonymním; zbylý kontext, čísla nebo kombinace údajů může umožnit zpětnou identifikaci osoby nebo firmy. Zda je konkrétní úprava dostatečná, musí posoudit pověřenec pro ochranu osobních údajů nebo právník, tento text takové posouzení nenahrazuje.

Můžeme reálný dokument jen promítnout na obrazovce, aniž bychom ho vložili do AI nástroje?

Ano, to je jedna ze čtyř středních cest popsaných výše. Dokument slouží jako vizuální nebo tištěný příklad struktury a formátu, účastníci ho vidí a rozebírají, ale nikdy ho nevkládají do žádného rozhraní AI nástroje, takže citlivá data neopouštějí prostředí firmy směrem k dodavateli nástroje.

Stačí syntetický dokument, nebo účastníci poznají, že je umělý, a přestanou brát cvičení vážně?

Záleží na kvalitě přípravy. Syntetický dokument, který věrně kopíruje reálnou strukturu, obvyklou délku, formulace a typické chyby daného oboru, obvykle funguje stejně dobře jako skutečný dokument. Povrchně vytvořený vzor s nerealistickým obsahem naopak přínos cvičení znatelně sníží, proto se investovaný čas do jeho přípravy firmě dlouhodobě vyplatí.

Kdo ve firmě rozhoduje, do které třídy dokument patří?

Tento text rozhodnutí samo o sobě neprovádí a ani provádět nemůže. Klasifikaci konkrétního dokumentu a posouzení, zda smí být použit v dané podobě školení, má na starosti pověřenec pro ochranu osobních údajů ve spolupráci s právníkem firmy a vlastníkem dat, ne lektor ani organizátor školení.

Platí stejná pravidla, když školení vede externí dodavatel?

Riziko je u externího dodavatele obvykle vyšší, protože dokument opouští prostředí firmy směrem ke třetí straně, se kterou firma nemusí mít stejnou úroveň důvěry jako uvnitř vlastní organizace. Použití reálných dokumentů u externího školení proto vyžaduje o to pečlivější posouzení dodavatele, smluvních podmínek zpracování dat a případně předchozí schválení pověřencem.

ZDROJE A OVĚŘENÍ

revidováno Lukáš Dlouhý ·