Proč se připravenost dat posuzuje po jednotlivých oblastech

Otázka, zda jsou firemní data “připravená pro AI”, se dá zodpovědět jen rozložením na konkrétní oblasti, protože jednotlivé části bývají v různém stavu současně. Datový soubor může být technicky čistý a strukturovaný, a přesto se nesmí pro daný účel použít, dokud to neposoudí právník nebo pověřenec pro ochranu osobních údajů. Jiný soubor může být z právního pohledu v pořádku, ale prakticky nepoužitelný, protože leží rozesetý ve stovkách e-mailových příloh.

Rozhoduje se tím, zda se projekt může posunout k technické přípravě, zda je potřeba nejdřív opravit konkrétní oblast dat, nebo zda se má úkol přeformulovat na menší rozsah, pro který data skutečně existují.

Osm oblastí, které rozhodují o použitelnosti dat

Posouzení pokrývá osm oblastí. Čtyři se týkají technického stavu dat: zda jsou dohledatelná na jednom místě, zda jsou strojově čitelná, zda jsou dostatečně úplná pro konkrétní úkol a zda jsou aktuální. Dvě se týkají správy: kdo data vlastní a jak jsou klasifikovaná podle citlivosti. Jedna se týká práva data pro tento účel použít. Poslední ověřuje praktickou stránku pilota: zda lze vytáhnout testovací vzorek, aniž by se sáhlo přímo do provozních systémů.

Definice “dostatečné úplnosti” se navíc liší podle typu projektu. Projekt, který vyhledává odpovědi v dokumentech a kombinuje je s jazykovým modelem, klade na strukturu a úplnost textu jiné nároky než projekt, který jen kategorizuje krátké záznamy; princip vyhledávání propojeného s modelem vysvětluje co je RAG.

Následující tabulka popisuje pro každou oblast tři stavy a ke každému stavu konkrétní další krok. Cílem není počítat skóre ani celkovou známku. Jednotlivé oblasti se často vyvíjejí nezávisle na sobě a jedna slabá oblast nemusí zablokovat celý projekt, pokud se úkol podle ní přiměřeně upraví.

Posouzení podle oblastí a stavů

OblastPřipravenoČástečně připravenoNepřipraveno
Dohledatelnost a jedno místoData jsou v jednom známém systému, přístup je zdokumentovaný. Pokračuje se k technické přípravě.Data existují, ale jsou rozeseta po více systémech, exportech a přílohách. Nejdřív se sepíše úplný seznam zdrojů.Nikdo přesně neví, kde všechna potřebná data leží, nebo žijí jen v osobních schránkách. Zahájí se průzkum, kde data fyzicky jsou.
Strojová čitelnostData jsou ve strukturovaném formátu zpracovatelném bez ručního přepisu.Data jsou digitální, ale nekonzistentní: naskenované dokumenty, volný text, mix formátů. Ověří se míra chyb na nejhorším vzorku formátu.Data existují převážně na papíře nebo jako obrázky bez čitelného textu. Digitalizace se řeší jako samostatný krok před pilotem.
Úplnost pro daný úkolPole potřebná pro úkol jsou vyplněná, mezery jsou výjimkou.Důležitá pole často chybí nebo jsou vyplněná nekonzistentně. Změří se míra vyplněnosti na vzorku.Data, která úkol skutečně potřebuje, se v současném procesu vůbec nesbírají. Řeší se úprava zdrojového procesu.
AktuálnostData odpovídají současnému stavu a aktualizují se podle známého harmonogramu.Aktualizace se opožďuje nebo její interval nikdo nezná. Interval se dohledá a ověří na vzorku.Data jsou prokazatelně zastaralá nebo jejich stáří nikdo neumí určit. Určí se vlastník, který stav napraví.
Jasné vlastnictvíJmenovaná role může schválit přístup i změny.Vlastnictví je sdílené mezi odděleními a schvalování je nejasné. Určí se jeden odpovědný vlastník pro účely projektu.K datům se nikdo nehlásí, nebo původní vlastník odešel a systém je osiřelý. Vlastnictví se přiřadí dřív, než se k datům přistoupí.
Klasifikace citlivostiKlasifikace (veřejné, interní, důvěrné, osobní údaje) je zdokumentovaná podle interní politiky.Klasifikace existuje jen pro část dat nebo se uplatňuje nedůsledně. Doplní se na celý použitý soubor.Klasifikace neexistuje a nikdo neposoudil obsah datového souboru. Posouzení obsahu se zadá dřív, než se rozhoduje dál.
Právo použít data pro tento účelPrávník nebo pověřenec pro ochranu osobních údajů použití pro tento konkrétní účel posoudil a schválil.Posouzení je zahájené, závěr zatím chybí. Projekt čeká na vyjádření, než se s daty pracuje.Posouzení nezačalo. Zadá se právníkovi nebo pověřenci dřív, než se s daty jakkoli pracuje.
Testovací vzorekReprezentativní vzorek lze exportovat bez zásahu do provozu.Vzorek lze získat, ale vyžaduje ruční práci nebo zvláštní oprávnění. Zajistí se přístup a otestuje se export malého vzorku.Neexistuje způsob, jak vzorek získat bez přímého zásahu do produkčních dat. Mechanismus exportu se navrhne jako první krok.

Právo použít data pro AI projekt patří právníkovi a pověřenci pro ochranu osobních údajů

Tento text neposuzuje, zda je konkrétní použití dat v souladu s GDPR, ani zda jsou po úpravě anonymní. Taková posouzení závisí na účelu zpracování, právním základu, kategorii údajů a nastavení konkrétního AI nástroje. Patří k pověřenci pro ochranu osobních údajů nebo k firemnímu právníkovi, nikoli k technickému nebo obchodnímu vlastníkovi projektu.

Tabulka výše proto u oblasti práva na použití nerozlišuje kvalitu dat. Rozlišuje stav posouzení: proběhlo, probíhá, nebo ještě nezačalo. Formálně strukturovaná a aktuální data se pro AI projekt nepoužijí dřív, než toto posouzení dopadne kladně.

Obecný rámec, jak spolu GDPR a AI souvisejí, shrnuje GDPR a umělá inteligence. Otázku, zda a za jakých podmínek lze osobní údaje s AI vůbec zpracovávat, řeší můžu zpracovávat osobní údaje pomocí AI.

Co dělat s výsledkem posouzení

Posouzení není jednorázová bariéra před projektem. Je podklad pro rozhodnutí o rozsahu. Pokud většina oblastí vychází jako připravená a jen jedna vychází jako částečně připravená, dává smysl začít malým pilotem na části dat, kde problém není, a zbytek řešit souběžně. Pokud je nepřipravených oblastí víc, zejména pokud chybí jasné vlastnictví nebo klasifikace citlivosti, má přednost oprava těchto základů před jakýmkoli technickým krokem.

Zvlášť opatrně se přistupuje k situaci, kdy jsou technické oblasti, tedy čitelnost, úplnost a aktuálnost, připravené, ale právní posouzení ještě neproběhlo. Snadná dostupnost dat svádí k tomu začít technickou přípravu hned a právní posouzení dohnat později. Pořadí kroků ale funguje opačně: dokud posouzení práva na použití neproběhne, technická příprava s reálnými daty by se neměla rozjíždět.

Otázky zabezpečení přístupu k datům během pilotu, mimo obsah tohoto posouzení, řeší jak zabezpečit AI ve firmě.

Stav zdrojů a omezení

GDPR je citováno konkrétně k článkům 5 a 6, které upravují účel zpracování a právní základ. Text z nich přebírá jen obecný požadavek. Nehodnotí soulad žádného konkrétního datového souboru s těmito články. Stanovisko EDPB 28/2024 popisuje vztah AI modelů a osobních údajů na evropské úrovni. Nenahrazuje posouzení konkrétního případu pověřencem pro ochranu osobních údajů. Rámec NIST AI RMF je dobrovolný a americký a posloužil jen jako obecná inspirace pro rozdělení oblastí Map a Measure. Nejde o závaznou strukturu tohoto kontrolního seznamu ani o certifikační normu. Osm oblastí a tři stavy jsou doporučení CIAD sestavené z běžné praxe datových projektů. Nejde o výčet zákonných povinností ani o náhradu právního posouzení.

Časté dotazy

Musí být všech osm oblastí připravených, než se AI projekt spustí?

Ne nutně naráz. Pokud je většina oblastí připravená a jen jedna vychází jako částečně připravená, často stačí pilot omezit na část dat, kde problém není, a zbytek řešit souběžně. Pokud chybí jasné vlastnictví nebo klasifikace citlivosti u víc oblastí najednou, dává smysl tyto základy opravit dřív, než začne cokoli technického.

Kdo má posouzení připravenosti dat provést?

Technickou a organizační část, tedy dohledatelnost, čitelnost, úplnost, aktuálnost, vlastnictví a klasifikaci, obvykle vede vlastník dat nebo IT ve spolupráci s vlastníkem projektu. Právo použít data pro daný účel posuzuje samostatně pověřenec pro ochranu osobních údajů nebo firemní právník. Tuto část neposuzuje osoba, která projekt technicky připravuje.

Co dělat, když firma neví, kde všechna relevantní data leží?

Nejdřív se provede krátký průzkum zdrojů: kde se data skutečně vytvářejí, kde se ukládají a kdo k nim má přístup. Bez tohoto kroku hrozí, že se AI projekt navrhne kolem jednoho viditelného zdroje a přehlédne data, která žijí v osobních schránkách, sdílených discích nebo starších systémech mimo hlavní evidenci.

Znamená možnost vytáhnout testovací vzorek, že se s daty už smí pracovat?

Ne automaticky. Možnost technicky vzorek vytáhnout je samostatná otázka od toho, zda je jeho použití pro daný účel právně v pořádku. Pokud posouzení práva na použití ještě neproběhlo, testovací vzorek se z reálných dat nevytváří, dokud pověřenec nebo právník nedá vyjádření.

Jak se posouzení liší pro projekt typu vyhledávání v dokumentech oproti jednoduché kategorizaci?

Projekt, který vyhledává odpovědi v dokumentech a kombinuje je s jazykovým modelem, klade vyšší nároky na strukturu a úplnost textu než projekt, který jen třídí krátké záznamy do kategorií. Stejných osm oblastí platí pro oba případy, ale práh dostatečné úplnosti se podle typu projektu liší.

ZDROJE A OVĚŘENÍ

revidováno Lukáš Dlouhý ·