Jedna stránka pro sadu úloh i pro rubriku

Tento článek nahrazuje samostatnou stránku o hodnoticí rubrice pro AI modely, kterou jsme se rozhodli nevydat zvlášť. Sada testovacích úloh bez pravidel pro hodnocení výstupu vede jen k dojmům; hodnoticí rubrika bez konkrétních úloh se známou odpovědí nemá co posuzovat. Jde o dvě poloviny jednoho hodnoticího rámce, proto patří na jednu stránku a vznikají spolu.

Rámec sestavíte odpovědí na sedm otázek v pořadí níže. Každá odpověď se stane polem nebo řádkem v tabulkách na konci článku; výsledkem není obecný návod, ale konkrétní sada přizpůsobená vaší firmě.

Otázka 1: Jaké rozhodnutí sada podpoří a co by vás přimělo nástroj vyměnit

Než napíšete první úlohu, zapište, k jakému rozhodnutí měření slouží: zůstat u současného nástroje, přejít na jiný, rozšířit použití na další tým, nebo úlohu AI vůbec nesvěřovat. Ke každé možnosti přidejte konkrétní podmínku, za které byste rozhodnutí skutečně změnili, například kolik závažných chyb ve výstupu je pro daný proces ještě přijatelných.

Sada bez vazby na rozhodnutí skončí jako zajímavé číslo, které nikoho k ničemu nezavazuje. Pokud si po měření nedokážete odpovědět, co se díky výsledku změní, otázka číslo jedna nebyla zodpovězena a zbytek postupu je předčasný.

Otázka 2: Které úlohy do sady patří

Vyberte úlohy z práce, kterou firma skutečně dělá, a vyhněte se obecným ukázkám. Zahrňte typické případy, se kterými se pracuje denně, ale i případy nepříjemné: neúplné podklady, protichůdné pokyny, hraniční formulace v češtině, situace, kdy má nástroj správně odmítnout nebo si vyžádat doplnění. Sada složená jen ze snadných úloh nadhodnotí každý porovnávaný nástroj stejně, takže rozdíly mezi nimi zmizí.

Ke každé úloze zapište, odkud pochází a proč je pro firmu důležitá. Pokud vybíráte úlohy až po prvním pohledu na výstupy nástrojů, sada přestává být nezávislým měřítkem a stává se potvrzením už vytvořeného názoru.

Otázka 3: Kolik položek sada potřebuje

Malý počet pečlivě vybraných úloh se známou odpovědí je použitelnější než rozsáhlá sbírka, kterou nikdo nestihne ohodnotit podle stejných pravidel. Jako praktické doporučení CIAD, bez nároku na ověřené optimum, počítejte s přibližně osmi až patnácti položkami na jednu porovnávanou kategorii úloh: méně u složitých procesů s vysokou cenou chyby, více jen tam, kde má tým kapacitu každou položku ohodnotit.

Rozsáhlá sada bez skórování nic neprokazuje. Menší sada s předem danou odpovědí u každé položky a proběhlým hodnocením unese srovnání, které tým obhájí.

Otázka 4: Co je u položky správná odpověď a kdo to určuje

Kritérium přijatelnosti napište dřív, než kterýkoli nástroj úlohu vůbec zpracuje. Kritérium může být přesná hodnota, rozsah přijatelných formulací, povinná struktura výstupu nebo seznam faktů, které musí odpověď obsahovat. Určete také, kdo kritérium schvaluje: vlastník daného procesu, případně druhá nezávislá osoba u úloh s vyšším rizikem chyby.

Kritérium doplněné až po prvním čtení výstupů se nevyhnutelně přizpůsobí tomu, co model odpověděl, a srovnání ztrácí smysl. Pokud kritérium chybí u byť jediné položky, tuto položku ze sady vyřaďte, dokud kritérium nevznikne.

Otázka 5: Rubrika, podle čeho poznáte úroveň výstupu

Rubrika popisuje pozorovatelné vlastnosti výstupu a nahrazuje jimi subjektivní dojem hodnotitele. Pro porovnávání nástrojů doporučujeme pět vlastností: věcnou správnost proti předem dané odpovědi, dodržení požadovaného formátu, přítomnost vymyšleného detailu bez opory ve vstupu nebo v podkladech, správnost češtiny včetně diakritiky a rejstříku a přiměřené odmítnutí tam, kde úloha odmítnutí vyžaduje.

ÚroveňPozorovatelné vlastnosti výstupu
0odpověď je věcně nesprávná proti danému kritériu nebo chybí podstatná část zadání
1jádro odpovědi je správné, ale požadovaný formát není dodržen nebo výstup obsahuje detail bez opory ve vstupu
2odpověď je věcně správná a ve formátu, čeština obsahuje chyby nebo nevhodný rejstřík
3odpověď je věcně správná, ve formátu a v gramaticky správné češtině bez vymyšleného detailu
4úroveň 3 a navíc nástroj tam, kde to úloha vyžadovala, sám upozornil na chybějící podklady nebo úlohu přiměřeně odmítl

Rubrika je metodický návrh CIAD pro účely vlastního porovnání; nejde o externě ověřenou psychometrickou metodu. Ke každé úrovni si připravte krátký modelový příklad, jinak dva hodnotitelé u stejného výstupu snadno zvolí jinou úroveň.

Otázka 6: Jak sadu spustit, aby srovnání bylo férové

Každý porovnávaný nástroj dostane stejné zadání ve stejném znění, se stejnými podklady a se stejným pořadím úloh v rámci jednoho běhu. Pořadí, ve kterém nástroje testujete, střídejte, protože únava hodnotitele nebo změna kontextu jinak zvýhodní ten, který přijde na řadu jako první nebo poslední. Kde je to možné, hodnotitel neví, který nástroj konkrétní výstup vytvořil.

NIST řadí testování a měření do kroku Measure v rámci Govern, Map, Measure, Manage; jde o dobrovolné doporučení, přizpůsobitelné vlastnímu procesu. K hlavičce běhu zapište název a verzi každého porovnávaného nástroje a datum spuštění. Výsledek platí pro tuto verzi k tomuto datu; jakmile se nástroj nebo model za ním aktualizuje, měření je potřeba zopakovat. Kdy přesně retest spustit, řeší samostatný článek, tady stačí vědět, že datum je součástí výsledku.

Otázka 7: Co výsledek dokazuje a co ne

Výsledek popisuje, jak porovnávané nástroje zvládly právě tuto sadu úloh vaší firmy k danému datu. Nejde o obecné pořadí nástrojů ani o tvrzení platné mimo tyto úlohy nebo pro jinou firmu. CIAD u tohoto porovnání nemá vlastní srovnávací data ani interní žebříček; sada popsaná v tomto článku je metoda, kterou si měření provede firma sama na vlastní práci.

Formulace „na této sadě úloh dosáhl nástroj úrovně X u N procent položek“ popisuje přesně to, co sada změřila. Formulace „tento nástroj je obecně lepší“ přesahuje to, co jediné firemní porovnání může doložit.

Artefakt: sestavená testovací sada

Pole položkyCo do něj patří
ID položkyvlastní neměnný identifikátor, například TS-01
Kategorie úlohytyp práce z otázky 2, kterou nástroj ve firmě skutečně dělá
Vstupní zadánípřesné znění zadání a verze přiložených podkladů
Kritérium přijatelnostiodpověď z otázky 4, zapsaná před spuštěním
Schválilrole s rozhodovací pravomocí nad kritériem, zapsaná do hlavičky
Citlivost vstupuzda obsahuje osobní údaje a zda obsahuje firemní dokument
Nástroj, verze, datumz otázky 6, doplněno u každého běhu

Sada s firemními dokumenty je citlivé aktivum

Jakmile do položek vložíte reálné firemní dokumenty, e-maily nebo záznamy, sada přestává být interní pomůckou a stává se citlivým aktivem podle stejných pravidel, jaká platí pro zdrojový materiál: řízený přístup, jasně určené uložiště, doba uchování a omezení sdílení na určený okruh lidí. Kopie sady rozeslaná e-mailem kvůli rychlejšímu hodnocení tato pravidla obchází stejně jako kopie původního dokumentu.

Samotné spuštění testu může být formou zveřejnění: vložení položky do porovnávaného nástroje přenáší její obsah k dodavateli daného nástroje podle jeho vlastních podmínek zpracování. Než sadu s reálnými podklady spustíte proti nástroji, který teprve vyhodnocujete, ověřte, zda je takové vložení podle vašich interních pravidel a podmínek dodavatele přípustné; otázky k tomuto rozhodnutí shrnuje stránka je bezpečné vkládat firemní data do nástrojů AI.

Osobní údaje v položce patří pověřenci

Ke každé položce si položte otázku: obsahuje vstup nebo očekávaná odpověď údaj vztažený ke konkrétní žijící osobě? Pokud ano, o zařazení, redakci nebo anonymizaci dané položky rozhoduje pověřenec pro ochranu osobních údajů firmy, případně firemní právník; tento článek takové posouzení nenahrazuje a nestanovuje, kdy je zpracování zákonné. nařízení GDPR definuje osobní údaj v článku 4 a podmínky zákonnosti zpracování v článcích 5 a 6; zda konkrétní firemní použití AI tyto podmínky splňuje, popisuje stránka zpracování osobních údajů pomocí AI.

Kam sada zapadá do rozhodování o nástroji

Odpovědi na sedm otázek a obě tabulky dávají firmě opakovatelný podklad pro volbu mezi nástroji, kterou obecně popisuje stránka jak vybrat AI nástroj pro firmu; tato sada je konkrétní měřicí krok uvnitř takového rozhodování. Širší metodické zázemí testování popisuje stránka co je audit AI systémů; tento článek se soustředí jen na sadu úloh a rubriku, které si firma sestaví a spustí sama.

Tato sada netestuje jedinou konkrétní schopnost, jako je velikost kontextového okna nebo strukturovaný výstup; takové úzce zaměřené testy popisují samostatné články.

Stav zdrojů a omezení

Zdroje NIST popisují dobrovolný rámec pro řízení rizik AI a krok testování a měření uvnitř něj; nejde o certifikaci, závaznou normu ani o hotovou sadu úloh k prostému zkopírování. Citované články GDPR platí obecně pro zpracování osobních údajů; zda konkrétní položka sady osobní údaj obsahuje a za jakých podmínek ji lze zpracovat, musí posoudit pověřenec pro ochranu osobních údajů firmy. Sedm otázek a obě tabulky jsou metodický návrh CIAD pro vlastní použití, bez publikované spolehlivosti nezávisle validovaného měřicího nástroje. Článek neobsahuje data ani výsledky klientů CIAD a nenabízí srovnávací měření mezi konkrétními nástroji; výsledek každého porovnání závisí na úlohách, kritériích a hodnotitelích, které si firma zvolí sama, a nepřenáší se automaticky na jinou firmu ani na pozdější verzi téhož nástroje.

Časté dotazy

Kolik položek by měla mít testovací sada pro porovnání AI nástrojů?

Přesný počet neexistuje jako obecně platné číslo. Praktičtější je menší sada osmi až patnácti pečlivě vybraných úloh se známou odpovědí, kterou tým skutečně stihne ohodnotit podle jednotné rubriky, než rozsáhlá sbírka bez důsledného skórování. U procesů s vysokou cenou chyby zvolte méně úloh a věnujte více pozornosti kritériu u každé z nich.

Musí sadu hodnotit jedna osoba?

Ne nutně, ale hodnoticí kritéria musí být pro všechny hodnotitele stejná a zapsaná před spuštěním. U úloh s vyšším rizikem chyby je vhodné zapojit druhého nezávislého hodnotitele a rozdíly v hodnocení řešit podle postupu dohodnutého předem, ještě před spuštěním testu.

Co dělat, pokud testovací sada obsahuje osobní údaje?

U každé položky nejprve zjistěte, zda vstup nebo očekávaná odpověď obsahuje údaj vztažený ke konkrétní osobě. Pokud ano, rozhodnutí o zařazení, redakci nebo anonymizaci patří pověřenci pro ochranu osobních údajů firmy, případně právníkovi. Tento článek právní posouzení nenahrazuje a nestanovuje, za jakých podmínek je takové zpracování zákonné.

Platí výsledek porovnání i pro novější verzi téhož nástroje?

Ne automaticky. Výsledek je vázaný na konkrétní verzi nástroje a datum spuštění zaznamenané v hlavičce testu. Jakmile se nástroj nebo model za ním aktualizuje, chování na stejné sadě úloh se může změnit, a to i beze změny sady samotné. Kdy přesně měření zopakovat, řeší samostatný článek.

Můžeme použít stejnou testovací sadu pro porovnání i pro pozdější kontrolu kvality provozu?

Lze, pokud sada odpovídá úlohám, které nástroj v provozu skutečně vykonává, a rubrika zůstává stejná. Sada vzniklá pro jednorázové porovnání ale často neobsahuje dost provozních okrajových případů; pro průběžnou kontrolu kvality ji obvykle bude potřeba rozšířit o další položky odpovídající reálnému provozu.

ZDROJE A OVĚŘENÍ

revidováno Lukáš Dlouhý ·