ODPOVĚĎ

AI tvrdí, že si je jistá na 95 %: jak takovou odpověď číst

Téma
AI základy
Čtení
5 min
Publikováno
Obsah · 8 kapitol

STRUČNÁ ODPOVĚĎ

Sebehlášené procento jistoty bez doložené kalibrace na váš úkol neberte jako měření správnosti. Vyžadujte zdroj, ověřitelný postup a vlastní kontrolu. U opakovaných úloh nahraďte dojem z čísla malým interním testem a rozhodnutí řiďte výsledkem testu, nikoli deklarovanou jistotou.

Proč číslo jistoty působí přesvědčivě

Procento v odpovědi připomíná měření, například výsledek kalibrovaného přístroje nebo statistický odhad. Čtenář si může například číslo 95 % vyložit jako silnou oporu pro rozhodnutí. U jazykového modelu ale tato analogie selhává, protože model generuje plynulý text, jehož součástí může být i věta o jistotě. Číslo pak není výstupem nezávislého měření, ale pokračováním stejné odpovědi.

Problém je také v tom, že uživatel nemá k dispozici kontext vzniku čísla. Neví, z jakých dat model vycházel, zda pracoval s aktuálním podkladem, zda si nepletl dvě podobné varianty a zda by stejné číslo uvedl i po změně zadání. Proto je užitečné číst větu „jsem si jistý na 95 %“ spíše jako „odpověď zní plynule a rozhodně“, nikoli jako ověřenou pravděpodobnost správnosti.

Podobný mechanismus stojí za plynulými, ale nepravdivými odpověďmi, které podrobněji popisuje text o tom, proč si AI vymýšlí a vznikají halucinace. I tam platí, že přesvědčivá forma odpovědi ještě nedokládá její obsah.

Co znamená kalibrace na konkrétním úkolu

Kalibrace znamená, že deklarovaná jistota odpovídá skutečné úspěšnosti na jasně vymezeném úkolu. Například u většího souboru případů, kterým systém přisoudí jistotu kolem 90 %, by správnost měla být přibližně 90 %. Bez takového porovnání je procento jen neověřené tvrzení.

Dokumentace OpenAI k evaluačním postupům doporučuje měřit výkon strukturovanými evaluačními testy na konkrétních úlohách, nikoli spoléhat na obecné dojmy o kvalitě (přehled evaluačních doporučení). Věcné shrnutí tohoto zdroje: pro posouzení vhodnosti modelu je třeba navrhnout vlastní strukturovaný test, spustit ho na reprezentativních příkladech a výsledek použít jako podklad pro rozhodnutí.

Zásadní je slovo konkrétním. Model může být spolehlivý při shrnutí zápisu a nespolehlivý při výpočtu DPH, při práci s českými právními termíny nebo při čtení skenovaných tabulek. Jedno univerzální procento proto nemůže nahradit měření pro vaši úlohu, vaše data a váš požadovaný výstup.

Rozhodovací karta: jistota, důkaz a test

Následující kartu použijte pokaždé, když model uvede procento jistoty. Vyplňte ji pro jednu konkrétní odpověď, ne obecně pro celý nástroj.

Pole kartyCo zapsatJak rozhodnout
Tvrzení a jistotaPřesná citace odpovědi a uvedeného procenta, například „splatnost je 14 dnů, jistota 95 %“Bez citace nehodnoťte dojem, hodnoťte výrok
Typ oporyZda odpověď obsahuje citovatelný zdroj, výpočet, odkaz na dodaný dokument, nebo jen formulaciBez zdroje a postupu je opora nulová
OvěřitelnostZda lze tvrzení zkontrolovat do pěti minut v primárním podkladuNeověřitelné tvrzení neposouvejte dál
Dopad chybyNízký, střední nebo vysoký dopad na peníze, termín, smlouvu či bezpečnostVyšší dopad vyžaduje silnější důkaz
VýsledekPřijmout, přijmout s kontrolou, nebo zamítnout a testovatProcento samotné nikdy nestačí k přijetí

Pravidlo je jednoduché: čím vyšší dopad chyby, tím méně se smíte opírat o číslo jistoty a tím více potřebujete nezávislý důkaz. U fakturace, smluvních termínů, bezpečnosti a reportingu pro vedení platí, že odpověď bez ověřitelného podkladu je pracovní návrh, nikoli hotový výstup.

Obecný kontrolní postup pro druhý a třetí řádek karty najdete v návodu, jak ověřit odpověď AI. Karta zde slouží jako rychlé rozhodnutí, ověřovací postup jako provedení kontroly.

Postup ověření ve čtyřech krocích

Nejprve izolujte ověřitelné tvrzení. Z dlouhé odpovědi vyjměte jednu větu, která rozhoduje: částku, datum, název normy, postup nebo jméno. Právě tu budete kontrolovat, ne celou stylistiku odpovědi. Zapište ji do karty včetně procenta, aby bylo jasné, co model sliboval.

Potom vyžadujte oporu. Požádejte model, aby ukázal část zdrojového dokumentu, vzorec, kroky výpočtu nebo přesný úryvek, ze kterého vycházel. Nestačí nová parafráze ani opakování procenta jinými slovy. Pokud model oporu nedoplní, považujte původní odpověď za nepodloženou.

Následně proveďte nezávislou kontrolu. Otevřete původní smlouvu, fakturu, tabulku nebo interní předpis a údaj porovnejte ručně. U výpočtu přepočítejte výsledek kalkulačkou. U data zkontrolujte primární dokument, nikoli další generovaný text. Tento krok nesmí dělat stejný model na stejných datech bez nezávislého zdroje.

Nakonec u opakovaných úloh vytvořte minitest. Připravte deset až dvacet vlastních příkladů, u kterých znáte správnou odpověď, a sledujte úspěšnost. Metodickou oporu pro stavbu takové sady dává postup, jak vytvořit interní testovací sadu pro AI. Teprve výsledek testu vám řekne, zda má deklarovaná jistota v dané úloze vůbec nějakou váhu.

Hypotetický příklad s přesným výsledkem

Následující příklad je zcela ilustrativní a hypotetický, neslouží jako měření žádného konkrétního produktu.

Představte si, že se asistentky ptáte na splatnost dodavatelské faktury. Model odpoví: „Faktura je splatná 14. března, jsem si jistý na 95 %.“ Do rozhodovací karty zapíšete tvrzení, typ opory označíte jako chybějící a dopad chyby jako střední, protože pozdní platba znamená penále a zbytečnou komunikaci s dodavatelem.

Vyžádáte si oporu a provedete kontrolu ve smlouvě. Zjistíte, že základní splatnost je 30 dnů od doručení, nikoli 14 dnů. Model zaměnil standardní obchodní podmínku z jiného dokumentu za podmínku této konkrétní smlouvy. Původní odpověď tedy zamítnete.

Protože faktury kontrolujete opakovaně, vytvoříte ilustrativní minitest s 20 smluvními případy se známou splatností. Hypotetický výsledek je přesně tento: model správně určí 14 z 20 splatností, tedy úspěšnost 70 %, přestože u 12 chybných i správných odpovědí opakovaně uváděl jistotu 90 % a více. Závěr pro kartu zní: v tomto minitestu byla celková úspěšnost 70 %. To samo neukazuje, zda je procento jistoty kalibrované; k tomu by bylo nutné porovnat deklarovanou jistotu s výsledky u dostatečného souboru odpovědí.

Omezení postupu a další krok

Tato karta a minitest nenahrazují kalibraci výrobce ani nezávislý audit modelu. Měříte pouze chování na vašich příkladech, ve vašem znění dotazů a v daném čase. Po změně modelu, změně dokumentů, změně procesu nebo po přidání nového typu případů je třeba test zopakovat. Malý test s dvaceti příklady také nedokáže zachytit vzácné, ale závažné chyby.

Postup se nehodí pro tvůrčí nebo hodnotící úlohy, kde neexistuje jednoznačná správná odpověď. Tam nemá smysl počítat úspěšnost, ale posuzovat kvalitu návrhu, úplnost a rizika. Stejně tak karta nepomůže, pokud nemáte přístup k primárnímu zdroji pravdy; bez smlouvy, výpisu, dokumentace nebo autoritativního podkladu nelze tvrzení rozhodnout.

Další krok je praktický: vyberte jednu opakovanou úlohu s vysokým dopadem chyby, založte k ní jednoduchou tabulku tvrzení, opory a výsledku kontroly a po měsíci vyhodnoťte, u kterých typů dotazů se vysoká jistota rozchází s realitou. Právě tam zaveďte povinnou lidskou kontrolu a přestaňte procento uvádět v interních podkladech jako argument.

ZDROJE A OVĚŘENÍ

revidováno Muse Spark 1.3 Contributor; GPT 6 Luna independent review; CIAD Codex editorial source and Czech acceptance ·

Potřebujete odpověď pro svou organizaci?

Projdeme s vámi konkrétní situaci a navrhneme další krok.

Kontaktovat CIAD