AI tvrdí, že si je jistá na 95 %: jak takovou odpověď číst
Obsah · 8 kapitol
STRUČNÁ ODPOVĚĎ
Sebehlášené procento jistoty bez doložené kalibrace na váš úkol neberte jako měření správnosti. Vyžadujte zdroj, ověřitelný postup a vlastní kontrolu. U opakovaných úloh nahraďte dojem z čísla malým interním testem a rozhodnutí řiďte výsledkem testu, nikoli deklarovanou jistotou.
Proč číslo jistoty působí přesvědčivě
Procento v odpovědi připomíná měření, například výsledek kalibrovaného přístroje nebo statistický odhad. Čtenář si může například číslo 95 % vyložit jako silnou oporu pro rozhodnutí. U jazykového modelu ale tato analogie selhává, protože model generuje plynulý text, jehož součástí může být i věta o jistotě. Číslo pak není výstupem nezávislého měření, ale pokračováním stejné odpovědi.
Problém je také v tom, že uživatel nemá k dispozici kontext vzniku čísla. Neví, z jakých dat model vycházel, zda pracoval s aktuálním podkladem, zda si nepletl dvě podobné varianty a zda by stejné číslo uvedl i po změně zadání. Proto je užitečné číst větu „jsem si jistý na 95 %“ spíše jako „odpověď zní plynule a rozhodně“, nikoli jako ověřenou pravděpodobnost správnosti.
Podobný mechanismus stojí za plynulými, ale nepravdivými odpověďmi, které podrobněji popisuje text o tom, proč si AI vymýšlí a vznikají halucinace. I tam platí, že přesvědčivá forma odpovědi ještě nedokládá její obsah.
Co znamená kalibrace na konkrétním úkolu
Kalibrace znamená, že deklarovaná jistota odpovídá skutečné úspěšnosti na jasně vymezeném úkolu. Například u většího souboru případů, kterým systém přisoudí jistotu kolem 90 %, by správnost měla být přibližně 90 %. Bez takového porovnání je procento jen neověřené tvrzení.
Dokumentace OpenAI k evaluačním postupům doporučuje měřit výkon strukturovanými evaluačními testy na konkrétních úlohách, nikoli spoléhat na obecné dojmy o kvalitě (přehled evaluačních doporučení). Věcné shrnutí tohoto zdroje: pro posouzení vhodnosti modelu je třeba navrhnout vlastní strukturovaný test, spustit ho na reprezentativních příkladech a výsledek použít jako podklad pro rozhodnutí.
Zásadní je slovo konkrétním. Model může být spolehlivý při shrnutí zápisu a nespolehlivý při výpočtu DPH, při práci s českými právními termíny nebo při čtení skenovaných tabulek. Jedno univerzální procento proto nemůže nahradit měření pro vaši úlohu, vaše data a váš požadovaný výstup.
Rozhodovací karta: jistota, důkaz a test
Následující kartu použijte pokaždé, když model uvede procento jistoty. Vyplňte ji pro jednu konkrétní odpověď, ne obecně pro celý nástroj.
| Pole karty | Co zapsat | Jak rozhodnout |
|---|---|---|
| Tvrzení a jistota | Přesná citace odpovědi a uvedeného procenta, například „splatnost je 14 dnů, jistota 95 %“ | Bez citace nehodnoťte dojem, hodnoťte výrok |
| Typ opory | Zda odpověď obsahuje citovatelný zdroj, výpočet, odkaz na dodaný dokument, nebo jen formulaci | Bez zdroje a postupu je opora nulová |
| Ověřitelnost | Zda lze tvrzení zkontrolovat do pěti minut v primárním podkladu | Neověřitelné tvrzení neposouvejte dál |
| Dopad chyby | Nízký, střední nebo vysoký dopad na peníze, termín, smlouvu či bezpečnost | Vyšší dopad vyžaduje silnější důkaz |
| Výsledek | Přijmout, přijmout s kontrolou, nebo zamítnout a testovat | Procento samotné nikdy nestačí k přijetí |
Pravidlo je jednoduché: čím vyšší dopad chyby, tím méně se smíte opírat o číslo jistoty a tím více potřebujete nezávislý důkaz. U fakturace, smluvních termínů, bezpečnosti a reportingu pro vedení platí, že odpověď bez ověřitelného podkladu je pracovní návrh, nikoli hotový výstup.
Obecný kontrolní postup pro druhý a třetí řádek karty najdete v návodu, jak ověřit odpověď AI. Karta zde slouží jako rychlé rozhodnutí, ověřovací postup jako provedení kontroly.
Postup ověření ve čtyřech krocích
Nejprve izolujte ověřitelné tvrzení. Z dlouhé odpovědi vyjměte jednu větu, která rozhoduje: částku, datum, název normy, postup nebo jméno. Právě tu budete kontrolovat, ne celou stylistiku odpovědi. Zapište ji do karty včetně procenta, aby bylo jasné, co model sliboval.
Potom vyžadujte oporu. Požádejte model, aby ukázal část zdrojového dokumentu, vzorec, kroky výpočtu nebo přesný úryvek, ze kterého vycházel. Nestačí nová parafráze ani opakování procenta jinými slovy. Pokud model oporu nedoplní, považujte původní odpověď za nepodloženou.
Následně proveďte nezávislou kontrolu. Otevřete původní smlouvu, fakturu, tabulku nebo interní předpis a údaj porovnejte ručně. U výpočtu přepočítejte výsledek kalkulačkou. U data zkontrolujte primární dokument, nikoli další generovaný text. Tento krok nesmí dělat stejný model na stejných datech bez nezávislého zdroje.
Nakonec u opakovaných úloh vytvořte minitest. Připravte deset až dvacet vlastních příkladů, u kterých znáte správnou odpověď, a sledujte úspěšnost. Metodickou oporu pro stavbu takové sady dává postup, jak vytvořit interní testovací sadu pro AI. Teprve výsledek testu vám řekne, zda má deklarovaná jistota v dané úloze vůbec nějakou váhu.
Hypotetický příklad s přesným výsledkem
Následující příklad je zcela ilustrativní a hypotetický, neslouží jako měření žádného konkrétního produktu.
Představte si, že se asistentky ptáte na splatnost dodavatelské faktury. Model odpoví: „Faktura je splatná 14. března, jsem si jistý na 95 %.“ Do rozhodovací karty zapíšete tvrzení, typ opory označíte jako chybějící a dopad chyby jako střední, protože pozdní platba znamená penále a zbytečnou komunikaci s dodavatelem.
Vyžádáte si oporu a provedete kontrolu ve smlouvě. Zjistíte, že základní splatnost je 30 dnů od doručení, nikoli 14 dnů. Model zaměnil standardní obchodní podmínku z jiného dokumentu za podmínku této konkrétní smlouvy. Původní odpověď tedy zamítnete.
Protože faktury kontrolujete opakovaně, vytvoříte ilustrativní minitest s 20 smluvními případy se známou splatností. Hypotetický výsledek je přesně tento: model správně určí 14 z 20 splatností, tedy úspěšnost 70 %, přestože u 12 chybných i správných odpovědí opakovaně uváděl jistotu 90 % a více. Závěr pro kartu zní: v tomto minitestu byla celková úspěšnost 70 %. To samo neukazuje, zda je procento jistoty kalibrované; k tomu by bylo nutné porovnat deklarovanou jistotu s výsledky u dostatečného souboru odpovědí.
Omezení postupu a další krok
Tato karta a minitest nenahrazují kalibraci výrobce ani nezávislý audit modelu. Měříte pouze chování na vašich příkladech, ve vašem znění dotazů a v daném čase. Po změně modelu, změně dokumentů, změně procesu nebo po přidání nového typu případů je třeba test zopakovat. Malý test s dvaceti příklady také nedokáže zachytit vzácné, ale závažné chyby.
Postup se nehodí pro tvůrčí nebo hodnotící úlohy, kde neexistuje jednoznačná správná odpověď. Tam nemá smysl počítat úspěšnost, ale posuzovat kvalitu návrhu, úplnost a rizika. Stejně tak karta nepomůže, pokud nemáte přístup k primárnímu zdroji pravdy; bez smlouvy, výpisu, dokumentace nebo autoritativního podkladu nelze tvrzení rozhodnout.
Další krok je praktický: vyberte jednu opakovanou úlohu s vysokým dopadem chyby, založte k ní jednoduchou tabulku tvrzení, opory a výsledku kontroly a po měsíci vyhodnoťte, u kterých typů dotazů se vysoká jistota rozchází s realitou. Právě tam zaveďte povinnou lidskou kontrolu a přestaňte procento uvádět v interních podkladech jako argument.
ZDROJE A OVĚŘENÍ
revidováno Muse Spark 1.3 Contributor; GPT 6 Luna independent review; CIAD Codex editorial source and Czech acceptance ·
