Jak vlastně jazykový model „přemýšlí“?

Jazykový model nevyhledává fakta v databázi · předpovídá, které slovo statisticky nejpravděpodobněji následuje za předchozím textem. Celý trénink probíhá na obrovském množství textů, ze kterých se model naučil vzory, gramatiku a vztahy mezi pojmy. Výsledek umí znít přirozeně a kompetentně, přestože model nemá přístup k žádnému ověřovacímu mechanismu.

Tento princip funguje spolehlivě, dokud otázka odpovídá vzorům v trénovacích datech. Jakmile se dostanete mimo ně · nové události, příliš specifické odborné téma nebo kombinace informací, která v textech téměř nefigurovala · model nezahlásí „nevím“. Místo toho vygeneruje odpověď, která zní věrohodně.

Kde halucinace vznikají nejčastěji

Nejrizikovější jsou tři oblasti. Konkrétní reference · čísla paragrafů, citace, jména autorů, data rozsudků · jsou klasickým nebezpečím: model ví, že k tématu patří specifické číslo, ale přesná hodnota v trénovacích datech chyběla nebo byla rozporuplná. Například AI dotázaná na konkrétní ustanovení zákoníku práce může vrátit přesvědčivě znějící „§ 102a odst. 3“, který v zákoně vůbec neexistuje.

Druhou oblastí jsou nedávné události. Modely mají datum uzávěrky trénovacích dat; cokoli novějšího generují odhadem, nikoli znalostí. Třetí okruh tvoří velmi specifické lokální nebo oborové informace · místní předpisy, interní firemní procesy, technické normy úzkého zaměření, kde trénovací data byla řídká nebo protiřečivá.

Proč model nechce lhát, ale přesto lže

Model není naprogramovaný klamat · záměr ani vědomí nemá. Generuje text, který maximalizuje pravděpodobnost „smysluplné“ odpovědi. Pokud trénovací data obsahovala miliony textů, kde experti odpovídali sebevědomě a bez váhání, model se tento styl naučil · bez ohledu na to, zda konkrétní informaci skutečně „zná“.

Výsledek připomíná studenta, který nezná odpověď, ale nechce přiznat nevědomost. Vymyslí odpověď, která zní správně. Zásadní rozdíl tkví v tom, že model to nedělá úmyslně · jde o přímý důsledek architektury predikce dalšího tokenu, nikoli o zákeřnost nebo nedbalost výrobce.

Jak halucinace omezit v praxi

Naprostá eliminace halucinací není realistická, ale čtyři vrstvy ochrany je výrazně tlumí:

  • Omezit doménu: RAG (Retrieval-Augmented Generation) · model odpovídá pouze z předem definovaného korpusu dokumentů, které dostane jako kontext, nikoli z obecné paměti.
  • Vyžadovat citace: prompt model instruuje, aby každé tvrzení opřel o konkrétní pasáž ze zdrojového dokumentu; bez reference neodpovídá.
  • Nastavit práh nejistoty: instrukce, aby model při nízké jistotě odpověděl „nevím“ nebo nabídl varianty místo spekulace.
  • Ověřit výstup: u kritických výstupů · právní texty, lékařské informace, finanční data · vždy provést ruční nebo automatizovanou kontrolu vůči primárnímu zdroji.

Co to znamená: Halucinace AI nejsou chybou, kterou výrobci jednou opraví. Jsou vlastností architektury, s níž musí každé nasazení počítat od začátku. Správně navržený systém model obklopí vrstvami, které halucinaci odhalí dřív, než se dostane ke koncovému uživateli. Na tomto principu stojí metodika bezpečného nasazování AI, kterou CIAD aplikuje v auditech i školeních pro firmy zavádějící LLM do kritických procesů.

Časté dotazy

Pozná AI samo, že halucinuje?

Zpravidla ne. Model nemá interní mechanismus pro ověřování pravdivosti a generuje výstup s výraznou sebedůvěrou bez ohledu na to, zda odpověď odpovídá realitě. Proto je lidská kontrola nebo externě napojená znalostní báze nezbytná u každého kritického nasazení.

Je ChatGPT v halucinacích horší než jiné modely?

Modely se liší mírou halucinací, ale žádný současný velký jazykový model není imunní. Rozdíly závisí na velikosti modelu, kvalitě trénovacích dat a použité architektuře. Klíčové je nasadit správné zábrany bez ohledu na konkrétní zvolený nástroj.

Může RAG halucinace zcela odstranit?

RAG výrazně snižuje počet halucinací tím, že model dostane relevantní dokumenty jako kontext a odpovídá z nich, nikoli z paměti. Eliminovat halucinace úplně nedokáže · model může zdrojový text chybně interpretovat nebo vybrat nesprávnou pasáž. RAG je vrstva ochrany, ne absolutní záruka.

Jak poznám, že mi AI vymyslela informaci?

Spolehlivá metoda je křížová kontrola v primárním zdroji · zákon, veřejný rejstřík, odborná norma. Červeným příznakem je příliš konkrétní, ale neověřitelný detail: číslo paragrafu, jméno autora, datum rozsudku. Právě na zdánlivě specifické údaje si AI vymýšlí nejčastěji.