Proč AI naskenované PDF často mine

Naskenované PDF na pohled vypadá jako běžný dokument, ale uvnitř často neobsahuje skutečný text. Mnohé skenery uloží každou stránku jen jako obrázek, takže písmena nejsou pro stroj čitelná jako znaky, ale jen jako shluk pixelů. Pokud nástroj pracuje se stránkou jako s obrázkem, musí ji nejprve interpretovat; přesnost tohoto zpracování se liší podle konkrétního nástroje.

Problém se projeví typicky u starších smluv, vytištěných a znovu oskenovaných faktur, razítek přes text nebo šikmo založených stránek. Uživatel přitom v prohlížeči text vidí, a proto očekává přesné shrnutí. Dokumentace OpenAI k práci se soubory uvádí, že PDF s textem a s obrazem se zpracovávají odlišně než soubory, které PDF nejsou, což potvrzuje, že na formě PDF záleží. Tento obecný princip ale neříká, jak konkrétní aplikace OCR nebo čtení skenů řeší.

Porozumění rozdílu pomůže i vysvětlení, co je multimodální AI a proč některé nástroje obrázkovou stránku popíšou, zatímco jiné ji bez textové vrstvy nedokážou spolehlivě přepsat.

Co si připravte před testem

Jde o krátký orientační test a nepotřebujete k němu žádný zvláštní nástroj. Stačí běžný prohlížeč PDF v počítači nebo telefonu a chvíle klidu před tím, než soubor pošlete do AI. Cílem není soubor opravovat, pouze rychle rozhodnout, zda má smysl ho nahrát tak, jak je.

Připravte si původní soubor, nikoli jeho fotku z mobilu ani přeposlaný výtisk. Otevřete ho v prohlížeči, kde lze označovat text, a vyberte jednu stránku s běžným odstavcem a jednu část s důležitými údaji, například tabulkou, částkou nebo datem. Právě čísla a jména bývají u skenů nejrizikovější.

Pokud pravidelně pracujete s větším množstvím dokumentů, pomůže navázat širším postupem, jak posoudit připravenost dat pro AI, abyste odlišili jednorázový nečitelný sken od systémového problému v archivech.

Krátká zkouška kopírování textu

Začněte nejjednodušším krokem. Zkuste myší nebo prstem označit souvislý odstavec dlouhý alespoň tři řádky a zkopírujte ho do poznámkového bloku. Nespoléhejte jen na to, že označení barevně svítí. Rozhodující je vložený výsledek.

Přečtěte vložený text znak po znaku. Sedí diakritika, mezery a konce řádků. Nejsou písmena slepená, nechybí háčky a čárky, nemění se malé l za jedničku. Potom vyberte jeden konkrétní řádek s číslem, účtem, datem narození nebo částkou, a porovnejte ho s obrazem v PDF. U skenů se chyba často ukáže až zde, protože běžná slova vypadají dobře, ale číslice jsou prohozené.

Třetím krokem je kontrola orientace v dokumentu. Zeptejte se sami sebe, zda po zkopírování poznáte číslo stránky a nadpis oddílu. Pokud AI později dostane jen nesouvislý text bez vazby na stránku, těžko dohledáte, odkud údaj pochází. Když kopírování vůbec nelze provést, stránka se označí jen jako jeden velký obdélník nebo se vloží prázdno, může jít o obrázkový sken bez textové vrstvy. Ověřte také, zda problém nezpůsobuje prohlížeč nebo nastavení souboru.

Rozhodovací karta: nahrát, nebo nejdřív upravit

Výsledek zkoušky si zapište do krátké karty. Pomůže vám rozhodnout bez dohadů a stejný zápis můžete přiložit kolegovi, který bude se souborem dále pracovat.

Kontrolní otázkaJak ji vyplnitCo znamená odpověď
Lze označit a zkopírovat 3 souvislé řádkyano / ne / jen s chybamiNe může znamenat obrázkový sken bez textové vrstvy; ověřte také prohlížeč a nastavení souboru
Vložený řádek s číslem sedí s obrazempřesně / 1 znak jinak / zcela jinakOdchylku u důležitého údaje ověřte přímo v PDF; nepoužívejte neověřený přepis
Je jasné číslo stránky a nadpisano / neNe komplikuje dohledání zdroje a citace
Stránka je rovná a kontrastníano / šikmá, šedá, razítko přes textŠpatná kvalita zvyšuje riziko záměny znaků
Verdiktčitelné / podmíněně / nečitelnéPodmíněně řešte jen malou část, nečitelné upravte

Za čitelné považujte PDF, pokud lze spolehlivě zkopírovat a zkontrolovat běžný text i vybraný řádek s důležitými údaji. Číslo stránky a nadpis ověřte zvlášť jako pomůcku pro dohledání zdroje, ne jako test čitelnosti textu. Za podmíněně čitelné považujte stav, kdy běžný text jde zkopírovat, ale jeden znak v čísle nesedí nebo je část stránky zašedlá. Za nečitelné považujte stav, kdy kopírování nejde vůbec, vkládá se prázdno, nebo se text rozsype do nesmyslných znaků.

U podmíněně čitelného souboru zvažte práci s ověřeným výpisem; pokud použijete celé PDF, nejprve ověřte možnosti konkrétního nástroje a kritické údaje. U nečitelného souboru nejprve vytvořte kvalitnější sken nebo požádejte o strojově čitelný originál, případně nechte textovou vrstvu doplnit ověřeným postupem ve vaší organizaci.

Hypotetický příklad: čtyřstránková smlouva s verdiktem Nečitelné

Představte si následující ilustrativní situaci, nejde o měření konkrétního nástroje. Uživatel má čtyřstránkovou nájemní smlouvu, oskenovanou šikmo při rozlišení kancelářského skeneru, s razítkem přes podpisovou doložku. Na straně dvě je klíčový řádek: Měsíční nájemné činí 18 450 Kč splatné k 5. dni v měsíci.

Zkouška dopadne takto. Označení odstavce na straně jedna vytvoří jeden velký rámeček přes celou stránku, po vložení se neobjeví žádný text. Opakovaný pokus na straně dvě vloží shluk: Mesicni najemne cini 18 450 Kc. Řádek s částkou tedy ztratil diakritiku a při dalším pohledu uživatel zjistí, že číslice 5 je v obraze částečně překrytá razítkem. Číslo stránky se zkopírovat nedá, protože zápatí je obrázek.

Výsledek karty proto zní: kopírování tří řádků ne, přesnost číselného řádku nelze ověřit, vazba na stránku ne, kvalita šikmá s razítkem, verdikt nečitelné. Správný postup není smlouvu nahrát a žádat AI o výši nájmu, ale vyžádat si textový originál nebo provést nový rovný sken a kritická čísla přepsat ručně.

Omezení testu a vhodný další krok

Tato orientační zkouška je orientační pomůcka, nikoli záruka chování každého produktu. Různé aplikace mohou stejné PDF zpracovat různě podle toho, zda používají vlastní rozpoznávání obrazu, zda stránku zmenší, nebo zda pracují jen s vloženým textem. Úspěšné zkopírování ve vašem prohlížeči tedy nezaručuje, že konkrétní AI nástroj přečte soubor stejně.

Test také neodhalí všechny chyby. Neověří tabulky přes více stránek, poznámky pod čarou ani ručně psané vpisky. Proto po každém shrnutí proveďte cílenou kontrolu podle postupu, jak ověřit odpověď AI, zejména u částek, dat, jmen a závazků. Porovnejte každé klíčové číslo přímo s obrazem stránky a trvejte na uvedení strany, kde se údaj nachází.

Dalším krokem je jednoduché pravidlo pro tým. Pokud soubor projde jako čitelný, zvažte jeho nahrání s ohledem na možnosti a pravidla konkrétního nástroje; citace zkontrolujte. Pokud skončí jako podmíněně čitelný nebo nečitelný, soubor nenahrávejte opakovaně v naději na lepší výsledek, ale zajistěte lepší podklad. Tím můžete ušetřit čas a snížit riziko, že rozhodnutí postavíte na špatně přečteném skenu.

Zdroj pro doložený fakt: dokumentace OpenAI File inputs.

ZDROJE A OVĚŘENÍ

revidováno Muse Spark 1.3 Contributor; GPT 6 Luna independent review; CIAD Codex editorial source and Czech acceptance ·