Nejdřív rozdělte pole katalogu, teprve potom pouštějte nástroj

Otázka, jak katalog vyčistit a sjednotit pomocí AI, se často řeší obráceně: nejdřív se úprava spustí na celém sortimentu a teprve podle výsledku se zjišťuje, co se vlastně stalo. Správný postup jde opačným směrem. Než cokoli spustíte, rozdělte pole katalogu do tří skupin podle toho, jak moc smí být při úpravě dotčeno.

První skupina jsou pole, která zůstávají beze změny a slouží jako opora pro pozdější kontrolu: interní kód položky, dodavatelské číslo, datum poslední aktualizace ze zdrojového systému. Druhá skupina jsou pole, která lze bezpečně sjednotit do jednotného tvaru, pokud AI pracuje jen s tím, co v datech už je: formát názvu, kapitalizace, pořadí atributů, jednotný zápis rozměru. Třetí skupina jsou pole, kterých se nástroj nesmí dotknout vůbec, protože jejich přesné znění má právní nebo bezpečnostní význam.

Toto rozdělení nemusí být napoprvé dokonalé. Musí ale existovat dřív, než se katalog pustí do dávkového zpracování, protože bez něj chybí kritérium, podle kterého by se změna dala později posoudit.

Tabulka: co je závazné, co lze sjednotit, čeho se nedotýkat

Typ polePříkladSmí AI navrhnout úpravu?Kdo úpravu schvaluje
Závazný identifikátorinterní kód, EAN, dodavatelské číslone, pole se jen čte pro kontrolusprávce katalogu
Normalizovatelný tvarnázev, kapitalizace, pořadí atributů, formát rozměruano, pokud vychází jen z existující hodnotysprávce katalogu, namátková kontrola
Naměřená nebo technická hodnotarozměr, hmotnost, výkon, kapacitane bez ověření u zdroje, jednotka se nesmí měnit tišeosoba se znalostí specifikace
Bezpečnostní nebo právně vyžadované tvrzeníupozornění, věkové omezení, složení, návod k použitíne, text zůstává v původním zněníosoba, která smí posoudit právní obsah
Popis a marketingový textdlouhý popis, krátký popis, klíčové vlastnostiano jako návrh, nikdy jako automatické nahrazenísprávce katalogu před publikací

Řádek s naměřenou nebo technickou hodnotou bývá v praxi nejčastějším zdrojem chyby, protože vypadá jako text, ale nese číselnou informaci. AI dokáže formátování rozměru sjednotit, aniž by rozuměla tomu, že jednotka nebo desetinná čárka mění skutečný význam údaje.

Postup na malé dávce, ne na celém katalogu

  1. Vyberte vzorek přibližně 50 až 100 položek, který zahrnuje více kategorií, více dodavatelů dat a alespoň jednu položku se známou zvláštností, o které víte, že je náchylná k chybě.
  2. Nechte nástroj navrhnout úpravu podle pravidel z tabulky výše, ale výstup ukládejte odděleně od původních dat. Zdrojová pole se nikdy nepřepisují rovnou.
  3. Porovnejte výstup s originálem mechanicky, ne pohledem: pro každou položku a pole zaznamenejte, zda se hodnota shoduje, liší jen formátem, nebo liší obsahem. Tabulkový nástroj nebo skript na porovnání řetězců zvládne tento krok bez subjektivního dojmu.
  4. Každou položku, kde se liší obsah, ne jen formát, ručně otevřete a rozhodněte, zda je změna v pořádku, chybná, nebo mimo rozsah toho, co mělo být upraveno.
  5. Teprve když vzorek projde kontrolou beze změny obsahu mimo povolený rozsah, rozšiřte postup na další dávku. Rozšiřujte postupně, ne skokem na celý katalog.
  6. Uchovávejte původní hodnoty vedle nových, dokud si nejste jistí, že úprava je v pořádku napříč větším vzorkem. Úprava musí jít vrátit zpět jedním krokem.

Tento postup je pomalejší než jedno spuštění na celý katalog. Rozdíl je v tom, že chybu z prvního kroku objevíte na padesáti položkách, ne na deseti tisících.

Čtyři konkrétní rizika při čištění katalogu

Vymyšlená specifikace. Pokud pole chybí, má AI tendenci hodnotu odvodit z podobných položek nebo z běžného vzoru v kategorii. Odvozená hodnota vypadá jako skutečný údaj, ale nemá oporu ve zdroji. Prázdné pole musí zůstat prázdné nebo označené jako chybějící, nikdy dopočítané.

Tichá změna jednotky nebo naměřené hodnoty. Sjednocení zápisu rozměru nebo hmotnosti může nechtěně přepočítat hodnotu do jiné jednotky, zaokrouhlit ji nebo přesunout desetinnou čárku. Změna vypadá jako kosmetická úprava formátu, ale mění skutečný údaj, se kterým pracuje zákazník i sklad.

Sloučení dvou různých variant. Pokud se dvě položky liší jen v jednom atributu, AI je při sjednocování názvů nebo popisů může začít považovat za duplicitu a sloučit je do jedné. Výsledkem je katalog, který ztratil variantu, o jejímž zmizení nikdo nerozhodl.

Přepsání popisu, které poruší právní nebo bezpečnostní tvrzení. Úprava stylu textu může nenápadně změnit smysl věty s upozorněním, dávkováním, věkovým omezením nebo bezpečnostním pokynem. Tato pole patří do skupiny „nedotknutelné“ z tabulky výše přesně proto, že jejich přesné znění může vyžadovat pravidlo, které nemá AI k dispozici v kontextu.

Kdy postup rozšířit na celý katalog

Rozšíření na celý katalog má smysl, až když vzorek opakovaně projde kontrolou beze změny obsahu mimo povolený rozsah a máte funkční způsob mechanického porovnání, který zvládne i větší objem. Pokud kontrola vzorku stále odhaluje nové typy chyb, katalog ještě není připravený na plné zpracování. Rozsah polí, která se smí upravovat, by se neměl rozšiřovat v okamžiku škálování, protože riziko chyby roste s objemem stejně jako úspora času.

Pole s právním nebo bezpečnostním významem, jako je popis složení, dávkování nebo bezpečnostní upozornění, by měla zůstat mimo automatizované sjednocení bez ohledu na velikost dávky. Posouzení, zda konkrétní text splňuje požadavky na označení výrobku, patří osobě, která má k tomu oprávnění a kontext ve vaší firmě, ne nástroji, který text jen přeformátuje.

Než katalog rozšíříte, přečtěte si jak vybrat AI nástroj pro firmu, protože volba nástroje ovlivňuje, jak snadno půjde úprava mechanicky porovnávat a vracet zpět. Otázku, zda smíte do zpracování vkládat data o dodavatelích nebo zákaznících, řeší je bezpečné vkládat firemní data do ChatGPT. Riziko vymyšlené specifikace souvisí s obecnějším jevem popsaným v proč si AI vymyslí halucinace. Širší rámec zavádění podobných postupů do firmy najdete v zavedení AI ve firmě.

Stav zdrojů a omezení

Doporučení v tomto článku vychází z obecného rámce NIST pro řízení rizik AI, který doporučuje nejdřív zmapovat proces a teprve poté rozšiřovat nasazení, a z pokynů Google Search Central k obsahu vytvářenému s pomocí generativní AI, které se týkají produktových popisů publikovaných na webu. Ani jeden zdroj nepopisuje konkrétně čištění produktových katalogů a ani jeden neobsahuje číselné odhady úspory času nebo míry chyb, proto v článku žádná taková čísla nenajdete. Otázku, zda konkrétní pole popisu nebo štítku splňuje požadavky na označení výrobku, musí posoudit osoba s příslušnou odborností ve vaší firmě, ne tento text.

Časté dotazy

Může AI opravit produktový katalog úplně sama, bez lidské kontroly?

Ne bezpečně. AI dobře sjednotí formát textu, ale nerozezná, kdy sjednocení tiše mění obsah, jednotku nebo právně závazné tvrzení. Návrh proto vždy ukládejte odděleně od zdrojových dat, porovnejte ho mechanicky s originálem a teprve pak rozhodněte o nahrazení. Bez tohoto kroku se úprava nedá spolehlivě vrátit zpět.

Jak velký vzorek stačí na první test čištění katalogu?

Vzorek by měl pokrýt více kategorií, více dodavatelů dat a alespoň jednu položku se známou zvláštností. Přibližně 50 až 100 položek obvykle stačí na odhalení systematické chyby, ale konkrétní počet záleží na rozmanitosti sortimentu. Menší vzorek, který pokrývá jen jednu kategorii, riziko chyby neodhalí.

Jak poznat, že AI u produktu vymyslela chybějící údaj?

Porovnejte navržený výstup se zdrojovým polem řádek po řádku. Pokud pole ve zdroji chybělo a ve výstupu se objevila konkrétní hodnota, jde o odvozený, ne ověřený údaj. Prázdné pole má zůstat prázdné nebo označené jako chybějící, dokud hodnotu nepotvrdí osoba se znalostí specifikace.

Smí AI upravovat text s bezpečnostním upozorněním na produktu?

Text s bezpečnostním nebo právně vyžadovaným tvrzením by měl zůstat mimo automatizovanou úpravu úplně. Posouzení, zda konkrétní znění splňuje požadavky na označení výrobku, patří osobě s odpovídající odborností ve vaší firmě. Tento článek takové posouzení neprovádí a nenahrazuje odborné stanovisko.

Co dělat, když čištění spojí dvě různé varianty produktu do jedné?

Jde o typickou chybu při sjednocování názvů a popisů, kdy nástroj považuje podobné položky za duplicitní. Řešením je mechanické porovnání počtu položek podle kategorie před úpravou a po ní: pokud počet klesl, dohledejte, které záznamy zmizely, a rozhodněte, zda šlo o oprávněné sloučení.

ZDROJE A OVĚŘENÍ

revidováno Lukáš Dlouhý ·