V kostce:
- 404 Media umístil sledovací AirTag do knihy ze zásilky asi 1000 kusů.
- Zásilka skončila v amazonském skladu VGT3 v komplexu LAS8 v Las Vegas.
- Amazon uvedl, že knihy kupuje ke zlepšení svých produktů a služeb.
Investigativní server 404 Media zdokumentoval, že společnost Amazon ve velkém nakupuje knihy, odstraňuje jejich vazby, skenuje je pro trénování AI modelů a poté fyzické výtisky ničí. Redakce to dokázala tak, že do jedné ze zhruba tisícikusé zásilky vložila sledovací zařízení AirTag a sledovala jeho cestu napříč Spojenými státy až do amazonského skladu v Las Vegas.
Zásilku v červenci objednal jeden z knihkupců prostřednictvím tržiště Biblio. Jak uvedl Simon Willison, kterého 404 Media citoval, knihkupci v poslední době opakovaně zaznamenávají podobně velké objednávky od anonymních zákazníků, kteří nejsou citliví na cenu, a tyto objednávky spojují s firmami hledajícími trénovací data pro umělou inteligenci. Tržiště Biblio na dotazy novinářů nereagovalo.
Sledovaná kniha, jak zjistila redakce, prošla několika logistickými uzly v Kalifornii, Wisconsinu a Coloradu, než nakonec dorazila do amazonského skladu VGT3, který je součástí komplexu LAS8 na severovýchodě Las Vegas. Vstup do zařízení zdobí logo dinosaura držícího v tlapách knihu. Podle 404 Media diskuse zaměstnanců Amazonu na online fórech potvrdily, že ve VGT3 probíhá destruktivní skenování velkého množství knih.
Amazon serveru 404 Media sdělil, že knihy nakupuje „prostřednictvím komerčních kanálů ke zlepšení produktů a služeb, které zákazníci využívají“. Tím zároveň potvrdil, že fyzické výtisky po naskenování ničí. Podle serveru TechCrunch společnosti jako Amazon potřebují k trénování jazykových modelů obrovské množství textu, protože již vyčerpaly dostupný obsah z internetu · v případě Anthropicu podle dřívějších zjištění šlo dokonce o nelegálně získané pirátské kopie knih.
Vzácné a těžko dostupné tituly, zejména ty již nevydávané nebo online nedohledatelné, jsou podle TechCrunch cennou datovou surovinou. Texty vydané před rokem 2022 mají navíc výhodu, že jistě nevznikly pomocí jazykového modelu, což firmám pomáhá vyhnout se takzvanému kolapsu modelu · jevu, který nastává při trénování na příliš velkém podílu textu vygenerovaného samotnou AI.
Co to znamená: Případ ukazuje, že firmy vyvíjející AI modely aktivně vyhledávají offline zdroje trénovacích dat mimo rámec standardních licenčních a autorskoprávních kontrol. Pro společnosti provádějící audit dodavatelských řetězců AI je to signál, že je nutné prověřovat nejen výstupy modelů, ale také původ trénovacích dat a způsoby jejich získávání.
Zdroje: