17. SRPNA 2026

Amazon podle 404 Media ničí vzácné knihy za účelem trénování AI modelů

Investigativní server 404 Media pomocí sledovacího zařízení vystopoval zásilku přibližně tisíce knih až do amazonského skladu v Las Vegas, kde se knihy skenují…

Téma
AI modely
Čtení
2 min
Autor
CIAD

V kostce:

  • 404 Media umístil sledovací AirTag do knihy ze zásilky asi 1000 kusů.
  • Zásilka skončila v amazonském skladu VGT3 v komplexu LAS8 v Las Vegas.
  • Amazon uvedl, že knihy kupuje ke zlepšení svých produktů a služeb.

Investigativní server 404 Media zdokumentoval, že společnost Amazon ve velkém nakupuje knihy, odstraňuje jejich vazby, skenuje je pro trénování AI modelů a poté fyzické výtisky ničí. Redakce to dokázala tak, že do jedné ze zhruba tisícikusé zásilky vložila sledovací zařízení AirTag a sledovala jeho cestu napříč Spojenými státy až do amazonského skladu v Las Vegas.

Zásilku v červenci objednal jeden z knihkupců prostřednictvím tržiště Biblio. Jak uvedl Simon Willison, kterého 404 Media citoval, knihkupci v poslední době opakovaně zaznamenávají podobně velké objednávky od anonymních zákazníků, kteří nejsou citliví na cenu, a tyto objednávky spojují s firmami hledajícími trénovací data pro umělou inteligenci. Tržiště Biblio na dotazy novinářů nereagovalo.

Sledovaná kniha, jak zjistila redakce, prošla několika logistickými uzly v Kalifornii, Wisconsinu a Coloradu, než nakonec dorazila do amazonského skladu VGT3, který je součástí komplexu LAS8 na severovýchodě Las Vegas. Vstup do zařízení zdobí logo dinosaura držícího v tlapách knihu. Podle 404 Media diskuse zaměstnanců Amazonu na online fórech potvrdily, že ve VGT3 probíhá destruktivní skenování velkého množství knih.

Amazon serveru 404 Media sdělil, že knihy nakupuje „prostřednictvím komerčních kanálů ke zlepšení produktů a služeb, které zákazníci využívají“. Tím zároveň potvrdil, že fyzické výtisky po naskenování ničí. Podle serveru TechCrunch společnosti jako Amazon potřebují k trénování jazykových modelů obrovské množství textu, protože již vyčerpaly dostupný obsah z internetu · v případě Anthropicu podle dřívějších zjištění šlo dokonce o nelegálně získané pirátské kopie knih.

Vzácné a těžko dostupné tituly, zejména ty již nevydávané nebo online nedohledatelné, jsou podle TechCrunch cennou datovou surovinou. Texty vydané před rokem 2022 mají navíc výhodu, že jistě nevznikly pomocí jazykového modelu, což firmám pomáhá vyhnout se takzvanému kolapsu modelu · jevu, který nastává při trénování na příliš velkém podílu textu vygenerovaného samotnou AI.

Co to znamená: Případ ukazuje, že firmy vyvíjející AI modely aktivně vyhledávají offline zdroje trénovacích dat mimo rámec standardních licenčních a autorskoprávních kontrol. Pro společnosti provádějící audit dodavatelských řetězců AI je to signál, že je nutné prověřovat nejen výstupy modelů, ale také původ trénovacích dat a způsoby jejich získávání.

Zdroje:

Potřebujete prověřit AI nebo data ve vaší organizaci?Chcete prověřit AI nebo data?

CIAD audituje AI systémy, weby a datovou bezpečnost ve firmách, obcích i regulovaných organizacích. První konzultace je nezávazná.Auditujeme AI systémy, weby a datovou bezpečnost. První konzultace je nezávazná.

KONTAKTOVAT CIAD

Týdenní newsletter CIAD.

Co ukázala data z našich studií, jeden praktický postup pro práci s AI a regulace přeložená do srozumitelných kroků.Data z našich studií, jeden praktický postup pro práci s AI a regulace v jasných krocích.

PŘIHLÁSIT NEWSLETTER