V kostce:

  • Copilot snížil kliknutí na stránky Times až o 93 %.
  • OpenAI’s mid-training dataset obsahuje více než 91 692 kopií NYT.
  • Microsoft exec označil scrapování jako “největší krádež práce v lidské historii”.

Microsoft a OpenAI v soudních dokumentech označili scrapování obsahu Times za krádež a uvedli, že jejich AI modely ohrožují ekonomické základy vydavatelů. Podle TechCrunch AI interní dokument Microsoftu popisuje scrapování jako „krádež“ a naznačuje, že AI produkty představují existenciální hrozbu pro vydavatele.

Microsoftovy interní údaje ukazují, že Copilot snížil kliknutí na stránky Times až o 93 %. Podle TechCrunch AI jde o největší pokles ve srovnání s tradičním vyhledávačem Bing. Tento pokles je popsán jako „doom loop“, který by mohl poškodit výkon modelů i celou webovou ekonomiku.

Datová sada používaná při trénování modelů OpenAI obsahuje více než 91 692 kopií článků NYT a přes dva miliony dokumentů z nytimes.com pocházejících z Common Crawl‑derived datasetu. Podle TechCrunch AI tyto údaje odhalují rozsah kopírování, který přesahuje i miliony dokumentů.

Satya Nadella v depozičním prohlášení uvedl, že paywalled obsah musí být licencován a že by požadoval retrénink modelů, pokud by se dozvěděl o scrapování. Podle TechCrunch AI zdůraznil, že Microsoft má právo vyžadovat, aby OpenAI používal licence pro paywalled obsah.

Vedení OpenAI, včetně Nicka Turleyho a Grega Brockmana, poukázalo na existenciální hrozbu pro vydavatele a na schopnost modelů být substitutivní. Podle TechCrunch AI tyto komentáře naznačují, že AI může přímo konkurovat originálnímu obsahu.

Brent Hecht v interní prezentaci popsal „doom loop“ a uvedl, že generativní AI by mohla významně narušit zaměstnanost lidí, kteří generovali data. Podle TechCrunch AI je toto riziko spojeno s velkým množstvím kopírovaného obsahu.

Tyto dokumenty ukazují, že AI scrapování může mít zásadní dopad na tržby vydavatelů a na trh s obsahem. Firmy, které nasazují generativní AI, by měly zvážit rizika spojená s nelegálním získáváním dat a s možným porušením autorských práv.

Co to znamená: Firmy implementující generativní AI musí pečlivě auditovat zdroje dat a zajistit, aby jejich tréninkové sady byly legálně získány. Nedodržení licenčních podmínek může vést k právním sporům a finančním sankcím, které ovlivní provozní náklady a reputaci organizace.

Zdroje: