V kostce:

  • AI Observatory analyzovalo 85 633 konverzačních tahů z 24 521 konverzací od 5 000 uživatelů s 52 modely.
  • Podle metodiky Anthropic by bylo vyfiltrováno 48 % konverzací jako nepracovních.
  • Anthropic Economic Index vychází z 1 milionu konverzací, report OpenAI z 1,5 milionu konverzací s ChatGPT.

Nezávislý výzkumný projekt AI Observatory zjistil, že oficiální reporty firem jako Anthropic a OpenAI o užívání jejich chatbotů systematicky opomíjejí velkou část osobních a citlivých konverzací. Podle studie, kterou vedli Anka Reuel ze Stanford Trustworthy AI Research Lab a Shayne Longpre z MIT Media Lab, by při aplikaci metodiky Anthropic Economic Index na data projektu bylo jako „nepracovních“ vyfiltrováno celých 48 % konverzací.

Projekt agregoval 85 633 konverzačních tahů z 24 521 konverzací od 5 000 uživatelů, kteří v letech 2023 až 2025 interagovali s 52 různými modely včetně ChatGPT, Gemini, Claude a Grok. Data pocházejí ze sedmi veřejných datových sad shromážděných se souhlasem uživatelů v rámci předchozích výzkumů. Pro srovnání: Anthropic Economic Index vychází z analýzy milionu konverzací s Claude, report OpenAI o užívání ChatGPT pak z 1,5 milionu konverzací.

Mezi konverzacemi, které by Anthropicova metodika označila za nepracovní, se výrazně častěji objevovala citlivá témata. Zdraví a vztahy tvořily 44,2 % oproti 31,2 % v Anthropicově analýze, obtěžování a nenávistné projevy 27,5 % oproti 5,66 %, sexuální obsah 16,7 % oproti 2,4 % a témata pro dospělé či nelegální obsah 7,9 % oproti 2,1 %. Podobně report OpenAI z roku 2025 uvedl, že jen 30 % spotřebitelského užívání ChatGPT souvisí s prací.

Anthropic sice publikoval samostatné příspěvky o využití Claude pro emoční podporu a společenství, nebo dokonce o generování materiálu zneužívajícího děti, podle Davida Widdera, asistenta profesora na University of Texas at Austin, jsou ale tato zjištění roztříštěná do jednotlivých reportů namísto souhrnného pohledu, jaký nabízí AI Observatory.

Studie ukázala, že způsob užívání AI se výrazně liší podle modelu i v čase. Konverzace v datové sadě WildChat se postupně prodlužovaly a staly se propracovanějšími, přibylo také běžného povídání, zatímco ochota chatbotů přiznat, že jde o umělou inteligenci, klesala. Podíl konverzací s citlivým obsahem naopak v čase klesal, což podle výzkumníků naznačuje, že platformy postupně nasazují účinnější ochranné mechanismy.

Jednotlivé modely se podle studie liší i typem využití. Grok a Gemini lidé častěji používají k vyhledávání informací; Grok je navíc oblíbený zejména pro zprávy a politiku, ale zároveň se v jeho konverzacích koncentrují dezinformace. Naproti tomu Claude od Anthropicu lidé nejčastěji využívají pro programování, Gemini pro sociální interakce a hraní rolí a ChatGPT pro pomoc s domácími úkoly. Rozdíly se objevily i mezi verzemi téhož modelu · konverzace s ChatGPT poháněným GPT-3.5 byly kratší, zatímco GPT-4o vedl k delším a opakovaným interakcím, což odpovídá jeho pověsti modelu spojovaného s emoční závislostí uživatelů.

Zástupce Anthropicu uvedl, že publikovaný výzkum firmy odráží konkrétní otázky a zájmy jejích výzkumných týmů a že společnost považuje podporu nezávislého externího výzkumu za důležitou. OpenAI na žádost o vyjádření nereagovala. Autoři studie zároveň upozorňují, že jejich data pocházejí z dobrovolně poskytnutých zdrojů, a citlivé případy užívání proto mohou být spíše podhodnocené než nadhodnocené.

Co to znamená: Pro firmy provádějící bezpečnostní audity AI systémů studie ukazuje, že spoléhat se výhradně na oficiální reporty poskytovatelů modelů je rizikové, protože tyto materiály nemusí zachycovat plný rozsah citlivého a osobního užívání. Při implementaci a hodnocení AI nástrojů je proto vhodné doplnit firemní data o nezávislé zdroje a počítat s tím, že reálné riziko zneužití či expozice citlivého obsahu může být vyšší, než firemní metriky naznačují.

Zdroje: