Odešlete odpovědi palec dolů, protože vám nesedla, nebo si prostě jen běžně chatujete. Málokdo si u toho uvědomí, že konverzace, kterou berete jako soukromý rozhovor se strojem, může skončit na obrazovce cizího člověka, jehož jedinou prací je ji ohodnotit. Anotátor je člověk, kterého si poskytovatel najme přímo nebo přes externí firmu, aby posoudil, jestli je odpověď modelu dobrá, škodlivá nebo v rozporu s pravidly, na vzorku skutečných konverzací z běžného provozu. Podmínky pěti poskytovatelů, které jsme prošli, tuhle praxi otevřeně přiznávají, každý jinými slovy. Anthropic anotátory řadí do stejné věty jako uživatele, jako dva rovnocenné zdroje tréninkových dat:
Data that our users or crowd workers provide, including Inputs and Outputs from our Services (unless users opt out)
Data, která poskytují naši uživatelé nebo externí hodnotitelé, včetně vstupů a výstupů z našich služeb (pokud se uživatelé neodhlásí). Otter jde dál a přímo pojmenovává dodavatele, kteří tuhle práci dělají za peníze: poskytovatele služeb popisování dat, jimž sdílená data slouží k vytvoření trénovacích a hodnoticích souborů.
Co podmínky opravdu říkají
Poskytovatelé zdůrazňují, že většinu zpracování dělají automatické systémy, ale výslovně počítají i s ruční kontrolou „v některých případech”, aniž uvádí klíč výběru (Meta). xAI přiznává, že personál smí obsah kontrolovat i kvůli zlepšování funkcí produktu, tedy běžné kontrole kvality u nerizikového vstupu. Nejdál jde Google: poskytovatelé služeb pomáhají kontrolovat obsah YouTube z hlediska bezpečnosti a Google poslouchá vzorky uloženého zvuku, tam si člověk nahrávku skutečně pustí. Ne každý hodnotitel navíc vidí konverzaci se jménem: Anthropic vstupy a výstupy ze zpětné vazby odosobní od ID, ale jen pro tenhle krok, u bezpečnostních případů si identitu ponechává právo dohledat.
Jak je to závažné
Pro člověka, který si povídá o receptu na oběd, je riziko malé. Jinak to vypadá u tří skupin lidí. Živnostník nebo právník, který do nástroje vloží pasáž ze smlouvy, riskuje, že text uvidí externí hodnotitel, pokud padne do vzorku kontroly kvality, aniž by to předem zjistil. Zaměstnanec, který nahraje přepis porady do nástroje typu Otter, předává informace dodavateli, jehož jméno se v podmínkách neuvádí, a firma o tom typicky neví. A kdokoli, kdo řekne citlivou informaci nahlas hlasovému asistentovi, riskuje, že se stane jedním ze „vzorků” zvuku, které podle Googlu poslechne živý člověk: hlas nese víc než text, emoce, přízvuk i informaci o tom, kdo je s vámi v místnosti.
Bezpečnostní výjimka je navíc formulovaná tak široce, že ji žádné nastavení neobchází: u Anthropicu platí bez ohledu na vypnutí tréninku, u xAI mezi ni patří i zlepšování produktu, u Mety ruční kontrola nemá vypínač.
Jak požádat o vymazání dat
Právo na vymazání dat podle článku 17 nařízení o ochraně osobních údajů platí u všech pěti poskytovatelů. Lhůta na odpověď je podle článku 12 odstavce 3 jeden měsíc s možností prodloužení o další dva.
Konkrétní cesty: Anthropic privacy@anthropic.com nebo dpo@anthropic.com, jednotlivou konverzaci smažete i přímo v účtu (z historie ihned, ze zázemí do 30 dnů). xAI privacy@x.ai, smazání do 30 dnů. Meta nástroj Accounts Center, sekce pro informace a oprávnění. Google přes myaccount.google.com, sekce Data a soukromí. Otter privacy@otter.ai nebo formulář v nastavení účtu.
Co žádost o vymazání dat nevrátí zpět: hodnocení, které anotátor už provedl, a poznatek, který se díky němu dostal do trénovacích dat modelu. Anthropic to přiznává vlastními slovy: práva jsou omezená a postupy pro žádosti k tréninkovému souboru dat jsou složité. Smazaný text zmizí z účtu, ale co z něj model pochytil, se zpětně rozebrat nedá.
Jak se chránit
- Nedávejte palec nahoru ani dolů u odpovědí s citlivým obsahem: u Anthropicu je zpětná vazba jeden z výslovně uvedených způsobů, jak materiál skončí u lidského hodnocení bez ohledu na nastavení tréninku.
- Vypněte trénink na datech v nastavení účtu tam, kde je nabízený. Bezpečnostní výjimku to nezruší, sníží ale počet konverzací vstupujících do zlepšování produktu.
- Citlivé firemní údaje anonymizujte předem: jména nahraďte iniciálami, čísla smluv vynechte, částky zaokrouhlete, a s hlasovým asistentem mluvte o citlivých věcech jen v nutném případě, raději v textu.
- Pro firemní data sáhněte po podnikovém či API účtu, kde ho poskytovatel nabízí: typ smlouvy určuje, kdo obsah smí vidět.
Verdikt
Nejslabším místem je tu jednoznačně přístup lidí k obsahu. Pět poskytovatelů, jedno jádro: člověk se dívá na vaše konverzace mnohem častěji, než napovídá představa „mluvím jen s programem”. Anthropic a Otter to popisují téměř jako samozřejmost, Meta a xAI to zabalují do formulace, která zakrývá víc, než odhaluje. Nejkonkrétnější přiznání patří Googlu: lidé doopravdy poslouchají vzorky vašeho hlasu. Jedinou zárukou napříč poskytovateli je odosobnění dat před tréninkem, a i tu si každý v bezpečnostních případech vyhrazuje právo zrušit.
ZDROJE A CITACE
Citace 8
Data that our users or crowd workers provide, including Inputs and Outputs from our Services (unless users opt out)
Data, která poskytují naši uživatelé nebo externí hodnotitelé, včetně vstupů a výstupů z našich služeb (pokud se uživatelé neodhlásí)
Data labeling service providers who provide annotation services and use the data we share to create training and evaluation data for Otter’s product features.
Poskytovatelé služeb popisování dat, kteří poskytují anotační služby a data, jež jim sdílíme, používají k vytvoření trénovacích a hodnoticích dat pro funkce produktu Otter.
The information we use for these purposes is automatically processed by our systems. But in some cases, we also use manual review to access and review your information.
Informace, které pro tyto účely používáme, naše systémy zpracovávají automaticky. V některých případech ale k přístupu k vašim informacím a jejich kontrole používáme i ruční kontrolu.
Automated systems that analyze your use of the Service and User Content may be used for business, safety, and compliance purposes. Our authorized personnel may review how you use the Service and your User Content for specific business purposes, including improving product features, investigating security incidents and potential misuse of our Service, and complying with our legal obligations.
Automatizované systémy, které analyzují způsob, jakým službu používáte, a váš uživatelský obsah, mohou být použity pro obchodní, bezpečnostní a právní účely. Náš pověřený personál smí kontrolovat, jak službu používáte a jaký je váš uživatelský obsah, pro konkrétní obchodní účely, včetně zlepšování funkcí produktu, vyšetřování bezpečnostních incidentů a případného zneužití naší služby a plnění právních povinností.
We also use service providers to help review YouTube video content for public safety and analyze and listen to samples of saved user audio to help improve Google’s audio recognition technologies.
Také využíváme poskytovatele služeb, kteří nám pomáhají kontrolovat video obsah YouTube z hlediska veřejné bezpečnosti a analyzovat a poslouchat vzorky uloženého zvuku uživatelů, abychom zlepšili technologie rozpoznávání zvuku Google.
When you submit Feedback, we disassociate Inputs and Outputs from your user ID to use them for training and improving our models.
Když odešlete zpětnou vazbu, oddělíme vstupy a výstupy od vašeho uživatelského ID, abychom je použili k trénování a zlepšování našich modelů.
Customer authorizes Otter and its service providers to use Customer Content for the sole purpose of providing the Otter Platform and performing the activities contemplated by this Agreement (such as maintaining, securing, debugging, and otherwise performing quality control for the Otter Platform).
Zákazník opravňuje Otter a jeho poskytovatele služeb používat obsah zákazníka výhradně za účelem poskytování platformy Otter a provádění činností předpokládaných touto smlouvou (jako je údržba, zabezpečení, ladění a další provádění kontroly kvality platformy Otter).
Depending on where you live and the laws that apply in your country of residence, you may enjoy certain rights regarding your personal data, as described further below. However, please be aware that these rights are limited, and that the processes by which we may need to action your requests regarding our training dataset are complex.
V závislosti na tom, kde žijete, a na právu platném ve vaší zemi, můžete mít ohledně svých osobních údajů určitá práva popsaná dále. Mějte však na paměti, že tato práva jsou omezená a že postupy, kterými musíme vaše žádosti týkající se našeho tréninkového souboru dat vyřizovat, jsou složité.
Časté dotazy
Kdo jsou anotátoři a proč vidí moje konverzace?
Jsou to lidé, které si poskytovatel najme přímo nebo přes externí firmu, aby hodnotili skutečné odpovědi modelu. Otter je v podmínkách výslovně jmenuje jako poskytovatele služeb popisování dat, Anthropic je řadí do stejné kategorie jako samotné uživatele coby zdroj dat pro trénink.
Vidí anotátor moje jméno u textu, který hodnotí?
Ne vždy. Anthropic u zpětné vazby uvádí, že vstupy a výstupy před použitím k tréninku odosobní od uživatelského ID. Anonymizace ale platí jen pro tenhle konkrétní krok a Anthropic si sám v podmínkách ponechává možnost identitu u bezpečnostních případů znovu dohledat.
Můžete lidskému přezkumu úplně zabránit?
Podle prostudovaných podmínek ne. Vypnutí tréninku omezí, kolik dat se do procesu vůbec dostane, ale bezpečnostní a compliance výjimka platí bez ohledu na tohle nastavení u všech pěti poskytovatelů, které jsme prošli.
Mění se něco, když použijete firemní nebo API účet místo osobního?
Ano, u většiny poskytovatelů právě typ smlouvy určuje, kdo obsah smí vidět. Podmínky prošlé pro tento článek se ale týkají osobních účtů. Firemní zpracování řeší samostatná smlouva, kterou korpus k tomuto článku neobsahoval.