Měřte pracovní úkol, ne dojem ze školení
Docházka říká, kdo přišel. Test znalostí říká, kdo si zapamatoval správnou odpověď. Spokojenost říká, jak lidé vnímali lekci. Ani jedna z těchto veličin sama neukazuje, zda tým později vytvořil kvalitnější výstup, potřeboval méně celkové práce nebo dokázal zachytit chybu.
Než školení začne, vyberte jednu jednotku práce, kterou lze zopakovat za srovnatelných podmínek. Musí mít jasný začátek, konec, vlastníka procesu a kritéria přijatelnosti. „Psaní s AI“ je příliš široké. „Připravit první návrh struktury z daných schválených podkladů, dohledat zdroje a předat jej ke standardní kontrole“ už měřit lze.
Nejdřív oddělte měření procesu od hodnocení lidí
Tento pracovní list je navržen pro rozhodnutí o úkolu, školení a pracovním postupu. Výchozí jednotkou je vzorek výstupu nebo týmová dávka, ne zaměstnanec. Nepřebírejte jména, pracovní e-maily, přihlašovací identifikátory, kompletní historii promptů ani individuální telemetrii jen proto, že je nástroj umí exportovat.
Pokud lze výstup nebo skóre přiřadit člověku, může jít o osobní údaj; pseudonymizace sama z něj anonymní údaj nedělá. GDPR požaduje konkrétní účel, zákonnost, transparentnost, minimalizaci, omezenou dobu uchování a odpovídající zabezpečení. Profilování je užší pojem pro automatizované zpracování osobních údajů používané k hodnocení osobních aspektů, včetně pracovního výkonu. Článek 22 se týká ještě užší situace výhradně automatizovaného rozhodnutí s právním nebo obdobně významným účinkem. Tento list žádný právní základ nevytváří a výsledky se nesmějí bez samostatného schválení použít pro odměnu, kázeň, povýšení, nábor nebo ukončení pracovního vztahu.
Praktický výchozí režim je proto: náhodné ID procesního vzorku bez mapy na člověka, syntetická nebo schváleně redigovaná data, předem určená minimální velikost skupiny pro týmový souhrn a potlačení členění, které by odhalilo jednotlivce. Univerzálně bezpečný počet neexistuje; organizace jej musí určit podle možnosti zpětného přiřazení v daném týmu. Pokud potřebuje individuální měření, musí ještě před sběrem zapojit HR, právníka a pověřence pro ochranu osobních údajů a vyřešit také česká pracovněprávní pravidla; tento článek takové posouzení nenahrazuje.
Artefakt: měřicí list před/po
List má tři části. První uzamkne podmínky, druhá zaznamená jednotlivá pozorování a třetí určí, jak se výsledek smí interpretovat.
A. Hlavička měřicí série
Vyplňte ji jednou před prvním pozorováním.
| Pole | Přesný zápis |
|---|---|
| ID série | vlastní neměnný identifikátor |
| Rozhodnutí | co uděláme, pokud se výsledek zlepší, nezmění nebo zhorší |
| Jednotka práce | jeden výstup od převzetí zadání po stav připravený ke standardní kontrole |
| Proces a tým | pracovní postup a dostatečně velká skupina; bez jmen a individuálního pořadí |
| Vstupní balíček | seznam a verze podkladů; u paralelních variant popis srovnatelnosti |
| Nástroj a model | produkt, režim, známá verze a důležité nastavení |
| Povolené vstupy | co může a nemůže být do nástroje vloženo |
| Rubrika | verze kritérií kvality a příklady pro každou úroveň |
| Hodnotitelé | role, jejich proškolení a způsob řešení neshody |
| Období | data výchozího a následného měření |
| Velikost vzorku | plánovaný a skutečný počet procesních výstupů či dávek; počet lidí pouze pokud je nezbytný a schválený |
| Datový plán | účel, přesná pole, přístupy, agregace, minimální velikost skupiny a datum výmazu |
| Známé další vlivy | změna procesu, nástroje, týmu, sezóny, pobídek nebo další podpora |
Pokud se uprostřed série změní model, zdrojový balíček nebo rubrika, nelepte výsledek bez označení k původním měřením. Založte novou verzi série nebo změnu u každého řádku viditelně označte.
B. Jeden řádek pro jeden procesní vzorek
| Náhodné ID vzorku | Fáze | Úplný čas | Kvalita 0 až 4 | Čas oprav | Počet oprav | Závažná chyba | Zdroje ověřeny | Pravidla dodržena | Poznámka o změně podmínek |
|---|---|---|---|---|---|---|---|---|---|
| před / po / následně | ano/ne + typ | ano/ne/nevztahuje se | ano/ne/nevztahuje se |
Úplný čas začíná převzetím zadání a končí výstupem připraveným k běžné kontrole. Zahrnuje zadávání, čekání, dohledávání, kontrolu i vlastní opravy. Pokud firma měří pouze čas „generování“, může jen přesunout práci do neviditelné kontroly.
Čas oprav je práce další osoby nebo pozdější přepracování nutné k dosažení stejného standardu jako před změnou. Měřte jej odděleně, ale při rozhodnutí ho k celkové práci přičtěte.
Závažná chyba je předem definovaný jev, který může sám zneplatnit výstup: například nepodložené rozhodující tvrzení, použití nepovoleného vstupu nebo výstup, který by bez opravy vedl k nesprávnému úkonu. Typy a závažnost si musí organizace stanovit podle procesu.
C. Pracovní slepá rubrika 0 až 4 pro vzorky, ne zaměstnance
Rubrika je návrh CIAD, nikoli validovaný psychometrický nebo HR nástroj. Hodnotitel by pokud možno neměl vědět, zda výstup vznikl před školením, po něm nebo s AI. Z hodnoticí kopie odstraňte osobní a technické stopy, které pro posouzení nejsou potřebné; nemažte povinnou procesní auditní stopu. Nevytvářejte mapu vzorku na zaměstnance, pokud ji rozhodnutí nepotřebuje. Stejný člověk by neměl měnit kritéria až poté, co uvidí očekávaný výsledek.
| Úroveň | Popis |
|---|---|
| 0 | výstup nelze použít a obsahuje zásadní nedostatek; chybí podstatná část úkolu |
| 1 | vyžaduje rozsáhlé přepracování; několik rozhodujících kritérií není splněno |
| 2 | jádro je přítomné, ale běžná kontrola odhalí podstatné opravy |
| 3 | splňuje předem popsaný standard a vyžaduje jen obvyklou drobnou úpravu |
| 4 | splňuje standard a navíc přináší předem definovanou, ověřitelnou přidanou hodnotu |
Ke každé úrovni napište dva syntetické modelové příklady; skutečné příklady použijte pouze po schválené redakci či anonymizaci. Samotná čísla bez popisu vedou k tomu, že dva hodnotitelé mohou měřit něco jiného.
Jak provést měření bez záměny podmínek
1. Zachyťte výchozí procesní vzorek před školením
Nesnažte se rekonstruovat „před“ z paměti až po úspěšném pilotu. Ze stejného procesu zachyťte více než jeden vhodný výstup, pokud to provoz dovolí. Zapište i neúspěšné a nedokončené procesní vzorky; jejich vyřazení by mohlo výsledek uměle vylepšit. Není nutné ani žádoucí spojovat řádky se jmény lidí.
2. Nepoužívejte úplně stejnou odpověď jako paměťový test
Před a po mají být úlohy srovnatelné, ne nutně totožné. Když člověk zná správný text z prvního kola, měříte zapamatování. Připravte paralelní varianty se stejným typem vstupu, obtížností, rozsahem a rubrikou. Rozdíly mezi variantami popište.
3. Oddělte nácvik od následného používání
První pokus po lekci může zachytit krátkodobou podporu lektora. Přidejte další pozorování po době odpovídající běžné frekvenci úkolu. Sedm a třicet dní jsou praktické kontrolní body jen tam, kde se úkol v tomto období skutečně opakuje.
4. Zachovejte i nulové použití v procesním vzorku
Pokud se ve vzorku AI nepoužila, zapište pouze procesní kategorii důvodu: nevhodný úkol, chybějící přístup, nejasné pravidlo nebo zvolený stávající postup. Nesbírejte k tomu jméno ani volný komentář o pracovníkovi. Nulové použití není automaticky špatný výsledek. U nevhodného úkolu může být správným chováním AI nepoužít.
Pět pohledů, které se nesmějí slít do jednoho čísla
| Pohled | Otázka | Typické špatné zjednodušení |
|---|---|---|
| Rychlost | Je úplný úkol rychlejší po započtení kontroly a oprav? | měřit jen čekání na odpověď modelu |
| Kvalita | Splní výstup stejná kritéria jako dříve? | hodnotit styl místo pracovního standardu |
| Spolehlivost | Jak často se objevuje závažná chyba nebo nedokončení? | skrýt selhání v průměrném skóre |
| Dodržení pravidel | Byly použity schválené vstupy, nástroj a kontrola? | zaměnit absenci incidentu za prokázanou bezpečnost |
| Použitelnost v čase | Opakuje se přijatelný procesní výsledek bez podpory lektora? | počítat individuální přihlášení nebo počet promptů |
Vedení může předem určit minimální kvalitu a nepřijatelné typy chyby. Konkrétní hranice ale musí vycházet z procesu. Tento článek neposkytuje univerzální procento zlepšení ani bezpečný počet pozorování.
Jak popsat výsledek bez nepravdivé jistoty
Použijte sílu tvrzení odpovídající návrhu měření:
| Dostupný důkaz | Přiměřená formulace | Co netvrdit |
|---|---|---|
| jeden pokus před a jeden po | „V tomto konkrétním příkladu jsme pozorovali…“ | „Školení způsobilo…“ |
| více srovnatelných výstupů stejného procesu | „Ve sledovaném procesním vzorku se po školení změnilo…“ | „Výsledek platí pro celou firmu“ |
| opakování v čase se stabilními podmínkami | „Změna se ve sledovaném období opakovala…“ | „Bude trvalá“ |
| předem navržená kontrolní skupina a vhodná analýza | „Za těchto podmínek odhadujeme účinek…“ | přenos výsledku na jiné role a nástroje bez dalšího testu |
Vždy uveďte počet procesních vzorků, období, změny podmínek, způsob hodnocení a chybějící data. Počet lidí uvádějte jen tehdy, když je pro interpretaci nezbytný a zveřejnění neodhalí jednotlivce. Průměr bez rozptylu může zakrýt nestabilitu nebo závažná selhání, proto uvádějte také rozdělení výsledků a počty kritických chyb.
Co ukazují dvě terénní studie a kde končí jejich platnost
Studie Dell’Acqua a kol., publikovaná v Organization Science v roce 2026, zahrnula 758 znalostních pracovníků a realistické poradenské úlohy. U 18 úloh, které autoři považovali za ležící uvnitř tehdejší hranice schopností GPT-4, pozorovali zlepšení; u jediné vybrané úlohy mimo tuto hranici byli účastníci s AI méně často správní. Autoři sami označují jedinou úlohu mimo hranici za omezení. Výsledek podporuje testování po úlohách, nikoli obecný koeficient přínosu.
Brynjolfsson, Li a Raymond analyzovali postupné nasazení generativního asistenta u 5 172 pracovníků zákaznické podpory. Recenzovaný článek v Quarterly Journal of Economics uvádí průměrný růst počtu úspěšně vyřešených problémů za hodinu o 15 % a velké rozdíly podle zkušenosti. Studie měří konkrétní nástroj, roli, provoz a metriku; nešlo o obecné firemní školení a její procenta nejsou očekáváním pro váš tým.
Obě práce jsou důvodem předem popsat úkol, roli, podmínky a rozdílné účinky. Nejsou důvodem slíbit procentní návratnost školení CIAD.
Rozhodnutí po měření
Výsledek uzavřete jednou ze čtyř cest:
- pokračovat ve stejném omezeném použití, pokud výstup splňuje standard, pravidla a přínos je opakovaný;
- upravit školení nebo postup, pokud týmové vzorky opakovaně selhávají v konkrétním kroku, ale úloha zůstává vhodná;
- změnit nástroj či kontrolu, pokud problém není dovednost, ale prostředí nebo rozhraní;
- zastavit použití pro tento úkol, pokud kvalita, náklady na kontrolu nebo závažná chyba překročí interní hranici.
Pokud chcete rozlišit možné příčiny změny, měňte podle možností jeden hlavní prvek a všechny další změny zaznamenejte. Nový nástroj, jiný typ úlohy nebo nová rubrika obvykle znamenají novou verzi měřicí série; nejde však o záruku kauzálního důkazu.
Širší cestu od výběru úkolu po řízené zavedení popisuje zavedení AI ve firmě. Kontext praktického nácviku najdete na stránce školení AI pro firmy; rozpočtové rozhodnutí před spuštěním pilotu řeší jak obhájit rozpočet na školení AI a formát a zajištění samotného školení jak zvolit formát a zajištění AI školení. Před převzetím benchmarku porovnejte metodiku ve studiích CIAD a význam použitého modelu či metriky v datových srovnáních. Pro návrh výchozího měření lze použít poptávkový formulář; žádný výsledek ani procentní zlepšení zde negarantujeme.
Stav zdrojů a omezení
Pět zdrojů bylo naposledy ověřeno 5. 8. 2026. Obecný rozcestník NIST TEVV sdružuje zdroje k testování a hodnocení AI, ale tento list nepředepisuje. NIST ARIA 0.1 popisuje vlastní pilot se třemi scénáři, třemi úrovněmi testování a měřicími stromy; samotný report označuje výsledky za předběžné a počáteční CoRIx za vhodnější pro charakterizaci aplikací než pro jejich porovnávání. Nejde o univerzální protokol pro školení ani o validaci tohoto listu. Uvedené terénní studie nelze přenést na jinou organizaci bez nového ověření. Článek neobsahuje data klientů CIAD, neposkytuje právní základ pro sledování zaměstnanců a nedokazuje kauzalitu z prostého srovnání před a po.
Časté dotazy
Stačí po školení dotazník spokojenosti?
Ne pro tvrzení o změně práce. Dotazník může zachytit zkušenost účastníků, ale neověří kvalitu výstupu, úplný čas, přepracování ani dodržení pravidel. Použijte ho jako doplňkový signál, nikoli hlavní výsledek.
Je počet promptů vhodná metrika produktivity?
Ne. Více promptů může znamenat aktivitu, ne lepší práci. Pro dopad sledujte dokončený pracovní úkol, kvalitu podle stejné rubriky, čas včetně kontroly, opravy a závažná selhání.
Prokáže srovnání před a po, že změnu způsobilo školení?
Samo o sobě ne. Výsledek může ovlivnit jiný nástroj, snazší úloha, zkušenost, změna hodnotitele, sezónnost nebo další podpora. Bez vhodné kontrolní skupiny či robustnějšího návrhu popisujte pozorovanou souvislost a omezení.
Co dělat, když je práce rychlejší, ale kvalita horší?
Nevyhlašujte úsporu času. Započítejte přepracování a rozhodněte podle předem stanovené minimální kvality a závažnosti chyb. U některých úkolů má i malý pokles správnosti převážit časový přínos.
Má měření vytvořit skóre každého zaměstnance?
Výchozí návrh ne. Použijte náhodné identifikátory procesních vzorků bez mapy na lidi a reportujte týmové souhrny. Pokud má být výsledek spojen s člověkem nebo pracovním rozhodnutím, musí organizace předem samostatně vyřešit účel, právní základ, transparentnost, přístup, uchování a pracovněprávní pravidla s HR, právníkem a pověřencem.
ZDROJE A OVĚŘENÍ
- NIST: AI test, evaluation, validation and verification (TEVV; ověřeno 5. 8. 2026)
- NIST AI 700-2, Assessing Risks and Impacts of AI: ARIA Pilot Evaluation Report (ověřeno 5. 8. 2026)
- Dell'Acqua et al., Navigating the Jagged Technological Frontier, Organization Science (primární studie; ověřeno 5. 8. 2026)
- Brynjolfsson, Li, Raymond: Generative AI at Work, Quarterly Journal of Economics 140(2), 2025 (recenzovaná studie; ověřeno 5. 8. 2026)
- Nařízení (EU) 2016/679 (GDPR), zejména články 4, 5, 6, 13, 22, 25 a 32 (ověřeno 5. 8. 2026)