Kdy data opouští vaši síť
Cloudová AI posílá dotazy a často i kontext na servery poskytovatele. To znamená, že vaše interní dokumenty, kód nebo zákaznická data procházejí externí sítí a ukládají se v cizích datových centrech. I při smluvních zárukách o neukládání (zero-retention) existuje riziko neúmyslného úniku, chyby v anonimizaci nebo právního výzvy k předání dat. Pro českou lékařskou ordinaci, která zpracovává nemocenské listy, nebo pro advokátní kancelář s klientskými smlouvami je to často nepřijatelné riziko.
Co znamená běh modelu u vás
Lokální model (on-premise LLM) běží na vašich GPU serverech nebo výkonných stanicích. Data nikdy neopustí fyzickou hranici vaší sítě, což eliminuje riziko odposlechu při přenosu a úniku u dodavatele. Nároky na hardware jsou ale vysoké: pro použitelný 7B · 8B parametrů model potřebujete minimálně 24 až 48 GB VRAM, pro 70B modely už více karet v clusteru. K tomu sázíte spotřebu elektřiny, chlazení a čas správce na aktualizace kvantizací, ovladačů a bezpečnostních záplat. Typický příklad: české mittelstandové výrobní podnik nasadil Llama 3 8B na dva servery s NVIDIA A100 pro klasifikaci interních servisních protokolů a ušetřil tak měsíční cloudové poplatky i riziko úniku know-how.
Regulace a české realie
GDPR vyžaduje, aby osobní data neopustila EHP bez dostatečných záruk. U amerických cloudových poskytovatelů (OpenAI, Anthropic, Google) řešíte Standardní smluvní klauzule a riziko přístupu třetích zemí. NIS2 směrnice naopak tlačí kritickou infrastrukturu k minimalizaci závislosti na externích dodavatelích. V auditech CIAD se ukazuje, že české banky a pojišťovny preferují lokální modely pro interní analýzy rizik, zatímco marketingové oddělení spokojeně využívají cloud pro generování textů bez osobních dat. Rozdíl není v technologii, ale v klasifikaci dat.
Hybridní cesta a praktické kroky
Nejčastější produkční vzor v ČR je rozdělení podle citlivosti:
- Klasifikace dat · rozlišit veřejná, interní, důvěrná a regulovaná data.
- Routing dotazů · lehký klasifikátor (např. DistilBERT) posílá dotazy s důvěrnými daty na lokální model, ostatní do cloudu.
- Unifikované rozhraní · OpenAI-kompatibilní API (vLLM, Ollama, TGI) umožňuje měnit backend bez změny aplikace.
- Monitoring a logování · lokálně ukládat plné audity, do cloudu posílat jen metriky latence a chybovosti.
- Testování kvality · pravidelně porovnávat odpovědi lokálního a cloudového modelu na vzorové sadě, aby se zachovala užitečnost.
Tento přístup umožňuje využít cloudovou výkonnost pro obecné úkoly (překlady, brainstorming, kódování) a zároveň chránit korunní šperky organizace.
Rozhodovací rámeček pro tým
Před nasazením zodpovězte tyto otázky:
- Jaká je nejvyšší úroveň citlivosti dat, která model uvidí?
- Máme tým schopný spravovat GPU cluster a řešit drivery, kontejnery, monitoring?
- Jaký je měsíční rozpočet na cloudové API versus jednorákové CAPEX na hardware?
- Vyžaduje regulace (GDPR, NIS2, sektorní zákony) fyzickou lokalitu dat v ČR/EU?
- Je model kritický pro dostupnost služby (SLA), nebo jde o vnitřní produktivitu?
Pokud odpovíte „ano“ na prvotní dvě otázky a máte kapacitu, lokální model dává smysl. Pokud chybí kapacita nebo jde o nízkorizikové úkoly, cloud je pragmatičtější. Hybrid pokrývá většinu reálných situací.
Co to znamená: Bezpečnost není binární volba mezi cloudem a on-premise, ale shoda klasifikace dat, regulačních povinností a operačních schopností týmu. Začněte inventarizací dat a pilotech na malém měřítku, než investujete do infrastruktury.
Časté dotazy
Je lokální model skutečně plně offline?
Ano, po stažení vah a kontejneru model běží bez internetového připojení. Aktualizace vah nebo knihoven vyžadují dočasný přístup k repozitářům, ale inference probíhá zcela lokálně.
Kolik to stojí rozběhnout lokální LLM v malé firmě?
Minimální vstup pro 8B model je jedna stanice s 48 GB VRAM (cca 150 až 200 tisíc Kč). Pro produkci s redundancí a 70B modelem počítejte od 500 tisíc Kč za hardware plus náklady na správu.
Mohu používat cloud pro trénink a lokální pro inferenci?
Trénink (fine-tuning) vyžaduje obrovský výpočetní výkon, proto se obvykle děje v cloudu. Hotové váhy pak stáhnete a spustíte lokálně. Inferenci lze dělat i v cloudu, ale ztrácíte výhodu isolation dat.
Co je to kvantizace a ovlivňuje bezpečnost?
Kvantizace zmenšuje model (např. 4-bit) pro menší paměťová náročí. Bezpečnost dat neovlivňuje, může ale mírně snížit přesnost odpovědí. Je to standardní krok pro nasazení na dostupném hardwaru.
Jak řešit GDPR při používání OpenAI API?
Musíte uzavřít DPA (Data Processing Addendum), používat zero-retention endpoint (pokud je k dispozici), anonimizovat vstupy a posoudit riziko přenosu do USA. Pro citlivá data je toto často nedostatečné.