V kostce:
- Streamovací přepis dosahuje WER 4,0 %, dávkový 2,6 %, měřeno firmou Artificial Analysis
- Finální přepis je o 70 % rychlejší oproti předchozímu modelu Chirp 3
- Cena je přibližně 0,005 USD/min u dávkového a 0,009 USD/min u streamovacího zpracování
Google představil model pro převod řeči na text Gemini 3.5 Transcribe, který nabízí dvě samostatná rozhraní API · jedno se subsekundovou odezvou při streamování, druhé s vyšší přesností pro dávkové zpracování. Podle Google DeepMind a serveru Marktechpost dosahuje streamovací varianta průměrné chybovosti (WER) 4,0 procenta, dávková pak 2,6 procenta; údaje naměřila společnost Artificial Analysis. Model automaticky rozpoznává více než 85 jazyků a zvládá i přepínání mezi jazyky uprostřed věty.
Model je dostupný přes dvě oddělená rozhraní s odlišnými funkcemi. Streamovací verze gemini-3.5-transcribe-live běží přes Live API, zpracovává zvuk po 100milisekundových úsecích v 16bitovém PCM formátu při 16 kHz a jednotlivé relace jsou omezeny na deset minut nepřetržitého streamování. Dávková verze gemini-3.5-transcribe pracuje přes Interactions API a standardně podporuje až hodinu zvuku, což se při zapnutém rozpoznávání mluvčích nebo časových značek slov zkracuje na 30 minut.
Podle Google DeepMind nabízí dávkové zpracování na rozdíl od streamování rozpoznávání mluvčích (diarizaci) s přesností až pro tři mluvčí · podpora pro více mluvčích je zatím označena jako experimentální · a navíc časové značky jednotlivých slov. Streamovací verze tyto funkce nepodporuje, zato podle Marktechpost umožňuje takzvané efemérní tokeny pro mobilní a webové klienty, díky nimž není nutné uchovávat API klíč.
Oba režimy nabízejí dva způsoby přepisu: verbatim, tedy doslovný přepis včetně výplňkových slov a opakování, a smart, který odstraňuje nedokonalosti řeči, řeší mluvené sebeopravy a text formátuje. Podle Google DeepMind verbatim u příkladu věty se sebeopravou zachová celou původní formulaci, zatímco smart ji převede do čisté podoby. Podle Marktechpost však nelze režim smart kombinovat s časovými značkami slov ani s diarizací, takže čitelný souhrn a auditovatelný přepis vyžadují dva samostatné požadavky na API.
Na vícejazyčném benchmarku FLEURS napříč vybranými jazyky a lokalitami dosahuje model 5,50 procenta WER ve streamovacím režimu a 5,04 procenta v nestreamovacím, což podle Google DeepMind představuje zlepšení oproti předchozímu modelu Chirp 3. Ve srovnání s tímto předchůdcem se finální přepis zrychlil o 70 procent.
Cena podle Marktechpost činí přibližně 0,005 dolaru za minutu u dávkového zpracování a 0,009 dolaru za minutu u streamování. Model nemá otevřené váhy ani možnost samostatného nasazení · jde výhradně o spravovanou službu dostupnou přes API. Vývojáři mohou začít zdarma přes Google AI Studio, střední firmy přecházejí na placený tarif s vyššími limity, zatímco regulované podniky využívají Gemini Enterprise Agent Platform s garantovanou kapacitou, kontrolami shody s předpisy a objemovými slevami. Oba přístupy, vývojářský i podnikový, jsou zatím ve veřejné testovací fázi.
Model je již integrován do platforem LiveKit, Pipecat, Agora, Fishjam, Vercel, Vision Agents a LangChain a pohání funkci Rambler na Androidu, aplikaci Gemini na macOS a nástroj Google Antigravity. Do prohlížeče Chrome má být nasazen později. Podle Google DeepMind se ke spokojenosti s latencí, přesností a jazykovým pokrytím vyjádřily společnosti vivo, Intellitek Health a Lingopal.
Co to znamená: Pro firmy, které řeší audit a nasazení AI, přináší model jasně oddělené produkční scénáře · nízkolatentní hlasové agenty bez auditní stopy na jedné straně a dávkové zpracování s diarizací pro účely shody s předpisy na straně druhé. Vzhledem k tomu, že jde výhradně o spravovanou službu bez otevřených vah, je při hodnocení bezpečnosti a datové suverenity nutné počítat se závislostí na infrastruktuře Google i s omezeními veřejné testovací fáze u produkčních nasazení.
Zdroje: