Google 15. září 2026 uvedl do provozu dva nejpokročilejší modely pro živý dialog · Gemini 3.8 Live a Gemini 3.8 Live Extended Thinking. Oba jsou nativní systémy speech‑to‑speech určené pro produkční hlasové agenty, které v reálném čase volají API, zpracovávají živý vizuální vstup a přepínají mezi 97 jazyky během konverzace.

Gemini 3.8 Live je zaměřen na škálovatelnost a nákladovou efektivitu. Kombinuje konverzační inteligenci s plynulým dialogem a vizuálním zakotvením. Gemini 3.8 Live Extended Thinking je určen pro složité úkoly a přidává zvýšenou inteligenci a vícenásobné rozvádění kroků, přičemž během mluvení zároveň přemýšlí. Podle Marktechpost získal Gemini 3.8 Live Extended Thinking první místo na Artificial Analysis Speech‑to‑Speech Quality Index s výsledkem 82,6 a vede v agentic task completion s 68,6 % na τ‑Voice a 35,1 % na Sierra’s τ‑Voice‑banking benchmarku. Dále dosáhl 97,7 % na Big Bench Audio.

Modely jsou dostupné prostřednictvím Gemini Live API a Google AI Studio, nejsou otevřené váhy a nelze je nasadit samostatně. Ceny jsou 0,005 USD za minutu vstupního audio a 0,018 USD za minutu výstupního audio, což je odhad založený na 3 USD za milion vstupních tokenů a 12 USD za milion výstupních tokenů. Všechny generované audio nese neviditelný vodoznak SynthID od DeepMind.

Klíčové funkce pro vývojáře zahrnují asynchronní volání funkcí, zpracování vizuálního kontextu, přesné alfanumerické rozpoznávání, automatické přepínání mezi 97 jazyky a inkrementální aktualizace obsahu. Gemini 3.8 Live Extended Thinking umožňuje konfigurovat rozvádění v pozadí, přičemž model mluví a zároveň postupně řeší úkoly, přičemž používá výrazy jako „Let me check that“ k přirozenému přerušení.

Google spolupracuje s platformami jako Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel a Vision Agents, které umožňují vývojářům snadno implementovat vysokovýkonné hlasové rozhraní. Dále partnerství s Salesforce, Genspark a Lumeris zdůrazňují výkonnost modelů v oblasti latence, plynulosti a volání nástrojů.

Co to znamená:

Pro firmy zaměřené na audit a implementaci AI znamená zavedení Gemini 3.8 Live a Gemini 3.8 Live Extended Thinking možnost rychlejšího vývoje hlasových agentů s vyšší přesností a komplexností. Modely eliminují potřebu řetězců ASR‑LLM‑TTS, což snižuje latenci a zjednodušuje architekturu. Transparentní vodoznak SynthID podporuje sledovatelnost a bezpečnost AI‑generovaného obsahu, což je klíčové pro auditní požadavky na detekci a prevenci dezinformací. Vzhledem k cenové struktuře mohou organizace lépe plánovat rozpočet na hlasové aplikace a přizpůsobit se dynamickým nákladům na zpracování audio dat.

Zdroje: