V kostce:

  • GLM-5.3-Flash má 320 miliard parametrů s 18 miliardami aktivními, Qwen3.8-Flash-Next 125 miliard s 6 miliardami aktivními
  • Oba modely používají poměr 3:1 lineárních a plných attention vrstev s komprimovaným indexerem na 2048 tokenů
  • GLM-5.3-Flash dosahuje výkonu Claude Opus 4.8 v kódování při desetině ceny, Qwen vyžadoval devítinu výpočetních nákladů předchozí verze

Čínské AI laboratoře Z.ai a Alibaba Qwen nezávisle na sobě představily za jeden den modely GLM-5.3-Flash a Qwen3.8-Flash-Next, jejichž architektury se shodují v klíčových návrhových rozhodnutích. Oba týmy zvolily hybridní poměr 3:1 lineárních a plných attention vrstev, komprimované indexery s kapacitou 2048 tokenů, čtyři paralelní reziduální větve a trénink optimalizérem Muon.

GLM-5.3-Flash je 320miliardový multimodální MoE model s 18 miliardami aktivních parametrů, vydaný pod licencí MIT na Hugging Face. Model byl trénován na 30 bilionech tokenů multimodálního korpusu a nabízí kontextové okno až 1 milion tokenů. Podle Z.ai překonává GLM-5.2 v benchmarcích při desetině nákladů a dosahuje výkonu srovnatelného s Claude Opus 4.8 v kódování a agentních úlohách. Cenová nabídka činí 0,15 USD za milion vstupních a 0,50 USD za milion výstupních tokenů.

Qwen3.8-Flash-Next má 125 miliard hlavních parametrů a dodatečnou 51miliardovou n-gram embedding tabulku, z nichž se aktivuje 6 miliard na token. Nativní kontext je 262 144 tokenů, rozšiřitelný na 1 milion pomocí YaRN. Qwen tým uvádí, že trénink vyžadoval pouze jednu devítinu výpočetních nákladů oproti Qwen3.7-Plus. Model slouží jako předběžná verze architektury Qwen4.

U lineárních attention vrstev používá GLM Kimi Delta Attention (KDA) s per‑channel decay gating, zatímco Qwen implementuje Gated DeltaNet (GDN) s per‑head gating. Obě metody patří do rodiny delta‑pravidel a komprimují historii do fixní rekurentní velikosti. U plných attention vrstev GLM nasazuje NoPE multi‑head latent attention (MLA) ve stylu DeepSeek, Qwen grouped‑query attention uvnitř Qwen Sparse Attention (QSA).

Oba modely omezují plné attention vrstvy na 2048 tokenů pomocí naučených indexerů. GLM využívá 32‑head lightning indexer s top‑2048 výběrem a IndexPool kompresí čtyř klíčových vektorů do jednoho. Qwen QSA pracuje na granularitě 4‑tokenových bloků a uchovává top 512 bloků, což odpovídá 2048 tokenům. Qwen uvádí až 7,6krát rychlejší prefill a 4,9krát rychlejší dekódování oproti plné attention při 1 milionu tokenů.

Co to znamená: Konvergence dvou velkých čínských laboratoří na skoro identickou hybridní architekturu signalizuje, že kombinace lineárních attention vrstev pro efektivitu a řídkých plných attention pro přesnost se stává dominantním vzorem pro velké modely. Pro firmy implementující AI znamená to dostupnost výkonných open‑weight modelů s nízkými inferenčními náklady a dlouhým kontextem, což zvyšuje tlak na proprietární řešení a snižuje bariéru vstupu pro specializované aplikace.

Zdroje: