Společnost Alibaba oficiálně uvolnila model Qwen3.8-Max, který tým popisuje jako dosud nejschopnější model v rodině Qwen. Jedná se o multimodální systém s 2,4 biliony parametrů využívající architekturu mixture-of-experts, který přijímá na vstupu text, obrázky i video a vrací textový výstup. Model nabízí kontextové okno o velikosti 1 milionu tokenů, přičemž maximální vstup dosahuje 991 tisíc tokenů (983 tisíc s povoleným myšlenkovým procesem) a maximální výstup 131 tisíc tokenů. Rozhodovací rozpočet pro úvahy je nastaven na 262 tisíc tokenů.

Rozhraní API je kompatibilní s OpenAI i DashScope, což umožňuje integraci jednoduchou změnou base URL a ID modelu. Cenová politika činí 2,00 USD za milion vstupních tokenů a 6,00 USD za milion výstupních tokenů. Implicitní čtení z cache stojí 0,25 USD za milion tokenů, explicitní vytvoření cache 2,50 USD a explicitní čtení 0,17 USD za milion tokenů. Limity rychlosti jsou nastaveny na 2 miliony tokenů za minutu a 15 tisíc požadavků za minutu. Mezi podporované funkce patří function calling, strukturované výstupy, dávkové zpracování, prefix completion a fine-tuning. Pět vestavěných nástrojů na Responses API zahrnuje code_interpreter, web_search, web_extractor, t2i_search a i2i_search.

V benchmarcích model dosahuje skóre 86,6 v Terminal-Bench 2.1, kde se umístí za GPT-5.6 Sol (max) s 88,8, ale před Claude Opus 4.8 a Claude Fable 5 s 84,6. V GPQA Diamond dosáhl 92,6 bodů, což je o 0,2 bodu více než předchozí Qwen3.7-Max. Na SWE-bench Pro dosáhl 67,7 proti 80,0 u Fable 5, na FrontierSWE 73,5 proti 88,8. Dominuje v PaperBench se 93,0 a IFBench se 82,8. Největší pokrok je viditelný v multimodálních a agentických úlohách: OSWorld-Verified 86,1, Parametric CAD Bench 91,5, OmniDocBench 1.5 92,1. Oproti předchůdci skočil DeepSWE 1.1 z 21,6 na 56,6, FrontierSWE z 40,7 na 73,5 a JobBench z 31,3 na 53,4.

Podle zdrojů Alibaba slibuje vydání otevřených vah pro Qwen3.8-Max i menší verzi Qwen3.8-27B v následujícím týdnu. Menší model s 27 miliardami parametrů by se měl vejít na běžný on-premise GPU hardware, zatímco 2,4 bilionu parametrů u Max verze vyžaduje víceuzlovou datacentrovou infrastrukturu. Alibaba neuváděla počet aktivovaných parametrů, takže náklady na servis nelze zatím modelovat. Marktechpost upozorňuje, že multimodální benchmarky byly porovnány s Qwen3.7-Plus, ne s Qwen3.7-Max, což může generativní skok zkreslit. Také RL škálovací křivka dosahuje vrcholu 0,725 u 4000 trénovacích prostředí, následovaného poklesem na 0,719 a 0,689.

Co to znamená: Pro firmy zvažující nasazení znamená Qwen3.8-Max okamžitou dostupnost výkonného multimodálního modelu přes API s cenou výrazně nižší než u uzavřených konkurentů. Otevřené vahy Qwen3.8-27B umožní on-premise nasazení bez závislosti na cloudu, což je klíčové pro regulované sektory. Audit bezpečnosti by měl zahrnovat ověření chování modelu v agentických úlohách a analýzu rizik přidružených k dodavateli z Číny, i když otevřená architektura umožňuje hlubší inspekci než u proprietárních modelů.

Zdroje: