V kostce:
- Hafner vyvíjí agenty s model-based reinforcement learning pro plánování dopředu.
- Jeho Dreamer 3 jako první vyřešil Minecraft Diamond challenge.
- Startup v utajení importuje humanoidní roboty z Číny.
Danijar Hafner, 31letý podnikatel a bývalý výzkumník Google Brain a DeepMind, ve svém novém utajovaném startupu vyvíjí AI agenty, které dokážou plánovat dopředu a reagovat na neočekávané situace v reálném světě. Jeho kancelář ve čtvrti SoMa v San Francisku je zatím prázdná, startup nemá ani název na dveřích, ale v prostorách visí humanoidní roboty různých tvarů a velikostí dovezené z Číny · fyzická podoba jeho práce.
Hafnerův přístup stojí na model-based reinforcement learning. Vytváří takzvané světové modely · AI modely, které emulují fyzikální realitu · a v nich trénuje agenty. Agent se chová, jako by byl v reálné simulaci, učí se v ní jednat a následně používá získané zkušenosti k předpovídání budoucích výsledků, což Hafner přirovnává ke snění nebo představivosti. To umožňuje agentům i robotům, v nichž jsou vložené, orientovat se v dosud neznámých situacích bez nutnosti reálného zkoušení metodou pokus‑omyl, kterou tradiční robotika vyžaduje.
Hafner pochází z malého města v severovýchodním Německu, kde jeho rodiče poslouchali klasickou hudbu. Programování se naučil od souseda a na střední škole začal studovat online kurzy AI. V roce 2015, jako druhý ročník inženýrství na Hasso Plattner Institute v Potsdamu, získal pozici studentského výzkumníka v Google Brain. Od té doby prošel desítkami stáží a pozic v Google Brain i Google DeepMind v USA, Velké Británii a Kanadě. Spolupracoval s předními odborníky, mezi nimi Geoffrey Hinton, často označovaný za jednoho z otců AI, a Ashish Vaswani, spoluautorem průlomového článku “Attention Is All You Need” popisujícího transformerovou architekturu dnešních velkých jazykových modelů.
Bývalý manažer a spoluautor Timothy Lillicrap z Google DeepMind Hafnera hodnotí jako výjimek mezi výjimek: “Setkávám se s mnoha velmi chytrými lidmi ve výzkumu v Google a on snadno spadá do lepší poloviny jednoho procenta. Mnohokrát postavil sám to, co by vyžadovalo celé týmy inženýrů.” Hafner svůj přístup ladil a ověřoval v herních prostředích. Jeho první průlom byl PlaNet, model umožňující agentům provádět akce plánováním dopředu. Dreamer 2 byl prvním agentem, který dosáhl lidského výkonu v Atari 2600 hrách pomocí světového modelu. Dreamer 3 jako první vyřešil Minecraft Diamond Challenge · autonomně doloval v herním prostředí diamanty. Dreamer 4 pokročil dále tím, že se naučil dolovat diamanty z offline datové sady nahraných herních videí, aniž by s hrou přímo interagoval.
Poslední dobou migruje své agenty z virtuálního světa do fyzické reality. Projekt DayDreamer používá stejnou metodiku pro trénink robotů. Cílem je dosáhnout schopnosti robotů pracovat v nových prostředích bez předchozího tréninku, což je klíčové pro nasazení v lidských prostorech, například v domácnostech s neznámými podlahovými plány a nábytkem.
Co to znamená: Pokud se Hafnerův přístup osvědčí v masovém nasazení, model-based reinforcement learning se stane standardem pro robotiku v neřízených prostředích. Pro firmy implementující AI to znamená posun od specializovaných, opakovaně trénovaných modelů k univerzálním agentům schopným nula-shot generalizace · klíčový krok k autonomním systémům s predikovatelným chováním v auditech bezpečnosti.
Zdroje: