V kostce:

  • R4T distiluje RL‑trénovaný fan‑out do 53,9‑milionového difúzního transformátoru.
  • Při dávce 8 dosahuje R4T 0,07 s oproti 1,46 s u autoregresivního fan‑outu.
  • Na datasetu Polyvore zvyšuje kvalitu slidu na 49,1 vs 40,9 u Best‑of‑N.

Google Research v článku ze 16. září 2026 představuje rámec Retrieve‑for‑Train (R4T), který kombinuje jednorázové posilovací učení s difúzním modelem, aby vyřešil problémy s vracením sady výsledků ve vyhledávání a doporučovacích systémech. R4T nejprve trénuje fan‑out jazykový model pomocí offline posilovaného učení a poté distiluje jeho chování do 53,9‑milionového difúzního transformátoru, jenž generuje všechny směry retrievalu v jediném neautoregresivním průchodu. Podle Marktechpost dosahuje tento přístup 12‑ až 20‑násobného zrychlení oproti tradičnímu autoregresivnímu fan‑outu, kdy se čas zkrátí z 1,46 s na 0,07 s při dávce 8.

R4T využívá třífázový kanál. Nejprve se trénuje fan‑out jazykový model (FOLM), který generuje dílčí dotazy, které následně zpracovává zamražený hustý retriever. Odměna na úrovni sady (set‑level reward) hodnotí celou sadu výsledků, nikoli jednotlivé položky. Ve druhém kroku se z těchto trénovaných fan‑outů vytváří tréninková data bez lidských štítků: 128 fan‑outů na dotaz slouží jako páry (dotaz, cílová sada).

Ve třetím kroku se trénuje difúzní retriever, který se učí mapovat vektor dotazu na kompletní sadu cílových vektorů. Model má 53,9 milionů parametrů a využívá variance‑exploding formulaci v rámci EDM frameworku. Při inferenci generuje všechny vektory najednou, což umožňuje rychlé vyhledávání nejbližších sousedů v databázi.

Návrh odměny pro otevřený abstraktní retrieval (OAR) kombinuje tři vážené složky: zakotvenost (groundedness, λg = 0,6), diverzitu (λd = 0,2) a shodu (alignment, λa = 0,2). Pro slabě dozorovaný složený retrieval (WSCR) se odměna skládá z podílu referenčních položek, které fan‑out získá. Trénink probíhá pomocí GRPO s měkkou PPO regularizací a klíčovými parametry, jako je learning rate 1 × 10⁻⁷ a globální batch size 512.

Experimentální výsledky na datasetu Polyvore ukázaly, že R4T‑FOLM dosahuje průměrné kvality 49,1 na Likertově škále, zatímco Best‑of‑N dosahuje 40,9 a zero‑shot 38,5. Diverzita se zvyšuje z 56,0 na 76,8 a R4T‑Diffusion zachovává 74,3. Na hudebním datasetu dosahuje R4T‑FOLM průměrné kvality 58,1 oproti 49,2 u Best‑of‑N. Výsledky WSCR ukazují, že R4T‑FOLM (Qwen) dosahuje Recall@5K = 20,9 a Hit@5K = 64,6, zatímco Gemini‑2.5‑Flash dosahuje 15,7 a 52,1.

Přestože kód ani váhy nebyly zveřejněny, přístup R4T nabízí výrazné zrychlení a zlepšení kvality, což by mohlo být pro firemní vyhledávací a doporučovací systémy významné. Implementace by vyžadovala přizpůsobení infrastruktury pro difúzní modely a integraci s existujícími databázemi.

Co to znamená: Firmy, které nasazují vyhledávací nebo doporučovací systémy, mohou díky R4T snížit dobu odezvy více než desetikrát a zároveň zvýšit kvalitu a rozmanitost výsledků. Pro audity a implementaci AI je klíčové ověřit, zda difúzní model splňuje požadavky na bezpečnost, škálovatelnost a interpretovatelnost, a zda se model snadno integruje do stávajících pipeline.

Zdroje: