V kostce:

  • 30B model AI trénován na hře 1830
  • Good Start Labs získal 3,6 milionu dolarů od General Catalyst a Inovia
  • Pouze multi‑turn terminal agent zlepšil výkon na Finance‑Agent benchmarku

Good Start Labs trénoval 30B model umělé inteligence na strategické hře 1830: The Game of Railroads and Robber Barons a zjistil, že pouze design multi‑turn terminal agentu zlepšil výkon na finančním benchmarku Finance‑Agent.

Společnost Good Start Labs vznikla v říjnu jako odštěpná firma z Every a získala 3,6 milionu dolarů od investorů General Catalyst, Inovia, Every a několika angel investorů. Podle zdroje Latent Space se trénink zaměřil na přenos dovedností z her do reálných úkolů.

Hra 1830 obsahuje mechaniku akciového trhu, kde hráči nabízejí akcie železničních společností a budují logistické sítě. Model byl testován na úkolech, které vyžadovaly vyhledávání informací v databázi, práci s tabulkami v Excelu a provádění výpočtů · tedy činnosti typické pro finanční pracovní postup.

Experiment porovnal dva tréninkové přístupy: single‑turn question answering, kdy model odpovídá na otázku o dalším kroku, a multi‑turn terminal agent, který využívá nástroje k průzkumu prostředí, plánování a adaptaci v reálném čase. Oba přístupy vedly k lepším výsledkům ve hře, ale pouze terminal agent zvýšil výkonnost na benchmarku Finance‑Agent.

Duffy, CEO Good Start Labs, zdůraznil, že klíčovým faktorem je návrh trénovacího prostředí. „Jak navrhnete prostředí, určuje, jaké dovednosti model získá,“ uvedl. Dodal, že firma může přidat expertní model, který poskytuje podrobnější zpětnou vazbu v podobě odměn, což může učení dále ovlivnit.

Výsledky naznačují, že design tréninkového prostředí hraje zásadní roli při přenosu dovedností z her do reálných úkolů. Firmy, které využívají AI pro finanční analýzy, by měly zvážit, jakým způsobem trénují své modely, aby maximalizovaly přenositelné dovednosti.

Co to znamená:

Pro firmy je důležité zaměřit se na strukturu tréninkového prostředí, protože správně navržený multi‑turn terminal agent může výrazně zlepšit schopnost AI modelů řešit reálné finanční úkoly. Audit a implementace AI by měly zahrnovat testování různých tréninkových designů a vyhodnocení jejich přenosnosti do konkrétních pracovních scénářů.

Zdroje: