V kostce:
- Pachocki předpovídá, že AI překoná lidskou inteligenci v našem životním věku.
- Očekává se rekursivní sebezdokonalování AI během několika let.
- OpenAI bude v případě potřeby zadržet další navyšování schopností.
Hlavní vědec OpenAI Jakub Pachocki varuje, že umělá inteligence se v našem životním věku stane inteligentnější než lidé a může se stát nekontrolovatelnou. Podle interních výsledků očekává, že do několika let nastane rekursivní sebezdokonalování AI. Pachocki uvedl, že nikdo není na důsledky připraven a OpenAI bude muset v případě potřeby zadržet další navyšování schopností. OpenAI tento problém nemůže řešit sama a vyžaduje mezinárodní koordinaci i zásahy do vývoje AI.
V roce 2023 se v rámci projektu RLSlow objevily první výsledky, které naznačovaly, že je možné škálovat trénink modelů schopných vytvářet vlastní řetězce myšlenek. Pachocki a jeho tým se zaměřili na to, že tyto modely budou schopny pracovat s počítači, spolupracovat s lidmi i mezi sebou a vést výzkumné projekty. Tím se otevírá nové riziko v oblasti počítačové bezpečnosti.
Klíčovým problémem je alignment · sladění cílů a hodnot AI. Pachocki rozlišuje mezi cílovým alignmentem, kdy se AI snaží dosáhnout zadaného cíle, a hodnotovým alignmentem, který považuje za nejdůležitější. Hlavní výzvou je generalizace hodnot. Investuje se do dvou přístupů: cílového RL a zlepšení generalizace z předtrénovaných dat. OpenAI také intenzivně pracuje na sledování řetězců myšlenek, avšak jeho účinnost postupně klesá.
Pachocki zdůrazňuje, že hlavním argumentem pro další škálování AI je obranná schopnost proti rozšířeným AI. Nicméně, aby se předešlo nebezpečím, je nutné buď urychlit výzkum alignmentu, nebo zpomalit škálování schopností. V ideálním případě by se mělo kombinovat obojí.
Co to znamená: Firmy, které nasazují AI, musí zohlednit riziko rychlého růstu schopností a připravit se na možné zastavení škálování. Audity by měly zahrnovat posouzení alignmentu, sledování řetězců myšlenek a připravenost na mezinárodní koordinaci bezpečnostních opatření. V praxi to znamená investovat do výzkumu hodnotového alignmentu a vyvíjet mechanismy umožňující rychlou reakci na potenciální nebezpečí AI.
Zdroje: