Co RAG dělá jinak než klasický LLM

RAG · celým názvem retrieval-augmented generation · kombinuje dvě fáze: vyhledání a generování. Dotaz uživatele nejprve projde vyhledávací vrstvou, která z dokumentové databáze vytáhne nejrelevantnější pasáže; teprve ty se předají jazykovému modelu spolu s původní otázkou.

Model tedy neodpovídá „z hlavy“ · závisí na tom, co vyhledávač skutečně nalezl. Právě tento mechanismus odlišuje RAG od klasického LLM, který generuje text čistě z parametrů natrénovaných při tréninku. Pokud trénovací data neobsahují aktuální interní směrnice firmy, bez RAG je model jednoduše nezná.

Výhodou oproti přímému dotazování LLM je také auditovatelnost: každou odpověď lze zpětně dohledat ke zdrojovému dokumentu, z něhož model čerpal. To je klíčové v regulovaných prostředích, kde každé tvrzení musí být doložitelné.

Jak vyhledávací vrstva funguje

Jádrem vyhledávání bývá vektorová databáze. Každý dokument · nebo jeho část · je při indexaci převeden na číselný vektor zachycující sémantický obsah; dotaz uživatele projde stejnou transformací a databáze vrátí dokumenty s nejbližším vektorem.

Tímto způsobem RAG najde relevantní pasáž i tehdy, když uživatel nepoužil přesná klíčová slova z dokumentu. Hledáte „co dělat při pracovním úrazu“ a systém může vrátit oddíl interní směrnice nadepsaný „postup při úrazu zaměstnance“ · přesná shoda slov není podmínkou.

Dokumenty se před indexací dělí na kratší části (chunky), protože jazykový model má omezený kontext a nemůže zpracovat celý rozsáhlý soubor najednou. Modelu se předají jen nejrelevantnější úseky. Kvalita tohoto dělení přímo ovlivňuje přesnost celého systému.

Proč RAG snižuje halucinace

Halucinace vznikají, když model generuje text bez spolehlivého základu. RAG tento problém omezuje tím, že model dostává konkrétní kontext · úryvky z firemních dokumentů · přímo v promptu.

Výsledek připomíná rozdíl mezi zkouškou „od stolu“ a zkouškou s otevřenou knihou: odpovídáte na základě toho, co máte před sebou, ne toho, co si pamatujete. Halucinace zcela nezmizí, zejména pokud jsou zdrojové dokumenty neúplné nebo zastaralé; jejich četnost však klesá výrazně tam, kde jsou dokumenty kvalitní a aktuální.

Přístupová práva: bezpečnostní riziko, které se přehlíží

Hlavní bezpečnostní riziko RAG systémů spočívá v přístupu k dokumentům · vyhledávací vrstva musí respektovat, kdo má ke kterému souboru oprávnění. Pokud tuto kontrolu vynechá, dostane model informace, k nimž by daná osoba přístup dostat neměla.

Modelový příklad: advokátní kancelář nasadí RAG nad celým sdíleným úložištěm. Asistent správně cituje relevantní pasáže · jenže z důvěrných smluv klienta, k nimž přistupující zaměstnanec přístup nemá. Systém v tomto scénáři netvoří únik dat v technickém smyslu, ale výsledek je stejný: citlivé informace se dostanou k neoprávněné osobě.

Řešení spočívá v tzv. permission-aware retrieval · vyhledávací vrstva musí ověřit oprávnění volajícího uživatele ještě před vrácením výsledků modelu. Jde o architektonické rozhodnutí přijaté při návrhu systému, ne o zpětnou záplatu. Právě proto bezpečnostní posouzení RAG nasazení zahrnuje jak analýzu samotného LLM, tak audit indexovací politiky a přístupových práv.

Co to znamená: RAG je praktický způsob, jak dodat firemnímu LLM přístup k aktuálním interním datům bez nákladného přetrénování modelu. Základní podmínky jsou tři: kvalitní a aktuální dokumenty, permission-aware retrieval na úrovni vyhledávání a pravidelná kontrola relevance vrácených výsledků. Nasazení bez těchto podmínek snižuje přínos a zvyšuje bezpečnostní riziko zároveň.

Časté dotazy

Jak se RAG liší od fine-tuningu?

Fine-tuning mění váhy samotného modelu přetrénováním na nových datech. RAG naopak model nemění · pouze mu při každém dotazu předloží relevantní dokumenty jako kontext. Fine-tuning je vhodný pro změnu stylu nebo specializovaného chování modelu, RAG pro přístup k aktuálním nebo důvěrným firemním datům.

Musí být dokumenty v RAG systému veřejně dostupné?

Ne, RAG funguje i nad interními, neveřejnými dokumenty · to je jeden z důvodů jeho oblíbenosti ve firmách. Klíčová podmínka je, že dokumenty musí být ve formátu, který lze indexovat, například PDF nebo prostý text. Přístup k nim řídí samotná organizace.

Co jsou vektorové databáze a proč je RAG potřebuje?

Vektorová databáze ukládá dokumenty ve formě číselných vektorů zachycujících jejich sémantický obsah. Při dotazu systém porovná vektor dotazu s vektory uložených dokumentů a vrátí nejpodobnější pasáže. Díky tomu RAG najde relevantní části i bez přesné shody klíčových slov.

Jak velké dokumenty lze do RAG systému vložit?

Jazykový model má omezený kontext (tzv. context window), takže celý rozsáhlý dokument nelze předat najednou. RAG proto dokumenty předem rozdělí na menší části (chunky) a modelu předá jen ty nejrelevantnější. Kvalita tohoto dělení výrazně ovlivňuje přesnost celého systému.