A cég mindentudó memóriája, a RAG
A retrieval-augmented generation (RAG), magyarul kereséssel kiegészített generálás, két lépésben dolgozik. Először a vállalat szerződéseit, wiki-oldalait és ERP-rekordjait kisebb szövegdarabokra bontja, majd egy vektoradatbázisban tárolja el őket. Amikor valaki kérdést tesz fel, a rendszer nem találgat: valós időben visszakeresi a releváns dokumentumrészt, és csak ez alapján fogalmazza meg a választ.

A McKinsey száz év alatt felhalmozott tanácsadói tudásán ül: módszertanok, projekttapasztalatok, iparági benchmarkok ezrei sorakoznak a belső rendszerekben. Csakhogy egy ekkora tudásvagyonban könnyű elveszni. Amit a cég egyszer már megoldott, azt a tanácsadók gyakran újra kitalálták, mert senki nem talált rá a régi anyagra. A válasz egy belső AI-asszisztens lett, Lilli néven, amely kereshetővé tette a teljes dokumentumtárat. Az eredmény: a munkatársak 72%-a rendszeresen használja, a keresési idő 30%-kal csökkent, a kimenetek minősége 20%-kal javult, havonta pedig félmillió kérdést tesznek fel neki.
Ez a probléma nem a McKinsey sajátja. Egy átlagos tudásmunkás naponta 100–120 percet tölt információkereséssel és kollégák hajszolásával („hol van ez az adat?"). A hagyományos vállalati keresők az esetek mindössze 10%-ában adnak elsőre releváns találatot, miközben egy publikus kereső 95%-os arányt hoz ugyanerre a feladatra.
Két fázis, egy szimpla elv
A retrieval-augmented generation (RAG), magyarul kereséssel kiegészített generálás, két lépésben dolgozik. Először a vállalat szerződéseit, wiki-oldalait és ERP-rekordjait kisebb szövegdarabokra bontja, majd egy vektoradatbázisban tárolja el őket. Amikor valaki kérdést tesz fel, a rendszer nem találgat: valós időben visszakeresi a releváns dokumentumrészt, és csak ez alapján fogalmazza meg a választ. Minden válaszhoz pontos forrás, dokumentumnév, oldalszám párosul, ami auditálhatóvá teszi a teljes folyamatot.
A leggyorsabban megtérülő projekt
A RAG-alapú tudásbázis megtérülési ideje átlagosan 6–14 hónap, szemben az egyedi modellfejlesztés 18–24 hónapjával. Az információkeresési idő 40–70%-kal csökken, a hallucinációk aránya pedig akár 90%-kal esik vissza, mert a válaszok valós dokumentumokhoz vannak hozzáláncolva. Nem csoda, hogy a globális piac a 2025-ös, nagyjából 2 milliárd dolláros értékéről 2030-ra várhatóan 9,86 milliárd dollárra nő. Iparági elemzések szerint 2026-ra a vállalati AI-fejlesztések 60–70%-a RAG-architektúrára épül majd.
Amikor a rendetlenség visszaüt
Ennyire jó lenne a RAG? Akkor az ilyen projektek nagy része miért nem éri el a termelési fázist? Az adatok ugyanis pont ezt mutatják: enterprise RAG-bevezetések 80%-a elbukik, és a hiba szinte sosem a nyelvi modellben keresendő. A rendezetlen, ellenőrizetlen belső adatvagyon a valódi probléma: a tisztított dokumentumokon futó rendszer pontossága 85–92%, a kaotikus adathalmazon dolgozóé alig 45–60%. Aki elhalasztja a rendrakást, egy másik kockázatot is vállal. Ha egy szenior kolléga felmond, gyakran vele távozik az a tudás is, amit soha senki nem írt le sehova.
A keresés, ami túl sokat mutat
Van egy kevésbé látványos, mégis veszélyes hiba is: a RAG-adatszivárgás. Ez akkor történik, ha a visszakereső motor olyan bizalmas dokumentumrészletet ad át a nyelvi modellnek, amelyet a kérdező egyébként nem láthatna. A NIS2 hatálya alá eső szervezeteknél ez a legkisebb jogosultság elvének megsértését jelenti: a keresési rétegnek ugyanazokat a hozzáférési szabályokat kellene követnie, mint amilyeneket a felhasználó Active Directory- vagy Entra ID-jogosultságai amúgy is meghatároznak. Az EU AI Act a magas kockázatú felhasználási területeken, a HR-toborzástól a hitelbírálatig, kötelező naplózást ír elő: a vonatkozó határidő az uniós jogalkotás nemrégiben elfogadott módosítása miatt 2027. december 2-re tolódott, de az elvárás iránya nem változott, a felkészülést érdemes már most elkezdeni.
Itthon még csak az elején tartunk
A magyar vállalatoknak mindössze 10%-a használ valamilyen AI-technológiát, ez elmarad az uniós átlagtól. Az infokommunikációs szektorban ez az arány közel 50%, az iparban és az építőiparban viszont 5% alatt marad. Akik viszont már belevágtak, azoknál a szövegbányászat és a dokumentumfeldolgozás a legnépszerűbb terület: az AI-t használó hazai cégek fele alkalmaz ilyet, 38%-uk pedig szoftverrobotokat is üzemeltet már. A RAG-alapú tudásbázis pontosan erre az igényre épül rá, csak egy nagyságrenddel tovább viszi.
Nem kell hozzá új rendszer
A SERCO Informatika Zrt. AI és Innovációs üzletága a meglévő infrastruktúrára építve alakítja ki a vállalati RAG-rendszert: saját szerveren, hibrid kereséssel és a felhasználói jogosultságokhoz igazított hozzáféréssel. Minden válaszhoz forrás párosul, minden keresés naplózható, az adatok pedig a vállalati tűzfalon belül maradnak. A teljes IT-rendszert nem kell hozzá lecserélni: elég egyetlen jól megválasztott, gyorsan megtérülő első lépés.
A cikk megjelenését a SERCO Informatika Zrt. AI és Innovációs üzletága támogatta.
Fotó: Envato




