Sistem RAG pentru firme: un „ChatGPT” care răspunde din documentele voastre

Un sistem RAG este un asistent AI care răspunde doar din documentele firmei tale: proceduri, contracte, oferte, manuale, fișe tehnice. Fiecare răspuns vine cu sursa: documentul și pasajul din care a fost luat. Dacă informația nu există în documente, asistentul spune asta, în loc să inventeze.

Pentru angajați, arată ca un „ChatGPT” obișnuit: pun o întrebare în română și primesc un răspuns. Diferența e de unde vine răspunsul și cine îl poate verifica.

De ce nu e suficient un ChatGPT obișnuit

Un model AI general răspunde din ce a învățat de pe internet. Nu știe procedura voastră de recepție a mărfii, ultima versiune a contractului-cadru sau ce scrie în fișa tehnică a utilajului din hala 2. Când nu știe, ghicește, și o face cu aceeași siguranță cu care spune lucruri adevărate. Asta e cunoscută ca „halucinație”1, iar într-o firmă poate costa: un client primește un termen greșit, un operator urmează o procedură depășită.

Un sistem RAG (de la Retrieval-Augmented Generation2) schimbă ordinea: întâi caută în documentele firmei pasajele relevante, apoi îi cere modelului AI să formuleze răspunsul numai din ele. Răspunsul are trimitere la sursă, deci oricine îl poate verifica în câteva secunde.

Trei variante: în cloud, local sau hibrid

În cloud. Folosim un model AI de la un furnizor mare, cu un contract care garantează că datele nu sunt păstrate și nu sunt folosite la antrenare. La sfârșitul lui septembrie 2026, OpenAI a anunțat pentru clienții Business și Enterprise opțiuni noi de confidențialitate3, printre care păstrarea zero a datelor. Dacă firma ta folosește deja ChatGPT Enterprise sau Claude4, putem construi sistemul RAG peste ele. E varianta cea mai rapidă și mai ieftină de pornit.

Local, pe serverul firmei. Modelul AI și baza de documente rulează pe infrastructura voastră, fără conexiune spre un furnizor extern. Pentru clinici, cabinete de avocatură, instituții publice sau fabrici cu rețele izolate, contează diferența dintre „furnizorul nu păstrează datele” și „datele nu ies deloc din clădire”. Varianta locală nu are abonament pe utilizator, deci pentru o echipă mare costul pe termen lung poate fi mai mic.

Hibrid: inteligența modelelor mari, fără datele firmei. Varianta combină ce e mai bun din primele două. Căutarea în documente rămâne locală: sistemul RAG de pe serverul firmei găsește pasajele relevante și furnizează doar contextul. Înainte ca întrebarea și contextul să plece spre un model mare din cloud, un model local de anonimizare înlocuiește datele sensibile cu etichete neutre:

Textul original, care rămâne în firmă:
„Clientul Exemplu Construct SRL are de plată 48.500 lei pentru contractul CTR-2026-114.”

Ce primește modelul mare:
„Clientul [FIRMA_1] are de plată [SUMA_1] pentru contractul [CONTRACT_1].”

Modelul mare primește doar varianta cu etichete și formulează răspunsul. Când răspunsul se întoarce, sistemul pune la loc, tot local, valorile reale. Angajatul vede un răspuns complet, iar furnizorul modelului nu vede niciodată nume, sume sau coduri.

Modelul de anonimizare se poate antrena pe datele specifice firmei. Un model general recunoaște5 nume, CNP-uri sau IBAN-uri, dar nu știe că „PRJ-0457” e un cod de proiect confidențial sau că un anumit nume de produs e încă secret. Antrenat pe exemple din documentele voastre, le recunoaște și pe acestea.

Alegem varianta împreună, după ce vedem ce documente aveți și ce reguli trebuie respectate.

Ce poate face concret

  • răspunde la întrebări despre proceduri, contracte și documentație tehnică, cu sursa citată;
  • găsește documentele care se contrazic sau folosesc o versiune veche a unei proceduri;
  • extrage informații structurate din documente: părți, termene, sume, clauze;
  • funcționează în română, inclusiv cu diacritice și terminologie de specialitate;
  • respectă drepturile de acces: un angajat primește răspunsuri doar din documentele pe care are voie să le vadă.

Cum lucrăm

  1. Discuție tehnică, gratuită. Ne spui ce întrebări primesc oamenii tăi și unde stau documentele.
  2. Evaluare pe documentele voastre. Pornim de la un set mic, reprezentativ, și măsurăm cât de bine răspunde sistemul, pe întrebări reale.
  3. Proiect. Integrăm sistemul cu sursele de documente și cu aplicațiile pe care le folosiți deja.
  4. Sprijin lunar. Actualizări, documente noi, întrebări noi, monitorizarea calității răspunsurilor.

Nu dăm prețuri pe site, pentru că fiecare firmă are alte documente și alte reguli. Oferta reală vine după evaluare.

Ce am construit deja

  • RagCode MCP: sistem RAG open source, scris în Go6, care rulează 100% local, cu Ollama7 pentru modelele AI și Qdrant8 pentru căutarea în documente, și le permite asistenților AI să înțeleagă codul unei echipe software.
  • FactCompass: platformă de verificare a informațiilor, care dă verdict cu surse și grad de încredere, folosind modele AI locale.
  • qwen3-ro-rel-extract: model AI publicat de noi pentru extragerea relațiilor din texte în limba română, cu rezultat structurat. E același tip de lucru ca recunoașterea datelor sensibile pentru anonimizare: un model mic, local, adaptat pe un anumit tip de text.
  • Am prezentat arhitectura RAG la conferința AI Business Upgrade, organizată împreună cu CCIA Argeș pentru peste 40 de antreprenori și manageri.

Programează o discuție tehnică

Surse


  1. Hallucination (artificial intelligence), Wikipedia. ↩︎

  2. Retrieval-augmented generation, Wikipedia. ↩︎

  3. OpenAI DevDay 2026: every announcement, Learnetto, despre Private Intelligence și Zero Data Retention. ↩︎

  4. Claude, Anthropic. ↩︎

  5. Named-entity recognition, Wikipedia: recunoașterea automată a numelor, organizațiilor, sumelor și altor entități dintr-un text. ↩︎

  6. Limbajul Go, site-ul oficial. ↩︎

  7. Ollama: rularea locală a modelelor AI. ↩︎

  8. Qdrant: bază de date pentru căutare semantică (vectorială). ↩︎

Întrebări frecvente

Ce este un sistem RAG?

Un asistent AI care, înainte să răspundă, caută în documentele firmei pasajele relevante și formulează răspunsul numai din ele, cu trimitere la sursă. Numele vine de la Retrieval-Augmented Generation.

Prin ce diferă de ChatGPT Enterprise?

ChatGPT Enterprise e un asistent general, cu garanții de confidențialitate. Un sistem RAG e construit pe documentele și regulile firmei tale: răspunde doar din ele, citează sursa și respectă cine are voie să vadă ce. Îl putem construi și peste ChatGPT Enterprise, dacă îl folosiți deja.

Datele mele pleacă din firmă?

Depinde de variantă. În varianta locală, nu: modelul AI și documentele rulează pe serverul vostru. În varianta hibridă, la modelul mare ajunge doar un text anonimizat, fără nume, coduri sau sume care să identifice pe cineva. În varianta în cloud, textele ajung la furnizorul modelului AI, cu un contract care interzice păstrarea și folosirea lor la antrenare.

Cum funcționează anonimizarea?

Un model mic, care rulează pe serverul firmei, găsește în text datele sensibile și le înlocuiește cu etichete neutre, de exemplu [CLIENT_1] sau [IBAN_2]. Modelul mare lucrează doar cu etichetele, iar la întoarcere sistemul pune la loc valorile reale, tot local. Modelul de anonimizare poate fi antrenat pe tipurile de date specifice firmei: coduri de produs, numere de dosar, denumiri interne.

Anonimizarea e perfectă?

Nu există anonimizare automată perfectă, așa că o măsurăm pe documentele voastre înainte de producție și stabilim împreună ce înseamnă „sensibil” pentru firmă. Pentru datele care nu au voie în niciun caz să iasă, recomandăm varianta complet locală.

Ce se întâmplă dacă răspunsul nu se află în documente?

Asistentul spune că nu a găsit informația în documentele firmei. Nu completează din imaginație.

Ce tipuri de documente poate folosi?

PDF, Word, Excel, pagini web interne, emailuri exportate și documente scanate, după ce trec prin recunoașterea textului (OCR). Stabilim lista exactă la evaluare.

Funcționează în limba română?

Da. Alegem și testăm modelele pe întrebări reale în română, inclusiv pe terminologia de specialitate a firmei.

De ce hardware e nevoie pentru varianta locală?

Depinde de numărul de utilizatori și de volumul de documente. Pentru echipe mici poate ajunge un server existent; pentru volume mari e nevoie de o placă video dedicată. Recomandarea concretă vine după evaluare.