Aller au contenu
Tous les guides

RAG LLM: brancher un modèle sur vos données sans le fine-tuner

RAG LLM en production: corpus, chunking, retrieval, citations, eval, HITL et coût. Méthode PME pour des réponses ancrées, pas un tutoriel embedding générique.

Illustration pour l'article : RAG LLM: brancher un modèle sur vos données sans le fine-tuner

RAG LLM: réponse ancrée, pas mémoire magique

RAG LLM (Retrieval-Augmented Generation) consiste à récupérer des passages de tes documents au moment de la question, puis à les injecter dans le contexte du modèle pour générer une réponse. Le modèle n'a pas « appris » ton PDF dans ses poids: il lit ce que le retriever lui donne.

Tu l'utilises quand la vérité métier vit hors du modèle: procédures, catalogues, contrats, tickets, wiki. Sans retrieval, le LLM invente poliment. Avec un mauvais retrieval, il invente en citant le mauvais paragraphe.

Avant de parler d'embedding, regarde le process: quelle question, quelle source de vérité, quel risque si la réponse est fausse, qui valide.

Les briques d'un pipeline RAG

1) Corpus: sources autorisées, droits, fraîcheur. 2) Ingestion: parse, nettoyage, métadonnées (produit, date, langue, confidentialité). 3) Chunking: tailles et chevauchements adaptés au type de doc. 4) Index: embeddings + éventuellement full-text / hybrides. 5) Retrieval: top-k, filtres, re-rank. 6) Génération: prompt qui impose de s'appuyer sur les passages. 7) Post: citations, logs, HITL.

Hybrid search (sémantique + mot-clé) sauve souvent les cas exacts (SKU, références légales). Un pure vector-only rate les identifiants rares.

Versionne le corpus et l'index comme du code: date d'ingest, hash des sources, paramètre de chunk. Sinon tu ne peux pas rejouer un incident.

Qualité: mesurer avant d'ajouter des features

Sans jeu d'eval, tu optimises au feeling. Constitue 30 à 100 questions réelles avec réponse attendue ou passages gold. Mesure: rappel retrieval (le bon chunk est-il dans le top-k ?), fidélité de la réponse, % de « je ne sais pas » correct, temps, tokens.

Les échecs se classent: corpus manquant, chunk trop gros/petit, mauvaise requête, hallucination malgré bon contexte, droits d'accès. Chaque classe a un fix différent. Ne change pas tout d'un coup.

Citations cliquables: utiles pour la confiance et la revue. Si l'équipe ne clique jamais, le HITL est mal conçu.

Sécurité et périmètre d'accès

Un RAG qui indexe tout le Drive sans ACL rejoue les fuites internes en plus poli. Filtre par identité et droits au retrieval, pas seulement au prompt. Journalise qui a vu quoi.

PII: minimise dans l'index, masque si besoin, fixe une rétention. Un chunk n'est pas anodin parce qu'il est « technique ».

Outils agents + RAG: le modèle peut enchaîner search puis action. Borne les tools (allowlist) et place le HITL sur l'action, pas seulement sur le texte.

Coût tokens et latence

Chaque chunk injecté coûte des tokens d'entrée. Top-k trop large = facture et bruit. Top-k trop petit = oublis. Calibre sur l'eval, pas sur une valeur magique internet.

Cache les embeddings de documents stables. Pour les questions répétées, cache de réponse avec invalidation sur re-ingest. Mesure p95 latence bout-en-bout (retrieve + generate).

Si le coût explose, regarde d'abord le bruit (chunks inutiles, historique de chat trop long) avant de changer de modèle.

Mettre un RAG en prod en 30 jours

Semaine 1: un flux, un corpus borné, 30 questions gold. Semaine 2: pipeline ingest + hybrid retrieval + citations. Semaine 3: eval + HITL sur cas à risque. Semaine 4: monitoring (qualité, coût, feedback) et élargissement contrôlé du corpus.

Critères de go-live: rappel retrieval acceptable, 0 incident d'accès, owner nommé, runbook re-ingest. Sans ça, tu as une démo.

Voir aussi fine-tuning vs RAG (quand les poids, quand le retrieval) et LLMOps (evals, observabilité).

Si vous voulez cadrer un premier RAG LLM sur un corpus réel, on peut le faire en 20-40 minutes.

FAQ

C'est quoi un RAG LLM ?
Un système qui récupère des passages de tes données au moment de la question et les donne au LLM pour générer une réponse ancrée, sans réentraîner le modèle.
RAG ou fine-tuning ?
RAG pour faits et documents changeants. Fine-tuning pour style, format ou comportement stable. Souvent les deux se combinent. Détail dans l'article fine-tuning vs RAG.
Quelle taille de chunk ?
Pas de taille universelle. Calibre sur ton eval: trop petit coupe le sens, trop grand noie le retriever et coûte des tokens.
Faut-il des embeddings maison ?
Commence par un modèle d'embedding standard + hybrid search. Customise seulement si l'eval stagne après nettoyage du corpus.
Comment éviter les hallucinations ?
Meilleur retrieval, prompt « cite ou dis ne sais pas », eval de fidélité, HITL sur les cas à risque. Zéro hallucination n'existe pas; on gère le risque.
Qui maintient le corpus ?
Un owner métier (contenu) + un owner tech (pipeline). Sans propriétaire, le RAG pourrit en silence.

Articles liés

Cadrez votre premier agent IA

20 minutes pour vérifier vos outils, vos données et le premier cas utile. Sans jargon, sans engagement.