Aller au contenu principal

Génération augmentée par la récupération (RAG)

Intermédiaire
What you'll learn
  • Ce qu'est le RAG et la boucle récupérer-augmenter-générer
  • Comment indexer, récupérer, augmenter et générer avec citations
  • Pourquoi le RAG surpasse le fine-tuning pour les besoins « répondre sur mes documents »
  • Les cinq modes de défaillance qui tuent la qualité du RAG
  • Un prompt d'ancrage à copier-coller qui comble les deux plus grandes lacunes

Le RAG fait répondre un modèle à des questions sur vos données — documents, base de connaissances, base de code — sur lesquelles il n'a jamais été entraîné. L'idée est simple : récupérer les éléments pertinents, augmenter le prompt avec eux, puis générer une réponse ancrée dans ces éléments.

La boucle

Guided walkthrough1 of 4
  1. Découpez-les en fragments, encodez-les (voir /docs/foundations/embeddings) et stockez-les dans un index vectoriel (et/ou par mots-clés).

Pour l'étape d'encodage lors de l'indexation, voir Embeddings et recherche vectorielle.

Pourquoi le RAG plutôt que le fine-tuning ?

Pro tip
  • Frais : mettez à jour les données, pas le modèle
  • Vérifiable : fournit des citations
  • Économique : bien moins cher qu'un réentraînement

Pour la plupart des besoins du type « répondre à propos de mes documents », le RAG est le bon premier outil — voir Fine-tuning vs prompting vs RAG.

Les modes de défaillance (là où la qualité du RAG meurt)

Watch out
  • Mauvaise récupération = mauvaise réponse. Si le bon fragment n'est pas récupéré, le modèle ne peut pas l'utiliser. La plupart des problèmes « le RAG se trompe » sont des problèmes de récupération.
  • Un découpage trop grossier/trop fin ruine la pertinence (voir embeddings).
  • Pas d'instruction d'ancrage : le modèle mélange les faits récupérés avec ses propres suppositions. Dites-lui de répondre uniquement à partir du contexte et d'admettre les lacunes.
  • Trop en entasser : des fragments non pertinents diluent le signal et coûtent des tokens. Récupérez peu de fragments, de haute qualité.
  • Pas de citations : vous ne pouvez pas vérifier, donc vous ne pouvez pas faire confiance.

L'échec de découpage renvoie aux embeddings, et le surentassement coûte des tokens.

Pro tip
  • Évaluez la récupération séparément : mesurez « avons-nous récupéré le bon fragment ? » indépendamment de « le modèle a-t-il bien répondu ? ». Cela localise le problème rapidement. Voir Évaluations (/docs/foundations/evals).

Copier-coller : un prompt d'ancrage

Le correctif au plus fort impact est une instruction d'ancrage. Déposez vos fragments récupérés dans un gabarit comme celui-ci — il force le modèle à répondre uniquement à partir du contexte, à citer chaque affirmation et à admettre les lacunes au lieu de deviner :

Prompt d'ancrage

You are answering strictly from the context below.

Rules:
- Use ONLY the context to answer. Do not use outside knowledge.
- Cite the source after each claim, like [chunk 2].
- If the answer is not in the context, reply exactly:
"I don't have that in the provided sources."
- Quote numbers and names verbatim — never paraphrase a figure.

Context:
[chunk 1] ...
[chunk 2] ...
[chunk 3] ...

Question: <the user's question>

Associez-le à quelques fragments de haute qualité (pas tout ce que vous avez récupéré) et vous comblez les deux plus grandes lacunes d'un coup : le mélange halluciné et les réponses invérifiables. Ensuite, évaluez la récupération et la génération séparément pour savoir quelle moitié régler.

Maîtrisez les termes

Appuyez sur Entrée ou Espace pour retourner la carte. Utilisez les flèches gauche et droite pour naviguer entre les cartes.Terme affiché.
1 / 6

Vérifiez vos connaissances

0/5
  1. Que signifient les trois lettres de RAG, dans l'ordre ?
  2. Quand « le RAG se trompe », quel est le plus souvent le vrai problème ?
  3. Pourquoi le RAG est-il généralement préféré au fine-tuning pour « répondre à propos de mes documents » ?
  4. Quel est le correctif au plus fort impact pour empêcher le modèle de mélanger les faits avec des suppositions ?
  5. Pourquoi évaluer la récupération séparément de la génération ?
Key takeaways
  • RAG = récupérer les fragments pertinents, augmenter le prompt, générer une réponse ancrée et citée.
  • Indexez (découper + encoder + stocker), récupérez les meilleurs fragments, augmentez avec une instruction d'ancrage, générez avec citations.
  • Préférez le RAG au fine-tuning pour les Q&R sur documents : frais, cité, moins cher.
  • La plupart des défaillances sont des défaillances de récupération — récupérez peu de fragments de haute qualité, pas tout.
  • Ajoutez toujours une instruction d'ancrage et citez ; évaluez la récupération et la génération séparément.

Pour aller plus loin