Un assistant documentaire utile ne remplace pas le document par une réponse convaincante. Il réduit le temps nécessaire pour localiser l’information, explique les passages utilisés et permet de revenir à la source. Le Retrieval-Augmented Generation associe recherche et génération, mais sa qualité dépend autant de l’extraction, du découpage, des métadonnées et de l’interface que du modèle final.
Commencer par une extraction fidèle
Un PDF peut contenir texte natif, scans, tableaux, colonnes et en-têtes répétés. Avant tout embedding, il faut reconstruire un contenu exploitable et conserver le lien avec la page, la zone et le document d’origine. Une extraction qui inverse l’ordre des colonnes produit des fragments faux.
L’OCR demande une évaluation selon la langue et la qualité des scans. Les tableaux peuvent nécessiter un format structuré. Le pipeline signale les pages peu fiables au lieu de les indexer comme si elles étaient certaines.
Découper selon la structure du document
Un découpage fixe est simple, mais peut séparer un titre de son paragraphe ou une règle de son exception. Sections, sous-titres, listes et limites de pages donnent de meilleurs indices. Chaque fragment conserve document, version, page, section et droits d’accès.
La taille influence rappel et précision. Un fragment court manque de contexte ; un fragment long dilue l’information et consomme davantage de tokens. Il faut tester plusieurs stratégies sur des questions réelles.
Combiner recherche lexicale et vectorielle
La recherche vectorielle retrouve des formulations proches, tandis que la recherche lexicale reste forte pour références exactes, numéros et noms rares. Une recherche hybride combine ces signaux, puis un reranker peut réordonner les résultats.
Les filtres d’autorisation s’appliquent avant la génération. Un assistant ne doit jamais récupérer un fragment interdit puis tenter de le masquer après coup. L’autorisation fait partie de la recherche.
- Mesurer si le bon passage apparaît en premier.
- Tester les questions sans réponse.
- Conserver la version exacte du document cité.
Générer avec un contrat de réponse
Le modèle reçoit question, passages et instruction claire : répondre à partir du contexte, citer et déclarer lorsque l’information manque. Un format structuré sépare réponse, citations et niveau de couverture.
Le RAG réduit certaines hallucinations mais ne les supprime pas. Le modèle peut mal interpréter un passage ou associer une mauvaise citation. Une étape de vérification contrôle que chaque affirmation importante est réellement soutenue.
Faire de la citation une interaction et une métrique
Une référence comme « source 3 » aide peu. L’utilisateur ouvre le document à la bonne page, voit le passage surligné et lit son contexte. La voix peut améliorer l’accessibilité, mais conserve un équivalent textuel et le chemin de vérification.
On évalue séparément recherche et génération : rappel des documents, précision des fragments, fidélité, qualité des citations et refus hors corpus. Chaque mise à jour est rejouée sur un jeu de questions simples, ambiguës, multi-documents et impossibles.
Gérer les versions et la fraîcheur du corpus
Un document remplacé ne doit pas disparaître sans trace si des réponses précédentes le citaient. L’index conserve une version, une date d’entrée en vigueur et un état actif. Lors d’une mise à jour, les fragments concernés sont reconstruits et l’équipe peut identifier les réponses ou évaluations à rejouer.
La fraîcheur dépend du métier : une procédure quotidienne exige une ingestion rapide, tandis qu’une archive historique privilégie la stabilité. L’interface indique la date de la source et peut avertir lorsque les passages retrouvés sont anciens ou contradictoires.
Passer du prototype au service exploitable
Le prototype devient un service lorsqu’il possède une politique d’accès, un budget de latence, des limites de taille et une stratégie de reprise. Les requêtes et documents sensibles sont protégés ; les journaux conservent des métriques utiles sans recopier tout le contenu. Un cache peut réduire le coût, à condition d’intégrer version du corpus et droits dans sa clé.
Une revue régulière des questions sans réponse est souvent plus utile que le changement immédiat de modèle. Elle révèle les lacunes du corpus, les mauvaises métadonnées et les formulations réellement utilisées. L’amélioration devient alors une boucle observable entre recherche, contenu et expérience.
- Versionner chaque source indexée.
- Tester les droits avant la récupération.
- Mesurer recherche et génération séparément.
- Permettre le retour exact au passage cité.
Mettre en pratique
Des réalisations à consulter
Ces études de cas illustrent certains principes présentés dans ce guide. Elles complètent l’apprentissage sans exposer les choix internes ou le code des produits privés.
Références & prolongements
Retrieval-Augmented Generation — Lewis et al.↗Microsoft — RAG Overview↗NIST AI 600-1 — Generative AI Profile↗