RAG Formation · Référence
Recherche sémantique, par mots-clés et hybride
Une fiche autonome pour apprendre et tester la qualité RAG sur ce site.
$ reference --status
▸ cours RAG Formation
▸ mode référence autonome
▸ statut Terminé
● apprendre → tester → vérifierFiche de référence
Recherche sémantique, par mots-clés et hybride
Le contenu du cours guidé RAG Formation est complet ; cette fiche est disponible pour un apprentissage autonome.
Règle en une ligne
Avant de modifier l’architecture de récupération, mesurez quel signal ajoute effectivement la source attendue.
Glossaire
| Terme | Signification |
|---|---|
| Recherche vectorielle (Vector search) | Utilise la similarité des embeddings pour trouver le sens et les paraphrases. Les résultats multilingues dépendent du modèle d’embedding. |
| Recherche plein texte (Full-text search) | Correspond littéralement aux identifiants, noms, acronymes et nombres. |
| Récupération de résumé (Summary retrieval) | Un résumé vectorisé par document entier, pas par fragment — pour les questions « de quoi parle ce document », trop larges pour un seul fragment. |
| Récupération par graphe (Graph retrieval) | Le graphe d’entités/relations de LightRAG, construit et parcouru séparément de la recherche par fragments — le seul signal qui relie des faits répartis entre plusieurs fragments ou documents. |
| Union cumulative (Cumulative union) | Dans la leçon 5, la source attendue est considérée comme trouvée lorsque ses métadonnées apparaissent dans l’un des quatre signaux. |
| Récupération hybride (Hybrid retrieval) | Dans ce système : les quatre signaux s’exécutent en parallèle et leurs résultats formatés sont concaténés — sans fusion ni reclassement. La véritable fusion ne se produit qu’à l’intérieur de LightRAG lui-même. |
Comment lire le tableau
| Colonne | Utiliser ces preuves | Ne pas affirmer |
|---|---|---|
| Résultat vectoriel | retrieval.indexes.vector.all | Que la recherche sémantique a produit une réponse correcte. |
| Résultat plein texte | retrieval.indexes.fulltext.all | Que le classement plein texte est gagnant pour chaque requête. |
| Résultat résumé | retrieval.indexes.summary.all | Qu’un hit au niveau du résumé signifie que la réponse au niveau du fragment a aussi été trouvée. |
| Résultat graphe | retrieval.indexes.graph.all | Un hit exact — cette colonne est approximative (voir l’encadré ci-dessous). |
| Union cumulative | retrieval.cumulative["vector+fulltext+summary+graph"].all | Toute fusion ou tout classement au-delà de « trouvé quelque part parmi les quatre ». |
| Interprétation | Quelle source attendue a été ajoutée, dupliquée ou reste manquante. | Une décision d’architecture générale fondée sur une seule ligne. |
Appariez toujours les références de documents attendues aux métadonnées des sources, et non au texte arbitraire des fragments. Sinon, les renvois croisés peuvent créer de faux hits.
La colonne du graphe est approximative : LightRAG renvoie une seule chaîne de contexte plate, pas une liste de documents, si bien qu’un hit peut provenir d’un renvoi croisé à l’intérieur d’un autre document plutôt que du document cible lui-même.
Pistes de décision
| Type de question | Première hypothèse utile | Expérience suivante |
|---|---|---|
| Identifiant exact du document | La recherche plein texte peut récupérer ce que la recherche vectorielle manque. | Extraire l’identifiant, le rechercher littéralement, puis fusionner et dédupliquer. |
| Concept multilingue | La recherche vectorielle peut aider si le modèle d’embedding est multilingue. | Comparer la ligne multilingue et vérifier que le modèle prend en charge cette hypothèse. |
| Question sur deux documents (multi-étapes) | Le rappel de l’union peut être élevé même lorsque la qualité de réponse est faible. | Vérifier d’abord la colonne du graphe — c’est le signal conçu pour relier deux faits entre documents — puis inspecter l’assemblage du contexte et la génération. |
Pointeurs locaux
demo/eval.pydemo/eval_set.yamlreports/lesson-05-experiment.json
Pour continuer : Ouvrir la leçon autonome correspondante · Feuille de route