SHEN YIFull-stack & solutions IA

Paris • Singapour • Shanghai

RAG Formation · Référence

Latence, coût et observabilité

Une fiche autonome pour apprendre et tester la qualité RAG sur ce site.

$ reference --status
▸ cours RAG Formation
▸ mode référence autonome
▸ statut Terminé
● apprendre → tester → vérifier

Fiche de référence

Latence, coût et observabilité

Le contenu du cours guidé RAG Formation est complet ; cette fiche est disponible pour un apprentissage autonome.

Règle en une ligne

La latence moyenne peut masquer une longue traîne lente qui rend le système inutilisable pendant un pilote.

Termes fondamentaux

TermeSignification
p50 et p95La médiane et la longue traîne. Les deux comptent, car une moyenne rapide peut masquer des valeurs aberrantes pénalisantes. p95 n’est calculé que pour les exécutions en mode answer — le mode retrieval seul ne rapporte que p50.
Facteurs de coûtAppels d’embedding, appels de LLM graphe, génération de réponses, appels de jugement et taille du contexte.
Le seul vrai levier--graph-topk (20 par défaut) — le réduire échange de la profondeur de parcours du graphe de LightRAG contre de la latence. Il n’existe aucun moyen de désactiver entièrement LightRAG sur une requête en direct.
ObservabilitéTraces, indicateurs et journaux structurés qui montrent ce qui s’est passé sans exposer de secrets ni le texte des documents.

Fiche de preuves

ÉlémentÀ consignerNe pas affirmer
RéférenceCommande, configuration et résultat observé — la même base eval_set.yaml que la leçon 4.La référence est un objectif.
ModificationUne hypothèse ou une décisionOn peut savoir ce qui a causé le résultat lorsque plusieurs éléments ont changé.
Indicateursummary.answer.latency_p50_s/.latency_p95_s, summary.retrieval.latency_p50_s, answer.stats.total_context_chars/.graph_context_chars ; ne jamais journaliser de secrets ni de contenu sensible brut.Un seul indicateur décrit toute la qualité.
SécuritéUn échec et un cas de régressionUne réponse fluide prouve que le système est fiable.

Commande locale

cd demo
python3 eval.py run --mode both --workspace meridian_demo --tag lesson-14-latency

Utilisez --mode both, pas --mode retrieval seul — le résumé purement retrieval ne rapporte jamais p95.

Livrable : Un budget de performance MVP et une liste de contrôle de télémétrie, chaque élément étant marqué comme mesuré ou supposé.

Pour continuer : Ouvrir la leçon autonome correspondante · Feuille de route