Skill RAG Evaluation
Découvrir le skill open source sur GitHub pour examiner les traces RAG réelles, mesurer la couche défaillante, valider le juge et évaluer la préparation à la production.
Laboratoire d’ingénierie IA · Méthodologie ouverte
RAG Evaluation aide à trouver quelle couche a échoué, choisir la bonne mesure, valider l’évaluateur lui-même et décider si un système est prêt pour la production.

Pipeline de preuves
Partir des échecs réellement vécus par les utilisateurs, puis garder la recherche, la génération, l’évaluation et la préparation visibles comme des questions séparées.
Découvrir le skill open source sur GitHub pour examiner les traces RAG réelles, mesurer la couche défaillante, valider le juge et évaluer la préparation à la production.
Utiliser Recall@k, Precision@k, MRR ou NDCG pour la recherche ; évaluer fidélité et pertinence après avoir fiabilisé la recherche.
Privilégier le code lorsque c’est possible et valider les juges LLM avec des annotations humaines, TPR, TNR et matrice de confusion.
Examiner fiabilité, évolutivité, sécurité, coût, gestion des données et qualité du pipeline avant la mise en production.
Méthode associée
Associer RAG Evaluation à RAG Engineer pour relier chaque échec observé à la plus petite amélioration d’ingénierie mesurée.