Yi SHENDéveloppeur Senior Full-Stack & Solutions IA

Paris • Singapour • Shanghai

Laboratoire d’ingénierie IA · Méthodologie ouverte

Mesurer séparément la recherche, la génération et la préparation à la production.

RAG Evaluation aide à trouver quelle couche a échoué, choisir la bonne mesure, valider l’évaluateur lui-même et décider si un système est prêt pour la production.

Méthode RAG Evaluation : les traces réelles deviennent des métriques, des juges validés et une préparation à la production

Pipeline de preuves

Un seul score ne peut pas expliquer chaque échec RAG.

Partir des échecs réellement vécus par les utilisateurs, puis garder la recherche, la génération, l’évaluation et la préparation visibles comme des questions séparées.

Skill RAG Evaluation

Découvrir le skill open source sur GitHub pour examiner les traces RAG réelles, mesurer la couche défaillante, valider le juge et évaluer la préparation à la production.

Explorer le skill RAG Evaluation

Mesurer la bonne couche

Utiliser Recall@k, Precision@k, MRR ou NDCG pour la recherche ; évaluer fidélité et pertinence après avoir fiabilisé la recherche.

Valider le juge

Privilégier le code lorsque c’est possible et valider les juges LLM avec des annotations humaines, TPR, TNR et matrice de confusion.

Auditer la préparation

Examiner fiabilité, évolutivité, sécurité, coût, gestion des données et qualité du pipeline avant la mise en production.

Méthode associée

Mesurer le système construit.

Associer RAG Evaluation à RAG Engineer pour relier chaque échec observé à la plus petite amélioration d’ingénierie mesurée.