What problem does it solve?
Evaluates end-to-end RAG pipelines by separately scoring retrieval and generation, then correlates results to identify bottlenecks and improvement opportunities.
Core Features & Use Cases
- Retrieval metrics: Recall@K, Precision@K, MRR, NDCG@K, and Hit Rate to quantify how well the system fetches relevant documents.
- Generation metrics: Faithfulness, Relevance, Completeness, and Conciseness to assess answer quality against retrieved context.
- Bottleneck analysis: Cross-reference retrieval and generation scores to classify failures and guide optimization.
- Pipeline comparison: Side-by-side evaluation of multiple configurations with statistical significance testing.
- Use case: Benchmarking RAG setups in knowledge bases, customer-support bots, or any system that relies on retrieved content to answer queries.
Quick Start
Run the eval-rag tool with your pipeline configuration, evaluation queries, and golden answers to generate a full evaluation report.