eval

Evaluate corpus retrieval quality with Hit@5, MRR, and nDCG metrics.

27|9|Updated Feb 15, 2026
One-click install
npx skills add https://github.com/nicholasglazer/gnosis-mcp --skill eval-nicholasglazer
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: eval
Source: https://github.com/nicholasglazer/gnosis-mcp/tree/main/skills/eval
Command: npx skills add https://github.com/nicholasglazer/gnosis-mcp --skill eval-nicholasglazer

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Measures retrieval quality on your corpus by evaluating against golden queries, providing interpretable results and regression tracking after ingestion or config changes.

Core Features & Use Cases

  • Thin wrapper around gnosis-mcp eval for quick quality checks after ingest
  • Compares current results to a saved baseline and highlights regressions
  • Provides actionable tuning pointers when numbers look off

Quick Start

Run the evaluation to generate current metrics and compare them to your saved baseline.

Frequently Asked Questions about eval

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I measure information retrieval quality on my corpus?

Measure retrieval quality by running an evaluation against golden queries to generate Hit@5, MRR, and nDCG metrics. This validates search accuracy and tracks regressions after ingest or configuration changes.

What is the best way to track search regressions after a corpus ingestion?

Track search regressions by comparing current evaluation metrics against a saved baseline. This highlights performance drops and provides actionable tuning pointers when numbers look off after ingesting new data.

How do I calculate Hit@5 and MRR for my search baseline?

Calculate Hit@5 and MRR by running a retrieval evaluation wrapper over your corpus using golden queries. This generates interpretable results that you can save as a baseline for future regression comparison.

Does this retrieval evaluation require integration with gnosis-mcp?

Yes, this retrieval evaluation requires integration with gnosis-mcp eval. It acts as a thin wrapper around gnosis-mcp to perform quick quality checks and validate search accuracy on your corpus.

When should I run an evaluation to validate search accuracy?

Run an evaluation to validate search accuracy after each corpus ingest or configuration change. This ensures your retrieval quality has not regressed from its saved baseline metrics.