eval-harness

Evaluate Claude Code sessions with capability and regression evals.

Updated Mar 31, 2026
One-click install
npx skills add https://github.com/BuildSmarterAI/claude-skills --skill eval-harness-buildsmarterai
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: eval-harness
Source: https://github.com/BuildSmarterAI/claude-skills/tree/main/eval-harness
Command: npx skills add https://github.com/BuildSmarterAI/claude-skills --skill eval-harness-buildsmarterai

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Formal evaluation framework for Claude Code sessions implementing eval-driven development (EDD) principles.

Core Features & Use Cases

  • Evals: capability and regression definitions to capture expected behavior and regression checks.
  • Graders: code-based, model-based, and human graders for diverse evaluation tasks.
  • Metrics: pass@k and pass^k tracking to quantify reliability and regressions.
  • Artifacts: store eval definitions, baselines, and run histories for traceability.

Quick Start

Run the evaluation workflow to establish defect-detection metrics and generate a reproducible report.

Frequently Asked Questions about eval-harness

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
What is eval-driven development for Claude Code sessions?

Eval-driven development systematically evaluates Claude Code sessions by defining capability and regression checks, applying graders, and tracking metrics like pass@k to quantify reliability and detect regressions.

How do I set up regression evals for Claude Code?

Set up regression evals by defining expected behavior checks, configuring code-based or model-based graders, and storing eval definitions and baselines as artifacts to capture run histories for traceability.

Can I use model-based graders with pass@k scoring for session evaluations?

Yes, the framework supports code-based, model-based, and human graders alongside pass@k and pass^k metrics to quantify both the reliability of capability evaluations and the presence of regressions.

What's the best way to track Claude Code session regressions over time?

Track regressions by storing eval definitions, baselines, and run histories as artifacts, using pass^k metrics to monitor reliability across capability and regression eval runs for reproducible reporting.

Do I need external dependencies to run Claude Code capability evaluations?

No external dependencies are required to run capability evaluations; the framework specifies requirements for eval definitions, graders, metrics, and artifacts directly within Claude Code sessions.

When should I not use a formal evaluation framework for Claude Code?

A formal evaluation framework is unnecessary for simple, one-off Claude Code tasks where systematic defect-detection, regression tracking, and reproducible reporting are not required.