eval-harness

Define, execute, and track evals for Claude Code sessions.

Updated Aug 27, 2026
One-click install
npx skills add https://github.com/dennisccy/finovae_strategy_platform --skill eval-harness-dennisccy
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: eval-harness
Source: https://github.com/dennisccy/finovae_strategy_platform/tree/main/.claude/skills/eval-harness
Command: npx skills add https://github.com/dennisccy/finovae_strategy_platform --skill eval-harness-dennisccy

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Formal evaluation framework for Claude Code sessions implementing eval-driven development (EDD) principles.

Core Features & Use Cases

  • Eval-driven development: define pass/fail criteria before coding and continuously validate agent behavior.
  • Regression and capability evals: support for pass@k metrics, baselines, regression tests, and standardized evaluation workflows.
  • Workflow tooling: storage and organization of eval definitions, runs, baselines, and reports under .claude/evals for reproducibility.

Quick Start

Define eval criteria, implement changes, then run eval checks to generate a report.

Frequently Asked Questions about eval-harness

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I set up regression evals for Claude Code sessions?

Regression evals for Claude Code sessions are configured by defining pass/fail criteria and storing definitions in .claude/evals. This framework continuously validates agent behavior and generates reproducible baseline reports.

What is eval-driven development for AI coding agents?

Eval-driven development defines pass/fail criteria before coding to continuously validate AI agent behavior. It ensures reliability across model versions by supporting capability evals, regression tests, and pass@k metrics.

Can I use model-based graders to evaluate Claude Code tasks?

Yes, evaluating Claude Code tasks supports multiple grader types including model-based, code-based, and human evaluation. These graders integrate into a standardized workflow to verify task success metrics.

How do I track pass@k metrics for prompt engineering workflows?

Pass@k metrics are tracked by running standardized evaluation workflows stored under .claude/evals. The framework computes these metrics against baselines to measure prompt engineering improvements and regression.

Does this evaluation framework support automated grading for model development?

Yes, the framework supports automated grading for model development through code-based and model-based graders. It applies standardized evaluation workflows to ensure reliability across different features and model versions.

When do I need a formal evaluation framework for Claude Code?

A formal evaluation framework is needed when ensuring reliability across model versions, prompt engineering changes, or regression testing. It provides standardized workflows for defining, executing, and tracking capability and regression evals.