eval-harness

Automate eval-driven development workflows for Claude Code sessions.

Updated Apr 25, 2026
One-click install
npx skills add https://github.com/ldk-hub/broke-shopping --skill eval-harness-ldk-hub
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: eval-harness
Source: https://github.com/ldk-hub/broke-shopping/tree/main/.agent/.agents/skills/eval-harness
Command: npx skills add https://github.com/ldk-hub/broke-shopping --skill eval-harness-ldk-hub

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Formal evaluation framework for Claude Code sessions enabling eval-driven development (EDD) principles.

Core Features & Use Cases

  • Define capability and regression evaluations
  • Run deterministic and model-based graders
  • Generate, store, and review evaluation reports

Quick Start

Define your first evaluation and run it against Claude Code to generate a results report.

Frequently Asked Questions about eval-harness

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I run regression evaluations for Claude Code sessions?

Regression evaluations for Claude Code are run by defining capability checks, executing deterministic and model-based graders, and generating results reports stored under .claude/evals.

What is eval-driven development for model evaluation?

Eval-driven development for model evaluation is a formal workflow that applies deterministic and model-based graders to assess capability and regression across prompt iterations and model versions.

Can I use pass@k metrics in Claude Code evaluation frameworks?

Yes, pass@k metrics are supported within the evaluation framework to measure capability and regression outcomes across different model versions and prompt iterations during Claude Code sessions.

How do I define evaluation definitions for Claude Code?

Define evaluation definitions for Claude Code by specifying capability and regression checks, which are then executed by deterministic and model-based graders to produce stored evaluation data.

Does the eval-harness framework store evaluation data and results locally?

Yes, the evaluation framework stores all evaluation data and results locally under the .claude/evals directory, ensuring persistent access to capability and regression test outcomes.

What are the limitations of model-based graders in regression evals?

Model-based graders in regression evals may exhibit non-deterministic scoring behavior across model versions, requiring deterministic checks to validate baseline capabilities and ensure stable prompt iterations.