eval-harness

Define and run eval-driven development tests for Claude Code sessions.

3|Updated Sep 20, 2021
One-click install
npx skills add https://github.com/jinyuanlu/dotfiles --skill eval-harness-jinyuanlu
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: eval-harness
Source: https://github.com/jinyuanlu/dotfiles/tree/main/.claude/skills/eval-harness
Command: npx skills add https://github.com/jinyuanlu/dotfiles --skill eval-harness-jinyuanlu

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Formal framework to define, implement, and evaluate eval-driven development tests for Claude Code sessions, enabling reproducible pass/fail criteria and regression checks.

Core Features & Use Cases

  • Capability and regression eval definitions
  • Deterministic (Code-based) and model-based graders
  • Eval storage and baselines for regression tests
  • Support for phased workflows (define, implement, evaluate, report)

Quick Start

Define an eval with a feature name, then run checks and generate a report.

Frequently Asked Questions about eval-harness

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I set up regression testing for AI model capability changes?

AI regression testing requires defining capability and regression evals with structured pass/fail criteria. You can define an eval with a feature name, run checks across model versions and prompts, and generate evaluation reports to detect regressions.

What is eval-driven development and how does it apply to AI testing?

Eval-driven development is a formal framework to define, implement, and evaluate tests for AI sessions. It applies to building capability and regression evals by enforcing a structured workflow with phases: define, implement, evaluate, and report.

Can I use both deterministic and model-based graders for AI evals?

Yes, AI evals support both deterministic code-based graders and model-based graders. You can apply these grader types within the evaluate phase to assess outputs against defined pass/fail criteria and baselines.

How do I evaluate AI prompts across different model versions?

Evaluating prompts across model versions involves storing baselines and running regression checks. The framework supports generating evaluation reports across model versions and prompts, applying deterministic or model-based graders to compare results against stored baselines.

Do I need any external dependencies to run eval-driven development tests?

No external dependencies are required to run eval-driven development tests. The framework operates independently to define, implement, evaluate, and report on AI capability and regression evals within your project eval store.