What problem does it solve?
Eval-harness helps teams turn AI agent behavior into measurable, repeatable pass/fail outcomes so regressions are caught early and reliability improves over time.
Core Features & Use Cases
- Eval-Driven Development (EDD) workflow: Define expected behavior before coding, evaluate continuously, and track regressions per change.
- Capability and regression eval templates: Create capability evals for new functionality and regression evals that compare against baselines (e.g., prior checkpoints or SHAs).
- Multiple grader modes: Use deterministic code-based graders, rubric-based model graders, and human review flags for ambiguous or high-risk cases.
- Reliability metrics (pass@k and pass^k): Measure success rates and stability with practical and strict thresholds.
Quick Start
Use eval-harness to define a new feature’s capability evals and required success criteria, then run and report the results to confirm readiness for review.