evaluation-harness

Evaluate AI model outputs against predefined criteria using golden datasets and LLM-as-judge.

1|1|Updated Mar 30, 2026
One-click install
npx skills add https://github.com/Entelligentsia/skillforge --skill evaluation-harness-entelligentsia
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: evaluation-harness
Source: https://github.com/Entelligentsia/skillforge/tree/main/llm-patterns/skills/evaluation-harness
Command: npx skills add https://github.com/Entelligentsia/skillforge --skill evaluation-harness-entelligentsia

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Evaluate AI model outputs against predefined evaluation criteria.

Core Features & Use Cases

  • Golden dataset creation and management for non-deterministic prompts
  • Metrics definitions for classification, generation, and regression testing
  • LLM-as-judge for structured, auditable evaluations
  • Production monitoring with asynchronous judgments

Quick Start

Run a baseline versus candidate evaluation on a representative dataset and generate a performance report.

Frequently Asked Questions about evaluation-harness

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I evaluate AI model outputs against predefined criteria?

To evaluate AI model outputs, you define golden datasets and metrics for classification, generation, and regression testing. The skill applies these criteria to non-deterministic prompts and model upgrades to generate a performance report.

What is LLM-as-judge for structured evaluation?

LLM-as-judge is an evaluation mechanism that uses a language model to provide structured, auditable assessments of AI outputs. It judges baseline versus candidate model responses against predefined metrics on a representative dataset.

How do I run regression testing for non-deterministic prompts?

Regression testing for non-deterministic prompts uses golden datasets and metrics definitions to compare baseline and candidate outputs. This detects performance regressions across prompt changes, model upgrades, and retrieval strategies.

Can I use this for production monitoring of AI pipelines?

Yes, production monitoring is supported through asynchronous judgments. This allows continuous evaluation of live AI model outputs against defined metrics during pipeline changes and retrieval strategy updates.

What's the best way to compare baseline versus candidate model performance?

The best way to compare model performance is running a baseline versus candidate evaluation on a representative golden dataset. This structured evaluation generates an auditable performance report using predefined metrics.

When do I need golden datasets for prompt testing?

You need golden datasets for prompt testing when evaluating non-deterministic AI outputs. They provide the standardized reference data required to measure regression and validate model upgrades or pipeline changes accurately.