evaluation-harness
Evaluate AI model outputs against predefined criteria using golden datasets and LLM-as-judge.
npx skills add https://github.com/Entelligentsia/skillforge --skill evaluation-harness-entelligentsia
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill. Skill: evaluation-harness Source: https://github.com/Entelligentsia/skillforge/tree/main/llm-patterns/skills/evaluation-harness Command: npx skills add https://github.com/Entelligentsia/skillforge --skill evaluation-harness-entelligentsia