advanced-evaluation

Assess LLM outputs with direct scoring, pairwise comparison, and calibration.

11|1|Updated Jul 5, 2010
One-click install
npx skills add https://github.com/georgeguimaraes/dotfiles --skill advanced-evaluation-georgeguimaraes
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: advanced-evaluation
Source: https://github.com/georgeguimaraes/dotfiles/tree/main/dot_claude/skills/context-engineering/advanced-evaluation
Command: npx skills add https://github.com/georgeguimaraes/dotfiles --skill advanced-evaluation-georgeguimaraes

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes scripts (resource) and references (resource) components.

What problem does it solve?

This skill provides production-grade evaluation techniques for assessing LLM outputs, including direct scoring, pairwise comparison with bias mitigation, rubric design, and calibration.

Core Features & Use Cases

  • Direct Scoring with structured prompts and justification
  • Pairwise Comparison with position-swapping bias mitigation
  • Rubric Generation for consistent evaluation
  • Bias Mitigation and Confidence Calibration
  • Cost-aware, multi-model evaluation patterns

Quick Start

Run the evaluation demo to see multiple evaluation patterns: Command: python dot_claude/skills/context-engineering/advanced-evaluation/scripts/evaluation_example.py