What problem does it solve?
This Skill provides production-grade patterns for evaluating LLM outputs using LLMs as judges. It covers direct scoring, pairwise comparisons, rubric-driven assessment, and bias mitigation to produce reliable, auditable results.
Core Features & Use Cases
- Direct Scoring: Calibrated, criterion-based scoring for objective aspects like accuracy and instruction-following.
- Pairwise Comparison: Compare two responses to determine preference while applying bias-mitigation protocols.
- Rubric Generation: Create domain-specific scoring rubrics to reduce evaluation variance.
- Evaluation Pipeline Design: Structured flow from input validation to scoring, bias mitigation, and output formatting.
- Bias Monitoring & Diagnostics: Track position bias, length bias, self-enhancement, and verbosity to maintain evaluation quality.
Quick Start
Use the scripts/evaluation_example.py to run end-to-end demonstrations of direct scoring, pairwise comparison, and rubric generation. Refer to the references for bias mitigation patterns and implementation guidance to adapt to your tasks.