advanced-evaluation

Automate LLM evaluation pipelines with direct scoring and pairwise comparison.

Updated Apr 15, 2025
One-click install
npx skills add https://github.com/khrore/nix-config --skill advanced-evaluation-khrore
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: advanced-evaluation
Source: https://github.com/khrore/nix-config/tree/main/dotfiles/common/.config/opencode/skills/advanced-evaluation
Command: npx skills add https://github.com/khrore/nix-config --skill advanced-evaluation-khrore

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes scripts (resource) and references (resource) components.

What problem does it solve?

This skill provides production-grade patterns for evaluating LLM outputs using LLMs as judges, enabling consistent scoring, bias mitigation, and robust rubric generation.

Core Features & Use Cases

  • Automated evaluation pipelines for comparing model outputs using Direct Scoring and Pairwise Comparison.
  • Rubric generation, bias detection, and confidence calibration to improve reliability across tasks.
  • End-to-end tooling for producing structured outputs (JSON) and diagnostics for production-quality QA.

Quick Start

Provide a sample prompt and two model outputs, then run the evaluation pipeline to generate scores, rubric diagnostics, and bias checks.

Frequently Asked Questions about advanced-evaluation

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I build an LLM evaluation pipeline for direct scoring and pairwise comparison?

You can build an LLM evaluation pipeline by providing a sample prompt and model outputs to automate direct scoring and pairwise comparison. The pipeline generates structured scores, rubric diagnostics, and bias checks for production-quality QA.

What is LLM-as-a-judge bias mitigation and how does it work?

LLM-as-a-judge bias mitigation detects and calibrates scoring biases during automated evaluations. It works by applying bias checks and confidence diagnostics to evaluation pipelines, ensuring consistent and trustworthy scoring across different model outputs.

Can I generate custom rubrics for evaluating LLM outputs automatically?

Yes, you can generate custom rubrics for evaluating LLM outputs automatically. The pipeline creates rubric diagnostics alongside direct scoring and pairwise comparison results to improve reliability across various evaluation tasks.

Does this evaluation pipeline output structured JSON for production QA?

Yes, the evaluation pipeline outputs structured JSON results for production-grade QA. It includes automated direct scoring, pairwise comparison data, rubric diagnostics, bias checks, and confidence calibration to ensure robust edge-case handling.

How do I calibrate confidence scores when using LLMs to evaluate model outputs?

You calibrate confidence scores by running model outputs through the evaluation pipeline. It applies confidence calibration and bias diagnostics alongside direct scoring or pairwise comparison to produce trustworthy, production-quality results.