ag-benchmark-qualidade

Orchestrate PDCA-based QAT benchmarks comparing AI outputs against baselines with dual-run and triple-scorer metrics.

19|4|Updated Mar 7, 2026
One-click install
npx skills add https://github.com/andregusman-raiz/a-gusman-claude --skill ag-benchmark-qualidade
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: ag-benchmark-qualidade
Source: https://github.com/andregusman-raiz/a-gusman-claude/tree/main/skills/ag-benchmark-qualidade
Command: npx skills add https://github.com/andregusman-raiz/a-gusman-claude --skill ag-benchmark-qualidade

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Automates end-to-end QA benchmarking for AI outputs by coordinating dual-run comparisons, multi-score aggregation, and PDCA-based improvement cycles.

Core Features & Use Cases

  • Dual-run comparison (app vs baseline) with triple scoring including L1/L2 rules and L3 judge jury.
  • Parity-focused metrics across 8 dimensions to quantify relative quality.
  • PDCA-based workflow to continuously update baselines, patterns, and learnings for ongoing improvement.

Quick Start

Provide a URL and optional scenario set to execute a full PDCA-based QAT benchmark against your AI app.

Frequently Asked Questions about ag-benchmark-qualidade

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I run an AI quality benchmark against my baseline outputs?

Run an AI quality benchmark by providing your app URL and optional scenario set to execute a dual-run comparison against baselines, aggregating scores and parity metrics for reporting.

What is dual-run comparison in AI quality testing?

Dual-run comparison in AI quality testing evaluates app outputs against baseline outputs using triple scoring with L1/L2 rules and an L3 judge jury to quantify relative quality.

How does the PDCA workflow apply to AI quality evaluation?

The PDCA workflow applies to AI quality evaluation by running continuous benchmark cycles, updating baselines and patterns, and surfacing actionable learnings for ongoing improvement.

Can I measure parity across multiple dimensions for my AI outputs?

Yes, you can measure parity-focused metrics across 8 dimensions to quantify the relative quality of your AI outputs against established baselines during benchmarking.

Do I need any external dependencies to execute a QAT benchmark?

No external dependencies are required to execute a QAT benchmark; you simply provide a URL and optional scenario set to initiate the end-to-end AI quality evaluation.

What is the best way to aggregate scores for AI quality benchmarks?

The best way to aggregate scores for AI quality benchmarks is using a triple-scorer approach with L1/L2 rules and an L3 judge jury to evaluate dual-run output parity.