What problem does it solve?
Evaluate, benchmark, compare, and recursively improve any skill across .gemini/skills/ and .claude/skills/. This ensures you can measure quality (pass rate, token usage, execution time), run blind A/B comparisons between skill versions, and progressively optimize instructions for better triggering.
Core Features & Use Cases
- Automated evaluation workflow: generate test cases, run with skill and baseline, and collect metrics.
- Benchmarking and comparison: aggregate pass rates, tokens, and durations; supports blind comparator and iteration logs.
- Iterative improvement: optimize skill descriptions and prompts based on feedback; persistence of lessons in a memory workspace.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.
Quick Start
Run skill-eval:generate to create test cases, then run skill-eval:run to execute them and gather metrics.