What problem does it solve?
Evaluation prevents agents from prematurely declaring work complete by forcing an evidence-based check against the original request, acceptance criteria, and residual risks.
Core Features & Use Cases
- Evidence-based completion scoring: Assign a disciplined 1–5 score using a visible score ceiling when required inputs or verification evidence are missing.
- Coverage of completion gaps: Inventory request fit, completeness, correctness, verification evidence, residual risks, and reporting quality.
- Evaluation-revision loop: Record findings with severity, evidence, required actions, and status, revise, re-verify, and rescore before accepting.
- Boundary-aware routing: Use this for end-of-task completion evaluation, not for designing eval datasets/graders, debugging failures, diff line-by-line review, or pre-work methodology design.
Quick Start
Use the evaluation skill to score a completed deliverable against the original request and acceptance criteria using the available evidence packet, then list any required revisions and residual risks before marking it done.