What problem does it solve?
This Skill automates the complex, multi-stage process of fine-tuning SOP monitoring models, reducing the manual effort required to coordinate data preparation, DDM and VLM training, evaluation, diagnosis, and iterative remediation.
Core Features & Use Cases
- End-to-End Orchestration: Coordinates dataset import, data augmentation, DDM-Net training, Cosmos-Reason VLM fine-tuning, evaluation, root-cause analysis, and corrective iterations.
- Autonomous Recovery: Applies configuration fixes based on RCA findings, manages independent DDM and VLM retry axes, and uses watchdogs to detect training failures, hangs, timeouts, and resource issues.
- Reproducible Run Management: Maintains run state, phase status, iteration budgets, configuration snapshots, evaluation outputs, RCA reports, progress files, and safe code overrides.
- Use Case: Given annotated training and evaluation datasets plus target accuracy thresholds, use this Skill to train an SOP monitoring pipeline and iteratively improve it until the configured success criteria are met or the iteration budget is exhausted.
Quick Start
Use the sop-ft-orchestrate skill with an inputs.yaml path or a natural-language request describing the dataset and desired SOP monitoring accuracy targets.