sop-rca

Diagnose SOP monitoring pipeline failures and produce evidence-driven root cause analysis reports.

49|14|Updated Aug 27, 2025
One-click install
npx skills add https://github.com/NVIDIA/sop-monitoring-blueprints --skill sop-rca
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: sop-rca
Source: https://github.com/NVIDIA/sop-monitoring-blueprints/tree/main/agentic/sop-agentic-ft/plugins/sop-rca-plugin/skills/sop-rca
Command: npx skills add https://github.com/NVIDIA/sop-monitoring-blueprints --skill sop-rca

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

This Skill diagnoses failures across SOP monitoring evaluation, temporal segmentation, vision-language inference, training data, and fine-tuning configurations, replacing ad hoc debugging with an evidence-driven root cause analysis.

Core Features & Use Cases

  • End-to-End Failure Analysis: Correlates evaluation metrics, per-video errors, raw VLM outputs, DDM boundaries, and by-action confusion results.
  • Training Pipeline Diagnostics: Examines augmentation coverage, data distributions, learning rates, convergence, LoRA capacity, and DDM training settings to distinguish capability gaps from coverage gaps.
  • Actionable Recommendations: Evaluates evaluation-parameter tuning, augmentation changes, training-config changes, DDM improvements, and code or manual interventions, then produces a structured RCA report and machine-readable handoff.
  • Use Case: When an SOP monitoring run has low sequence accuracy, use this Skill to determine whether missed actions originate from DDM under-segmentation, VLM confusion, model collapse, insufficient training coverage, or evaluation mismatches.

Quick Start

Provide the required evaluation logs, actions definition, augmentation and fine-tuning configurations, and training logs, then ask the SOP RCA skill to generate an evidence-driven root cause analysis report.

Frequently Asked Questions about sop-rca

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I diagnose root causes for low sequence accuracy in SOP monitoring pipelines?

Root cause analysis for SOP monitoring pipelines correlates evaluation metrics, per-video errors, DDM boundaries, and VLM outputs to identify whether failures stem from under-segmentation, model confusion, or training gaps, producing a structured RCA report with prioritized fixes.

Why does my vision-language model confuse actions during SOP evaluation?

Vision-language model action confusion during SOP evaluation is diagnosed by analyzing by-action confusion results and raw VLM outputs alongside training data distributions, distinguishing capability gaps from insufficient augmentation coverage or fine-tuning configuration errors.

How do I investigate DDM temporal segmentation failures in my SOP pipeline?

DDM temporal segmentation failures are investigated by examining DDM training settings, boundary outputs, and evaluation artifacts to determine if missed actions originate from under-segmentation, evaluation-parameter mismatches, or model convergence issues.

Can I use SOP root cause analysis to check if my fine-tuning configuration caused evaluation failures?

Yes, SOP root cause analysis examines fine-tuning configurations, learning rates, LoRA capacity, and training logs to distinguish capability gaps from coverage gaps, determining if evaluation failures require training-config changes or data augmentation adjustments.

What evaluation artifacts do I need to perform SOP pipeline failure analysis?

SOP pipeline failure analysis requires evaluation logs, actions.json definitions, augmentation and fine-tuning configurations, training logs or reports, and helper-script analysis outputs to classify root causes and generate evidence-driven corrective recommendations.

What's the best way to fix SOP monitoring failures without ad hoc debugging?

Fixing SOP monitoring failures without ad hoc debugging requires evidence-driven root cause analysis that correlates evaluation metrics, DDM boundaries, VLM outputs, and training data, then recommends prioritized corrective actions including parameter tuning, augmentation changes, or code interventions.