What problem does it solve?
Manually tracking long-running machine learning experiments across different compute platforms (local SSH servers, Vast.ai GPU instances, Modal cloud) is time-consuming and prone to missing completion events, unexpected failures, or key performance metrics.
Core Features & Use Cases
- Cross-Platform Monitoring: Supports checking experiment status on SSH servers, Vast.ai instances, and Modal cloud runs without switching between tools.
- Automated Result Collection: Pulls terminal output, JSON result files, and Weights & Biases training metrics automatically, eliminating manual log parsing.
- Use Case: For example, if you are running multiple vertebrae segmentation training jobs on Vast.ai to test your FMC-Net model, use this skill to automatically check each job's progress, pull the latest evaluation metrics, and compare them against your baseline results.
Quick Start
Use the monitor-experiment skill to check the progress of your running vertebrae segmentation training job on the Vast.ai instance named 'gpu-server-1' and pull the latest evaluation metrics.