huggingface-vision-trainer

Train and fine-tune vision models with Hugging Face Transformers and Jobs.

Updated Jun 15, 2026
One-click install
npx skills add https://github.com/Andrew-Girgis/token-holdem --skill huggingface-vision-trainer-andrew-girgis
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: huggingface-vision-trainer
Source: https://github.com/Andrew-Girgis/token-holdem/tree/main/.agents/skills/huggingface-vision-trainer
Command: npx skills add https://github.com/Andrew-Girgis/token-holdem --skill huggingface-vision-trainer-andrew-girgis

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires transformers, datasets, monai, trackio, and includes scripts (resource) and references (resource) and assets (resource) components.

What problem does it solve?

This Skill addresses the complexity and time-consuming nature of training and fine-tuning vision models. It provides a streamlined, cloud-based experience using Hugging Face Transformers and Hugging Face Jobs.

Core Features & Use Cases

  • Cloud-Based Training: Leverage managed cloud GPUs for scalable and efficient training.
  • Hugging Face Transformers Integration: Utilize state-of-the-art vision models from Hugging Face Transformers library.
  • Dataset Preparation: Automate the preparation of COCO-format datasets with Albumentations augmentation.
  • Evaluation: Perform mAP/mAR evaluation and track accuracy metrics.
  • Use Case: A user can train a segmentation model for image matting by simply providing a dataset with image and mask columns, and specifying the appropriate prompts.

Quick Start

To train a SAM2 segmentation model on the 'MicroMat-mini' dataset, use the following command: uv run huggingface-vision-trainer.py --model_name_or_path "facebook/sam2.1-hiera-small" --dataset_name "merve/MicroMat-mini" --prompt_type "bbox" --prompt_column_name "prompt" --output_dir "sam2-finetuned" --num_train_epochs 30 --per_device_train_batch_size 4 --learning_rate 1e-5 --logging_steps 1 --save_strategy "epoch" --save_total_limit 2 --remove_unused_columns False --dataloader_pin_memory False --push_to_hub True --hub_model_id "username/sam2-finetuned" --do_train True --report_to "trackio" --report_to "tensorboard" --tensorboard_log_dir "tensorboard_logs".

Frequently Asked Questions about huggingface-vision-trainer

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I fine-tune a Hugging Face vision model for object detection or segmentation?

Fine-tune Hugging Face vision models for object detection and segmentation by running cloud-based training jobs with Hugging Face Transformers, handling COCO-format dataset preparation and evaluation automatically.

What's the best way to train a SAM2 segmentation model using cloud GPUs?

Train SAM2 segmentation models on cloud GPUs by providing a dataset with image and mask columns, specifying bbox or point prompts, and configuring DiceCE loss with Hugging Face Jobs.

Does Hugging Face Jobs support Albumentations augmentation for COCO-format datasets?

Yes, Hugging Face Jobs supports Albumentations augmentation by automating the preparation of COCO-format datasets during the vision model training pipeline.

Can I track mAP and mAR evaluation metrics when training image classification models?

Track mAP and mAR evaluation metrics alongside accuracy metrics for image classification models using Trackio and Tensorboard monitoring integrations during Hugging Face Jobs training.

How do I estimate hardware costs and select GPUs for Hugging Face Transformers training?

Estimate hardware costs and select cloud GPUs for Hugging Face Transformers training through built-in hardware selection and cost estimation features provided by Hugging Face Jobs infrastructure.

What are the limitations of using Hugging Face Jobs for vision model fine-tuning?

Hugging Face Jobs fine-tuning requires Hugging Face Transformers and Jobs infrastructure dependencies, limiting usage to environments where these specific platform dependencies are available.