What problem does it solve?
This Skill enables end-to-end multimodal workflows: analyzing and transcribing audio, understanding and describing images, processing PDFs, extracting structured data, and generating images/videos from prompts using Google Gemini's multimodal models.
Core Features & Use Cases
- Media Processing: Analyze, transcribe, summarize audio; caption and describe images; perform OCR and document understanding.
- Content Generation: Generate images with Imagen 4 variants; create videos with Veo 3; leverage Gemini 3/2.5 for advanced reasoning.
- Model Coverage: Supports Imagen 4 for image generation, Veo 3 for video, Gemini 3/2.5 for analysis.
Quick Start
Set GEMINI_API_KEY, install dependencies, then run:
- Analyze media: python scripts/gemini_batch_process.py --files <files> --task analyze
- Generate content: python scripts/gemini_batch_process.py --task generate --prompt "<text>" --model imagen-4.0-generate-001