vllm-omni-multimodal

Orchestrate multimodal reasoning and generation across text, image, audio, and video inputs.

84|27|Updated Mar 3, 2026
One-click install
npx skills add https://github.com/hsliuustc0106/vllm-omni-skills --skill vllm-omni-multimodal
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: vllm-omni-multimodal
Source: https://github.com/hsliuustc0106/vllm-omni-skills/tree/main/skills/vllm-omni-multimodal
Command: npx skills add https://github.com/hsliuustc0106/vllm-omni-skills --skill vllm-omni-multimodal

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

End-to-end multimodal AI workloads often require separate tools for text, image, audio, and video processing. This skill unifies those capabilities under one Omni-model workflow to simplify development and inference.

Core Features & Use Cases

  • End-to-end multimodal reasoning and generation across text, image, audio, and video inputs using Qwen Omni models.
  • Quick-start examples for offline and online deployment and multi-turn conversations.
  • Supports multiple model variants with different VRAM requirements and serving modes.

Quick Start

Initialize an Omni session with a Qwen-Omni model and ask a text question to begin a multi-modal conversation.

Frequently Asked Questions about vllm-omni-multimodal

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I run multimodal AI inference across text, image, audio, and video?

Unified Omni models enable multimodal AI inference across text, image, audio, and video inputs. This skill orchestrates end-to-end reasoning and generation for interactive chat and content analysis tasks.

What is the best way to deploy an omni-model for serving multimodal requests?

Deploying an omni-model for serving multimodal requests is supported through both offline and online options. The skill provides quick-start examples and model configuration guidance for serving.

How does multimodal reasoning work for analyzing video and audio inputs?

Multimodal reasoning for video and audio inputs works by passing media directly to the Omni model. The model transcribes speech from video and describes images while answering contextual questions.

Do I need specific hardware to run different omni-model variants?

Running different omni-model variants requires specific hardware based on VRAM requirements. The skill supports multiple model variants with different VRAM needs and serving modes.

Can I use a single model for image description and speech transcription?

You can use a single Omni model for image description and speech transcription. The skill unifies text, image, audio, and video processing capabilities under one workflow to simplify inference.