multimodal-injection-test

Test multimodal AI systems for cross-modal prompt injection vulnerabilities.

6|Updated May 30, 2026
One-click install
npx skills add https://github.com/jassics/awesome-claude-security --skill multimodal-injection-test
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: multimodal-injection-test
Source: https://github.com/jassics/awesome-claude-security/tree/main/plugins/multimodal-security/skills/multimodal-injection-test
Command: npx skills add https://github.com/jassics/awesome-claude-security --skill multimodal-injection-test

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes scripts (resource) and references (resource) components.

What problem does it solve?

This Skill identifies and mitigates potential vulnerabilities in multimodal AI features, detecting cross-modal prompt injection and adversarial inputs.

Core Features & Use Cases

  • Cross-Modal Prompt Injection Testing: Evaluate AI features for instructions hidden in images, OCR'd text, file metadata, or audio.
  • Non-Text Input Handling Validation: Test an app's ability to process non-text inputs without executing malicious instructions.
  • Use Case: For an AI application that accepts visual and audio inputs, use this Skill to ensure it does not execute unintended commands embedded in media.

Quick Start

Use the multimodal-injection-test skill to check for image text injection on your application.

Frequently Asked Questions about multimodal-injection-test

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
What is cross-modal prompt injection in multimodal AI systems?

Cross-modal prompt injection embeds malicious instructions within non-text inputs like images, OCR'd text, file metadata, or audio to manipulate multimodal AI models into executing unintended commands.

How do I test my AI application for image text injection vulnerabilities?

Test image text injection by feeding your application benign crafted media inputs containing hidden instructions, then validate whether the system processes the non-text inputs without executing the embedded malicious commands.

Can I use this skill to check if my app executes hidden commands in audio or file metadata?

Yes, you can check if your app executes hidden commands by testing non-text input handling across audio, file metadata, and adversarial perturbation techniques to ensure safe processing without malicious command execution.

Do I need authorization before running adversarial testing on multimodal AI features?

Yes, authorization is required before running adversarial testing on multimodal AI features to ensure ethical validation of cross-modal prompt injection vulnerabilities using benign crafted media inputs.

What types of adversarial inputs are evaluated during multimodal vulnerability assessment?

Adversarial inputs evaluated during multimodal vulnerability assessment include image text injections, OCR hidden text, file metadata payloads, audio embedded instructions, and adversarial perturbation techniques targeting multimodal AI models.

When should I perform cross-modal prompt injection testing on my AI model?

Perform cross-modal prompt injection testing when your AI application accepts visual and audio inputs, ensuring it safely handles non-text inputs and mitigates potential vulnerabilities before deployment.