digital-health-clinical-asr-build

Curates clinical terms, annotates IPA pronunciations, and generates NeMo manifests with evaluation audio.

Updated Apr 16, 2026
One-click install
npx skills add https://github.com/sayalinvidia/sayali-skills-test --skill digital-health-clinical-asr-build
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: digital-health-clinical-asr-build
Source: https://github.com/sayalinvidia/sayali-skills-test/tree/main/skills/digital-health-clinical-asr-build
Command: npx skills add https://github.com/sayalinvidia/sayali-skills-test --skill digital-health-clinical-asr-build

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

This skill enables clinical teams to assemble term pools, annotate IPA pronunciations, and produce ready-to-score ASR evaluation manifests and audio assets, accelerating reproducible benchmarking of clinical ASR.

Core Features & Use Cases

  • Term curation and IPA annotation using a two-tier IPA pipeline (override, Merriam-Webster, Magpie G2P).
  • NeMo manifest generation with clinical extension fields (term, entity_category, ipa_source, voice_id, noise_level, context_type) and audio assets.
  • Cycle-based workflow with append-only seeds and IPA overrides, plus evaluation-ready audio for Stage 3.

Quick Start

Create a term_seed.csv with 4–10 terms, run the IPA pipeline, and generate a NeMo manifest with evaluation audio.

Frequently Asked Questions about digital-health-clinical-asr-build

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I build a NeMo manifest for clinical ASR benchmarking?

To build a NeMo manifest for clinical ASR, curate clinical terms, annotate IPA pronunciations, and synthesize a manifest with evaluation audio. This process outputs term_seed.csv, pronunciation_overrides.csv, and manifest.jsonl for Stage 3 evaluation.

What is the IPA annotation pipeline for medical speech recognition?

The IPA annotation pipeline for medical speech recognition uses a two-tier process with override and Merriam-Webster lookups, supplemented by Magpie G2P. It generates pronunciation annotations for clinical terms to ensure accurate ASR evaluation.

Do I need to complete a setup stage before generating clinical ASR evaluation audio?

Yes, you must complete the digital-health-clinical-asr-setup stage and secure Magpie TTS access via NVCF before generating clinical ASR evaluation audio. These prerequisites enable the two-tier IPA pipeline required for manifest synthesis.

What file formats are output when curating clinical terms for ASR datasets?

Curating clinical terms for ASR datasets outputs three primary files: term_seed.csv for the initial term pool, pronunciation_overrides.csv for manual IPA corrections, and manifest.jsonl containing the NeMo-format evaluation audio and clinical extension fields.

How many clinical terms do I need to start an ASR benchmark manifest?

To start an ASR benchmark manifest, create a term_seed.csv containing 4 to 10 clinical terms. This seed file initiates the cycle-based workflow, allowing you to run the IPA pipeline and generate evaluation audio.

What clinical metadata fields are included in a NeMo manifest for medical ASR?

A NeMo manifest for medical ASR includes clinical extension fields such as term, entity_category, ipa_source, voice_id, noise_level, and context_type. These fields support reproducible benchmarking across medical specialties.