podcast-generation

Generate podcast audio narratives from text via Azure OpenAI GPT Realtime Mini WebSocket streaming.

63|12|Updated Mar 9, 2026
One-click install
npx skills add https://github.com/iBz-04/gloamy --skill podcast-generation-ibz-04
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: podcast-generation
Source: https://github.com/iBz-04/gloamy/tree/main/.agents/skills/podcast-generation
Command: npx skills add https://github.com/iBz-04/gloamy --skill podcast-generation-ibz-04

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) and scripts (resource) components.

What problem does it solve?

This Skill turns written content into an engaging podcast-style audio narrative without requiring you to manually handle speech synthesis, chunked streaming, or audio format conversion.

Core Features & Use Cases

  • WebSocket Realtime Audio Streaming: Generates audio via Azure OpenAI GPT Realtime Mini using WebSocket, collecting incremental PCM chunks and transcript deltas.
  • End-to-End Audio Pipeline: Converts 24kHz 16-bit mono PCM output into browser-ready WAV and returns base64 audio plus the transcript.
  • Configurable Narration Output: Supports voice selection and session instructions for narrator/podcast tone, suitable for short episodes, summaries, or multi-part scripts.

Quick Start

Use the skill to generate a podcast audio narrative for the topic "Why local-first agents matter" and return base64 WAV plus transcript for playback in your frontend.

Frequently Asked Questions about podcast-generation

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I convert text to streaming podcast audio using WebSocket?

You can convert text to streaming podcast audio by sending content over WebSocket to Azure OpenAI GPT Realtime Mini, which streams incremental PCM chunks and transcript deltas back for real-time playback. The pipeline collects response output events and assembles the transcript incrementally.

How do I convert 24kHz PCM chunks to WAV for browser audio playback?

To convert 24kHz PCM chunks to WAV for browser playback, collect the streamed 16-bit mono PCM data from the WebSocket response and apply a PCM-to-WAV conversion step. The resulting WAV is encoded as base64 for direct use in frontend audio elements.

Can I use FastAPI to serve incremental audio streaming from Azure OpenAI?

Yes, FastAPI can serve incremental audio streaming from Azure OpenAI by managing WebSocket connections, handling session configuration for audio modality, and relaying the base64 WAV output and assembled transcript to a React frontend for playback.

How do I configure Azure OpenAI GPT Realtime Mini for text-to-speech narration?

To configure Azure OpenAI GPT Realtime Mini for text-to-speech narration, establish a WSS endpoint converted from HTTPS, set the session to audio modality, and provide voice selection and session instructions to define the desired podcast narrator tone.

Does Azure OpenAI Realtime API return a transcript along with streamed audio?

Yes, Azure OpenAI Realtime API returns a transcript along with streamed audio. The WebSocket connection delivers incremental PCM chunks for audio synthesis and transcript deltas simultaneously, allowing you to assemble the full text narrative as the audio streams.