Audio pipeline: transcription (Whisper), TTS (ElevenLabs), audio extraction (ffmpeg),
and YouTube transcript via MCP.
[WHAT] Audio skill for transcribe, TTS, voice-over, podcast workflow.
Whisper for transcription (default OpenAI Whisper, configurable per-language),
ElevenLabs for TTS, ffmpeg for extraction, YouTube-transcript MCP for video.
[WHEN] Use when: transcribe, audio, TTS, voice-over, podcast, YouTube transcript,
generate speech, read aloud, dictation audio, mp3, wav, m4a.
[LANGUAGE] Configurable. TTS voice configurable per project.