音频

浏览带有 音频 标签的 Agent Skill,并比较目录中的相关工作流与详情页。

33 个技能
A
videodb

作者 affaan-m

videodb 可帮助你从本地文件、URL、RTSP/RTMP 直播流或桌面录制中导入视频和音频;按时间戳搜索片段并查看可播放证据;还可通过剪辑、叠加层、转写、告警和时间线编辑来执行操作。它是面向 VideoDB 视频编辑与直播分析的实用 videodb 指南。

视频编辑
收藏 0GitHub 156.3k
A
video-editing

作者 affaan-m

video-editing 技能可以帮助你更快把现有素材打磨成适合各平台发布的成片。它聚焦剪辑、结构整理、字幕添加、画面重构和轻度增强,适用于 vlog、教程、演示、短视频片段和访谈剪辑。特别适合你已经有原始素材、需要一份实用的 video-editing 指南时使用。

视频编辑
收藏 0GitHub 156.3k
A
fal-ai-media

作者 affaan-m

fal-ai-media 是一个通过 fal.ai MCP 实现统一媒体生成的 GitHub 技能。它帮助用户安装和使用 fal-ai-media 技能,覆盖图像生成、图像编辑、视频、语音和音频工作流,并提供模型搜索、成本检查和引导式提示。

图像生成
收藏 0GitHub 156.1k
C
youtube-downloader

作者 ComposioHQ

youtube-downloader 是一个 File Automation skill,用于保存单个 YouTube 视频,或通过 Python yt-dlp wrapper 提取 MP3 音频。它支持选择画质、mp4/webm/mkv 格式、仅音频模式,以及自定义输出文件夹。

文件自动化
收藏 0GitHub 67.5k
C
meeting-insights-analyzer

作者 ComposioHQ

meeting-insights-analyzer 可用于分析会议转录文本中的沟通模式、填充词、模糊措辞、冲突回避、发言均衡度,并为 Workplace Communication 提供基于转录内容的 coaching 反馈。

职场沟通
收藏 0GitHub 67.5k
C
Spotify Automation

作者 ComposioHQ

Spotify Automation 是一个面向 Composio MCP 的 Spotify Automation skill,可通过已认证的 SPOTIFY_* tools 访问 Spotify 搜索、歌单、播放控制、专辑、曲目和用户资料等能力。

工作流自动化
收藏 0GitHub 67.5k
C
rev-ai-automation

作者 ComposioHQ

rev-ai-automation 是一个用于通过 Composio Rube MCP 自动化 Rev AI 工作流的 Claude skill。它会引导 agent 连接 Rube、验证 rev_ai connection、先搜索当前 tool schemas,并在更少猜测的情况下执行转录或相关 Rev AI 任务。

工作流自动化
收藏 0GitHub 67.5k
C
lmnt-automation

作者 ComposioHQ

lmnt-automation 可帮助 Claude 通过 Composio 的 Rube MCP 自动化 LMNT workflows:先发现当前可用 tools,检查 LMNT 连接,并在执行前使用实时 schemas。

工作流自动化
收藏 0GitHub 67.5k
C
happy-scribe-automation

作者 ComposioHQ

happy-scribe-automation 帮助 Claude 通过 Composio Rube MCP 运行 Happy Scribe 工作流。你可以了解转录、字幕、导出和项目自动化所需的设置要求、连接检查、工具发现方式,以及更安全的使用模式。

工作流自动化
收藏 0GitHub 67.5k
C
GroqCloud Automation

作者 ComposioHQ

GroqCloud Automation 是一项 Composio MCP skill,可通过 GROQCLOUD_* tools 实现 GroqCloud 模型发现、chat completions、音频翻译和 TTS 语音选择。

工作流自动化
收藏 0GitHub 67.5k
C
deepgram-automation

作者 ComposioHQ

deepgram-automation 是一个 Claude skill,用于通过 Composio Rube MCP 自动化 Deepgram 任务。它可用于发现当前工具 schema、验证有效的 Deepgram 连接,并运行以 schema 为先的工作流。

工作流自动化
收藏 0GitHub 67.5k
O
transcribe

作者 openai

transcribe 可将音频或视频转成文本,并支持可选的说话人分离和已知说话人提示。它很适合技术写作、会议纪要、访谈、讲座和内容运营等场景,尤其是在你需要一个可重复使用、输出格式清晰、比通用提示词更少猜测的 transcribe 技能时。

技术写作
收藏 0GitHub 18.8k
J
baoyu-youtube-transcript

作者 JimLiu

baoyu-youtube-transcript 可从 YouTube URL 或 video ID 提取 transcript、subtitles 和封面图。它支持语言选择、翻译、Markdown 或 SRT 输出、基于缓存的重新格式化,并在 InnerTube API 不可用时回退到 yt-dlp,以更稳定地获取 transcript。

格式转换
收藏 0GitHub 13.2k
H
hyperframes

作者 heygen-com

hyperframes 是一项工作流技能,用于在 HyperFrames 中构建基于 HTML 的视频合成。适用于需要结构化、以代码为先的 hyperframes 视频编辑场景,比如标题卡、叠加层、字幕、配音、音频驱动动效和场景转场。它更强调布局、时序和动画决策,而不是泛泛的只靠提示词生成视频请求。

视频编辑
收藏 0GitHub 2.7k
M
azure-ai-voicelive-ts

作者 microsoft

azure-ai-voicelive-ts 可帮助你使用 Azure AI Voice Live TypeScript SDK 构建实时语音 AI 应用。适用于需要双向音频、流式响应、会话设置和函数调用的 Node.js 或浏览器项目。这份 azure-ai-voicelive-ts 指南适合在你需要实用的安装、用法和代码生成帮助时参考。

代码生成
收藏 0GitHub 2.3k
M
azure-ai-contentunderstanding-py

作者 microsoft

azure-ai-contentunderstanding-py 是 Azure AI Content Understanding 的 Python 技能。它可从文档、图像、音频和视频中提取结构化内容,适用于 RAG 工作流和自动化场景。若你需要可靠的多模态提取、Azure 身份验证以及可重复、可直接接入流水线的输出,就适合使用它。

RAG 工作流
收藏 0GitHub 2.2k
M
azure-ai-voicelive-java

作者 microsoft

azure-ai-voicelive-java 是面向 Java 后端开发的 Azure AI VoiceLive SDK 技能,涵盖安装、身份验证、WebSocket 语音流式传输、事件处理以及基于示例的使用方式,适合构建实时助手。

后端开发
收藏 0GitHub 2.2k
M
azure-ai-voicelive-dotnet

作者 microsoft

azure-ai-voicelive-dotnet 是用于借助 Azure AI Voice Live 构建实时语音 AI 应用的 .NET 技能。它涵盖安装、配置、身份验证和使用指南,面向后端开发,内容包括双向音频、低延迟会话以及 speech-to-speech 工作流。

后端开发
收藏 0GitHub 2.2k
M
podcast-generation

作者 microsoft

podcast-generation 可基于文本,借助 Azure OpenAI GPT Realtime Mini 通过 WebSocket 生成 AI 播客风格音频。它适用于 Full-Stack Development 场景,并提供 React、Python FastAPI、PCM 流式传输、转录捕获和 WAV 转换方面的指导。若你需要的是面向真实应用集成的实用 podcast-generation 指南,而不是通用提示词,这个技能就很合适。

全栈开发
收藏 0GitHub 2.2k
M
github-issue-creator

作者 microsoft

github-issue-creator 可将原始笔记、错误日志、语音口述和截图整理成清晰的 GitHub 风格 issue 草稿。这个 github-issue-creator 技能适用于 Issue Tracking,会把摘要、环境、复现步骤、预期与实际行为、影响范围和证据组织成一份可审阅的 markdown issue。

问题追踪
收藏 0GitHub 2.2k
N
speech-to-text

作者 NoizAI

speech-to-text 技能可将受支持的音频文件转写为纯文本,并支持时间戳、说话人标签和 JSON 输出。它面向需要稳定、可重复流程的实际 speech-to-text 场景,适用于访谈、会议、播客、讲座,以及对转写一致性要求较高的自动化任务。

工作流自动化
收藏 0GitHub 498
N
tts

作者 NoizAI

tts 技能可将文本转换为语音音频,适用于旁白、配音、配音解说和按时间轴对齐的播放。你可以用它把纯文本生成语音文件,将文章或文本文件转成语音,或生成带时间控制的 SRT 驱动音频。它支持简单模式和时间轴模式,也支持面向后端的工作流,便于重复、稳定地使用 tts。

语音生成
收藏 0GitHub 498
N
sound-fx

作者 NoizAI

使用 sound-fx 技能,把文本提示词转换成音效、拟音、环境底噪、怪物声音和 UI 音效。它适合用于音效编辑、快速原型验证和可下载音频素材制作。先通过 NoizAI/skills 安装,然后使用基于脚本的工作流,并准备有效的 Noiz API key。它不适用于语音、歌词、旋律或声音克隆。

音频编辑
收藏 0GitHub 498
N
characteristic-voice

作者 NoizAI

characteristic-voice 是一款用于生成温暖、像陪伴者一样、带有情感在场感的语音技能。适合安抚式回复、早安晚安消息、轻松闲聊,以及带停顿、笑声或温柔感的角色化表达。它包含基于预设的工作流和后端支持,便于实际使用 characteristic-voice。

语音生成
收藏 0GitHub 498