Audio

Entdecke Agent Skills mit dem Tag Audio und vergleiche verwandte Workflows im Verzeichnis.

33 Skills
A
videodb

von affaan-m

videodb hilft beim Ingest von Video und Audio aus lokalen Dateien, URLs, RTSP/RTMP-Livefeeds oder Desktop-Capture; beim Finden von Momenten mit Zeitstempeln und abspielbaren Belegen; sowie beim Arbeiten mit Clips, Overlays, Transkription, Alerts und Timeline-Bearbeitung. Das ist ein praxisnaher Videodb-Leitfaden für VideoDB für Video Editing und die Analyse von Livestreams.

Video Editing
Favoriten 0GitHub 156.3k
A
video-editing

von affaan-m

Die video-editing-Skill hilft dir dabei, vorhandenes Footage schneller in saubere, plattformtaugliche Videos zu verwandeln. Der Fokus liegt auf Schneiden, Strukturieren, Untertiteln, Reframing und leichter Aufbereitung für Vlogs, Tutorials, Demos, kurze Clips und Interview-Schnitte. Am besten geeignet ist sie, wenn du bereits Rohmaterial hast und einen praxisnahen video-editing-Leitfaden brauchst.

Video Editing
Favoriten 0GitHub 156.3k
A
fal-ai-media

von affaan-m

fal-ai-media ist ein GitHub-Skill für die einheitliche Mediengenerierung über fal.ai MCP. Er hilft dabei, den fal-ai-media Skill zu installieren und zu nutzen – für Bildgenerierung, Bildbearbeitung, Video sowie Speech- und Audio-Workflows mit Modellsuche, Kostenprüfung und geführten Prompts.

Image Generation
Favoriten 0GitHub 156.1k
C
youtube-downloader

von ComposioHQ

youtube-downloader ist eine File Automation Skill zum Speichern einzelner YouTube-Videos oder zum Extrahieren von MP3-Audio über einen Python-Wrapper für yt-dlp. Sie unterstützt Qualitätsauswahl, die Formate mp4/webm/mkv, einen Nur-Audio-Modus und benutzerdefinierte Ausgabeordner.

File Automation
Favoriten 0GitHub 67.5k
C
meeting-insights-analyzer

von ComposioHQ

meeting-insights-analyzer hilft dabei, Meeting-Transcripts auf Kommunikationsmuster, Füllwörter, abschwächende Formulierungen, Konfliktvermeidung, Redeanteile und transcript-gestütztes Coaching-Feedback für Workplace Communication zu analysieren.

Workplace Communication
Favoriten 0GitHub 67.5k
C
Spotify Automation

von ComposioHQ

Spotify Automation ist ein Composio-MCP-Skill für Spotify-Suche, Playlists, Wiedergabesteuerung, Alben, Tracks und Zugriff auf Nutzerprofile über authentifizierte `SPOTIFY_*`-Tools.

Workflow Automation
Favoriten 0GitHub 67.5k
C
rev-ai-automation

von ComposioHQ

rev-ai-automation ist ein Claude-Skill zur Automatisierung von Rev AI-Workflows über Composio Rube MCP. Er führt Agents dabei an, Rube zu verbinden, die rev_ai-Verbindung zu prüfen, zuerst aktuelle Tool-Schemas zu suchen und Transkriptionen oder verwandte Rev AI-Aufgaben mit weniger Rätselraten auszuführen.

Workflow Automation
Favoriten 0GitHub 67.5k
C
lmnt-automation

von ComposioHQ

lmnt-automation hilft Claude, LMNT-Workflows über Composio's Rube MCP zu automatisieren: aktuelle Tools werden ermittelt, die LMNT-Verbindung wird geprüft und vor der Ausführung werden Live-Schemas verwendet.

Workflow Automation
Favoriten 0GitHub 67.5k
C
happy-scribe-automation

von ComposioHQ

happy-scribe-automation hilft Claude, Happy Scribe-Workflows über Composio Rube MCP auszuführen. Der Leitfaden erklärt Einrichtungsanforderungen, Verbindungsprüfungen, Tool-Erkennung und sichere Nutzungsmuster für Transkription, Untertitel, Exporte und Projekt automatisierung.

Workflow Automation
Favoriten 0GitHub 67.5k
C
GroqCloud Automation

von ComposioHQ

GroqCloud Automation ist ein Composio MCP-Skill für GroqCloud Model Discovery, Chat Completions, Audio Translation und TTS Voice Selection über GROQCLOUD_*-Tools.

Workflow Automation
Favoriten 0GitHub 67.5k
C
deepgram-automation

von ComposioHQ

deepgram-automation ist ein Claude-Skill zur Automatisierung von Deepgram-Aufgaben über Composio Rube MCP. Er hilft dabei, aktuelle Tool-Schemas zu finden, eine aktive Deepgram-Verbindung zu prüfen und schemaorientierte Workflows auszuführen.

Workflow Automation
Favoriten 0GitHub 67.5k
O
transcribe

von openai

transcribe wandelt Audio oder Video in Text um, optional mit Diarisierung und Hinweisen auf bekannte Sprecher. Es eignet sich besonders für technisches Schreiben, Meeting-Notizen, Interviews, Vorlesungen und Content Ops, wenn du einen wiederholbaren transcribe Skill mit klaren Ausgabeformaten brauchst und weniger raten willst als bei einem generischen Prompt.

Technical Writing
Favoriten 0GitHub 18.8k
J
baoyu-youtube-transcript

von JimLiu

baoyu-youtube-transcript extrahiert YouTube-Transkripte, Untertitel und Cover-Bilder aus einer URL oder Video-ID. Unterstützt Sprachwahl, Übersetzung, Ausgabe als Markdown oder SRT, gecachte Neuformatierung sowie einen Fallback von der InnerTube API zu yt-dlp für eine zuverlässigere Transkript-Abrufung.

Format Conversion
Favoriten 0GitHub 13.2k
H
hyperframes

von heygen-com

hyperframes ist eine Workflow-Skill zum Erstellen von HTML-basierten Videokompositionen in HyperFrames. Nutze sie für Title Cards, Overlays, Untertitel, Voiceovers, audio-reactive Motion und Szenenübergänge, wenn du strukturierte, code-first hyperframes für Videoediting brauchst. Der Fokus liegt stärker auf Layout, Timing und Animation als auf allgemeinen Prompt-only-Videoanfragen.

Video Editing
Favoriten 0GitHub 2.7k
M
azure-ai-voicelive-ts

von microsoft

azure-ai-voicelive-ts hilft Ihnen, Echtzeit-Voice-AI-Apps mit dem Azure AI Voice Live TypeScript SDK zu entwickeln. Nutzen Sie es für Node.js- oder Browser-Projekte, die bidirektionales Audio, Streaming-Antworten, Session-Setup und Function Calling benötigen. Diese Anleitung zu azure-ai-voicelive-ts ist hilfreich, wenn Sie praktische Unterstützung bei Installation, Nutzung und Codegenerierung suchen.

Code Generation
Favoriten 0GitHub 2.3k
M
azure-ai-contentunderstanding-py

von microsoft

azure-ai-contentunderstanding-py ist das Python-Skill für Azure AI Content Understanding. Es extrahiert strukturierte Inhalte aus Dokumenten, Bildern, Audio und Video für RAG-Workflows und Automatisierung. Nutzen Sie es, wenn Sie zuverlässige multimodale Extraktion, Azure-Authentifizierung und reproduzierbare, pipelinefähige Ausgaben benötigen.

RAG Workflows
Favoriten 0GitHub 2.2k
M
azure-ai-voicelive-java

von microsoft

azure-ai-voicelive-java ist ein Azure AI VoiceLive SDK-Skill für Java-Backend-Entwicklung. Er deckt Installation, Authentifizierung, WebSocket-Voice-Streaming, Event-Handling und beispielbasierte Nutzung für Echtzeit-Assistenten ab.

Backend Development
Favoriten 0GitHub 2.2k
M
azure-ai-voicelive-dotnet

von microsoft

azure-ai-voicelive-dotnet ist das .NET-Skill für die Entwicklung von Echtzeit-Sprach-KI-Apps mit Azure AI Voice Live. Es deckt Installation, Einrichtung, Authentifizierung und Nutzung für die Backend-Entwicklung ab, einschließlich bidirektionaler Audioübertragung, Sitzungen mit geringer Latenz und Speech-to-Speech-Workflows.

Backend Development
Favoriten 0GitHub 2.2k
M
podcast-generation

von microsoft

podcast-generation hilft dabei, aus Text KI-generierte Audioinhalte im Podcast-Stil zu erstellen – mit Azure OpenAI GPT Realtime Mini über WebSocket. Es eignet sich für podcast-generation im Full-Stack-Development und bietet Orientierung für React, Python FastAPI, PCM-Streaming, Transkript-Erfassung und WAV-Konvertierung. Nutze es, wenn du einen praxisnahen podcast-generation-Leitfaden für die Integration in echte Anwendungen brauchst und nicht nur einen generischen Prompt.

Full-Stack Development
Favoriten 0GitHub 2.2k
M
github-issue-creator

von microsoft

github-issue-creator wandelt rohe Notizen, Fehlermeldungen, Sprachdiktate und Screenshots in prägnante GitHub-kompatible Issue-Entwürfe um. Diese github-issue-creator-Skill unterstützt beim Issue-Tracking, indem sie Zusammenfassung, Umgebung, Schritte zur Reproduktion, erwartetes vs. tatsächliches Verhalten, Auswirkungen und Belege in ein prüfbares Markdown-Issue strukturiert.

Issue Tracking
Favoriten 0GitHub 2.2k
N
speech-to-text

von NoizAI

Die speech-to-text-Skill transkribiert unterstützte Audiodateien in Klartext und bietet Optionen für Zeitstempel, Sprecherlabels und JSON-Ausgabe. Sie ist auf den praktischen Einsatz von speech-to-text in wiederholbaren Workflows ausgelegt, darunter Interviews, Meetings, Podcasts, Vorlesungen und Automatisierungsaufgaben, bei denen konsistente Transkriptionen wichtig sind.

Workflow Automation
Favoriten 0GitHub 498
N
tts

von NoizAI

Die tts-Skill wandelt Text in Sprachaudio um – für Erzählungen, Synchronisation, Voiceover und zeitlich abgestimmte Wiedergabe. Sie eignet sich, um aus reinem Text eine Sprachdatei zu erzeugen, Artikel oder Textdateien in Sprache zu konvertieren oder SRT-gesteuertes Audio mit Timing-Kontrolle zu rendern. Unterstützt werden ein einfacher Modus und ein Timeline-Modus sowie backend-bewusste Workflows für wiederholbare tts-Nutzung.

Voice Generation
Favoriten 0GitHub 498
N
sound-fx

von NoizAI

Nutze die sound-fx-Skill, um Textprompts in Soundeffekte, Foley, Ambient-Betten, Kreaturengeräusche und UI-Geräusche umzuwandeln. Sie eignet sich für Audio Editing mit sound-fx, schnelles Prototyping und herunterladbare Audio-Assets. Installation über NoizAI/skills, anschließend der skriptbasierte Workflow mit einem gültigen Noiz API-Schlüssel. Nicht für Sprache, Lyrics, Melodien oder Voice Cloning.

Audio Editing
Favoriten 0GitHub 498
N
characteristic-voice

von NoizAI

characteristic-voice ist ein Voice-Generation-Skill für warme, begleitende und emotional präsente Sprache. Verwende ihn für tröstende Antworten, Morgen- oder Nachtbotschaften, lockeren Schlagabtausch und charakterorientierte Wiedergabe mit Pausen, Lachen oder Zärtlichkeit. Er bietet einen preset-gesteuerten Workflow sowie Backend-Unterstützung für den praktischen Einsatz von characteristic-voice.

Voice Generation
Favoriten 0GitHub 498