Audio

Explora agent skills con la etiqueta Audio y compara workflows relacionados en el directorio.

33 skills
A
videodb

por affaan-m

videodb te ayuda a ingerir video y audio desde archivos locales, URLs, transmisiones en vivo RTSP/RTMP o captura de escritorio; a buscar momentos con marcas de tiempo y evidencia reproducible; y a actuar con clips, superposiciones, transcripción, alertas y edición en línea de tiempo. Es una guía práctica de videodb para VideoDB for Video Editing y análisis de transmisiones en directo.

Video Editing
Favoritos 0GitHub 156.3k
A
video-editing

por affaan-m

La skill de video-editing te ayuda a convertir metraje existente en videos pulidos y listos para publicar, más rápido. Se centra en cortar, estructurar, añadir subtítulos, reencuadrar y aplicar mejoras ligeras para vlogs, tutoriales, demos, clips cortos y ediciones de entrevistas. Es ideal cuando ya tienes material en bruto y necesitas una guía práctica de video-editing.

Video Editing
Favoritos 0GitHub 156.3k
A
fal-ai-media

por affaan-m

fal-ai-media es un skill de GitHub para la generación unificada de medios a través de fal.ai MCP. Ayuda a los usuarios a instalar y usar el skill fal-ai-media para flujos de trabajo de generación de imágenes, edición de imágenes, video, voz y audio, con búsqueda de modelos, comprobación de costes y prompts guiados.

Image Generation
Favoritos 0GitHub 156.1k
C
youtube-downloader

por ComposioHQ

youtube-downloader es una skill de File Automation para guardar videos individuales de YouTube o extraer audio MP3 mediante un wrapper de Python para yt-dlp. Admite selección de calidad, formatos mp4/webm/mkv, modo de solo audio y carpetas de salida personalizadas.

File Automation
Favoritos 0GitHub 67.5k
C
meeting-insights-analyzer

por ComposioHQ

meeting-insights-analyzer ayuda a analizar transcripciones de reuniones para identificar patrones de comunicación, muletillas, lenguaje evasivo, evitación de conflictos, equilibrio en la participación y feedback de coaching respaldado por la transcripción para Workplace Communication.

Workplace Communication
Favoritos 0GitHub 67.5k
C
Spotify Automation

por ComposioHQ

Spotify Automation es una skill de Composio MCP para búsquedas en Spotify, playlists, control de reproducción, álbumes, pistas y acceso al perfil de usuario mediante herramientas autenticadas `SPOTIFY_*`.

Workflow Automation
Favoritos 0GitHub 67.5k
C
rev-ai-automation

por ComposioHQ

rev-ai-automation es una skill de Claude para automatizar flujos de trabajo de Rev AI mediante Composio Rube MCP. Orienta a los agentes para conectar Rube, verificar la conexión rev_ai, buscar primero los esquemas actuales de las herramientas y ejecutar transcripciones u otras tareas relacionadas con Rev AI con menos conjeturas.

Workflow Automation
Favoritos 0GitHub 67.5k
C
lmnt-automation

por ComposioHQ

lmnt-automation ayuda a Claude a automatizar flujos de trabajo de LMNT mediante Rube MCP de Composio: descubre las herramientas disponibles, comprueba la conexión con LMNT y usa esquemas en vivo antes de ejecutar acciones.

Workflow Automation
Favoritos 0GitHub 67.5k
C
happy-scribe-automation

por ComposioHQ

happy-scribe-automation ayuda a Claude a ejecutar flujos de trabajo de Happy Scribe mediante Composio Rube MCP. Consulta los requisitos de configuración, las comprobaciones de conexión, el descubrimiento de herramientas y patrones de uso seguros para transcripción, subtítulos, exportaciones y automatización de proyectos.

Workflow Automation
Favoritos 0GitHub 67.5k
C
GroqCloud Automation

por ComposioHQ

GroqCloud Automation es una skill MCP de Composio para descubrir modelos de GroqCloud, generar chat completions, traducir audio y seleccionar voces TTS mediante herramientas GROQCLOUD_*.

Workflow Automation
Favoritos 0GitHub 67.5k
C
deepgram-automation

por ComposioHQ

deepgram-automation es una skill de Claude para automatizar tareas de Deepgram mediante Composio Rube MCP. Úsala para descubrir los esquemas actuales de las herramientas, verificar una conexión activa con Deepgram y ejecutar flujos de trabajo orientados por esquema.

Workflow Automation
Favoritos 0GitHub 67.5k
O
transcribe

por openai

transcribe convierte audio o video en texto con diarización opcional y pistas de hablantes conocidos. Encaja muy bien para redacción técnica, notas de reuniones, entrevistas, clases y operaciones de contenido cuando necesitas una skill de transcripción repetible, con formatos de salida claros y menos improvisación que con un prompt genérico.

Technical Writing
Favoritos 0GitHub 18.8k
J
baoyu-youtube-transcript

por JimLiu

baoyu-youtube-transcript ayuda a extraer transcripciones, subtítulos e imágenes de portada de YouTube a partir de una URL o un ID de video. Admite selección de idioma, traducción, salida en markdown o SRT, reformateo con caché y una alternativa de respaldo desde la API InnerTube a yt-dlp para obtener transcripciones con mayor fiabilidad.

Format Conversion
Favoritos 0GitHub 13.2k
H
hyperframes

por heygen-com

hyperframes es una skill de flujo de trabajo para crear composiciones de video basadas en HTML en HyperFrames. Úsala para tarjetas de título, superposiciones, subtítulos, locuciones, movimiento reactivo al audio y transiciones de escena cuando necesites hyperframes estructurados y orientados al código para edición de video. Prioriza decisiones de diseño, tiempo y animación por encima de solicitudes genéricas de video basadas solo en prompts.

Video Editing
Favoritos 0GitHub 2.7k
M
azure-ai-voicelive-ts

por microsoft

azure-ai-voicelive-ts te ayuda a crear aplicaciones de voz en tiempo real con el SDK de TypeScript de Azure AI Voice Live. Úsalo en proyectos de Node.js o de navegador que necesiten audio bidireccional, respuestas en streaming, configuración de sesiones y llamadas a funciones. Esta guía de azure-ai-voicelive-ts es útil cuando buscas ayuda práctica para instalarlo, usarlo y generar código.

Code Generation
Favoritos 0GitHub 2.3k
M
azure-ai-contentunderstanding-py

por microsoft

azure-ai-contentunderstanding-py es la skill de Python para Azure AI Content Understanding. Extrae contenido estructurado de documentos, imágenes, audio y video para flujos de trabajo RAG y automatización. Úsala cuando necesites extracción multimodal fiable, autenticación con Azure y resultados repetibles, listos para integrar en pipelines.

RAG Workflows
Favoritos 0GitHub 2.2k
M
azure-ai-voicelive-java

por microsoft

azure-ai-voicelive-java es una skill de Azure AI VoiceLive para desarrollo backend en Java. Cubre instalación, autenticación, streaming de voz por WebSocket, gestión de eventos y uso guiado por ejemplos para crear asistentes en tiempo real.

Backend Development
Favoritos 0GitHub 2.2k
M
azure-ai-voicelive-dotnet

por microsoft

azure-ai-voicelive-dotnet es el skill de .NET para crear apps de voz con IA en tiempo real con Azure AI Voice Live. Incluye guía de instalación, configuración, autenticación y uso para desarrollo backend, con audio bidireccional, sesiones de baja latencia y flujos de speech-to-speech.

Backend Development
Favoritos 0GitHub 2.2k
M
podcast-generation

por microsoft

podcast-generation ayuda a crear audio tipo podcast generado por IA a partir de texto usando Azure OpenAI GPT Realtime Mini sobre WebSocket. Encaja en podcast-generation para desarrollo full-stack, con orientación para React, Python FastAPI, streaming PCM, captura de transcripción y conversión a WAV. Úsalo cuando necesites una guía práctica de podcast-generation para integrarlo en una app real, no un prompt genérico.

Full-Stack Development
Favoritos 0GitHub 2.2k
M
github-issue-creator

por microsoft

github-issue-creator convierte notas sueltas, registros de error, dictado por voz y capturas de pantalla en borradores de incidencias de GitHub bien definidos. Esta habilidad de github-issue-creator ayuda con el seguimiento de incidencias al organizar el resumen, el entorno, los pasos para reproducir, el comportamiento esperado frente al real, el impacto y las pruebas en una incidencia en Markdown lista para revisión.

Issue Tracking
Favoritos 0GitHub 2.2k
N
speech-to-text

por NoizAI

La skill de speech-to-text transcribe archivos de audio compatibles a texto plano, con opciones de marcas de tiempo, etiquetas de hablantes y salida JSON. Está pensada para un uso práctico de speech-to-text en flujos de trabajo repetibles, como entrevistas, reuniones, pódcast, clases y tareas de automatización donde importa mantener una transcripción consistente.

Workflow Automation
Favoritos 0GitHub 498
N
tts

por NoizAI

La skill de tts convierte texto en audio hablado para narración, doblaje, locución y reproducción alineada a una línea de tiempo. Úsala para generar un archivo de voz a partir de texto plano, convertir artículos o archivos de texto en voz, o renderizar audio a partir de SRT con control de tiempos. Admite modos simple y de línea de tiempo, además de flujos de trabajo conscientes del backend para un uso repetible de tts.

Voice Generation
Favoritos 0GitHub 498
N
sound-fx

por NoizAI

Usa la skill sound-fx para convertir instrucciones de texto en efectos de sonido, foley, ambientes, sonidos de criaturas y ruidos de interfaz. Encaja bien para edición de audio con sound-fx, prototipado rápido y activos de audio descargables. Se instala con NoizAI/skills y luego se usa el flujo de trabajo basado en scripts con una clave válida de Noiz API. No sirve para voz hablada, letras, melodías ni clonación de voz.

Audio Editing
Favoritos 0GitHub 498
N
characteristic-voice

por NoizAI

characteristic-voice es una habilidad de generación de voz para un habla cálida, cercana y con presencia emocional. Úsala para respuestas reconfortantes, mensajes de buenos días o buenas noches, charla casual y entregas con estilo de personaje con pausas, risas o ternura. Incluye un flujo de trabajo guiado por presets y soporte de backend para un uso práctico de characteristic-voice.

Voice Generation
Favoritos 0GitHub 498