Transcripción de Audio
AutoTalk convierte audio en texto de dos maneras:
- Transcripción automática del chat — las notas de voz entrantes en tus canales se transcriben al instante, para que agentes y asistentes de IA puedan leerlas inmediatamente.
- Transcripción independiente — transcribe cualquier archivo de audio de
tu almacenamiento (entrevistas, reuniones, pódcasts — incluso de horas de
duración) en transcripciones descargables
.txt,.srt,.vtty.json, opcionalmente con etiquetas de hablantes.
Ambas se configuran mediante perfiles de transcripción.
Perfiles de transcripción
Un perfil es una configuración de transcripción reutilizable a nivel de empresa. Gestiónalos en Empresa → Perfiles de transcripción. Cada empresa comienza con un perfil predeterminado OpenAI (plataforma), así que la transcripción funciona sin configuración.
| Tipo de proveedor | Qué hace | Facturación |
|---|---|---|
openai | Usa Whisper de OpenAI. Sin clave de API definida, usa la clave de la plataforma AutoTalk; define tu propia clave de OpenAI para convertirlo en BYOK. | Con la clave de la plataforma (sin clave de API), se factura como minutos de audio en tu factura de AutoTalk. Con tu propia clave de OpenAI pasa a ser BYOK — lo factura tu proveedor, no como minutos de audio de AutoTalk. |
openai_compatible | Envía el audio a tu propio endpoint compatible con Whisper (tu clave de OpenAI, Groq, un servidor faster-whisper autoalojado, …). | Lo factura tu proveedor; AutoTalk solo registra el uso. |
diarize | Envía el audio a una máquina WhisperX autoalojada que además identifica quién habló (diarización de hablantes). | Lo pagas tú (tu hardware); AutoTalk solo registra el uso. |
Campos del perfil:
- Nombre — se muestra en los selectores.
- Tipo de proveedor — uno de los tres anteriores.
- URL base — tu endpoint (solo proveedores propios). Debe ser una URL HTTP(S) pública.
- Modelo — modelo opcional (por defecto
whisper-1). - Idioma — idioma predeterminado de la transcripción (vacío usa el idioma de la empresa).
- Clave de API — la clave de tu proveedor o el secreto compartido de la máquina autoalojada, almacenada cifrada y enviada como token Bearer.
- Headers — headers HTTP adicionales opcionales enviados a los endpoints
de proveedores propios (BYO) (se muestra para perfiles
openai_compatible/diarize). - Predeterminado de la empresa — el perfil usado cuando un canal o trabajo no elige uno explícitamente.
Los canales pueden fijar un perfil específico en las opciones de
Transcripción del canal. Los canales solo aceptan perfiles openai /
openai_compatible — la diarización es exclusiva de los trabajos
independientes (las notas de voz tienen un solo hablante).
Transcribir un archivo del Almacenamiento
- Abre Empresa → Almacenamiento, selecciona un archivo de audio y elige Transcribir (menú contextual o panel de detalles).
- Elige el perfil, el idioma y los formatos de salida. Si el perfil es de diarización, la transcripción etiquetará a los hablantes.
- Haz clic en Transcribir. El diálogo cambia a una vista de progreso en vivo — puedes cerrarlo en cualquier momento; el trabajo sigue ejecutándose en segundo plano.
- Sigue los trabajos en el panel de Transcripciones (menú lateral o el atajo en la barra del Almacenamiento). Al terminar también recibirás una notificación.
- Las salidas se guardan junto al archivo original como
<nombre>.transcript.<jobId>.txt/srt/vtt/json(el id del trabajo mantiene distinta la salida de cada ejecución, para que las reejecuciones nunca colisionen), y el panel ofrece descargas, botón de copiar y un visor con marcas de tiempo y hablantes.
Los archivos largos se manejan automáticamente: el audio se divide en fragmentos, se transcribe en paralelo y se vuelve a unir con las marcas de tiempo correctas (hasta 4 horas por archivo; trabajos con diarización hasta 90 minutos).
Diarización autoalojada (WhisperX)
Las etiquetas de hablantes provienen de un servicio WhisperX + pyannote
autoalojado que ejecutas en tu propia máquina con GPU (12 GB de VRAM
recomendados; tarjetas más pequeñas funcionan con la opción int8). La
configuración — incluido el token de Hugging Face requerido por los modelos
restringidos de pyannote — está documentada en el README del repositorio
autotalk-transcription-gpu.
Apunta un perfil diarize a la URL de tu máquina con el secreto compartido
como clave de API, y quedará disponible en el diálogo de Transcribir.
API
Los trabajos de transcripción también están disponibles programáticamente:
POST /v1/transcriptions— encola un trabajo (fullPath, opcionalesprofileId,languageCode,formats).GET /v1/transcriptions/{id}— estado, progreso y rutas de las salidas.
Los asistentes conectados por MCP pueden llamar a las herramientas
transcribe_storage_file y get_transcription_job para el mismo flujo.
Detalles de facturación
- La transcripción de la plataforma (
openai) usa el medidor de minutos de audio, normalizado por el costo del proveedor, y respeta los límites mensuales de tu plan. - Los perfiles propios y autoalojados no los factura AutoTalk — el uso se registra internamente solo como referencia.
- La preparación del audio (normalización/división) usa el medidor de transcodificación, como el resto del procesamiento de medios.