Transcripción de Audio
AutoTalk convierte audio en texto de dos maneras:
- Transcripción automática del chat — las notas de voz entrantes en tus canales se transcriben al instante, para que agentes y agentes de IA puedan leerlas inmediatamente.
- Transcripción independiente — transcribe cualquier archivo de audio de
tu almacenamiento (entrevistas, reuniones, pódcasts — incluso de horas de
duración) en transcripciones descargables
.txt,.srt,.vtty.json, opcionalmente con etiquetas de hablantes.
Ambas se configuran mediante perfiles de transcripción.
Perfiles de transcripción
Un perfil es una configuración de transcripción reutilizable a nivel de empresa. Gestiónalos en Empresa → Perfiles de transcripción. Cada empresa comienza con un perfil predeterminado OpenAI (plataforma), así que la transcripción funciona sin configuración.
| Tipo de proveedor | Qué hace | Facturación |
|---|---|---|
openai | Usa Whisper de OpenAI. Sin clave de API definida, usa la clave de la plataforma AutoTalk; define tu propia clave de OpenAI para convertirlo en BYOK. | Con la clave de la plataforma (sin clave de API), se factura en el medidor Voz→texto (stt_ms) de tu factura de AutoTalk. Con tu propia clave de OpenAI pasa a ser BYOK — lo factura tu proveedor, y solo se registra en el contador interno audio_ms_byok, que no se factura. |
openai_compatible | Envía el audio a tu propio endpoint compatible con Whisper (tu clave de OpenAI, Groq, un servidor faster-whisper autoalojado, …). | Lo factura tu proveedor; AutoTalk solo registra el uso. |
diarize | Envía el audio a una máquina WhisperX autoalojada que además identifica quién habló (diarización de hablantes). | Lo pagas tú (tu hardware); AutoTalk solo registra el uso. |
assemblyai | Envía el audio a AssemblyAI, un servicio alojado que además identifica quién habló — diarización sin hardware propio. Sin clave de API definida, usa la cuenta de la plataforma AutoTalk; define tu propia clave de AssemblyAI para convertirlo en BYOK. | Con la cuenta de la plataforma (sin clave de API), se factura en el medidor Voz→texto (stt_ms) de tu factura de AutoTalk. Con tu propia clave pasa a ser BYOK — lo factura AssemblyAI. |
cloudflare | Envía el audio a Deepgram Nova-3 en Cloudflare Workers AI. La opción más rápida para archivos largos, pero no etiqueta hablantes. Deja vacíos el ID de cuenta y la clave de API para usar la cuenta de la plataforma AutoTalk, o define ambos para ejecutarlo en tu propia cuenta de Cloudflare. | Con la cuenta de la plataforma, se factura en el medidor Voz→texto (stt_ms) de tu factura de AutoTalk. Con tu propio ID de cuenta + token pasa a ser BYOK — lo factura Cloudflare. |
Campos del perfil:
- Nombre — se muestra en los selectores.
- Tipo de proveedor — uno de los cinco anteriores.
- URL base — tu endpoint (solo
openai_compatibleydiarize). Debe ser una URL HTTP(S) pública. Los proveedoresopenai,assemblyaiycloudflareusan endpoints fijos, así que el campo queda oculto para ellos. - ID de cuenta Cloudflare — (solo perfiles
cloudflare) el ID de tu cuenta, de 32 caracteres hexadecimales. Vacío significa la cuenta de Cloudflare de la plataforma AutoTalk. Debe definirse junto con la clave de API: definir solo uno de los dos se rechaza, en lugar de caer silenciosamente en la cuenta de la plataforma. - Modelo — modelo opcional. Vacío usa el valor predeterminado del propio
proveedor:
whisper-1paraopenai,universal-2paraassemblyai,@cf/deepgram/nova-3paracloudflare. En la cuenta de la plataforma AutoTalk los dos proveedores alojados solo aceptan modelos que AutoTalk tarifica; usa tus propias credenciales para ejecutar otros. Un modelocloudflaredebe ser un id de modelo de Workers AI (@cf/publisher/model) en ambos casos — tus credenciales cambian qué modelos puedes elegir, no el formato que deben tener. - Modelo del modo de voz — (solo perfiles
openai) el modelo en tiempo real que el modo de voz de la app usa mientras este sea el perfil predeterminado de la empresa. Vacío significagpt-4o-mini-transcribe, que cobra solo el habla detectada.gpt-live-transcribemuestra tus palabras mientras todavía hablas, pero cobra cada minuto con el micrófono abierto (silencio incluido) a unas 5,7 veces la tarifa — aproximadamente 10 veces el predeterminado en una conversación típica. Siempre facturado en el medidor Voz→texto (stt_ms) de AutoTalk, incluso en un perfil con clave de API propia. - Idioma — idioma predeterminado de la transcripción (vacío usa el idioma de la empresa).
- Clave de API — la clave de tu proveedor, la clave de AssemblyAI, el
token de API de Cloudflare o el secreto compartido de la máquina
autoalojada. Se almacena cifrada y se envía al proveedor en el formato que
ese proveedor espera. Dejarla vacía en un perfil
openai,assemblyaiocloudflarees lo que pone ese perfil en la cuenta de la plataforma AutoTalk. - Headers — headers HTTP adicionales opcionales enviados a los endpoints
de proveedores propios (BYO) (se muestra para perfiles
openai_compatible/diarize). - Predeterminado de la empresa — el perfil usado cuando un canal o trabajo no elige uno explícitamente.
Los canales pueden fijar un perfil específico en las opciones de
Transcripción del canal. Los canales aceptan cualquier perfil que no
etiquete hablantes — hoy openai, openai_compatible y cloudflare. Los
perfiles que siempre diarizan (diarize, assemblyai) son exclusivos de los
trabajos independientes: las notas de voz tienen un solo hablante, y la ruta
de entrada tiene que responder de inmediato.
Transcribir un archivo del Almacenamiento
- Abre Empresa → Almacenamiento, selecciona un archivo de audio y elige Transcribir (menú contextual o panel de detalles).
- Elige el perfil, el idioma y los formatos de salida. Si el perfil es de diarización, la transcripción etiquetará a los hablantes.
- Haz clic en Transcribir. El diálogo cambia a una vista de progreso en vivo — puedes cerrarlo en cualquier momento; el trabajo sigue ejecutándose en segundo plano.
- Sigue los trabajos en el panel de Transcripciones (menú lateral o el atajo en la barra del Almacenamiento). Al terminar también recibirás una notificación.
- Las salidas se guardan junto al archivo original como
<nombre>.transcript.<jobId>.txt/srt/vtt/json(el id del trabajo mantiene distinta la salida de cada ejecución, para que las reejecuciones nunca colisionen), y el panel ofrece descargas, botón de copiar y un visor con marcas de tiempo y hablantes.
Los archivos largos se manejan automáticamente. Los perfiles openai y
openai_compatible dividen el audio en fragmentos, los transcriben en
paralelo y vuelven a unir el resultado con las marcas de tiempo correctas; los
otros tres procesan el archivo entero de una vez. La duración máxima depende
del proveedor del perfil:
| Proveedor | Archivo más largo |
|---|---|
openai, openai_compatible | 4 horas |
assemblyai | 139 minutos |
cloudflare | 81 minutos |
diarize (WhisperX autoalojado) | 90 minutos |
El límite de duración se comprueba antes de cualquier procesamiento, así que un archivo demasiado largo se rechaza de inmediato en vez de fallar a mitad de camino.
Los dos límites de los proveedores alojados son de AutoTalk, no de ellos: AssemblyAI acepta archivos de hasta 10 horas. AutoTalk convierte cada archivo a un formato de audio estándar antes de transcribirlo, y esa copia convertida tiene un presupuesto de tamaño — es decir, el límite real es un número de megabytes, y estas cifras son lo que ese presupuesto supone en minutos. Están calculadas sobre el mayor tamaño que puede alcanzar una copia convertida, no sobre un caso típico, así que la grabación no tiene que ser pequeña ni silenciosa para caber.
Diarización autoalojada (WhisperX)
Las etiquetas de hablantes pueden venir de un servicio WhisperX + pyannote
autoalojado que ejecutas en tu propia máquina con GPU (12 GB de VRAM
recomendados; tarjetas más pequeñas funcionan con la opción int8). La
configuración — incluido el token de Hugging Face requerido por los modelos
restringidos de pyannote — está documentada en el README del repositorio
autotalk-transcription-gpu.
Apunta un perfil diarize a la URL de tu máquina con el secreto compartido
como clave de API, y quedará disponible en el diálogo de Transcribir.
Si prefieres no mantener hardware, un perfil assemblyai también etiqueta
hablantes — mira la tabla de proveedores más arriba.
API
Los trabajos de transcripción también están disponibles programáticamente:
POST /v1/transcriptions— encola un trabajo (fullPath, opcionalesprofileId,languageCode,formats).GET /v1/transcriptions/{id}— estado, progreso y rutas de las salidas.
Los agentes conectados por MCP pueden llamar a las herramientas
transcribe_storage_file y get_transcription_job para el mismo flujo.
Detalles de facturación
- La transcripción de la plataforma — un perfil
openai,assemblyaiocloudflareejecutándose con las credenciales de la propia AutoTalk — usa el medidor Voz→texto (stt_ms), normalizado por el costo del proveedor, y respeta los límites mensuales de tu plan. - Los perfiles propios y autoalojados no los factura AutoTalk — el uso
se registra en el contador interno
audio_ms_byoksolo como referencia. Ese contador se comparte con la síntesis de voz con clave propia y nunca aparece en una factura. - La preparación del audio (normalización/división) usa el medidor de transcodificación, como el resto del procesamiento de medios.