Saltar al contenido principal
Actualizado el Sep 7, 2026

Transcripción de Audio

AutoTalk convierte audio en texto de dos maneras:

  • Transcripción automática del chat — las notas de voz entrantes en tus canales se transcriben al instante, para que agentes y agentes de IA puedan leerlas inmediatamente.
  • Transcripción independiente — transcribe cualquier archivo de audio de tu almacenamiento (entrevistas, reuniones, pódcasts — incluso de horas de duración) en transcripciones descargables .txt, .srt, .vtt y .json, opcionalmente con etiquetas de hablantes.

Ambas se configuran mediante perfiles de transcripción.

Perfiles de transcripción

Un perfil es una configuración de transcripción reutilizable a nivel de empresa. Gestiónalos en Empresa → Perfiles de transcripción. Cada empresa comienza con un perfil predeterminado OpenAI (plataforma), así que la transcripción funciona sin configuración.

Tipo de proveedorQué haceFacturación
openaiUsa Whisper de OpenAI. Sin clave de API definida, usa la clave de la plataforma AutoTalk; define tu propia clave de OpenAI para convertirlo en BYOK.Con la clave de la plataforma (sin clave de API), se factura en el medidor Voz→texto (stt_ms) de tu factura de AutoTalk. Con tu propia clave de OpenAI pasa a ser BYOK — lo factura tu proveedor, y solo se registra en el contador interno audio_ms_byok, que no se factura.
openai_compatibleEnvía el audio a tu propio endpoint compatible con Whisper (tu clave de OpenAI, Groq, un servidor faster-whisper autoalojado, …).Lo factura tu proveedor; AutoTalk solo registra el uso.
diarizeEnvía el audio a una máquina WhisperX autoalojada que además identifica quién habló (diarización de hablantes).Lo pagas (tu hardware); AutoTalk solo registra el uso.
assemblyaiEnvía el audio a AssemblyAI, un servicio alojado que además identifica quién habló — diarización sin hardware propio. Sin clave de API definida, usa la cuenta de la plataforma AutoTalk; define tu propia clave de AssemblyAI para convertirlo en BYOK.Con la cuenta de la plataforma (sin clave de API), se factura en el medidor Voz→texto (stt_ms) de tu factura de AutoTalk. Con tu propia clave pasa a ser BYOK — lo factura AssemblyAI.
cloudflareEnvía el audio a Deepgram Nova-3 en Cloudflare Workers AI. La opción más rápida para archivos largos, pero no etiqueta hablantes. Deja vacíos el ID de cuenta y la clave de API para usar la cuenta de la plataforma AutoTalk, o define ambos para ejecutarlo en tu propia cuenta de Cloudflare.Con la cuenta de la plataforma, se factura en el medidor Voz→texto (stt_ms) de tu factura de AutoTalk. Con tu propio ID de cuenta + token pasa a ser BYOK — lo factura Cloudflare.

Campos del perfil:

  • Nombre — se muestra en los selectores.
  • Tipo de proveedor — uno de los cinco anteriores.
  • URL base — tu endpoint (solo openai_compatible y diarize). Debe ser una URL HTTP(S) pública. Los proveedores openai, assemblyai y cloudflare usan endpoints fijos, así que el campo queda oculto para ellos.
  • ID de cuenta Cloudflare — (solo perfiles cloudflare) el ID de tu cuenta, de 32 caracteres hexadecimales. Vacío significa la cuenta de Cloudflare de la plataforma AutoTalk. Debe definirse junto con la clave de API: definir solo uno de los dos se rechaza, en lugar de caer silenciosamente en la cuenta de la plataforma.
  • Modelo — modelo opcional. Vacío usa el valor predeterminado del propio proveedor: whisper-1 para openai, universal-2 para assemblyai, @cf/deepgram/nova-3 para cloudflare. En la cuenta de la plataforma AutoTalk los dos proveedores alojados solo aceptan modelos que AutoTalk tarifica; usa tus propias credenciales para ejecutar otros. Un modelo cloudflare debe ser un id de modelo de Workers AI (@cf/publisher/model) en ambos casos — tus credenciales cambian qué modelos puedes elegir, no el formato que deben tener.
  • Modelo del modo de voz — (solo perfiles openai) el modelo en tiempo real que el modo de voz de la app usa mientras este sea el perfil predeterminado de la empresa. Vacío significa gpt-4o-mini-transcribe, que cobra solo el habla detectada. gpt-live-transcribe muestra tus palabras mientras todavía hablas, pero cobra cada minuto con el micrófono abierto (silencio incluido) a unas 5,7 veces la tarifa — aproximadamente 10 veces el predeterminado en una conversación típica. Siempre facturado en el medidor Voz→texto (stt_ms) de AutoTalk, incluso en un perfil con clave de API propia.
  • Idioma — idioma predeterminado de la transcripción (vacío usa el idioma de la empresa).
  • Clave de API — la clave de tu proveedor, la clave de AssemblyAI, el token de API de Cloudflare o el secreto compartido de la máquina autoalojada. Se almacena cifrada y se envía al proveedor en el formato que ese proveedor espera. Dejarla vacía en un perfil openai, assemblyai o cloudflare es lo que pone ese perfil en la cuenta de la plataforma AutoTalk.
  • Headers — headers HTTP adicionales opcionales enviados a los endpoints de proveedores propios (BYO) (se muestra para perfiles openai_compatible / diarize).
  • Predeterminado de la empresa — el perfil usado cuando un canal o trabajo no elige uno explícitamente.

Los canales pueden fijar un perfil específico en las opciones de Transcripción del canal. Los canales aceptan cualquier perfil que no etiquete hablantes — hoy openai, openai_compatible y cloudflare. Los perfiles que siempre diarizan (diarize, assemblyai) son exclusivos de los trabajos independientes: las notas de voz tienen un solo hablante, y la ruta de entrada tiene que responder de inmediato.

Transcribir un archivo del Almacenamiento

  1. Abre Empresa → Almacenamiento, selecciona un archivo de audio y elige Transcribir (menú contextual o panel de detalles).
  2. Elige el perfil, el idioma y los formatos de salida. Si el perfil es de diarización, la transcripción etiquetará a los hablantes.
  3. Haz clic en Transcribir. El diálogo cambia a una vista de progreso en vivo — puedes cerrarlo en cualquier momento; el trabajo sigue ejecutándose en segundo plano.
  4. Sigue los trabajos en el panel de Transcripciones (menú lateral o el atajo en la barra del Almacenamiento). Al terminar también recibirás una notificación.
  5. Las salidas se guardan junto al archivo original como <nombre>.transcript.<jobId>.txt/srt/vtt/json (el id del trabajo mantiene distinta la salida de cada ejecución, para que las reejecuciones nunca colisionen), y el panel ofrece descargas, botón de copiar y un visor con marcas de tiempo y hablantes.

Los archivos largos se manejan automáticamente. Los perfiles openai y openai_compatible dividen el audio en fragmentos, los transcriben en paralelo y vuelven a unir el resultado con las marcas de tiempo correctas; los otros tres procesan el archivo entero de una vez. La duración máxima depende del proveedor del perfil:

ProveedorArchivo más largo
openai, openai_compatible4 horas
assemblyai139 minutos
cloudflare81 minutos
diarize (WhisperX autoalojado)90 minutos

El límite de duración se comprueba antes de cualquier procesamiento, así que un archivo demasiado largo se rechaza de inmediato en vez de fallar a mitad de camino.

Los dos límites de los proveedores alojados son de AutoTalk, no de ellos: AssemblyAI acepta archivos de hasta 10 horas. AutoTalk convierte cada archivo a un formato de audio estándar antes de transcribirlo, y esa copia convertida tiene un presupuesto de tamaño — es decir, el límite real es un número de megabytes, y estas cifras son lo que ese presupuesto supone en minutos. Están calculadas sobre el mayor tamaño que puede alcanzar una copia convertida, no sobre un caso típico, así que la grabación no tiene que ser pequeña ni silenciosa para caber.

Diarización autoalojada (WhisperX)

Las etiquetas de hablantes pueden venir de un servicio WhisperX + pyannote autoalojado que ejecutas en tu propia máquina con GPU (12 GB de VRAM recomendados; tarjetas más pequeñas funcionan con la opción int8). La configuración — incluido el token de Hugging Face requerido por los modelos restringidos de pyannote — está documentada en el README del repositorio autotalk-transcription-gpu. Apunta un perfil diarize a la URL de tu máquina con el secreto compartido como clave de API, y quedará disponible en el diálogo de Transcribir.

Si prefieres no mantener hardware, un perfil assemblyai también etiqueta hablantes — mira la tabla de proveedores más arriba.

API

Los trabajos de transcripción también están disponibles programáticamente:

  • POST /v1/transcriptions — encola un trabajo (fullPath, opcionales profileId, languageCode, formats).
  • GET /v1/transcriptions/{id} — estado, progreso y rutas de las salidas.

Los agentes conectados por MCP pueden llamar a las herramientas transcribe_storage_file y get_transcription_job para el mismo flujo.

Detalles de facturación

  • La transcripción de la plataforma — un perfil openai, assemblyai o cloudflare ejecutándose con las credenciales de la propia AutoTalk — usa el medidor Voz→texto (stt_ms), normalizado por el costo del proveedor, y respeta los límites mensuales de tu plan.
  • Los perfiles propios y autoalojados no los factura AutoTalk — el uso se registra en el contador interno audio_ms_byok solo como referencia. Ese contador se comparte con la síntesis de voz con clave propia y nunca aparece en una factura.
  • La preparación del audio (normalización/división) usa el medidor de transcodificación, como el resto del procesamiento de medios.