Pular para o conteúdo principal
Atualizado em Sep 7, 2026

Transcrição de Áudio

O AutoTalk converte áudio em texto de duas formas:

  • Transcrição automática do chat — mensagens de voz recebidas nos seus canais são transcritas na hora, para que atendentes e agentes de IA possam lê-las imediatamente.
  • Transcrição avulsa — transcreva qualquer arquivo de áudio do seu armazenamento (entrevistas, reuniões, podcasts — mesmo com horas de duração) em transcrições baixáveis .txt, .srt, .vtt e .json, opcionalmente com identificação de falantes.

Ambas são configuradas por meio de perfis de transcrição.

Perfis de transcrição

Um perfil é uma configuração de transcrição reutilizável, no nível da empresa. Gerencie-os em Empresa → Perfis de transcrição. Toda empresa começa com um perfil padrão OpenAI (plataforma), então a transcrição funciona sem configuração.

Tipo de provedorO que fazCobrança
openaiUsa o Whisper da OpenAI. Sem chave de API definida, usa a chave da plataforma AutoTalk; defina sua própria chave OpenAI para torná-lo BYOK.Com a chave da plataforma (sem chave de API), cobrado no medidor Fala→texto (stt_ms) na sua fatura AutoTalk. Com sua própria chave OpenAI vira BYOK — cobrado pelo seu provedor, e apenas registrado no contador interno audio_ms_byok, que não é cobrado.
openai_compatibleEnvia o áudio para o seu próprio endpoint compatível com Whisper (sua chave OpenAI, Groq, um servidor faster-whisper auto-hospedado, …).Cobrado pelo seu provedor; o AutoTalk apenas registra o uso.
diarizeEnvia o áudio para uma máquina WhisperX auto-hospedada que também identifica quem falou (diarização de falantes).Cobrado por você (seu hardware); o AutoTalk apenas registra o uso.
assemblyaiEnvia o áudio para a AssemblyAI, um serviço hospedado que também identifica quem falou — diarização sem nenhum hardware seu. Sem chave de API definida, usa a conta da plataforma AutoTalk; defina sua própria chave AssemblyAI para torná-lo BYOK.Com a conta da plataforma (sem chave de API), cobrado no medidor Fala→texto (stt_ms) na sua fatura AutoTalk. Com sua própria chave vira BYOK — cobrado pela AssemblyAI.
cloudflareEnvia o áudio para o Deepgram Nova-3 na Cloudflare Workers AI. A opção mais rápida para arquivos longos, mas não identifica falantes. Deixe o ID da conta e a chave de API vazios para usar a conta da plataforma AutoTalk, ou preencha os dois para rodar na sua própria conta Cloudflare.Com a conta da plataforma, cobrado no medidor Fala→texto (stt_ms) na sua fatura AutoTalk. Com seu próprio ID de conta + token vira BYOK — cobrado pela Cloudflare.

Campos do perfil:

  • Nome — exibido nos seletores.
  • Tipo de provedor — um dos cinco acima.
  • URL base — seu endpoint (apenas openai_compatible e diarize). Deve ser uma URL HTTP(S) pública. Os provedores openai, assemblyai e cloudflare usam endpoints fixos, então o campo fica oculto para eles.
  • ID da conta Cloudflare — (apenas perfis cloudflare) o ID da sua conta, com 32 caracteres hexadecimais. Vazio significa a conta Cloudflare da plataforma AutoTalk. Precisa ser definido junto com a chave de API: preencher apenas um dos dois é rejeitado, em vez de cair silenciosamente na conta da plataforma.
  • Modelo — modelo opcional. Vazio usa o padrão do próprio provedor: whisper-1 para openai, universal-2 para assemblyai, @cf/deepgram/nova-3 para cloudflare. Na conta da plataforma AutoTalk os dois provedores hospedados aceitam apenas modelos que a AutoTalk precifica; use suas próprias credenciais para rodar outros. Um modelo cloudflare precisa ser um id de modelo da Workers AI (@cf/publisher/model) nos dois casos — suas credenciais mudam quais modelos você pode escolher, não o formato deles.
  • Modelo do modo de voz — (apenas perfis openai) o modelo em tempo real que o modo de voz no app usa enquanto este for o perfil padrão da empresa. Vazio significa gpt-4o-mini-transcribe, que cobra apenas a fala detectada. O gpt-live-transcribe mostra suas palavras enquanto você ainda fala, mas cobra cada minuto com o microfone aberto (inclusive silêncio) a cerca de 5,7× a tarifa — por volta de 10× o padrão numa conversa típica. Sempre cobrado no medidor Fala→texto (stt_ms) da AutoTalk, mesmo em um perfil com chave de API própria.
  • Idioma — idioma padrão da transcrição (vazio usa o idioma da empresa).
  • Chave de API — a chave do seu provedor, a chave da AssemblyAI, o token de API da Cloudflare ou o segredo compartilhado da máquina auto-hospedada. Armazenada criptografada e enviada ao provedor no formato que esse provedor espera. Deixá-la vazia em um perfil openai, assemblyai ou cloudflare é o que coloca esse perfil na conta da plataforma AutoTalk.
  • Headers — headers HTTP extras opcionais enviados aos endpoints de provedores próprios (BYO) (exibido para perfis openai_compatible / diarize).
  • Padrão da empresa — o perfil usado quando um canal ou trabalho não escolhe um explicitamente.

Canais podem fixar um perfil específico nas opções de Transcrição do canal. Canais aceitam qualquer perfil que não identifique falantes — hoje openai, openai_compatible e cloudflare. Perfis que sempre diarizam (diarize, assemblyai) são exclusivos dos trabalhos avulsos: mensagens de voz têm um único falante, e o caminho de entrada precisa responder na hora.

Transcrevendo um arquivo do Armazenamento

  1. Abra Empresa → Armazenamento, selecione um arquivo de áudio e escolha Transcrever (menu de contexto ou painel de detalhes).
  2. Escolha o perfil, o idioma e os formatos de saída. Se o perfil for de diarização, a transcrição identificará os falantes.
  3. Clique em Transcrever. O diálogo muda para uma visão de progresso ao vivo — você pode fechá-lo a qualquer momento; o trabalho continua rodando em segundo plano.
  4. Acompanhe os trabalhos no painel de Transcrições (menu lateral ou o atalho na barra do Armazenamento). Ao concluir, você também recebe uma notificação.
  5. As saídas são salvas ao lado do arquivo original como <nome>.transcript.<jobId>.txt/srt/vtt/json (o id do trabalho mantém a saída de cada execução distinta, para que reexecuções nunca colidam), e o painel oferece downloads, botão de copiar e um visualizador com timestamps e falantes.

Arquivos longos são tratados automaticamente. Perfis openai e openai_compatible dividem o áudio em trechos, transcrevem em paralelo e reúnem o resultado com os timestamps corretos; os outros três processam o arquivo inteiro de uma vez. A duração máxima depende do provedor do perfil:

ProvedorArquivo mais longo
openai, openai_compatible4 horas
assemblyai139 minutos
cloudflare81 minutos
diarize (WhisperX auto-hospedado)90 minutos

O limite de duração é verificado antes de qualquer processamento, então um arquivo longo demais é recusado de imediato em vez de falhar no meio do caminho.

Os dois limites dos provedores hospedados são da AutoTalk, não deles: a AssemblyAI aceita arquivos de até 10 horas. A AutoTalk converte todo arquivo para um formato de áudio padrão antes de transcrever, e essa cópia convertida tem um orçamento de tamanho — ou seja, o limite real é um número de megabytes, e estes valores são o que esse orçamento representa em minutos. Eles são calculados sobre o maior tamanho que uma cópia convertida pode alcançar, não sobre um caso típico, então a gravação não precisa ser pequena nem silenciosa para caber.

Diarização auto-hospedada (WhisperX)

A identificação de falantes pode vir de um serviço WhisperX + pyannote auto-hospedado que você roda na sua própria máquina com GPU (12 GB de VRAM recomendados; placas menores funcionam com a opção int8). A configuração — incluindo o token do Hugging Face exigido pelos modelos restritos do pyannote — está documentada no README do repositório autotalk-transcription-gpu. Aponte um perfil diarize para a URL da sua máquina com o segredo compartilhado como chave de API, e ele fica disponível no diálogo de Transcrever.

Se você prefere não manter hardware, um perfil assemblyai também identifica falantes — veja a tabela de provedores acima.

API

Os trabalhos de transcrição também estão disponíveis programaticamente:

  • POST /v1/transcriptions — enfileira um trabalho (fullPath, opcionais profileId, languageCode, formats).
  • GET /v1/transcriptions/{id} — status, progresso e caminhos das saídas.

Agentes conectados via MCP podem chamar as ferramentas transcribe_storage_file e get_transcription_job para o mesmo fluxo.

Detalhes de cobrança

  • A transcrição da plataforma — um perfil openai, assemblyai ou cloudflare rodando com as credenciais da própria AutoTalk — usa o medidor Fala→texto (stt_ms), normalizado pelo custo do provedor, e respeita os limites mensais do seu plano.
  • Perfis próprios e auto-hospedados não são cobrados pelo AutoTalk — o uso é registrado no contador interno audio_ms_byok apenas para sua referência. Esse contador é compartilhado com a síntese de voz com chave própria e nunca aparece em uma fatura.
  • A preparação do áudio (normalização/divisão) usa o medidor de transcodificação, como os demais processamentos de mídia.