Pular para o conteúdo principal
Atualizado em Jul 26, 2026

Transcrição de Áudio

O AutoTalk converte áudio em texto de duas formas:

  • Transcrição automática do chat — mensagens de voz recebidas nos seus canais são transcritas na hora, para que atendentes e assistentes de IA possam lê-las imediatamente.
  • Transcrição avulsa — transcreva qualquer arquivo de áudio do seu armazenamento (entrevistas, reuniões, podcasts — mesmo com horas de duração) em transcrições baixáveis .txt, .srt, .vtt e .json, opcionalmente com identificação de falantes.

Ambas são configuradas por meio de perfis de transcrição.

Perfis de transcrição

Um perfil é uma configuração de transcrição reutilizável, no nível da empresa. Gerencie-os em Empresa → Perfis de transcrição. Toda empresa começa com um perfil padrão OpenAI (plataforma), então a transcrição funciona sem configuração.

Tipo de provedorO que fazCobrança
openaiUsa o Whisper da OpenAI. Sem chave de API definida, usa a chave da plataforma AutoTalk; defina sua própria chave OpenAI para torná-lo BYOK.Com a chave da plataforma (sem chave de API), cobrado como minutos de áudio na sua fatura AutoTalk. Com sua própria chave OpenAI vira BYOK — cobrado pelo seu provedor, não como minutos de áudio da AutoTalk.
openai_compatibleEnvia o áudio para o seu próprio endpoint compatível com Whisper (sua chave OpenAI, Groq, um servidor faster-whisper auto-hospedado, …).Cobrado pelo seu provedor; o AutoTalk apenas registra o uso.
diarizeEnvia o áudio para uma máquina WhisperX auto-hospedada que também identifica quem falou (diarização de falantes).Cobrado por você (seu hardware); o AutoTalk apenas registra o uso.

Campos do perfil:

  • Nome — exibido nos seletores.
  • Tipo de provedor — um dos três acima.
  • URL base — seu endpoint (apenas provedores próprios). Deve ser uma URL HTTP(S) pública.
  • Modelo — modelo opcional (padrão whisper-1).
  • Idioma — idioma padrão da transcrição (vazio usa o idioma da empresa).
  • Chave de API — a chave do seu provedor ou o segredo compartilhado da máquina auto-hospedada, armazenada criptografada e enviada como token Bearer.
  • Headers — headers HTTP extras opcionais enviados aos endpoints de provedores próprios (BYO) (exibido para perfis openai_compatible / diarize).
  • Padrão da empresa — o perfil usado quando um canal ou trabalho não escolhe um explicitamente.

Canais podem fixar um perfil específico nas opções de Transcrição do canal. Canais aceitam apenas perfis openai / openai_compatible — a diarização é exclusiva dos trabalhos avulsos (mensagens de voz têm um único falante).

Transcrevendo um arquivo do Armazenamento

  1. Abra Empresa → Armazenamento, selecione um arquivo de áudio e escolha Transcrever (menu de contexto ou painel de detalhes).
  2. Escolha o perfil, o idioma e os formatos de saída. Se o perfil for de diarização, a transcrição identificará os falantes.
  3. Clique em Transcrever. O diálogo muda para uma visão de progresso ao vivo — você pode fechá-lo a qualquer momento; o trabalho continua rodando em segundo plano.
  4. Acompanhe os trabalhos no painel de Transcrições (menu lateral ou o atalho na barra do Armazenamento). Ao concluir, você também recebe uma notificação.
  5. As saídas são salvas ao lado do arquivo original como <nome>.transcript.<jobId>.txt/srt/vtt/json (o id do trabalho mantém a saída de cada execução distinta, para que reexecuções nunca colidam), e o painel oferece downloads, botão de copiar e um visualizador com timestamps e falantes.

Arquivos longos são tratados automaticamente: o áudio é dividido em trechos, transcrito em paralelo e reunido com os timestamps corretos (até 4 horas por arquivo; trabalhos com diarização até 90 minutos).

Diarização auto-hospedada (WhisperX)

A identificação de falantes vem de um serviço WhisperX + pyannote auto-hospedado que você roda na sua própria máquina com GPU (12 GB de VRAM recomendados; placas menores funcionam com a opção int8). A configuração — incluindo o token do Hugging Face exigido pelos modelos restritos do pyannote — está documentada no README do repositório autotalk-transcription-gpu. Aponte um perfil diarize para a URL da sua máquina com o segredo compartilhado como chave de API, e ele fica disponível no diálogo de Transcrever.

API

Os trabalhos de transcrição também estão disponíveis programaticamente:

  • POST /v1/transcriptions — enfileira um trabalho (fullPath, opcionais profileId, languageCode, formats).
  • GET /v1/transcriptions/{id} — status, progresso e caminhos das saídas.

Assistentes conectados via MCP podem chamar as ferramentas transcribe_storage_file e get_transcription_job para o mesmo fluxo.

Detalhes de cobrança

  • A transcrição da plataforma (openai) usa o medidor de minutos de áudio, normalizado pelo custo do provedor, e respeita os limites mensais do seu plano.
  • Perfis próprios e auto-hospedados não são cobrados pelo AutoTalk — o uso é registrado internamente apenas para sua referência.
  • A preparação do áudio (normalização/divisão) usa o medidor de transcodificação, como os demais processamentos de mídia.