Transcrição de Áudio
O AutoTalk converte áudio em texto de duas formas:
- Transcrição automática do chat — mensagens de voz recebidas nos seus canais são transcritas na hora, para que atendentes e agentes de IA possam lê-las imediatamente.
- Transcrição avulsa — transcreva qualquer arquivo de áudio do seu
armazenamento (entrevistas, reuniões, podcasts — mesmo com horas de
duração) em transcrições baixáveis
.txt,.srt,.vtte.json, opcionalmente com identificação de falantes.
Ambas são configuradas por meio de perfis de transcrição.
Perfis de transcrição
Um perfil é uma configuração de transcrição reutilizável, no nível da empresa. Gerencie-os em Empresa → Perfis de transcrição. Toda empresa começa com um perfil padrão OpenAI (plataforma), então a transcrição funciona sem configuração.
| Tipo de provedor | O que faz | Cobrança |
|---|---|---|
openai | Usa o Whisper da OpenAI. Sem chave de API definida, usa a chave da plataforma AutoTalk; defina sua própria chave OpenAI para torná-lo BYOK. | Com a chave da plataforma (sem chave de API), cobrado no medidor Fala→texto (stt_ms) na sua fatura AutoTalk. Com sua própria chave OpenAI vira BYOK — cobrado pelo seu provedor, e apenas registrado no contador interno audio_ms_byok, que não é cobrado. |
openai_compatible | Envia o áudio para o seu próprio endpoint compatível com Whisper (sua chave OpenAI, Groq, um servidor faster-whisper auto-hospedado, …). | Cobrado pelo seu provedor; o AutoTalk apenas registra o uso. |
diarize | Envia o áudio para uma máquina WhisperX auto-hospedada que também identifica quem falou (diarização de falantes). | Cobrado por você (seu hardware); o AutoTalk apenas registra o uso. |
assemblyai | Envia o áudio para a AssemblyAI, um serviço hospedado que também identifica quem falou — diarização sem nenhum hardware seu. Sem chave de API definida, usa a conta da plataforma AutoTalk; defina sua própria chave AssemblyAI para torná-lo BYOK. | Com a conta da plataforma (sem chave de API), cobrado no medidor Fala→texto (stt_ms) na sua fatura AutoTalk. Com sua própria chave vira BYOK — cobrado pela AssemblyAI. |
cloudflare | Envia o áudio para o Deepgram Nova-3 na Cloudflare Workers AI. A opção mais rápida para arquivos longos, mas não identifica falantes. Deixe o ID da conta e a chave de API vazios para usar a conta da plataforma AutoTalk, ou preencha os dois para rodar na sua própria conta Cloudflare. | Com a conta da plataforma, cobrado no medidor Fala→texto (stt_ms) na sua fatura AutoTalk. Com seu próprio ID de conta + token vira BYOK — cobrado pela Cloudflare. |
Campos do perfil:
- Nome — exibido nos seletores.
- Tipo de provedor — um dos cinco acima.
- URL base — seu endpoint (apenas
openai_compatibleediarize). Deve ser uma URL HTTP(S) pública. Os provedoresopenai,assemblyaiecloudflareusam endpoints fixos, então o campo fica oculto para eles. - ID da conta Cloudflare — (apenas perfis
cloudflare) o ID da sua conta, com 32 caracteres hexadecimais. Vazio significa a conta Cloudflare da plataforma AutoTalk. Precisa ser definido junto com a chave de API: preencher apenas um dos dois é rejeitado, em vez de cair silenciosamente na conta da plataforma. - Modelo — modelo opcional. Vazio usa o padrão do próprio provedor:
whisper-1paraopenai,universal-2paraassemblyai,@cf/deepgram/nova-3paracloudflare. Na conta da plataforma AutoTalk os dois provedores hospedados aceitam apenas modelos que a AutoTalk precifica; use suas próprias credenciais para rodar outros. Um modelocloudflareprecisa ser um id de modelo da Workers AI (@cf/publisher/model) nos dois casos — suas credenciais mudam quais modelos você pode escolher, não o formato deles. - Modelo do modo de voz — (apenas perfis
openai) o modelo em tempo real que o modo de voz no app usa enquanto este for o perfil padrão da empresa. Vazio significagpt-4o-mini-transcribe, que cobra apenas a fala detectada. Ogpt-live-transcribemostra suas palavras enquanto você ainda fala, mas cobra cada minuto com o microfone aberto (inclusive silêncio) a cerca de 5,7× a tarifa — por volta de 10× o padrão numa conversa típica. Sempre cobrado no medidor Fala→texto (stt_ms) da AutoTalk, mesmo em um perfil com chave de API própria. - Idioma — idioma padrão da transcrição (vazio usa o idioma da empresa).
- Chave de API — a chave do seu provedor, a chave da AssemblyAI, o token
de API da Cloudflare ou o segredo compartilhado da máquina auto-hospedada.
Armazenada criptografada e enviada ao provedor no formato que esse provedor
espera. Deixá-la vazia em um perfil
openai,assemblyaioucloudflareé o que coloca esse perfil na conta da plataforma AutoTalk. - Headers — headers HTTP extras opcionais enviados aos endpoints de
provedores próprios (BYO) (exibido para perfis
openai_compatible/diarize). - Padrão da empresa — o perfil usado quando um canal ou trabalho não escolhe um explicitamente.
Canais podem fixar um perfil específico nas opções de Transcrição do
canal. Canais aceitam qualquer perfil que não identifique falantes — hoje
openai, openai_compatible e cloudflare. Perfis que sempre diarizam
(diarize, assemblyai) são exclusivos dos trabalhos avulsos: mensagens de
voz têm um único falante, e o caminho de entrada precisa responder na hora.
Transcrevendo um arquivo do Armazenamento
- Abra Empresa → Armazenamento, selecione um arquivo de áudio e escolha Transcrever (menu de contexto ou painel de detalhes).
- Escolha o perfil, o idioma e os formatos de saída. Se o perfil for de diarização, a transcrição identificará os falantes.
- Clique em Transcrever. O diálogo muda para uma visão de progresso ao vivo — você pode fechá-lo a qualquer momento; o trabalho continua rodando em segundo plano.
- Acompanhe os trabalhos no painel de Transcrições (menu lateral ou o atalho na barra do Armazenamento). Ao concluir, você também recebe uma notificação.
- As saídas são salvas ao lado do arquivo original como
<nome>.transcript.<jobId>.txt/srt/vtt/json(o id do trabalho mantém a saída de cada execução distinta, para que reexecuções nunca colidam), e o painel oferece downloads, botão de copiar e um visualizador com timestamps e falantes.
Arquivos longos são tratados automaticamente. Perfis openai e
openai_compatible dividem o áudio em trechos, transcrevem em paralelo e
reúnem o resultado com os timestamps corretos; os outros três processam o
arquivo inteiro de uma vez. A duração máxima depende do provedor do perfil:
| Provedor | Arquivo mais longo |
|---|---|
openai, openai_compatible | 4 horas |
assemblyai | 139 minutos |
cloudflare | 81 minutos |
diarize (WhisperX auto-hospedado) | 90 minutos |
O limite de duração é verificado antes de qualquer processamento, então um arquivo longo demais é recusado de imediato em vez de falhar no meio do caminho.
Os dois limites dos provedores hospedados são da AutoTalk, não deles: a AssemblyAI aceita arquivos de até 10 horas. A AutoTalk converte todo arquivo para um formato de áudio padrão antes de transcrever, e essa cópia convertida tem um orçamento de tamanho — ou seja, o limite real é um número de megabytes, e estes valores são o que esse orçamento representa em minutos. Eles são calculados sobre o maior tamanho que uma cópia convertida pode alcançar, não sobre um caso típico, então a gravação não precisa ser pequena nem silenciosa para caber.
Diarização auto-hospedada (WhisperX)
A identificação de falantes pode vir de um serviço WhisperX + pyannote
auto-hospedado que você roda na sua própria máquina com GPU (12 GB de VRAM
recomendados; placas menores funcionam com a opção int8). A configuração —
incluindo o token do Hugging Face exigido pelos modelos restritos do
pyannote — está documentada no README do repositório
autotalk-transcription-gpu.
Aponte um perfil diarize para a URL da sua máquina com o segredo
compartilhado como chave de API, e ele fica disponível no diálogo de
Transcrever.
Se você prefere não manter hardware, um perfil assemblyai também identifica
falantes — veja a tabela de provedores acima.
API
Os trabalhos de transcrição também estão disponíveis programaticamente:
POST /v1/transcriptions— enfileira um trabalho (fullPath, opcionaisprofileId,languageCode,formats).GET /v1/transcriptions/{id}— status, progresso e caminhos das saídas.
Agentes conectados via MCP podem chamar as ferramentas
transcribe_storage_file e get_transcription_job para o mesmo fluxo.
Detalhes de cobrança
- A transcrição da plataforma — um perfil
openai,assemblyaioucloudflarerodando com as credenciais da própria AutoTalk — usa o medidor Fala→texto (stt_ms), normalizado pelo custo do provedor, e respeita os limites mensais do seu plano. - Perfis próprios e auto-hospedados não são cobrados pelo AutoTalk — o
uso é registrado no contador interno
audio_ms_byokapenas para sua referência. Esse contador é compartilhado com a síntese de voz com chave própria e nunca aparece em uma fatura. - A preparação do áudio (normalização/divisão) usa o medidor de transcodificação, como os demais processamentos de mídia.