Transcrição de Áudio
O AutoTalk converte áudio em texto de duas formas:
- Transcrição automática do chat — mensagens de voz recebidas nos seus canais são transcritas na hora, para que atendentes e assistentes de IA possam lê-las imediatamente.
- Transcrição avulsa — transcreva qualquer arquivo de áudio do seu
armazenamento (entrevistas, reuniões, podcasts — mesmo com horas de
duração) em transcrições baixáveis
.txt,.srt,.vtte.json, opcionalmente com identificação de falantes.
Ambas são configuradas por meio de perfis de transcrição.
Perfis de transcrição
Um perfil é uma configuração de transcrição reutilizável, no nível da empresa. Gerencie-os em Empresa → Perfis de transcrição. Toda empresa começa com um perfil padrão OpenAI (plataforma), então a transcrição funciona sem configuração.
| Tipo de provedor | O que faz | Cobrança |
|---|---|---|
openai | Usa o Whisper da OpenAI. Sem chave de API definida, usa a chave da plataforma AutoTalk; defina sua própria chave OpenAI para torná-lo BYOK. | Com a chave da plataforma (sem chave de API), cobrado como minutos de áudio na sua fatura AutoTalk. Com sua própria chave OpenAI vira BYOK — cobrado pelo seu provedor, não como minutos de áudio da AutoTalk. |
openai_compatible | Envia o áudio para o seu próprio endpoint compatível com Whisper (sua chave OpenAI, Groq, um servidor faster-whisper auto-hospedado, …). | Cobrado pelo seu provedor; o AutoTalk apenas registra o uso. |
diarize | Envia o áudio para uma máquina WhisperX auto-hospedada que também identifica quem falou (diarização de falantes). | Cobrado por você (seu hardware); o AutoTalk apenas registra o uso. |
Campos do perfil:
- Nome — exibido nos seletores.
- Tipo de provedor — um dos três acima.
- URL base — seu endpoint (apenas provedores próprios). Deve ser uma URL HTTP(S) pública.
- Modelo — modelo opcional (padrão
whisper-1). - Idioma — idioma padrão da transcrição (vazio usa o idioma da empresa).
- Chave de API — a chave do seu provedor ou o segredo compartilhado da máquina auto-hospedada, armazenada criptografada e enviada como token Bearer.
- Headers — headers HTTP extras opcionais enviados aos endpoints de
provedores próprios (BYO) (exibido para perfis
openai_compatible/diarize). - Padrão da empresa — o perfil usado quando um canal ou trabalho não escolhe um explicitamente.
Canais podem fixar um perfil específico nas opções de Transcrição do
canal. Canais aceitam apenas perfis openai / openai_compatible — a
diarização é exclusiva dos trabalhos avulsos (mensagens de voz têm um único
falante).
Transcrevendo um arquivo do Armazenamento
- Abra Empresa → Armazenamento, selecione um arquivo de áudio e escolha Transcrever (menu de contexto ou painel de detalhes).
- Escolha o perfil, o idioma e os formatos de saída. Se o perfil for de diarização, a transcrição identificará os falantes.
- Clique em Transcrever. O diálogo muda para uma visão de progresso ao vivo — você pode fechá-lo a qualquer momento; o trabalho continua rodando em segundo plano.
- Acompanhe os trabalhos no painel de Transcrições (menu lateral ou o atalho na barra do Armazenamento). Ao concluir, você também recebe uma notificação.
- As saídas são salvas ao lado do arquivo original como
<nome>.transcript.<jobId>.txt/srt/vtt/json(o id do trabalho mantém a saída de cada execução distinta, para que reexecuções nunca colidam), e o painel oferece downloads, botão de copiar e um visualizador com timestamps e falantes.
Arquivos longos são tratados automaticamente: o áudio é dividido em trechos, transcrito em paralelo e reunido com os timestamps corretos (até 4 horas por arquivo; trabalhos com diarização até 90 minutos).
Diarização auto-hospedada (WhisperX)
A identificação de falantes vem de um serviço WhisperX + pyannote
auto-hospedado que você roda na sua própria máquina com GPU (12 GB de VRAM
recomendados; placas menores funcionam com a opção int8). A configuração —
incluindo o token do Hugging Face exigido pelos modelos restritos do
pyannote — está documentada no README do repositório
autotalk-transcription-gpu.
Aponte um perfil diarize para a URL da sua máquina com o segredo
compartilhado como chave de API, e ele fica disponível no diálogo de
Transcrever.
API
Os trabalhos de transcrição também estão disponíveis programaticamente:
POST /v1/transcriptions— enfileira um trabalho (fullPath, opcionaisprofileId,languageCode,formats).GET /v1/transcriptions/{id}— status, progresso e caminhos das saídas.
Assistentes conectados via MCP podem chamar as ferramentas
transcribe_storage_file e get_transcription_job para o mesmo fluxo.
Detalhes de cobrança
- A transcrição da plataforma (
openai) usa o medidor de minutos de áudio, normalizado pelo custo do provedor, e respeita os limites mensais do seu plano. - Perfis próprios e auto-hospedados não são cobrados pelo AutoTalk — o uso é registrado internamente apenas para sua referência.
- A preparação do áudio (normalização/divisão) usa o medidor de transcodificação, como os demais processamentos de mídia.