Preparar Texto Falado
Use esta ação quando estiver prestes a falar um texto que foi escrito para ser lido e quiser que ele soe como algo que uma pessoa realmente diria. Ela devolve apenas texto — não produz áudio.
Melhor para
- Preparar a resposta de um agente ou de um LLM antes de falá-la
- Falar um modelo de texto ou um campo de texto formatado que contenha formatação
- Qualquer passo cujo texto vá para Sintetizar Fala
Isso não é o mesmo que remover a formatação. Uma tabela não tem forma falada, então tirar a marcação não gera texto falável — gera uma sopa de palavras, lendo as células em sequência ou perdendo a resposta por completo. Esta ação pede a um modelo pequeno e barato que diga a mesma coisa do jeito que uma pessoa diria, enquanto o seu texto original fica intacto para o histórico.
Use outra coisa quando
| Você quer | Use |
|---|---|
| O áudio em si | Sintetizar Fala — rode esta ação antes e aquela depois |
| Conteúdo novo, e não a reescrita de um texto que você já tem | Gerar Resposta LLM — ela usa o seu próprio prompt e modelo |
Campos principais
| Campo | O que faz |
|---|---|
| Markdown | O texto escrito a reescrever para fala, com no máximo 8000 caracteres. Normalmente a resposta de um passo anterior, como step(0).choices[0].message.content |
| Finalidade | Rótulo opcional para o que este passo faz, exibido nos registros |
O que passos posteriores podem usar
| Valor | O que é |
|---|---|
step(N).text | A forma falada. Envie-a direto para o campo Texto de Sintetizar Fala |
step(N).model | O modelo que produziu a reescrita |
Limites
| Limite | Valor |
|---|---|
| Tamanho da entrada | 8000 caracteres |
| Requisi ções de fala | 60 por minuto, por empresa |
A reescrita é deliberadamente curta, então ela sempre cabe no limite de 4096 caracteres de Sintetizar Fala — você nunca precisa cortá-la no meio do caminho.
O teto de 60 por minuto é compartilhado com o modo de voz do aplicativo e com Sintetizar Fala, então um par preparar-e-falar custa duas dessas requisições por execução.
Custo
Este passo é descontado do uso de tokens de IA do seu plano, e não do uso de áudio. Ele roda em um modelo pequeno e barato escolhido para você — você não pode escolher o modelo, porque a tarefa é uma reescrita mecânica e não raciocínio, e não deveria custar preço de raciocínio.
Quando falha
| Código | O que aconteceu |
|---|---|
spoken_text_too_long | A entrada passa de 8000 caracteres. Encurte-a ou divida-a em vários passos |
O modo de voz do aplicativo cai discretamente para o texto puro quando essa reescrita falha, mas um workflow não tem essa saída: uma falha aqui faz o passo falhar. Se quiser a mesma degradação suave, condicione o passo de síntese a step_ok(N) e envie o texto original pelo outro caminho.