Preparar Texto Hablado
Usa esta acción cuando estés a punto de decir en voz alta un texto que se escribió para leerse y quieras que suene como algo que diría una persona. Devuelve solo texto — no produce audio.
Ideal para
- Preparar la respuesta de un agente o de un LLM antes de decirla
- Decir en voz alta una plantilla o un campo de texto enriquecido que lleve formato
- Cualquier paso cuyo texto vaya hacia Sintetizar Voz
Esto no es lo mismo que quitar el formato. Una tabla no tiene forma hablada, así que quitar el marcado no da un texto decible — da una sopa de palabras, leyendo las celdas en fila o perdiendo la respuesta por completo. Esta acción le pide a un modelo pequeño y barato que diga lo mismo como lo diría una persona, mientras tu texto original queda intacto para el historial.
Usa otra cosa cuando
| Quieres | Usa |
|---|---|
| El audio en sí | Sintetizar Voz — ejecuta esta acción antes y aquella después |
| Contenido nuevo, no la reescritura de un texto que ya tienes | Generar Respuesta LLM — usa tu propio prompt y modelo |
Campos principales
| Campo | Qué hace |
|---|---|
| Markdown | El texto escrito a reescribir para voz, como máximo 8000 caracteres. Normalmente la respuesta de un paso anterior, como step(0).choices[0].message.content |
| Propósito | Etiqueta opcional para lo que hace este paso, visible en los registros |
Qué pueden usar los pasos posteriores
| Valor | Qué es |
|---|---|
step(N).text | La forma hablada. Pásala directamente al campo Texto de Sintetizar Voz |
step(N).model | El modelo que produjo la reescritura |
Límites
| Límite | Valor |
|---|---|
| Longitud de la entrada | 8000 caracteres |
| Solicitudes de voz | 60 por minuto, por empresa |
La reescritura es deliberadamente corta, así que siempre cabe en el límite de 4096 caracteres de Sintetizar Voz — nunca hace falta recortarla por el camino.
El techo de 60 por minuto se comparte con el modo de voz de la aplicación y con Sintetizar Voz, así que un par preparar-y-decir cuesta dos de esas solicitudes por ejecución.
Coste
Este paso se descuenta del uso de tokens de IA de tu plan, no del de audio. Se ejecuta en un modelo pequeño y barato elegido por ti — no puedes escoger el modelo, porque la tarea es una reescritura mecánica y no razonamiento, y no debería costar precio de razonamiento.
Cuando falla
| Código | Qué pasó |
|---|---|
spoken_text_too_long | La entrada supera los 8000 caracteres. Acórtala o repártela en varios pasos |
El modo de voz de la aplicación recurre discretamente al texto plano cuando esta reescritura falla, pero un flujo de trabajo no tiene esa salida: un fallo aquí hace fallar el paso. Si quieres la misma degradación suave, condiciona el paso de síntesis a step_ok(N) y pasa el texto original por la otra rama.