Voz con ChatGPT — TTS para WhatsApp
Guía completa de Text-to-Speech con OpenAI en ChatCielo: responde notas de voz de WhatsApp en audio con tts-1 y tts-1-hd, tabla de voces alloy/echo/fable/onyx/nova/shimmer, configuración en el canal y prompts optimizados para habla natural
Voz con ChatGPT — TTS para responder notas de voz en WhatsApp
ChatCielo puede responder en audio cuando el cliente envía una nota de voz por WhatsApp: la IA transcribe el audio, genera la respuesta de texto con GPT y la convierte a voz natural con los modelos Text-to-Speech de OpenAI (tts-1, tts-1-hd). El cliente recibe una nota de voz que suena humana, no un texto para leer.
Activa TTS cuando tu cliente ya te habla en audio. Responder en la misma modalidad crea cercanía y reduce fricción — especialmente en soporte, ventas por WhatsApp y públicos que prefieren escuchar en lugar de leer.
Cómo funciona el flujo de voz
Cliente envía nota de voz por WhatsApp
El mensaje entra a ChatCielo como audio. Si tienes STT (Speech-to-Text) activo, ChatCielo lo transcribe automáticamente a texto para que la IA lo entienda. Sin STT, la nota igual llega al panel pero la IA no la puede procesar como texto.
GPT genera la respuesta (texto)
El texto transcrito + el Prompt del Sistema + el histórico se envían a gpt-4o, gpt-4o-mini u otro modelo de OpenAI. La respuesta es texto plano — ChatCielo la intercepta antes de enviarla al cliente.
OpenAI TTS convierte texto → audio
Si el canal tiene Responder con audio (TTS) activo, ChatCielo envía ese texto al endpoint https://api.openai.com/v1/audio/speech con el modelo tts-1 o tts-1-hd y la voz elegida. OpenAI devuelve un MP3/Opus que ChatCielo reenvía al cliente como nota de voz de WhatsApp.
El flujo inverso también existe: el cliente escribe texto y tú puedes forzar que la respuesta salga en audio (modo "Siempre en audio"). Ver Cuándo usar voz más abajo.
1. Modelos TTS de OpenAI
ChatCielo soporta los dos modelos actuales de Text-to-Speech de OpenAI. Ambos comparten las 6 voces, pero difieren en calidad y latencia.
| Modelo | Calidad | Latencia | Costo estimado* | Cuándo usar |
|---|---|---|---|---|
tts-1 | Alta — voz natural y fluida | Baja (0.8–1.5 s) — ideal para conversación en tiempo real | $15 / 1M caracteres | Recomendado para WhatsApp — respuesta rápida sin sacrificar naturalidad |
tts-1-hd | Muy alta — matices más ricos, entonación más expresiva | Media (1.5–3 s) | $30 / 1M caracteres | Audios largos, mensajes premium, podcast o cuando la calidad prima sobre la velocidad |
- Precio de referencia OpenAI a mayo 2026. Un mensaje de WhatsApp de 300 caracteres ≈ $0.005 con
tts-1.
Ambos modelos solo generan audio a partir de texto — no son STT. Para entender el audio del cliente necesitas además Whisper / Google Speech-to-Text. Ver Google Speech-to-Text y ChatGPT — sección TTS.
Endpoint subyacente (referencia)
Si quieres probar fuera de ChatCielo:
ChatCielo hace esta llamada por ti — solo eliges modelo y voz en el panel.
2. Tabla de voces — personalidad y caso de uso
Las 6 voces de OpenAI tienen timbre, ritmo y personalidad distintos. Elige según tu marca y el tipo de conversación.
| Voz | Timbre | Personalidad | Mejor caso de uso en ChatCielo | Ejemplo de marca |
|---|---|---|---|---|
alloy | Neutra, equilibrada, clara | Profesional, confiable, sin afectación | Uso general por defecto — atención, soporte, ventas consultivas | SaaS, servicios, e-commerce general |
echo | Cálida, con resonancia suave | Envolvente, empática, cercana | Narración y soporte sensible — reclamos, explicaciones que requieren calidez | Salud, educación, coaching |
fable | Suave, narrativa, pausada | Cálida, amigable, cuentacuentos | Audiolibros y explicaciones empáticas — tutoriales, bienvenidas extensas | Infoproductos, formación |
onyx | Grave, firme, profunda | Autoridad, seriedad, estructura | Instrucciones y comunicaciones corporativas — confirmaciones, políticas, avisos formales | Legal, finanzas, B2B enterprise |
nova | Brillante, optimista, energética | Fresca, joven, positiva | Marcas jóvenes y creativas — e-commerce tendencia, atención con entusiasmo | Moda, lifestyle, público joven |
shimmer | Refinada, serena, elegante | Tranquila, premium, sofisticada | Atención premium — clientes VIP, mensajes que deben sonar cuidados y exclusivos | Hotelería, lujo, servicios high-ticket |
Recomendación para empezar: alloy si dudas, nova si tu marca es cercana/joven, shimmer si es premium. Prueba las 6 enviando el mismo texto con cada voz y elige la que mejor represente tu tono de marca — ChatCielo te permite cambiarla sin reconfigurar prompts.
Prueba este texto con cada voz y nota la diferencia:
"Hola Ana, gracias por escribir a Luna Store. Tu pedido 4821 ya fue despachado y llega mañana entre 9 y 12. Cualquier duda, me escribes por acá."
alloy→ sonará neutra y profesional, sin emoción marcada.echo→ sonará cálida y envolvente, como si te hablaran cerca.nova→ sonará alegre y energética, con ritmo más vivo.shimmer→ sonará suave y elegante, pausada.onyx→ sonará grave y firme, con autoridad.fable→ sonará narrativa y dulce, como una historia.
Pide a 3 personas de tu equipo que voten a ciegas — la ganadora suele ser evidente en 2 minutos.
3. Configuración en ChatCielo (paso a paso)
Activa la integración OpenAI en el canal
Ve a Canales > Tu canal (WhatsApp) > Integración IA > OpenAI / ChatGPT y completa:
- API Key:
sk-proj-...de platform.openai.com con saldo disponible. - Modelo de chat:
gpt-4o-mini(económico) ogpt-4o(calidad máxima) — es el que genera el texto que luego se vocaliza. - Prompt del Sistema: ver sección 5 (plantillas optimizadas para TTS).
- Temperatura:
0.3–0.5para respuestas vocales precisas (evita creatividad excesiva que alarga el audio). - Max Tokens:
300–450— los audios largos (>60 s) se hacen pesados en WhatsApp.
Activa Text-to-Speech (Voz)
En el mismo panel, busca la sección Voz / TTS / Responder con audio:
| Campo | Qué poner |
|---|---|
| Responder con audio | Activa el toggle |
| Modelo TTS | tts-1 (recomendado) o tts-1-hd (calidad premium) |
| Voz | Elige una de alloy, echo, fable, onyx, nova, shimmer |
| Disparador (cuándo usar voz) | Ver siguiente paso — "Cuándo usar voz" |
| Velocidad (si aparece) | 1.0 normal; 0.9 más pausado para explicaciones largas; 1.1 más ágil para ventas |
Si no ves la sección Voz / TTS, verifica que tu plan de ChatCielo la incluya y que el canal sea WhatsApp (u otro canal que soporte audio). Algunos canales de email no soportan notas de voz.
Define cuándo usar voz
Elige el disparador que mejor calce con tu operación:
| Disparador | Comportamiento | Recomendado para |
|---|---|---|
| Solo si el cliente envía audio | Si el cliente manda nota de voz → IA responde en audio. Si escribe texto → responde en texto. | Recomendado para empezar — respeta la modalidad del cliente, experiencia más natural |
| Siempre en audio | Cada respuesta de la IA sale como nota de voz, aunque el cliente escriba | Casos donde la voz es tu diferenciador (coaching por audio, atención telefónica híbrida) |
| Palabra clave | Solo cuando el cliente escribe una frase como audio, voz, respóndeme en audio | Operaciones mixtas donde el cliente elige explícitamente |
Para Cumpleaños / Wavoip / Telefonía que usan audio, el modo "Siempre en audio" evita que el cliente tenga que pedirlo cada vez.
Prueba de extremo a extremo
- Con un número de prueba, envía una nota de voz por WhatsApp al canal ("Hola, ¿hacen envíos a Rosario?").
- Verifica que ChatCielo la transcribe (verás el texto en el panel), la IA responde y el cliente recibe una nota de voz que suena natural.
- Prueba también escribiendo texto: si elegiste "Solo si el cliente envía audio", esta vez debe llegar texto, no audio.
- Si el audio llega cortado, baja
Max Tokensa350y verifica que tuOPENAI_API_KEYtenga cuota paraaudio/speech.
4. Cómo redactar prompts optimizados para habla natural
Un texto que se lee bien no siempre suena bien. Los modelos TTS leen literalmente lo que les das — si tu prompt genera asteriscos, markdown, emojis o párrafos larguísimos, el audio sonará robótico o dirá "asterisco asterisco".
Obligatorias para TTS:
- Prohíbe markdown y formato visual — sin
**negrita**,*cursiva*,### títulos,- listas,`código`ni> citas. El TTS los lee como "asterisco" o los ignora con pausas raras. - Prohíbe emojis —
😊,🚀,👉se leen como "cara sonriente" o se omiten con silencio incómodo. - Frases cortas y pausas naturales — máximo 18–20 palabras por frase. Usa puntos y comas para marcar pausas: el TTS respira donde hay puntuación.
- Números y fechas en palabras cuando ayuden:
15%→ el TTS dice "quince por ciento" (bien); peroR$ 1.234,56puede sonar raro — prefiere "mil doscientos treinta y cuatro reales con cincuenta y seis". - Evita URLs y códigos largos en audio — si debes dar un link, di "te envío el enlace por texto a continuación" y envía el link como mensaje de texto separado vía ChatFlow.
- Un solo CTA por audio — "¿Te preparo la cotización?" es mejor que tres preguntas seguidas que el cliente no retiene escuchando.
- Longitud total: 40–90 palabras por audio (~15–45 segundos). Más de 120 palabras (>60 s) pierde atención en WhatsApp.
5. Flujos combinados — ChatFlow + TTS
Puedes orquestar voz y texto en el mismo flujo:
| Objetivo | Cómo hacerlo |
|---|---|
| Enviar link sin decirlo en audio | Nodo IA (TTS) dice "Te envío el enlace por texto a continuación" → siguiente nodo Enviar mensaje (texto) con la URL real. El cliente escucha y luego ve el link clickeable. |
| Confirmar con audio y pedir dato por texto | Audio: "Perfecto, ya registré tu consulta para {{protocol}}. ¿Me confirmas tu correo para enviarte el comprobante?" → siguiente nodo espera texto con {{email}}. |
| Derivar a humano con resumen en audio | Audio: "Ana, prefiero derivarte con un asesor para ese dato. Tu protocolo es setenta y dos catorce. Te conecto ahora." → nodo Asignar a agente/departamento. |
En ChatFlow puedes poner condiciones por tipo de mensaje: si tipo_mensaje == audio → usa rama TTS; si es texto → rama texto. Así respetas la modalidad sin duplicar prompts.
6. Costos y límites
| Concepto | Detalle |
|---|---|
| Costo TTS | Se factura por caracteres de texto enviado a audio/speech, no por segundos de audio. ~150 palabras ≈ 900 caracteres ≈ $0.013 con tts-1. |
| Límite por request | Máximo 4.096 caracteres por llamada a audio/speech. Un mensaje de WhatsApp de 4 líneas nunca lo supera. Si concatenas histórico, trunca a 3.000 caracteres. |
| Latencia total | STT (1–2 s) + GPT (1–2 s) + TTS (0.8–1.5 s con tts-1) ≈ 3–5 s desde que el cliente suelta el micrófono hasta que recibe el audio — comparable a un humano que piensa antes de responder. |
| Costo STT adicional | Si usas Whisper para transcribir la nota entrante, suma ~$0.006/minuto. Ver Google Speech-to-Text. |
Optimización: baja Max Tokens a 350 y mantén respuestas de 60–90 palabras — reduces costo TTS a la mitad sin perder calidad.
7. Troubleshooting
| Problema | Causa probable | Solución |
|---|---|---|
| El cliente recibe texto en lugar de audio | TTS desactivado, voz no seleccionada o disparador mal configurado | Verifica Responder con audio activo, voz elegida y disparador "Solo si el cliente envía audio" si hiciste la prueba con nota de voz. |
| Audio robótico / dice "asterisco" | Prompt genera markdown, emojis o símbolos | Usa la plantilla de la sección 4 (prohíbe **, *, -, emojis). Prueba enviando "Hola" y verifica que no haya ** en la respuesta de GPT. |
| Audio cortado a los 10 segundos | Max Tokens muy bajo o límite de 4.096 caracteres superado | Sube Max Tokens a 400 y verifica que el texto no supere 4.096 caracteres. Si usas histórico largo, bájalo a 10 mensajes. |
invalid_api_key en TTS | API Key sin saldo o sin permiso para audio/speech | Verifica en platform.openai.com > Billing que tengas crédito y que la key tenga scope audio. Regenera si persiste. |
| Latencia >8 segundos | tts-1-hd + gpt-4o + nota de voz larga | Cambia a tts-1 (más rápido) y a gpt-4o-mini para respuestas vocales. Reserva tts-1-hd solo para audios premium. |
| No transcribe la nota entrante | STT no configurado | Activa Transcripción de audio en el canal (Whisper o Google STT). Sin transcripción, la IA no entiende el audio aunque el TTS de salida esté activo. |
| El audio se escucha muy rápido/lento | Velocidad TTS mal configurada | Ajusta Velocidad a 1.0 (normal). Usa 0.9 solo para explicaciones largas y 1.1 para ventas ágiles. |
8. Siguiente paso
- Si aún no configuraste el reconocimiento de voz entrante (STT), completa primero Google Speech-to-Text — sin STT la IA no entiende las notas del cliente aunque pueda responder en audio.
- Para la configuración general de prompts, temperatura y derivación humana, revisa la guía completa de ChatGPT (sección 5).
- Para atención on-premise con voz local, evalúa combinar Whisper local (STT) + Ollama (LLM) + TTS local cuando ChatCielo soporte TTS on-premise.