ChatCieloDocs

Voz con ChatGPT — TTS para WhatsApp

Guía completa de Text-to-Speech con OpenAI en ChatCielo: responde notas de voz de WhatsApp en audio con tts-1 y tts-1-hd, tabla de voces alloy/echo/fable/onyx/nova/shimmer, configuración en el canal y prompts optimizados para habla natural

Voz con ChatGPT — TTS para responder notas de voz en WhatsApp

ChatCielo puede responder en audio cuando el cliente envía una nota de voz por WhatsApp: la IA transcribe el audio, genera la respuesta de texto con GPT y la convierte a voz natural con los modelos Text-to-Speech de OpenAI (tts-1, tts-1-hd). El cliente recibe una nota de voz que suena humana, no un texto para leer.

Activa TTS cuando tu cliente ya te habla en audio. Responder en la misma modalidad crea cercanía y reduce fricción — especialmente en soporte, ventas por WhatsApp y públicos que prefieren escuchar en lugar de leer.

Cómo funciona el flujo de voz

Cliente envía nota de voz por WhatsApp

El mensaje entra a ChatCielo como audio. Si tienes STT (Speech-to-Text) activo, ChatCielo lo transcribe automáticamente a texto para que la IA lo entienda. Sin STT, la nota igual llega al panel pero la IA no la puede procesar como texto.

GPT genera la respuesta (texto)

El texto transcrito + el Prompt del Sistema + el histórico se envían a gpt-4o, gpt-4o-mini u otro modelo de OpenAI. La respuesta es texto plano — ChatCielo la intercepta antes de enviarla al cliente.

OpenAI TTS convierte texto → audio

Si el canal tiene Responder con audio (TTS) activo, ChatCielo envía ese texto al endpoint https://api.openai.com/v1/audio/speech con el modelo tts-1 o tts-1-hd y la voz elegida. OpenAI devuelve un MP3/Opus que ChatCielo reenvía al cliente como nota de voz de WhatsApp.

El flujo inverso también existe: el cliente escribe texto y tú puedes forzar que la respuesta salga en audio (modo "Siempre en audio"). Ver Cuándo usar voz más abajo.

1. Modelos TTS de OpenAI

ChatCielo soporta los dos modelos actuales de Text-to-Speech de OpenAI. Ambos comparten las 6 voces, pero difieren en calidad y latencia.

ModeloCalidadLatenciaCosto estimado*Cuándo usar
tts-1Alta — voz natural y fluidaBaja (0.8–1.5 s) — ideal para conversación en tiempo real$15 / 1M caracteresRecomendado para WhatsApp — respuesta rápida sin sacrificar naturalidad
tts-1-hdMuy alta — matices más ricos, entonación más expresivaMedia (1.5–3 s)$30 / 1M caracteresAudios largos, mensajes premium, podcast o cuando la calidad prima sobre la velocidad
  • Precio de referencia OpenAI a mayo 2026. Un mensaje de WhatsApp de 300 caracteres ≈ $0.005 con tts-1.

Ambos modelos solo generan audio a partir de texto — no son STT. Para entender el audio del cliente necesitas además Whisper / Google Speech-to-Text. Ver Google Speech-to-Text y ChatGPT — sección TTS.

Endpoint subyacente (referencia)

Si quieres probar fuera de ChatCielo:

curl https://api.openai.com/v1/audio/speech \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-1",
    "voice": "alloy",
    "input": "Hola Carlos, tu pedido 12345 ya está en camino. Te aviso cuando llegue a sucursal."
  }' --output respuesta.mp3

ChatCielo hace esta llamada por ti — solo eliges modelo y voz en el panel.

2. Tabla de voces — personalidad y caso de uso

Las 6 voces de OpenAI tienen timbre, ritmo y personalidad distintos. Elige según tu marca y el tipo de conversación.

VozTimbrePersonalidadMejor caso de uso en ChatCieloEjemplo de marca
alloyNeutra, equilibrada, claraProfesional, confiable, sin afectaciónUso general por defecto — atención, soporte, ventas consultivasSaaS, servicios, e-commerce general
echoCálida, con resonancia suaveEnvolvente, empática, cercanaNarración y soporte sensible — reclamos, explicaciones que requieren calidezSalud, educación, coaching
fableSuave, narrativa, pausadaCálida, amigable, cuentacuentosAudiolibros y explicaciones empáticas — tutoriales, bienvenidas extensasInfoproductos, formación
onyxGrave, firme, profundaAutoridad, seriedad, estructuraInstrucciones y comunicaciones corporativas — confirmaciones, políticas, avisos formalesLegal, finanzas, B2B enterprise
novaBrillante, optimista, energéticaFresca, joven, positivaMarcas jóvenes y creativas — e-commerce tendencia, atención con entusiasmoModa, lifestyle, público joven
shimmerRefinada, serena, eleganteTranquila, premium, sofisticadaAtención premium — clientes VIP, mensajes que deben sonar cuidados y exclusivosHotelería, lujo, servicios high-ticket

Recomendación para empezar: alloy si dudas, nova si tu marca es cercana/joven, shimmer si es premium. Prueba las 6 enviando el mismo texto con cada voz y elige la que mejor represente tu tono de marca — ChatCielo te permite cambiarla sin reconfigurar prompts.

Prueba este texto con cada voz y nota la diferencia:

"Hola Ana, gracias por escribir a Luna Store. Tu pedido 4821 ya fue despachado y llega mañana entre 9 y 12. Cualquier duda, me escribes por acá."

  • alloy → sonará neutra y profesional, sin emoción marcada.
  • echo → sonará cálida y envolvente, como si te hablaran cerca.
  • nova → sonará alegre y energética, con ritmo más vivo.
  • shimmer → sonará suave y elegante, pausada.
  • onyx → sonará grave y firme, con autoridad.
  • fable → sonará narrativa y dulce, como una historia.

Pide a 3 personas de tu equipo que voten a ciegas — la ganadora suele ser evidente en 2 minutos.

3. Configuración en ChatCielo (paso a paso)

Activa la integración OpenAI en el canal

Ve a Canales > Tu canal (WhatsApp) > Integración IA > OpenAI / ChatGPT y completa:

  • API Key: sk-proj-... de platform.openai.com con saldo disponible.
  • Modelo de chat: gpt-4o-mini (económico) o gpt-4o (calidad máxima) — es el que genera el texto que luego se vocaliza.
  • Prompt del Sistema: ver sección 5 (plantillas optimizadas para TTS).
  • Temperatura: 0.30.5 para respuestas vocales precisas (evita creatividad excesiva que alarga el audio).
  • Max Tokens: 300450 — los audios largos (>60 s) se hacen pesados en WhatsApp.

Activa Text-to-Speech (Voz)

En el mismo panel, busca la sección Voz / TTS / Responder con audio:

CampoQué poner
Responder con audioActiva el toggle
Modelo TTStts-1 (recomendado) o tts-1-hd (calidad premium)
VozElige una de alloy, echo, fable, onyx, nova, shimmer
Disparador (cuándo usar voz)Ver siguiente paso — "Cuándo usar voz"
Velocidad (si aparece)1.0 normal; 0.9 más pausado para explicaciones largas; 1.1 más ágil para ventas

Si no ves la sección Voz / TTS, verifica que tu plan de ChatCielo la incluya y que el canal sea WhatsApp (u otro canal que soporte audio). Algunos canales de email no soportan notas de voz.

Define cuándo usar voz

Elige el disparador que mejor calce con tu operación:

DisparadorComportamientoRecomendado para
Solo si el cliente envía audioSi el cliente manda nota de voz → IA responde en audio. Si escribe texto → responde en texto.Recomendado para empezar — respeta la modalidad del cliente, experiencia más natural
Siempre en audioCada respuesta de la IA sale como nota de voz, aunque el cliente escribaCasos donde la voz es tu diferenciador (coaching por audio, atención telefónica híbrida)
Palabra claveSolo cuando el cliente escribe una frase como audio, voz, respóndeme en audioOperaciones mixtas donde el cliente elige explícitamente

Para Cumpleaños / Wavoip / Telefonía que usan audio, el modo "Siempre en audio" evita que el cliente tenga que pedirlo cada vez.

Prueba de extremo a extremo

  1. Con un número de prueba, envía una nota de voz por WhatsApp al canal ("Hola, ¿hacen envíos a Rosario?").
  2. Verifica que ChatCielo la transcribe (verás el texto en el panel), la IA responde y el cliente recibe una nota de voz que suena natural.
  3. Prueba también escribiendo texto: si elegiste "Solo si el cliente envía audio", esta vez debe llegar texto, no audio.
  4. Si el audio llega cortado, baja Max Tokens a 350 y verifica que tu OPENAI_API_KEY tenga cuota para audio/speech.

4. Cómo redactar prompts optimizados para habla natural

Un texto que se lee bien no siempre suena bien. Los modelos TTS leen literalmente lo que les das — si tu prompt genera asteriscos, markdown, emojis o párrafos larguísimos, el audio sonará robótico o dirá "asterisco asterisco".

Obligatorias para TTS:

  1. Prohíbe markdown y formato visual — sin **negrita**, *cursiva*, ### títulos, - listas, `código` ni > citas. El TTS los lee como "asterisco" o los ignora con pausas raras.
  2. Prohíbe emojis😊, 🚀, 👉 se leen como "cara sonriente" o se omiten con silencio incómodo.
  3. Frases cortas y pausas naturales — máximo 18–20 palabras por frase. Usa puntos y comas para marcar pausas: el TTS respira donde hay puntuación.
  4. Números y fechas en palabras cuando ayuden: 15% → el TTS dice "quince por ciento" (bien); pero R$ 1.234,56 puede sonar raro — prefiere "mil doscientos treinta y cuatro reales con cincuenta y seis".
  5. Evita URLs y códigos largos en audio — si debes dar un link, di "te envío el enlace por texto a continuación" y envía el link como mensaje de texto separado vía ChatFlow.
  6. Un solo CTA por audio — "¿Te preparo la cotización?" es mejor que tres preguntas seguidas que el cliente no retiene escuchando.
  7. Longitud total: 40–90 palabras por audio (~15–45 segundos). Más de 120 palabras (>60 s) pierde atención en WhatsApp.

5. Flujos combinados — ChatFlow + TTS

Puedes orquestar voz y texto en el mismo flujo:

ObjetivoCómo hacerlo
Enviar link sin decirlo en audioNodo IA (TTS) dice "Te envío el enlace por texto a continuación" → siguiente nodo Enviar mensaje (texto) con la URL real. El cliente escucha y luego ve el link clickeable.
Confirmar con audio y pedir dato por textoAudio: "Perfecto, ya registré tu consulta para {{protocol}}. ¿Me confirmas tu correo para enviarte el comprobante?" → siguiente nodo espera texto con {{email}}.
Derivar a humano con resumen en audioAudio: "Ana, prefiero derivarte con un asesor para ese dato. Tu protocolo es setenta y dos catorce. Te conecto ahora." → nodo Asignar a agente/departamento.

En ChatFlow puedes poner condiciones por tipo de mensaje: si tipo_mensaje == audio → usa rama TTS; si es texto → rama texto. Así respetas la modalidad sin duplicar prompts.

6. Costos y límites

ConceptoDetalle
Costo TTSSe factura por caracteres de texto enviado a audio/speech, no por segundos de audio. ~150 palabras ≈ 900 caracteres ≈ $0.013 con tts-1.
Límite por requestMáximo 4.096 caracteres por llamada a audio/speech. Un mensaje de WhatsApp de 4 líneas nunca lo supera. Si concatenas histórico, trunca a 3.000 caracteres.
Latencia totalSTT (1–2 s) + GPT (1–2 s) + TTS (0.8–1.5 s con tts-1) ≈ 3–5 s desde que el cliente suelta el micrófono hasta que recibe el audio — comparable a un humano que piensa antes de responder.
Costo STT adicionalSi usas Whisper para transcribir la nota entrante, suma ~$0.006/minuto. Ver Google Speech-to-Text.

Optimización: baja Max Tokens a 350 y mantén respuestas de 60–90 palabras — reduces costo TTS a la mitad sin perder calidad.

7. Troubleshooting

ProblemaCausa probableSolución
El cliente recibe texto en lugar de audioTTS desactivado, voz no seleccionada o disparador mal configuradoVerifica Responder con audio activo, voz elegida y disparador "Solo si el cliente envía audio" si hiciste la prueba con nota de voz.
Audio robótico / dice "asterisco"Prompt genera markdown, emojis o símbolosUsa la plantilla de la sección 4 (prohíbe **, *, -, emojis). Prueba enviando "Hola" y verifica que no haya ** en la respuesta de GPT.
Audio cortado a los 10 segundosMax Tokens muy bajo o límite de 4.096 caracteres superadoSube Max Tokens a 400 y verifica que el texto no supere 4.096 caracteres. Si usas histórico largo, bájalo a 10 mensajes.
invalid_api_key en TTSAPI Key sin saldo o sin permiso para audio/speechVerifica en platform.openai.com > Billing que tengas crédito y que la key tenga scope audio. Regenera si persiste.
Latencia >8 segundostts-1-hd + gpt-4o + nota de voz largaCambia a tts-1 (más rápido) y a gpt-4o-mini para respuestas vocales. Reserva tts-1-hd solo para audios premium.
No transcribe la nota entranteSTT no configuradoActiva Transcripción de audio en el canal (Whisper o Google STT). Sin transcripción, la IA no entiende el audio aunque el TTS de salida esté activo.
El audio se escucha muy rápido/lentoVelocidad TTS mal configuradaAjusta Velocidad a 1.0 (normal). Usa 0.9 solo para explicaciones largas y 1.1 para ventas ágiles.

8. Siguiente paso

  • Si aún no configuraste el reconocimiento de voz entrante (STT), completa primero Google Speech-to-Text — sin STT la IA no entiende las notas del cliente aunque pueda responder en audio.
  • Para la configuración general de prompts, temperatura y derivación humana, revisa la guía completa de ChatGPT (sección 5).
  • Para atención on-premise con voz local, evalúa combinar Whisper local (STT) + Ollama (LLM) + TTS local cuando ChatCielo soporte TTS on-premise.