Mejores prácticas del Audio Agent
Este documento reúne las prácticas más habituales para elegir, ajustar y publicar el Audio Agent, con el fin de ayudarte a conseguir más rápido un Agent de voz que «escuche con claridad, responda con precisión y hable con naturalidad». El significado y el rango de valores de cada parámetro se encuentran en la Guía de configuración.
Cómo elegir el modo de motor
Primero define el modo según tus necesidades y, después, elige el modelo:
- Buscas la latencia mínima y un estilo coloquial natural → Modelo en tiempo real (REALTIME): la latencia mínima, idóneo para escenarios sensibles a la velocidad de reacción y con un discurso relativamente abierto, como charla informal, práctica conversacional o navegación por voz.
- Necesitas una gran capacidad de texto, llamadas a herramientas y un discurso estricto → ASR-LLM-TTS: la latencia más alta, pero el gran modelo de texto ofrece el máximo control y puede integrar de forma estable la base de conocimiento, la base de datos y las herramientas; es idóneo para atención al cliente por voz, gestiones de negocio, etc.; el timbre lo determina un TTS independiente, lo que facilita unificar la voz de marca.
- El modelo admite de forma nativa la entrada de voz y quieres simplificar la cadena → LLM+TTS: latencia media; prescinde de una etapa de ASR independiente, ya que el gran modelo «entiende» la voz directamente, y la cadena es más corta.
Ajuste de VAD y de la interrupción
El VAD determina «cuándo considera el Agent que has terminado de hablar», lo que afecta directamente a la experiencia. Elige según el escenario:
- Atención al cliente por voz / líneas directas (rápido y con posibilidad de interrumpir): sube adecuadamente la sensibilidad de la interrupción por voz para que el usuario pueda intervenir en cualquier momento; el corte de frase por pausa puede ser algo menor, para acortar la espera de respuesta. El coste es que, en entornos ruidosos, es más fácil que se interrumpa por error.
- Preguntas y respuestas en profundidad / lectura en voz alta (estable y con pocas interrupciones erróneas): baja la sensibilidad de la interrupción por voz y sube adecuadamente el corte de frase por pausa para evitar cortar la palabra cuando el usuario hace una pausa para pensar.
- Entornos ruidosos: en el modo predefinido del Modelo en tiempo real, sube el umbral de activación por volumen para reducir las activaciones erróneas por ruido de fondo.
- Modo predefinido vs. modo semántico (solo Modelo en tiempo real): si buscas un corte de frase estable y previsible, usa el modo predefinido; si quieres que el Agent decida según el significado si el usuario ha terminado de hablar, usa el modo semántico y ajusta el ritmo con la velocidad de respuesta.
Se recomienda empezar probando con los valores predeterminados (corte de frase por pausa 500 ms, interrupción por voz 0.5) y, después, ajustar paso a paso a partir de grabaciones reales, cambiando un solo parámetro a la vez.
Cómo redactar el prompt de identidad
En un escenario de voz el usuario «escucha» en lugar de «leer», por lo que el prompt conviene que sea conciso y coloquial:
- Deja claros el rol y los límites: quién es, qué puede hacer y de qué no habla.
- Exige respuestas en frases cortas, evitando párrafos largos, viñetas, tablas y otras estructuras poco adecuadas para leer en voz alta.
- Establece una expresión coloquial: que los números, importes y horas se pronuncien de la forma más natural posible, reduciendo la terminología rígida.
- Especifica el idioma y el tono: por ejemplo, «responde en español, con cortesía y concisión».
Limpieza del texto para TTS
Las respuestas de texto del gran modelo suelen contener símbolos que, si se sintetizan directamente, se «leen» en voz alta. Límpialos con las opciones Eliminar y Sustituir:
- Eliminar: paréntesis
(), corchetes[], comillas angulares《》, asteriscos*, almohadillas#y otros símbolos de Markdown y de maquetación, para evitar que se pronuncien «asterisco» o «almohadilla». - Sustituir por un espacio: para los símbolos que requieren una pausa pero no deben pronunciarse, mejorando la naturalidad del corte de frase.
- Los paréntesis por pares se introducen como un único conjunto (como
()) y los distintos símbolos se separan con una coma (inglesa).
Combinarlo con un prompt de identidad que pida al modelo «no generar Markdown» da mejores resultados al aplicar ambas medidas a la vez.
Mensaje de bienvenida y avatar virtual
- El mensaje de bienvenida debe ser breve e ir al grano, indicando en una frase quién es y para qué sirve; por ejemplo, «Hola, aquí atención al cliente de XX, ¿en qué puedo ayudarte?».
- Los vídeos de avatar hablando / en espera deben tener obligatoriamente el primer y el último fotograma enlazados; de lo contrario, al reproducirse en bucle se produce un salto de fotograma evidente. El avatar hablando corresponde a «hablando» y el avatar en espera a «escuchando».
- En negocios multilingües, recuerda configurar por separado el mensaje de bienvenida y el avatar para cada idioma.
Estrategia de control de la llamada
Establece un «plan de respaldo» para cada conversación, a fin de evitar el ralentí y la ocupación de recursos:
- Control de silencios: fija un tiempo de espera por silencio razonable (predeterminado 10 segundos) y acompáñalo de un aviso de silencio natural, como «¿Sigues ahí? ¿Quieres que continúe?», para devolver al usuario a la conversación.
- Colgado automático: usa la duración máxima de la llamada (predeterminado 600 segundos) y el número máximo de silencios (predeterminado 5 veces) como respaldo, para evitar llamadas indefinidas o líneas ocupadas durante mucho tiempo sin que nadie responda. El aviso de colgado se limita a 20 tokens; basta con una despedida breve.
Consideraciones sobre el uso del sonido de fondo
- El volumen de fondo no debe tapar la voz humana (predeterminado 30, rango 1~50); un valor demasiado alto reduce la precisión del reconocimiento y la claridad de la llamada.
- El sonido de fondo personalizado debe ser mp3 y ≤ 1 MB.
Calidad del reconocimiento de voz
- Ante dominios específicos, aprovecha las instrucciones de transcripción de ASR para indicar nombres propios, nombres de marca y terminología del sector, lo que mejora notablemente la precisión del reconocimiento.
- Cuando el idioma del usuario es fijo, especifica el idioma de voz en lugar de usar «Reconocimiento automático», ya que la estabilidad es mayor.
- La plataforma incorpora una verificación de la calidad de voz: descarta automáticamente los audios demasiado cortos (menos de 1 segundo) y filtra las frases «alucinadas» de reconocimiento habituales (como «gracias por ver» o «bienvenido, suscríbete», resultados sin sentido) para reducir las activaciones erróneas. Que estos resultados se ignoren es un comportamiento normal y no requiere configuración adicional.
Publicación e integración
- Inserción en página web: incorpora el Audio Agent como componente de conversación de voz en el sitio web; consulta la Integración con Iframe.
- Acceso telefónico: vincula un número de Twilio para recibir llamadas, o recibe llamadas transferidas a través de un sistema SIP de terceros; consulta el Manual de integración del sistema telefónico.
Facturación y concurrencia
- Las llamadas de voz descuentan créditos según el uso de voz; agotar los créditos hace que las llamadas entrantes sean rechazadas, así que reserva un margen.
- Presta atención al límite de llamadas simultáneas: las nuevas llamadas entrantes que lo superen serán rechazadas. Antes de publicar, evalúa las necesidades de concurrencia según el volumen de llamadas previsto.
- Los registros de llamadas se pueden consultar en registros / historial de conversaciones, con el origen de la sesión, el número de la llamada entrante, las preguntas y respuestas de varios turnos y la secuencia de ejecución, lo que facilita el análisis y la optimización.
