logo
Desarrollo
Buscar
Resumen del Audio Agent

Resumen del Audio Agent

El Audio Agent es el tipo de Agent orientado a la interacción por voz dentro del Espacio de Desarrollo de GPTBots. El usuario habla en lugar de teclear y el Agent responde por voz, logrando una experiencia de llamada en tiempo real muy cercana a la de una persona real. Puede insertarse en una página web como componente de conversación de voz, o bien atender llamadas entrantes directamente a través de un sistema telefónico, lo que lo hace idóneo para escenarios como atención al cliente por voz, navegación telefónica, asistentes de voz o práctica conversacional de idiomas.

En comparación con un Agent de texto, el Audio Agent se diferencia en tres aspectos:

  • La entrada y la salida son voz: según el modo, la voz se procesa de forma distinta.
  • Sesión en tiempo real: mantiene una llamada sobre una conexión persistente, permite que el usuario tome la palabra e interrumpa en cualquier momento (barge-in) y cuenta con capacidad de reconexión tras una caída.
  • Facturación por uso de voz: los créditos se descuentan según el reconocimiento de voz, la síntesis de voz y la duración de la llamada, en lugar de por el número de mensajes de texto.

Conceptos básicos

Comprender los siguientes conceptos ayuda a configurar y depurar el Audio Agent:

Concepto Descripción
ASR (reconocimiento de voz) Automatic Speech Recognition; transcribe a texto lo que dice el usuario para que el gran modelo lo entienda.
LLM (inferencia del gran modelo) Genera la respuesta a partir del texto reconocido y del contexto; esta capa es idéntica a la de un Agent de texto y puede invocar capacidades como base de conocimiento, base de datos o memoria.
TTS (síntesis de voz) Text-To-Speech; convierte en voz la respuesta de texto generada por el gran modelo para leérsela al usuario.
VAD (detección de actividad de voz) Voice Activity Detection; determina cuándo empieza y cuándo termina de hablar el usuario, y es la base para lograr un corte de frase natural y la interrupción por voz.
Llamada en tiempo real Una conversación de voz transcurre sobre una única conexión persistente, y el Agent escucha y responde de forma simultánea.

Tres modos de motor de voz

El Audio Agent ofrece tres modos de motor, que determinan quién completa la cadena «voz — texto — voz». Tras la creación, se pueden cambiar en la parte superior de la página de configuración, y los modelos y parámetros que se muestran varían según el modo.

Modo Cadena Características Escenarios adecuados
Modelo en tiempo real
(Real-time model / REALTIME)
Latencia mínima; un único gran modelo de voz en tiempo real procesa de extremo a extremo la entrada y la salida de audio Latencia mínima y tono natural, pero con un control relativamente limitado del timbre y del texto Llamadas en tiempo real que buscan la latencia mínima y un estilo coloquial
ASR-LLM-TTS Reconocimiento de voz → gran modelo de texto → síntesis de voz, en tres etapas La latencia más alta, la mayor capacidad del modelo de texto y el máximo control; permite combinar libremente los modelos ASR, LLM y TTS Atención al cliente por voz que requiere lógica de negocio compleja, llamadas a herramientas y un control estricto del discurso
LLM+TTS Un gran modelo compatible con entrada de voz entiende la voz directamente → síntesis de voz Latencia media; prescinde de la etapa de ASR independiente, ya que el gran modelo «entiende» la voz directamente El gran modelo elegido admite de forma nativa la entrada de voz y se desea simplificar la cadena

Para recomendaciones de elección, consulta las Mejores prácticas. Los tres modos comparten capacidades como base de conocimiento, base de datos, memoria, control de la llamada y mensaje de bienvenida; solo cambia la forma de implementar la cadena de voz.

Funciones principales

  • Conversación de voz en tiempo real: el usuario habla, el Agent responde en tiempo real y se forma una llamada de varios turnos.
  • Interrupción por voz (barge-in): el usuario puede tomar la palabra e interrumpir mientras el Agent habla; la sensibilidad es ajustable y se aproxima al hábito de una conversación real.
  • Mensaje de bienvenida: reproduce un saludo al inicio de la llamada; se pueden cargar dos vídeos en bucle del avatar virtual, «hablando» y «en espera», para dotar a la conversación de voz de una imagen visual.
  • Control de la llamada: admite preguntas de seguimiento automáticas ante silencios, y el colgado automático por tiempo de espera o por un silencio prolongado, para evitar que la llamada quede al ralentí o ocupe recursos de forma indefinida.
  • Sonido de fondo: se puede superponer a la llamada un sonido ambiental predefinido (oficina, cafetería, lluvia, etc.) o cargar un audio personalizado para crear ambiente (solo surte efecto en los modos ASR-LLM-TTS y LLM+TTS).
  • Limpieza del texto para TTS: elimina o sustituye símbolos como paréntesis o marcas de Markdown del texto de la respuesta antes de leerlo, para evitar que se pronuncien los símbolos.
  • Reconocimiento de imágenes: durante la conversación admite reconocer 1 imagen, de modo que el escenario de voz también pueda procesar información visual.
  • Verificación de la calidad de voz: la plataforma incorpora una verificación que filtra automáticamente los audios demasiado cortos y las frases «alucinadas» de reconocimiento habituales (como «gracias por ver» o «bienvenido, suscríbete», entre otras) para reducir las activaciones erróneas.
  • Acceso telefónico / SIP: se puede vincular un número de Twilio para recibir llamadas, o recibir llamadas transferidas a través de un sistema SIP de terceros, de modo que el Agent atienda las llamadas directamente. Consulta el Manual de integración del sistema telefónico.

Inicio rápido

  1. Crear: entra en Espacio de Desarrollo → Crear Agent y selecciona el tipo «Audio Agent».
  2. Elegir el modo de motor y el modelo: en el panel Motor de voz, situado en la parte superior de la página de configuración, selecciona Modelo en tiempo real / ASR-LLM-TTS / LLM+TTS, y elige el modelo de cada etapa (Audio LLM / ASR / LLM / TTS).
  3. Configurar los parámetros de voz y de llamada: ajusta según sea necesario la interrupción por voz, el corte de frase por pausa, el mensaje de bienvenida, las preguntas de seguimiento ante silencios, el colgado automático, etc.; consulta la Guía de configuración.
  4. Probar la experiencia: inicia una conversación de voz en la ventana de depuración para verificar si el reconocimiento es preciso, si la interrupción es sensible y si el timbre y la velocidad del habla son adecuados.
  5. Integrar y publicar: incorpora el Audio Agent a tu negocio mediante dos métodos:

Facturación y concurrencia

Las llamadas de voz descuentan créditos según el uso de voz (reconocimiento de voz, síntesis de voz y duración de la llamada). Cuando los créditos son insuficientes o se supera el límite de llamadas simultáneas, las nuevas llamadas entrantes son rechazadas. Antes de publicar, confirma que la cuenta dispone de créditos suficientes y de una cuota de concurrencia acorde con el volumen de llamadas previsto. Para las preguntas habituales sobre el acceso telefónico, consulta el apartado de FAQ del Manual de integración del sistema telefónico.