logo
Desarrollo
Buscar
Guía de configuración del Audio Agent

Guía de configuración del Audio Agent

Este documento explica cada parámetro siguiendo el orden de los paneles de arriba abajo en la página de configuración: su función, su rango de valores y valor predeterminado, y los modos de motor a los que se aplica. Además de conservar capacidades generales como conocimiento, base de datos y memoria, el Audio Agent añade cinco grupos de configuración relacionados con la voz: motor de voz, entrada, salida, mensaje de bienvenida y control de la llamada.

Si aún no conoces los conceptos básicos del Audio Agent ni sus tres modos de motor, te recomendamos leer primero el Resumen del Audio Agent.

Motor de voz

En la parte superior del panel Motor de voz se encuentra el selector de modo de motor, que permite alternar entre Modelo en tiempo real (Real-time model), ASR-LLM-TTS y LLM+TTS. Al cambiarlo, los modelos y parámetros que se muestran debajo cambian en consecuencia.

Modelo en tiempo real (REALTIME)

Un único gran modelo de voz en tiempo real completa de extremo a extremo el ciclo «escuchar — pensar — hablar»; la entrada y la salida de audio se cierran dentro del mismo modelo, sin pasar por un reconocimiento y una síntesis de voz independientes, por lo que la latencia es mínima y el tono, el más natural.

Por lo general, recomendamos más el modo Modelo en tiempo real: latencia mínima y tono natural, idóneo para la mayoría de los escenarios de voz en tiempo real. El modelo Live que OpenAI está a punto de lanzar no solo admite voz full-duplex en tiempo real, sino que ante tareas complejas puede invocar en segundo plano un gran modelo de texto de mayor capacidad, y en el futuro se convertirá en la opción preferente para la voz en tiempo real.

loading...
graph LR
  U([Voz del usuario]) --> RT[Gran modelo de voz en tiempo real procesamiento de extremo a extremo]
  RT --> A([Respuesta de voz])

El Modelo en tiempo real integra el reconocimiento, la inferencia y la síntesis en un solo modelo, por lo que los parámetros de configuración son los más reducidos:

Parámetro Obligatorio Descripción
Audio LLM Selecciona el gran modelo en tiempo real que procesa la voz de extremo a extremo; el reconocimiento, la inferencia y la síntesis los realiza este modelo.
Parámetros del modelo No Temperature, Top P, longitud máxima de respuesta, timbre, etc.; iguales a los de un gran modelo normal, controlan la aleatoriedad, la longitud y el timbre de la respuesta.
Prompt de identidad No Define la identidad y el rol del Agent, y se inyecta en la conversación como prompt de sistema; común a los tres modos.

El Modelo en tiempo real no tiene etapas independientes de ASR / TTS, por lo que no ofrece ajustes como instrucciones de transcripción, idioma de voz o limpieza de símbolos de TTS (eliminar / sustituir): estas capacidades ya están internalizadas en el modelo.

ASR-LLM-TTS

Cadena de tres etapas: primero la voz se reconoce como texto, se entrega a un gran modelo de texto para la inferencia y, después, la respuesta se sintetiza en voz. Cada etapa permite elegir su propio modelo, por lo que es el modo con mayor control.

loading...
graph LR
  U([Voz del usuario]) --> ASR[ASR reconocimiento de voz]
  ASR -->|Texto| LLM[Gran modelo de texto inferencia]
  LLM -->|Texto de respuesta| TTS[TTS síntesis de voz]
  TTS --> A([Respuesta de voz])

La configuración etapa por etapa es la siguiente:

Etapa Parámetro Descripción
ASR Modelo de reconocimiento de voz Selecciona el modelo de reconocimiento que transcribe a texto la voz del usuario.
Instrucciones de transcripción Orientan el estilo de reconocimiento, los términos habituales, los nombres propios, etc., y mejoran la precisión del reconocimiento en dominios específicos (como nombres de marca o terminología del sector).
Idioma de voz Especifica el idioma de origen, o selecciona «Reconocimiento automático» para que el modelo lo determine; especificar el idioma suele ser más estable.
LLM Gran modelo de texto Selecciona el gran modelo de texto encargado de la inferencia; puede combinarse con capacidades como conocimiento, base de datos, memoria o herramientas.
Parámetros del modelo Temperature, Top P, longitud máxima de respuesta, etc.; iguales a los de un gran modelo normal.
Prompt de identidad Sirve para definir el rol y las normas de comportamiento del Agent.
TTS Modelo de síntesis de voz Selecciona el modelo y el timbre que sintetizan en voz la respuesta de texto.
Eliminar Introduce los símbolos que se deben eliminar; estos símbolos se borran antes de enviarlos al TTS para evitar que se pronuncien.
Sustituir Introduce los símbolos que se deben sustituir por un espacio antes de enviarlos al TTS, para marcar cortes de frase o eliminar pausas bruscas.

Tanto en Eliminar como en Sustituir, los distintos símbolos se separan con una coma (inglesa); los paréntesis por pares (como () o 《》) se introducen como un único conjunto.

LLM+TTS

Un LLM multimodal compatible con entrada de voz entiende la voz directamente, y prescinde de una etapa de ASR independiente; la respuesta de texto del modelo se entrega después al TTS para sintetizarla en voz.

loading...
graph LR
  U([Voz del usuario]) --> LLM[Gran modelo multimodal entiende la voz directamente]
  LLM -->|Texto de respuesta| TTS[TTS síntesis de voz]
  TTS --> A([Respuesta de voz])

Los parámetros de configuración son LLM (con parámetros del modelo y prompt de identidad) y TTS (con Eliminar y Sustituir), con el mismo significado que en ASR-LLM-TTS.

Entrada

El panel Entrada controla «cómo escucha el Agent»; su núcleo son el VAD (detección de actividad de voz) y el reconocimiento de adjuntos.

Control de VAD

El VAD (detección de actividad de voz) determina cómo juzga el Agent cuándo el usuario ha terminado de hablar y si puede ser interrumpido. Los parámetros ajustables varían según el modo de motor y el modo de reconocimiento, y al cambiarlos el formulario también cambia:

  • Modelo en tiempo real: usa el VAD propio del modelo; en la página de configuración se puede elegir el modo de reconocimiento —modo predefinido o modo semántico—, siendo el modo predefinido el valor por defecto.
  • ASR-LLM-TTS / LLM+TTS: usan el VAD incorporado de la plataforma, cuyo comportamiento equivale al modo predefinido, y no ofrecen cambio de modo de reconocimiento.

Modo predefinido

Corta las frases según la señal de sonido: se basa en un umbral de volumen y en la duración del silencio para determinar si el usuario ha terminado de hablar; su comportamiento es intuitivo y previsible. Se aplica al Modelo en tiempo real (cuando se elige el modo predefinido) y a ASR-LLM-TTS y LLM+TTS.

Parámetro Rango de valores Valor predeterminado Aplicable a Descripción
Activación por volumen 0 ~ 1 (paso 0.1) 0.5 Solo Modelo en tiempo real Umbral de volumen que dispara el reconocimiento; cuanto más alto, menos probable es que el ruido ambiental lo active por error.
Corte de frase por pausa 0 ~ 5000 ms (paso 50) 500 General Cuántos milisegundos de silencio, tras dejar de hablar el usuario, se consideran el final de una frase; cuanto más alto, menos probable es «cortar la palabra».
Interrupción por voz 0 ~ 1 (paso 0.1) 0.5 General Sensibilidad con la que el usuario puede interrumpir (barge-in) mientras el Agent habla; cuanto más alta, más fácil es interrumpir; también se puede desactivar por completo.

Modo semántico

Solo lo admite el Modelo en tiempo real. El modelo juzga si el usuario ha terminado de hablar comprendiendo el significado, sin depender ya de umbrales fijos de volumen y silencio; el corte de frase es más natural, idóneo para conversaciones coloquiales con muchas pausas y un tono relajado.

Parámetro Rango de valores Valor predeterminado Aplicable a Descripción
Velocidad de respuesta Baja / Media / Alta Media General Ritmo de respuesta una vez que se determina que el usuario ha terminado de hablar; cuanto más rápida, más compacta; cuanto más lenta, más pausada.
Interrupción por voz 0 ~ 1 (paso 0.1) 0.5 General Sensibilidad con la que el usuario puede interrumpir (barge-in) mientras el Agent habla; cuanto más alta, más fácil es interrumpir; también se puede desactivar por completo.

Adjuntos

Parámetro Descripción
Reconocimiento de imágenes Interruptor. Una vez activado, permite reconocer imágenes durante la conversación.
Número de adjuntos Fijado en 1.
Tipo de adjunto Solo admite imágenes (Image).

Salida

El panel Salida controla «cómo habla el Agent»; incluye el sonido de fondo y la reproducción en caché.

Sonido de fondo

Superpone un sonido ambiental a la llamada para dar mayor sensación de presencia a la conversación de voz; se recomienda ajustar el volumen en torno a 0.2 para no tapar la voz humana.

Parámetro Valor Descripción
Modo de sonido de fondo Desactivado / Predefinido / Personalizado Selecciona si se activa y su origen.
Opciones predefinidas Oficina / Cafetería / Lluvia / Naturaleza / Ruido blanco Sonidos ambientales incorporados de la plataforma.
Personalizado mp3, ≤ 1 MB Carga un audio de fondo propio; debe usarse un audio sin costuras con inicio y final enlazados.
Volumen de fondo 1~50% Predeterminado 30%

Reproducción en caché

Parámetro Rango de valores Valor predeterminado Descripción
Reproducción en caché 0 ~ 1500 ms (paso 50) 200 Almacena en caché un fragmento de la voz de respuesta antes de empezar a reproducirlo, para reducir los cortes causados por el jitter de red; cuanto mayor es el valor, más fluida es la reproducción, pero la latencia del primer carácter aumenta ligeramente.

Mensaje de bienvenida

Define la presentación de apertura al inicio de la llamada; admite configurar cada idioma por separado.

Parámetro Requisito Descripción
Avatar hablando mp4, ≤ 5 MB Vídeo en bucle del avatar virtual «hablando»; el primer y el último fotograma deben enlazar para que la transición del bucle sea natural.
Avatar en espera mp4, ≤ 5 MB Vídeo en bucle del avatar virtual «escuchando»; igualmente, el primer y el último fotograma deben enlazar.
Mensaje de bienvenida Texto Sirve de saludo de apertura al iniciar la conversación, y el modelo lo lee una vez.

Control de la llamada

El control de la llamada sirve para que esta sea más natural y evitar que quede al ralentí por silencios. Mediante un mecanismo de colgado se impide una ocupación indefinida, lo que ahorra recursos y costes.

Control de silencios

Cuando se alcanza el umbral de silencio, se realiza automáticamente una pregunta de seguimiento o se reproduce un aviso para devolver al usuario a la conversación.

Parámetro Rango de valores Valor predeterminado Descripción
Tiempo de espera por silencio 5 ~ 60 segundos (paso 1) 10 Cuánto tiempo de silencio del usuario dispara la pregunta de seguimiento por silencio.
Aviso de silencio Texto Texto de la pregunta de seguimiento / aviso que se reproduce o se entrega al modelo cuando se dispara.

Colgar la llamada

Se dispara el colgado al cumplirse cualquiera de estas condiciones: la duración máxima de la llamada o el número máximo de silencios.

Parámetro Rango de valores Valor predeterminado Descripción
Duración máxima de la llamada 30 ~ 3600 segundos (paso 30) 600 Duración máxima de una sola llamada; al superarse, finaliza automáticamente.
Número máximo de silencios 1 ~ 100 (paso 1) 5 Se cuelga automáticamente cuando los silencios consecutivos acumulados alcanzan este número.
Aviso de colgado Texto, ≤ 20 tokens Texto que se comunica al usuario antes de colgar.
*Finalizar la llamada por iniciativa propia Interruptor Disponible próximamente; una vez activado, permite que el AI Agent finalice la llamada por iniciativa propia durante la conversación, lo que dispara el aviso de colgado.

Paneles de capacidades compartidas

El Audio Agent también admite capacidades generales de Agent como conocimiento, base de datos y memoria, que se configuran igual que en un Agent normal; puedes consultar la documentación correspondiente. Conviene tener en cuenta:

  • El panel Atención humana aparece por ahora como «Disponible próximamente» en el Audio Agent.
  • Los paneles como Herramientas y Workflow no se muestran en el Audio Agent.

Comparativa de parámetros por modo

En los distintos modos de motor, los elementos que muestra la página de configuración presentan ligeras diferencias; consulta la tabla siguiente:

Parámetro Modelo en tiempo real ASR-LLM-TTS LLM+TTS
Audio LLM
ASR (con instrucciones de transcripción / idioma de voz)
LLM (gran modelo de texto)
TTS (con Eliminar / Sustituir)
Prompt de identidad
Modo de reconocimiento (predefinido / semántico)
Activación por volumen ✓ (predefinido)
Corte de frase por pausa ✓ (predefinido)
Velocidad de respuesta ✓ (semántico)
Interrupción por voz
Reconocimiento de imágenes
Sonido de fondo
Reproducción en caché
Mensaje de bienvenida
Control de la llamada

Para saber cómo ajustar los parámetros de forma más acorde con tu negocio, continúa leyendo las Mejores prácticas.