Guía de configuración del Audio Agent
Este documento explica cada parámetro siguiendo el orden de los paneles de arriba abajo en la página de configuración: su función, su rango de valores y valor predeterminado, y los modos de motor a los que se aplica. Además de conservar capacidades generales como conocimiento, base de datos y memoria, el Audio Agent añade cinco grupos de configuración relacionados con la voz: motor de voz, entrada, salida, mensaje de bienvenida y control de la llamada.
Si aún no conoces los conceptos básicos del Audio Agent ni sus tres modos de motor, te recomendamos leer primero el Resumen del Audio Agent.
Motor de voz
En la parte superior del panel Motor de voz se encuentra el selector de modo de motor, que permite alternar entre Modelo en tiempo real (Real-time model), ASR-LLM-TTS y LLM+TTS. Al cambiarlo, los modelos y parámetros que se muestran debajo cambian en consecuencia.
Modelo en tiempo real (REALTIME)
Un único gran modelo de voz en tiempo real completa de extremo a extremo el ciclo «escuchar — pensar — hablar»; la entrada y la salida de audio se cierran dentro del mismo modelo, sin pasar por un reconocimiento y una síntesis de voz independientes, por lo que la latencia es mínima y el tono, el más natural.
Por lo general, recomendamos más el modo Modelo en tiempo real: latencia mínima y tono natural, idóneo para la mayoría de los escenarios de voz en tiempo real. El modelo Live que OpenAI está a punto de lanzar no solo admite voz full-duplex en tiempo real, sino que ante tareas complejas puede invocar en segundo plano un gran modelo de texto de mayor capacidad, y en el futuro se convertirá en la opción preferente para la voz en tiempo real.
graph LR U([Voz del usuario]) --> RT[Gran modelo de voz en tiempo real procesamiento de extremo a extremo] RT --> A([Respuesta de voz])
El Modelo en tiempo real integra el reconocimiento, la inferencia y la síntesis en un solo modelo, por lo que los parámetros de configuración son los más reducidos:
| Parámetro | Obligatorio | Descripción |
|---|---|---|
| Audio LLM | Sí | Selecciona el gran modelo en tiempo real que procesa la voz de extremo a extremo; el reconocimiento, la inferencia y la síntesis los realiza este modelo. |
| Parámetros del modelo | No | Temperature, Top P, longitud máxima de respuesta, timbre, etc.; iguales a los de un gran modelo normal, controlan la aleatoriedad, la longitud y el timbre de la respuesta. |
| Prompt de identidad | No | Define la identidad y el rol del Agent, y se inyecta en la conversación como prompt de sistema; común a los tres modos. |
El Modelo en tiempo real no tiene etapas independientes de ASR / TTS, por lo que no ofrece ajustes como instrucciones de transcripción, idioma de voz o limpieza de símbolos de TTS (eliminar / sustituir): estas capacidades ya están internalizadas en el modelo.
ASR-LLM-TTS
Cadena de tres etapas: primero la voz se reconoce como texto, se entrega a un gran modelo de texto para la inferencia y, después, la respuesta se sintetiza en voz. Cada etapa permite elegir su propio modelo, por lo que es el modo con mayor control.
graph LR U([Voz del usuario]) --> ASR[ASR reconocimiento de voz] ASR -->|Texto| LLM[Gran modelo de texto inferencia] LLM -->|Texto de respuesta| TTS[TTS síntesis de voz] TTS --> A([Respuesta de voz])
La configuración etapa por etapa es la siguiente:
| Etapa | Parámetro | Descripción |
|---|---|---|
| ASR | Modelo de reconocimiento de voz | Selecciona el modelo de reconocimiento que transcribe a texto la voz del usuario. |
| Instrucciones de transcripción | Orientan el estilo de reconocimiento, los términos habituales, los nombres propios, etc., y mejoran la precisión del reconocimiento en dominios específicos (como nombres de marca o terminología del sector). | |
| Idioma de voz | Especifica el idioma de origen, o selecciona «Reconocimiento automático» para que el modelo lo determine; especificar el idioma suele ser más estable. | |
| LLM | Gran modelo de texto | Selecciona el gran modelo de texto encargado de la inferencia; puede combinarse con capacidades como conocimiento, base de datos, memoria o herramientas. |
| Parámetros del modelo | Temperature, Top P, longitud máxima de respuesta, etc.; iguales a los de un gran modelo normal. | |
| Prompt de identidad | Sirve para definir el rol y las normas de comportamiento del Agent. | |
| TTS | Modelo de síntesis de voz | Selecciona el modelo y el timbre que sintetizan en voz la respuesta de texto. |
| Eliminar | Introduce los símbolos que se deben eliminar; estos símbolos se borran antes de enviarlos al TTS para evitar que se pronuncien. | |
| Sustituir | Introduce los símbolos que se deben sustituir por un espacio antes de enviarlos al TTS, para marcar cortes de frase o eliminar pausas bruscas. |
Tanto en Eliminar como en Sustituir, los distintos símbolos se separan con una coma (inglesa); los paréntesis por pares (como
()o《》) se introducen como un único conjunto.
LLM+TTS
Un LLM multimodal compatible con entrada de voz entiende la voz directamente, y prescinde de una etapa de ASR independiente; la respuesta de texto del modelo se entrega después al TTS para sintetizarla en voz.
graph LR U([Voz del usuario]) --> LLM[Gran modelo multimodal entiende la voz directamente] LLM -->|Texto de respuesta| TTS[TTS síntesis de voz] TTS --> A([Respuesta de voz])
Los parámetros de configuración son LLM (con parámetros del modelo y prompt de identidad) y TTS (con Eliminar y Sustituir), con el mismo significado que en ASR-LLM-TTS.
Entrada
El panel Entrada controla «cómo escucha el Agent»; su núcleo son el VAD (detección de actividad de voz) y el reconocimiento de adjuntos.
Control de VAD
El VAD (detección de actividad de voz) determina cómo juzga el Agent cuándo el usuario ha terminado de hablar y si puede ser interrumpido. Los parámetros ajustables varían según el modo de motor y el modo de reconocimiento, y al cambiarlos el formulario también cambia:
- Modelo en tiempo real: usa el VAD propio del modelo; en la página de configuración se puede elegir el modo de reconocimiento —modo predefinido o modo semántico—, siendo el modo predefinido el valor por defecto.
- ASR-LLM-TTS / LLM+TTS: usan el VAD incorporado de la plataforma, cuyo comportamiento equivale al modo predefinido, y no ofrecen cambio de modo de reconocimiento.
Modo predefinido
Corta las frases según la señal de sonido: se basa en un umbral de volumen y en la duración del silencio para determinar si el usuario ha terminado de hablar; su comportamiento es intuitivo y previsible. Se aplica al Modelo en tiempo real (cuando se elige el modo predefinido) y a ASR-LLM-TTS y LLM+TTS.
| Parámetro | Rango de valores | Valor predeterminado | Aplicable a | Descripción |
|---|---|---|---|---|
| Activación por volumen | 0 ~ 1 (paso 0.1) | 0.5 | Solo Modelo en tiempo real | Umbral de volumen que dispara el reconocimiento; cuanto más alto, menos probable es que el ruido ambiental lo active por error. |
| Corte de frase por pausa | 0 ~ 5000 ms (paso 50) | 500 | General | Cuántos milisegundos de silencio, tras dejar de hablar el usuario, se consideran el final de una frase; cuanto más alto, menos probable es «cortar la palabra». |
| Interrupción por voz | 0 ~ 1 (paso 0.1) | 0.5 | General | Sensibilidad con la que el usuario puede interrumpir (barge-in) mientras el Agent habla; cuanto más alta, más fácil es interrumpir; también se puede desactivar por completo. |
Modo semántico
Solo lo admite el Modelo en tiempo real. El modelo juzga si el usuario ha terminado de hablar comprendiendo el significado, sin depender ya de umbrales fijos de volumen y silencio; el corte de frase es más natural, idóneo para conversaciones coloquiales con muchas pausas y un tono relajado.
| Parámetro | Rango de valores | Valor predeterminado | Aplicable a | Descripción |
|---|---|---|---|---|
| Velocidad de respuesta | Baja / Media / Alta | Media | General | Ritmo de respuesta una vez que se determina que el usuario ha terminado de hablar; cuanto más rápida, más compacta; cuanto más lenta, más pausada. |
| Interrupción por voz | 0 ~ 1 (paso 0.1) | 0.5 | General | Sensibilidad con la que el usuario puede interrumpir (barge-in) mientras el Agent habla; cuanto más alta, más fácil es interrumpir; también se puede desactivar por completo. |
Adjuntos
| Parámetro | Descripción |
|---|---|
| Reconocimiento de imágenes | Interruptor. Una vez activado, permite reconocer imágenes durante la conversación. |
| Número de adjuntos | Fijado en 1. |
| Tipo de adjunto | Solo admite imágenes (Image). |
Salida
El panel Salida controla «cómo habla el Agent»; incluye el sonido de fondo y la reproducción en caché.
Sonido de fondo
Superpone un sonido ambiental a la llamada para dar mayor sensación de presencia a la conversación de voz; se recomienda ajustar el volumen en torno a 0.2 para no tapar la voz humana.
| Parámetro | Valor | Descripción |
|---|---|---|
| Modo de sonido de fondo | Desactivado / Predefinido / Personalizado | Selecciona si se activa y su origen. |
| Opciones predefinidas | Oficina / Cafetería / Lluvia / Naturaleza / Ruido blanco | Sonidos ambientales incorporados de la plataforma. |
| Personalizado | mp3, ≤ 1 MB | Carga un audio de fondo propio; debe usarse un audio sin costuras con inicio y final enlazados. |
| Volumen de fondo | 1~50% | Predeterminado 30% |
Reproducción en caché
| Parámetro | Rango de valores | Valor predeterminado | Descripción |
|---|---|---|---|
| Reproducción en caché | 0 ~ 1500 ms (paso 50) | 200 | Almacena en caché un fragmento de la voz de respuesta antes de empezar a reproducirlo, para reducir los cortes causados por el jitter de red; cuanto mayor es el valor, más fluida es la reproducción, pero la latencia del primer carácter aumenta ligeramente. |
Mensaje de bienvenida
Define la presentación de apertura al inicio de la llamada; admite configurar cada idioma por separado.
| Parámetro | Requisito | Descripción |
|---|---|---|
| Avatar hablando | mp4, ≤ 5 MB | Vídeo en bucle del avatar virtual «hablando»; el primer y el último fotograma deben enlazar para que la transición del bucle sea natural. |
| Avatar en espera | mp4, ≤ 5 MB | Vídeo en bucle del avatar virtual «escuchando»; igualmente, el primer y el último fotograma deben enlazar. |
| Mensaje de bienvenida | Texto | Sirve de saludo de apertura al iniciar la conversación, y el modelo lo lee una vez. |
Control de la llamada
El control de la llamada sirve para que esta sea más natural y evitar que quede al ralentí por silencios. Mediante un mecanismo de colgado se impide una ocupación indefinida, lo que ahorra recursos y costes.
Control de silencios
Cuando se alcanza el umbral de silencio, se realiza automáticamente una pregunta de seguimiento o se reproduce un aviso para devolver al usuario a la conversación.
| Parámetro | Rango de valores | Valor predeterminado | Descripción |
|---|---|---|---|
| Tiempo de espera por silencio | 5 ~ 60 segundos (paso 1) | 10 | Cuánto tiempo de silencio del usuario dispara la pregunta de seguimiento por silencio. |
| Aviso de silencio | Texto | — | Texto de la pregunta de seguimiento / aviso que se reproduce o se entrega al modelo cuando se dispara. |
Colgar la llamada
Se dispara el colgado al cumplirse cualquiera de estas condiciones: la duración máxima de la llamada o el número máximo de silencios.
| Parámetro | Rango de valores | Valor predeterminado | Descripción |
|---|---|---|---|
| Duración máxima de la llamada | 30 ~ 3600 segundos (paso 30) | 600 | Duración máxima de una sola llamada; al superarse, finaliza automáticamente. |
| Número máximo de silencios | 1 ~ 100 (paso 1) | 5 | Se cuelga automáticamente cuando los silencios consecutivos acumulados alcanzan este número. |
| Aviso de colgado | Texto, ≤ 20 tokens | — | Texto que se comunica al usuario antes de colgar. |
| *Finalizar la llamada por iniciativa propia | Interruptor | — | Disponible próximamente; una vez activado, permite que el AI Agent finalice la llamada por iniciativa propia durante la conversación, lo que dispara el aviso de colgado. |
Paneles de capacidades compartidas
El Audio Agent también admite capacidades generales de Agent como conocimiento, base de datos y memoria, que se configuran igual que en un Agent normal; puedes consultar la documentación correspondiente. Conviene tener en cuenta:
- El panel Atención humana aparece por ahora como «Disponible próximamente» en el Audio Agent.
- Los paneles como Herramientas y Workflow no se muestran en el Audio Agent.
Comparativa de parámetros por modo
En los distintos modos de motor, los elementos que muestra la página de configuración presentan ligeras diferencias; consulta la tabla siguiente:
| Parámetro | Modelo en tiempo real | ASR-LLM-TTS | LLM+TTS |
|---|---|---|---|
| Audio LLM | ✓ | — | — |
| ASR (con instrucciones de transcripción / idioma de voz) | — | ✓ | — |
| LLM (gran modelo de texto) | — | ✓ | ✓ |
| TTS (con Eliminar / Sustituir) | — | ✓ | ✓ |
| Prompt de identidad | ✓ | ✓ | ✓ |
| Modo de reconocimiento (predefinido / semántico) | ✓ | — | — |
| Activación por volumen | ✓ (predefinido) | — | — |
| Corte de frase por pausa | ✓ (predefinido) | ✓ | ✓ |
| Velocidad de respuesta | ✓ (semántico) | — | — |
| Interrupción por voz | ✓ | ✓ | ✓ |
| Reconocimiento de imágenes | ✓ | ✓ | ✓ |
| Sonido de fondo | — | ✓ | ✓ |
| Reproducción en caché | ✓ | ✓ | ✓ |
| Mensaje de bienvenida | ✓ | ✓ | ✓ |
| Control de la llamada | ✓ | ✓ | ✓ |
Para saber cómo ajustar los parámetros de forma más acorde con tu negocio, continúa leyendo las Mejores prácticas.
