logo
Développement
Rechercher
Guide de configuration de l'Agent vocal

Guide de configuration de l'Agent vocal

Ce document explique chaque paramètre en suivant l'ordre des panneaux, de haut en bas, sur la page de configuration : son rôle, sa plage de valeurs et sa valeur par défaut, ainsi que les modes de moteur concernés. Tout en conservant les capacités communes (connaissances, base de données, mémoire, etc.), l'Agent vocal ajoute cinq groupes de configurations liées à la voix : moteur vocal, entrée, sortie, accueil et amorce, contrôle des appels.

Si vous ne connaissez pas encore les concepts de base de l'Agent vocal ni ses trois modes de moteur, il est recommandé de lire d'abord l'Aperçu de l'Agent vocal.

Moteur vocal

En haut du panneau Moteur vocal se trouve le sélecteur de mode de moteur, qui permet de basculer entre Real-time model, ASR-LLM-TTS et LLM+TTS. Après le changement, les modèles et paramètres affichés en dessous s'adaptent en conséquence.

Real-time model (REALTIME)

Un seul grand modèle vocal en temps réel réalise de bout en bout « écouter — penser — parler » : l'entrée et la sortie audio sont bouclées au sein du même modèle, sans passer par une reconnaissance et une synthèse vocales indépendantes, d'où la latence la plus faible et l'intonation la plus naturelle.

En règle générale, nous recommandons davantage le mode Real-time model : latence la plus faible, intonation naturelle, adapté à la plupart des scénarios de voix en temps réel. Le modèle Live que s'apprête à publier OpenAI prend non seulement en charge la voix en temps réel full-duplex, mais peut aussi, face à des tâches complexes, faire appel en arrière-plan à un grand modèle textuel plus puissant ; il deviendra à l'avenir la solution privilégiée pour la voix en temps réel.

loading...
graph LR
  U([Voix de l'utilisateur]) --> RT[Grand modèle vocal temps réel traitement de bout en bout]
  RT --> A([Réponse vocale])

Le Real-time model regroupe reconnaissance, inférence et synthèse dans un seul modèle, d'où des options de configuration très épurées :

Option de configuration Obligatoire Description
Audio LLM Oui Choisir le grand modèle temps réel qui traite la voix de bout en bout ; reconnaissance, inférence et synthèse sont toutes assurées par lui.
Paramètres du modèle Non Temperature, Top P, longueur de réponse maximale, voix, etc., identiques aux paramètres d'un grand modèle classique ; contrôlent l'aléa, la longueur et la voix de la réponse.
Invite d'identité Non Définit l'identité et le rôle de l'Agent, injectée dans la conversation comme invite système ; commune aux trois modes.

Le Real-time model n'a pas d'étape ASR / TTS indépendante ; il ne propose donc pas d'instruction de transcription, de langue vocale, de nettoyage des symboles TTS (suppression / remplacement), etc. — ces capacités sont internalisées dans le modèle.

ASR-LLM-TTS

Chaîne en trois étapes : la voix est d'abord reconnue en texte, confiée à un grand modèle textuel pour inférence, puis la réponse est synthétisée en voix. Un modèle peut être choisi pour chacune des trois étapes ; c'est le mode offrant le plus haut niveau de contrôle.

loading...
graph LR
  U([Voix de l'utilisateur]) --> ASR[ASR reconnaissance vocale]
  ASR -->|texte| LLM[Grand modèle textuel inférence]
  LLM -->|texte de réponse| TTS[TTS synthèse vocale]
  TTS --> A([Réponse vocale])

Configuration étape par étape :

Étape Option de configuration Description
ASR Modèle de reconnaissance vocale Choisir le modèle de reconnaissance qui transcrit la voix de l'utilisateur en texte.
Instruction de transcription Oriente le style de reconnaissance, les termes courants, les noms propres, etc., pour améliorer la précision dans des domaines spécifiques (noms de marque, terminologie sectorielle).
Langue vocale Spécifie la langue source, ou choisit « détection automatique » pour laisser le modèle décider ; spécifier la langue est généralement plus stable.
LLM Grand modèle textuel Choisir le grand modèle textuel chargé de l'inférence, associable aux connaissances, base de données, mémoire, outils, etc.
Paramètres du modèle Temperature, Top P, longueur de réponse maximale, etc., identiques à un grand modèle classique.
Invite d'identité Sert à définir le rôle et les règles de comportement de l'Agent.
TTS Modèle de synthèse vocale Choisir le modèle et la voix qui synthétisent la réponse textuelle en voix.
Suppression Saisir les symboles à supprimer ; ils sont retirés avant transmission au TTS pour éviter d'être prononcés.
Remplacement Saisir les symboles à remplacer par un espace ; le remplacement s'effectue avant transmission au TTS, pour le découpage des phrases ou pour éliminer les pauses abruptes.

Suppression et remplacement acceptent plusieurs symboles séparés par une virgule anglaise ; les parenthèses appariées (comme (), 《》) se saisissent comme un tout.

LLM+TTS

Un LLM multimodal prenant en charge l'entrée vocale comprend directement la voix, supprimant l'étape ASR indépendante ; la réponse textuelle du modèle est ensuite confiée au TTS pour synthèse vocale.

loading...
graph LR
  U([Voix de l'utilisateur]) --> LLM[Grand modèle multimodal compréhension directe de la voix]
  LLM -->|texte de réponse| TTS[TTS synthèse vocale]
  TTS --> A([Réponse vocale])

Les options de configuration sont LLM (avec paramètres du modèle et invite d'identité) et TTS (avec suppression et remplacement), au même sens que dans ASR-LLM-TTS.

Entrée

Le panneau Entrée contrôle « comment l'Agent écoute » ; il repose sur le VAD (détection d'activité vocale) et la reconnaissance des pièces jointes.

Contrôle VAD

Le VAD (détection d'activité vocale) détermine comment l'Agent juge quand l'utilisateur a fini de parler et s'il peut être interrompu. Les paramètres réglables varient selon le mode de moteur et le mode de reconnaissance ; le formulaire change après un basculement :

  • Real-time model : utilise le VAD intégré au modèle ; on peut choisir dans la page de configuration le mode de reconnaissance — mode prédéfini ou mode sémantique, par défaut mode prédéfini.
  • ASR-LLM-TTS / LLM+TTS : utilise le VAD intégré à la plateforme, au comportement équivalent au mode prédéfini, sans possibilité de changer de mode de reconnaissance.

Mode prédéfini

Découpe les phrases d'après le signal sonore : il s'appuie sur un seuil de volume et une durée de silence pour déterminer si l'utilisateur a fini de parler ; comportement intuitif et prévisible. Adapté au Real-time model (lorsque le mode prédéfini est choisi) ainsi qu'à ASR-LLM-TTS et LLM+TTS.

Option de configuration Plage de valeurs Valeur par défaut Applicable Description
Activation par le volume 0 ~ 1 (pas de 0,1) 0,5 Real-time model uniquement Seuil de volume déclenchant la reconnaissance ; plus il est élevé, moins il est activé par erreur par le bruit ambiant.
Découpage des pauses 0 ~ 5000 ms (pas de 50) 500 Commun Durée de silence (en ms) après l'arrêt de parole de l'utilisateur pour juger qu'une phrase est terminée ; plus elle est grande, moins l'Agent « coupe la parole ».
Interruption vocale 0 ~ 1 (pas de 0,1) 0,5 Commun Sensibilité de l'interruption (barge-in) lorsque l'utilisateur prend la parole pendant que l'Agent parle ; plus elle est élevée, plus il est facile d'interrompre ; peut aussi être entièrement désactivée.

Mode sémantique

Pris en charge uniquement par le Real-time model. Le modèle comprend le sens pour juger si l'utilisateur a fini de parler, sans plus dépendre de seuils fixes de volume et de silence ; le découpage est plus naturel, adapté aux conversations orales avec beaucoup de pauses et un ton relâché.

Option de configuration Plage de valeurs Valeur par défaut Applicable Description
Vitesse de réponse Basse / Moyenne / Haute Moyenne Commun Rythme de réponse après avoir jugé que l'utilisateur a fini de parler ; plus rapide, plus serré ; plus lent, plus posé.
Interruption vocale 0 ~ 1 (pas de 0,1) 0,5 Commun Sensibilité de l'interruption (barge-in) lorsque l'utilisateur prend la parole pendant que l'Agent parle ; plus elle est élevée, plus il est facile d'interrompre ; peut aussi être entièrement désactivée.

Pièces jointes

Option de configuration Description
Reconnaissance d'image Interrupteur. Une fois activé, la reconnaissance d'image est possible dans la conversation.
Nombre de pièces jointes Fixé à 1.
Type de pièce jointe Image uniquement (Image).

Sortie

Le panneau Sortie contrôle « comment l'Agent parle » ; il comprend le son d'ambiance et la lecture avec mise en cache.

Son d'ambiance

Ajoute un son d'ambiance à l'appel pour rendre la conversation vocale plus immersive ; il est recommandé de régler le volume autour de 0,2 pour éviter de couvrir la voix.

Option de configuration Valeur Description
Mode du son d'ambiance Désactivé / Préréglé / Personnalisé Choisir s'il est activé et sa source.
Options préréglées Bureau / Café / Pluie / Nature / Bruit blanc Sons d'ambiance intégrés à la plateforme.
Personnalisé mp3, ≤ 1 MB Téléverser son propre audio d'ambiance ; utiliser un audio en boucle sans coupure (début et fin raccordés).
Volume d'ambiance 1~50 % Par défaut 30 %

Lecture avec mise en cache

Option de configuration Plage de valeurs Valeur par défaut Description
Lecture avec mise en cache 0 ~ 1500 ms (pas de 50) 200 Met d'abord en cache un segment de la réponse vocale avant de commencer la lecture, réduisant les saccades dues à la gigue réseau ; plus la valeur est élevée, plus la lecture est fluide, mais la latence du premier mot augmente légèrement.

Accueil et amorce

Définit la mise en scène d'ouverture au début de l'appel ; la configuration par langue est prise en charge.

Option de configuration Exigence Description
Avatar en parole mp4, ≤ 5 MB Vidéo en boucle de l'avatar virtuel « en train de parler » ; les images de début et de fin doivent être raccordées pour une transition de boucle naturelle.
Avatar en attente mp4, ≤ 5 MB Vidéo en boucle de l'avatar virtuel « en train d'écouter » ; images de début et de fin également raccordées.
Message d'accueil Texte Sert d'introduction à l'ouverture de la conversation, lu une fois par le modèle.

Contrôle des appels

Le contrôle des appels sert à rendre l'appel plus naturel et à éviter qu'il tourne à vide en cas de silence. Grâce à un mécanisme de raccrochage, il empêche l'occupation indéfinie de la ligne, économisant des ressources et des coûts.

Contrôle du silence

Lorsque le seuil de silence est atteint, une relance ou une invite est déclenchée automatiquement pour ramener l'utilisateur dans la conversation.

Option de configuration Plage de valeurs Valeur par défaut Description
Délai de silence 5 ~ 60 secondes (pas de 1) 10 Durée de silence de l'utilisateur avant de déclencher une relance.
Invite de silence Texte Texte de relance / d'invite diffusé ou transmis au modèle lors du déclenchement.

Raccrocher l'appel

Le raccrochage est déclenché dès que l'une des conditions durée d'appel maximale ou nombre maximal de silences est remplie.

Option de configuration Plage de valeurs Valeur par défaut Description
Durée d'appel maximale 30 ~ 3600 secondes (pas de 30) 600 Durée maximale d'un appel ; au-delà, il se termine automatiquement.
Nombre maximal de silences 1 ~ 100 (pas de 1) 5 Une fois ce nombre de silences consécutifs cumulés atteint, l'appel raccroche automatiquement.
Invite de raccrochage Texte, ≤ 20 tokens Texte d'invite informant l'utilisateur avant le raccrochage.
*Terminer l'appel de manière proactive Interrupteur Bientôt disponible ; une fois activé, l'AI Agent peut mettre fin à l'appel de sa propre initiative pendant la conversation, déclenchant l'invite de raccrochage.

Panneaux de capacités partagées

L'Agent vocal prend également en charge les capacités communes d'un Agent — connaissances, base de données, mémoire, etc. — configurées de la même manière qu'un Agent classique ; reportez-vous à la documentation relative aux Agents. À noter :

  • Le panneau Service humain affiche pour l'instant « Bientôt disponible » dans l'Agent vocal.
  • Les panneaux Outils, Workflow, etc. ne sont pas affichés dans l'Agent vocal.

Comparaison des options de configuration par mode

Les éléments affichés sur la page de configuration diffèrent légèrement selon le mode de moteur ; voir le tableau ci-dessous :

Option de configuration Real-time model ASR-LLM-TTS LLM+TTS
Audio LLM
ASR (avec instruction de transcription / langue vocale)
LLM (grand modèle textuel)
TTS (avec suppression / remplacement)
Invite d'identité
Mode de reconnaissance (prédéfini / sémantique)
Activation par le volume ✓ (prédéfini)
Découpage des pauses ✓ (prédéfini)
Vitesse de réponse ✓ (sémantique)
Interruption vocale
Reconnaissance d'image
Son d'ambiance
Lecture avec mise en cache
Accueil et amorce
Contrôle des appels

Pour savoir comment régler les paramètres au plus près de votre activité, poursuivez avec les Meilleures pratiques.