Meilleures pratiques de l'Agent vocal
Ce document rassemble les pratiques courantes pour le choix, le réglage et la mise en ligne de l'Agent vocal, afin de vous aider à obtenir plus vite un Agent vocal qui « entend clairement, répond juste et parle naturellement ». Le sens et la plage de valeurs de chaque paramètre figurent dans le Guide de configuration.
Comment choisir le mode de moteur
Positionnez d'abord le mode selon vos besoins, puis choisissez les modèles :
- Recherche de la latence minimale, ton oral naturel → Real-time model (REALTIME) : latence la plus faible, adapté aux scénarios sensibles à la réactivité et au discours relativement ouvert, comme la conversation informelle, l'entraînement ou la navigation vocale.
- Besoin d'une forte capacité textuelle, d'appels d'outils, d'un discours strict → ASR-LLM-TTS : latence la plus élevée, contrôle le plus poussé du grand modèle textuel, intégration stable de la base de connaissances, de la base de données et des outils, adapté au service client vocal, aux démarches métier, etc. ; la voix est déterminée par un TTS indépendant, ce qui facilite l'unification de la voix de marque.
- Le modèle prend nativement en charge l'entrée vocale, on veut simplifier la chaîne → LLM+TTS : latence moyenne, suppression d'une étape ASR indépendante, le grand modèle « comprend » directement la voix, chaîne plus courte.
Réglage du VAD et de l'interruption
Le VAD détermine « quand l'Agent considère que vous avez fini de parler », ce qui influe directement sur l'expérience. Arbitrez selon le scénario :
- Service client vocal / hotline (rapide, interruptible) : augmentez raisonnablement la sensibilité de l'interruption vocale pour que l'utilisateur puisse intervenir à tout moment ; le découpage des pauses peut être légèrement réduit pour raccourcir l'attente. En contrepartie, l'interruption intempestive est plus fréquente en environnement bruyant.
- Questions-réponses approfondies / lecture à voix haute (stable, peu d'interruptions intempestives) : réduisez la sensibilité de l'interruption vocale et augmentez raisonnablement le découpage des pauses, pour éviter de couper la parole lorsque l'utilisateur marque une pause de réflexion.
- Environnement bruyant : en mode prédéfini du Real-time model, augmentez le seuil d'activation par le volume pour réduire les déclenchements intempestifs dus au bruit de fond.
- Mode prédéfini vs mode sémantique (Real-time model uniquement) : pour un découpage stable et prévisible, utilisez le mode prédéfini ; pour que l'Agent juge d'après le sens si l'utilisateur a fini de parler, utilisez le mode sémantique et affinez le rythme avec la vitesse de réponse.
Il est conseillé de commencer par les valeurs par défaut (découpage des pauses 500 ms, interruption vocale 0,5), puis d'affiner cran par cran sur des enregistrements réels, en ne modifiant qu'un seul paramètre à la fois.
Rédaction de l'invite d'identité
Dans un scénario vocal, l'utilisateur « écoute » au lieu de « lire » ; l'invite doit être concise et orale :
- Clarifiez le rôle et les limites : qui est-ce, ce qu'il peut faire, ce qu'il n'aborde pas.
- Exigez des réponses en phrases courtes, en évitant les longs paragraphes, les puces, les tableaux et autres structures qui se prêtent mal à la lecture.
- Prévoyez une expression orale : les nombres, montants et heures sont énoncés autant que possible de manière naturelle et orale, en réduisant les termes rigides.
- Précisez la langue et le ton : par exemple « répondre en français, de façon polie et concise ».
Nettoyage du texte TTS
La réponse textuelle du grand modèle contient souvent des symboles qui, synthétisés tels quels, seraient « prononcés ». Nettoyez à l'aide des deux options suppression et remplacement :
- Suppression : parenthèses
(), crochets[], guillemets de titre《》, astérisque*, dièse#et autres symboles Markdown et de mise en page, pour éviter de prononcer « astérisque » ou « dièse ». - Remplacement par un espace : pour les symboles nécessitant une pause mais qui ne doivent pas être prononcés, améliorant le naturel du découpage.
- Les parenthèses appariées se saisissent comme un tout (comme
()), plusieurs symboles étant séparés par une virgule anglaise.
En complément, demandez au modèle dans l'invite d'identité de « ne pas produire de Markdown » : les deux approches combinées donnent un meilleur résultat.
Accueil, amorce et avatar virtuel
- Le message d'accueil doit être court et aller droit au but : une phrase indiquant l'identité et l'usage, par exemple « Bonjour, vous êtes au service client de XX, en quoi puis-je vous aider ? »
- Les vidéos d'avatar en parole / en attente doivent impérativement avoir leurs images de début et de fin raccordées, sans quoi des sauts d'image visibles apparaîtront à chaque boucle. L'avatar en parole correspond à « en train de parler », l'avatar en attente à « en train d'écouter ».
- Pour une activité multilingue, pensez à configurer le message d'accueil et l'avatar séparément pour chaque langue.
Stratégie de contrôle des appels
Prévoyez un « filet de sécurité » pour chaque conversation, afin d'éviter les appels à vide et l'occupation des ressources :
- Contrôle du silence : définissez un délai de silence raisonnable (par défaut 10 secondes) et associez-lui une invite de silence naturelle, comme « Vous êtes toujours là ? Souhaitez-vous que je continue ? » pour ramener l'utilisateur.
- Raccrochage automatique : servez-vous de la durée d'appel maximale (par défaut 600 secondes) et du nombre maximal de silences (par défaut 5) comme filet de sécurité, pour empêcher les appels sans fin ou les lignes occupées longtemps sans réponse. L'invite de raccrochage est limitée à 20 tokens ; un bref message d'au revoir suffit.
Précautions d'usage du son d'ambiance
- Le volume d'ambiance ne doit pas couvrir la voix (par défaut 30, plage 1~50) ; un volume trop élevé réduit la précision de reconnaissance et la clarté de l'appel.
- Le son d'ambiance personnalisé doit être en mp3 et ≤ 1 MB.
Qualité de la reconnaissance vocale
- Pour un domaine spécifique, tirez parti de l'instruction de transcription ASR pour signaler les noms propres, les noms de marque et la terminologie sectorielle, ce qui améliore nettement la précision de reconnaissance.
- Lorsque la langue de l'utilisateur est fixe, spécifiez la langue vocale plutôt que « détection automatique », pour une meilleure stabilité.
- La plateforme intègre une validation de la qualité vocale : elle écarte automatiquement les audios trop courts (moins d'1 seconde) et filtre les expressions « hallucinées » de reconnaissance courantes (comme « merci d'avoir regardé », « pensez à vous abonner » et autres résultats dénués de sens), réduisant les déclenchements intempestifs. Que ces résultats soient ignorés est normal et ne nécessite aucune configuration supplémentaire.
Mise en ligne et intégration
- Intégration web : intégrez l'Agent vocal comme composant de conversation vocale à un site web, voir l'intégration Iframe.
- Accès téléphonique : associez un numéro Twilio pour les appels entrants, ou transférez les appels entrants via un système SIP tiers, voir le Manuel d'intégration du système téléphonique.
Facturation et concurrence
- L'appel vocal déduit des crédits selon l'usage vocal ; l'épuisement des crédits entraîne le rejet des appels entrants, prévoyez donc une marge.
- Surveillez la limite d'appels simultanés : tout nouvel appel entrant dépassant cette limite est rejeté. Avant la mise en ligne, évaluez vos besoins de concurrence selon le volume d'appels attendu.
- Les enregistrements d'appels sont consultables dans les journaux / enregistrements de conversation ; ils incluent la source de la session, le numéro de l'appelant, les échanges multi-tours et la chronologie d'exécution, facilitant l'analyse rétrospective et l'optimisation.
