logo
Développement
Rechercher
Aperçu de l'Agent vocal (Audio Agent)

Aperçu de l'Agent vocal (Audio Agent)

L'Agent vocal (Audio Agent) est le type d'Agent de l'Espace de développement GPTBots dédié à l'interaction vocale. L'utilisateur parle au lieu de taper, et l'Agent répond par la voix, offrant une expérience d'appel en temps réel proche d'une conversation humaine. Il peut aussi bien être intégré à une page web comme composant de conversation vocale que répondre directement aux appels entrants via un système téléphonique. Il convient aux scénarios de service client vocal, de standard téléphonique, d'assistant vocal, d'entraînement à l'oral, etc.

Par rapport à un Agent textuel, l'Agent vocal se distingue sur trois points :

  • L'entrée et la sortie sont vocales : selon le mode, le traitement de la voix diffère.
  • Session en temps réel : une conversation est maintenue sur une connexion persistante, l'utilisateur peut prendre la parole pour interrompre à tout moment (barge-in), et la reconnexion après coupure est prise en charge.
  • Facturation à l'usage vocal : les crédits sont déduits sur la base de la reconnaissance vocale, de la synthèse vocale et de la durée d'appel, et non selon le nombre de messages textuels.

Concepts clés

Comprendre les quelques concepts suivants facilite la configuration et le débogage de l'Agent vocal :

Concept Description
ASR (reconnaissance vocale) Automatic Speech Recognition, transcrit en texte ce que dit l'utilisateur pour que le grand modèle puisse le comprendre.
LLM (inférence du grand modèle) Génère une réponse à partir du texte reconnu et du contexte ; cette couche est identique à celle d'un Agent textuel et peut faire appel à la base de connaissances, à la base de données, à la mémoire, etc.
TTS (synthèse vocale) Text-To-Speech, synthétise en voix la réponse textuelle générée par le grand modèle pour la lire à l'utilisateur.
VAD (détection d'activité vocale) Voice Activity Detection, détermine quand l'utilisateur commence et finit de parler ; c'est la base d'un découpage naturel des phrases et de l'interruption vocale.
Appel en temps réel Une conversation vocale se déroule sur une seule connexion persistante, l'Agent écoute et répond en continu.

Trois modes de moteur vocal

L'Agent vocal propose trois modes de moteur qui déterminent qui prend en charge la chaîne « voix — texte — voix ». Après la création, on peut en changer en haut de la page de configuration ; les modèles et paramètres affichés varient selon le mode.

Mode Chaîne Caractéristiques Cas d'usage
Real-time model
(Real-time model / REALTIME)
Latence la plus faible, un seul grand modèle vocal en temps réel traite de bout en bout l'entrée et la sortie audio Latence la plus faible, intonation naturelle, mais contrôle relativement limité sur la voix et le texte Appels en temps réel recherchant la latence minimale et un ton conversationnel
ASR-LLM-TTS Reconnaissance vocale → grand modèle textuel → synthèse vocale, en trois étapes Latence la plus élevée, capacité du modèle textuel maximale, contrôle le plus poussé, libre combinaison des modèles ASR, LLM, TTS Service client vocal nécessitant une logique métier complexe, des appels d'outils et un contrôle strict du discours
LLM+TTS Un grand modèle prenant en charge l'entrée vocale comprend directement la voix → synthèse vocale Latence moyenne, suppression de l'étape ASR indépendante, le grand modèle « comprend » directement la voix Le grand modèle choisi prend nativement en charge l'entrée vocale et l'on souhaite simplifier la chaîne

Pour les recommandations de choix, voir les Meilleures pratiques. Les trois modes partagent la base de connaissances, la base de données, la mémoire, le contrôle des appels et les fonctions d'accueil ; seule l'implémentation de la chaîne vocale diffère.

Fonctionnalités principales

  • Conversation vocale en temps réel : l'utilisateur parle, l'Agent répond en temps réel, formant une conversation multi-tours.
  • Interruption vocale (barge-in) : l'utilisateur peut prendre la parole pour interrompre l'Agent pendant qu'il parle ; la sensibilité est réglable, au plus près des habitudes de conversation humaine.
  • Accueil et amorce : diffusion d'un message d'accueil au début de l'appel ; possibilité de téléverser deux vidéos en boucle d'avatar virtuel (« en train de parler » et « en attente ») pour donner une représentation visuelle à la conversation vocale.
  • Contrôle des appels : relance automatique en cas de silence, raccrochage automatique en cas de dépassement de délai ou de silence prolongé, pour éviter les appels qui tournent à vide ou monopolisent la ligne indéfiniment.
  • Son d'ambiance : possibilité d'ajouter à l'appel des sons d'ambiance préréglés (bureau, café, pluie, etc.) ou un audio personnalisé téléversé, pour créer une atmosphère (uniquement en modes ASR-LLM-TTS et LLM+TTS).
  • Nettoyage du texte TTS : suppression ou remplacement des parenthèses, marqueurs Markdown et autres symboles présents dans le texte de réponse avant lecture, afin d'éviter que les symboles soient prononcés.
  • Reconnaissance d'image : la reconnaissance d'une image est prise en charge dans la conversation, pour que le scénario vocal puisse aussi traiter des informations visuelles.
  • Validation de la qualité vocale : la plateforme intègre une validation qui filtre automatiquement les audios trop courts et les expressions « hallucinées » de reconnaissance courantes (comme « merci d'avoir regardé », « pensez à vous abonner », etc.), réduisant les déclenchements intempestifs.
  • Accès téléphonique / SIP : possibilité d'associer un numéro Twilio pour les appels entrants, ou de transférer les appels entrants via un système SIP tiers, pour que l'Agent réponde directement au téléphone. Voir le Manuel d'intégration du système téléphonique.

Démarrage rapide

  1. Créer : allez dans Espace de développement → Créer un Agent et sélectionnez le type « Agent vocal (Audio Agent) ».
  2. Choisir le mode de moteur et les modèles : dans le panneau Moteur vocal en haut de la page de configuration, sélectionnez Real-time model / ASR-LLM-TTS / LLM+TTS, puis choisissez les modèles correspondant à chaque étape (Audio LLM / ASR / LLM / TTS).
  3. Configurer les paramètres vocaux et d'appel : réglez selon vos besoins l'interruption vocale, le découpage des pauses, le message d'accueil, la relance en cas de silence, le raccrochage automatique, etc. Voir le Guide de configuration.
  4. Tester l'expérience : lancez une conversation vocale dans la fenêtre de débogage pour vérifier la précision de la reconnaissance, la réactivité de l'interruption, ainsi que la voix et le débit de parole.
  5. Intégrer et mettre en ligne : intégrez l'Agent vocal à votre activité selon deux méthodes :

Facturation et concurrence

L'appel vocal déduit des crédits selon l'usage vocal (reconnaissance vocale, synthèse vocale, durée d'appel). Si les crédits sont insuffisants ou si la limite d'appels simultanés est dépassée, les nouveaux appels entrants sont rejetés. Avant la mise en ligne, vérifiez que le compte dispose de crédits suffisants et que le quota de concurrence correspond au volume d'appels attendu. Pour les questions fréquentes sur l'accès téléphonique, consultez la section FAQ du Manuel d'intégration du système téléphonique.