logo
Entwicklung
Suchen
Übersicht über den Audio Agent (Voice Agent)

Übersicht über den Audio Agent (Voice Agent)

Der Audio Agent (Voice Agent) ist der auf Sprachinteraktion ausgerichtete Agent-Typ im GPTBots-Entwicklungsbereich. Nutzer:innen sprechen, statt zu tippen, und der Agent antwortet per Sprache, wodurch ein nahezu menschliches Echtzeit-Gesprächserlebnis entsteht. Er lässt sich sowohl als Sprachkonversationskomponente in eine Webseite einbetten als auch über ein Telefonsystem direkt für eingehende Anrufe nutzen und eignet sich für Szenarien wie Sprach-Kundenservice, telefonische Navigation, Sprachassistenten oder Sprechtraining.

Im Vergleich zu einem Text-Agent zeigt sich der Unterschied des Audio Agent in drei Punkten:

  • Ein- und Ausgabe erfolgen per Sprache: Je nach Modus wird die Sprache unterschiedlich verarbeitet.
  • Echtzeit-Konversation: Ein Gespräch wird über eine dauerhafte Verbindung geführt, Nutzer:innen können jederzeit dazwischensprechen (barge-in), und bei Verbindungsabbruch ist ein automatischer Wiederverbindungsaufbau möglich.
  • Abrechnung nach Sprachnutzung: Credits werden anhand von Spracherkennung, Sprachsynthese und Gesprächsdauer abgezogen, nicht nach der Anzahl der Textnachrichten.

Kernkonzepte

Das Verständnis der folgenden Konzepte hilft beim Konfigurieren und Testen des Audio Agent:

Konzept Erläuterung
ASR (Spracherkennung) Automatic Speech Recognition, wandelt das Gesprochene der Nutzer:innen in Text um, damit das große Modell es verstehen kann.
LLM (Inferenz mit großem Modell) Erzeugt anhand des erkannten Textes und des Kontexts eine Antwort; diese Ebene entspricht dem Text-Agent und kann Wissensdatenbank, Datenbank, Gedächtnis und weitere Fähigkeiten nutzen.
TTS (Sprachsynthese) Text-To-Speech, wandelt die vom großen Modell erzeugte Textantwort in Sprache um und liest sie den Nutzer:innen vor.
VAD (Sprachaktivitätserkennung) Voice Activity Detection, erkennt, wann Nutzer:innen zu sprechen beginnen und wann sie fertig sind – die Grundlage für natürliche Satzgrenzen und Sprachunterbrechungen.
Echtzeit-Gespräch Ein Sprachgespräch läuft über eine dauerhafte Verbindung, der Agent hört zu und antwortet gleichzeitig.

Die drei Sprach-Engine-Modi

Der Audio Agent bietet drei Engine-Modi, die festlegen, wer die Kette „Sprache – Text – Sprache“ abwickelt. Nach dem Erstellen lässt sich der Modus oben auf der Konfigurationsseite umschalten; je nach Modus werden unterschiedliche Modelle und Parameter angezeigt.

Modus Kette Merkmale Geeignete Szenarien
Real-time model
(Real-time model / REALTIME)
Niedrigste Latenz; ein einzelnes großes Echtzeit-Sprachmodell verarbeitet Audioeingabe und -ausgabe end-to-end Niedrigste Latenz, natürlicher Tonfall, aber Klangfarbe und Textsteuerbarkeit sind vergleichsweise begrenzt Echtzeit-Gespräche mit niedrigster Latenz und umgangssprachlichem Charakter
ASR-LLM-TTS Spracherkennung → großes Textmodell → Sprachsynthese, dreistufig Höchste Latenz, stärkste Fähigkeiten des Textmodells, höchste Steuerbarkeit; ASR-, LLM- und TTS-Modelle frei kombinierbar Sprach-Kundenservice mit komplexer Geschäftslogik, Tool-Aufrufen und strenger Gesprächssteuerung
LLM+TTS Ein großes Modell mit Sprachunterstützung versteht die Sprache direkt → Sprachsynthese Mittlere Latenz, entfällt der separate ASR-Schritt, das große Modell „versteht“ die Sprache direkt Das gewählte große Modell unterstützt Spracheingabe nativ und die Kette soll vereinfacht werden

Empfehlungen zur Modellwahl finden Sie unter Best Practices. Alle drei Modi teilen sich Fähigkeiten wie Wissensdatenbank, Datenbank, Gedächtnis, Gesprächssteuerung und Begrüßung; sie unterscheiden sich lediglich in der Umsetzung der Sprachkette.

Kernfunktionen

  • Echtzeit-Sprachkonversation: Nutzer:innen sprechen, der Agent antwortet in Echtzeit und es entsteht ein mehrstufiges Gespräch.
  • Sprachunterbrechung (barge-in): Nutzer:innen können den Agenten während des Sprechens unterbrechen; die Empfindlichkeit ist einstellbar und orientiert sich an menschlichen Gesprächsgewohnheiten.
  • Begrüßung: Zu Beginn des Gesprächs wird ein Begrüßungstext abgespielt; es lassen sich zwei Schleifenvideos einer virtuellen Person – „sprechend“ und „wartend“ – hochladen, sodass die Sprachkonversation eine visuelle Darstellung erhält.
  • Gesprächssteuerung: Unterstützt automatisches Nachfragen bei Gesprächspausen sowie automatisches Auflegen bei Zeitüberschreitung oder langem Schweigen, um Leerlauf oder unbegrenzte Belegung zu vermeiden.
  • Hintergrundgeräusch: Dem Gespräch lassen sich voreingestellte Umgebungsgeräusche wie Büro, Café oder Regen überlagern, oder es kann eigenes Audio hochgeladen werden, um Atmosphäre zu schaffen (wirksam nur in den Modi ASR-LLM-TTS und LLM+TTS).
  • TTS-Textbereinigung: Klammern, Markdown-Zeichen und ähnliche Symbole im Antworttext werden vor dem Vorlesen entfernt oder ersetzt, damit keine Symbole vorgelesen werden.
  • Bilderkennung: Im Gespräch kann 1 Bild erkannt werden, sodass auch das Sprachszenario Bildinformationen verarbeiten kann.
  • Prüfung der Sprachqualität: Die Plattform verfügt über eine integrierte Prüfung, die zu kurze Audioaufnahmen und häufige „halluzinierte“ Erkennungsphrasen (wie „Danke fürs Zuschauen“, „Abonnieren Sie gern“ usw.) automatisch herausfiltert, um Fehlauslösungen zu reduzieren.
  • Telefon-/SIP-Anbindung: Es lässt sich eine Twilio-Nummer für eingehende Anrufe binden oder über ein Drittanbieter-SIP-System eine Weiterleitung eingehender Anrufe einrichten, sodass der Agent Anrufe direkt entgegennimmt. Siehe Bedienungsanleitung zur Anbindung des Telefonsystems.

Schnellstart

  1. Erstellen: Gehen Sie zu Entwicklungsbereich → Agent erstellen und wählen Sie den Typ „Audio Agent (Voice Agent)“.
  2. Engine-Modus und Modell wählen: Wählen Sie oben auf der Konfigurationsseite im Panel Sprach-Engine Real-time model / ASR-LLM-TTS / LLM+TTS und ordnen Sie den jeweiligen Schritten Modelle zu (Audio LLM / ASR / LLM / TTS).
  3. Sprach- und Gesprächsparameter konfigurieren: Stellen Sie nach Bedarf Sprachunterbrechung, Pausen-Satztrennung, Begrüßungstext, Nachfragen bei Gesprächspausen, automatisches Auflegen usw. ein, siehe Konfigurationsanleitung.
  4. Testen und ausprobieren: Starten Sie im Testfenster ein Sprachgespräch und prüfen Sie, ob die Erkennung korrekt ist, das Unterbrechen empfindlich reagiert und Klangfarbe sowie Sprechgeschwindigkeit passen.
  5. Integrieren und live schalten: Binden Sie den Audio Agent in Ihr Geschäft ein; dafür gibt es zwei Wege:

Abrechnung und Parallelität

Sprachgespräche ziehen Credits nach Sprachnutzung ab (Spracherkennung, Sprachsynthese, Gesprächsdauer). Bei unzureichenden Credits oder Überschreiten des Limits gleichzeitiger Gespräche werden neue eingehende Anrufe abgewiesen. Stellen Sie vor dem Live-Schalten sicher, dass das Konto über ausreichend Credits verfügt und das Parallelitätskontingent das erwartete Anrufvolumen abdeckt. Häufige Fragen zur Telefonanbindung finden Sie im FAQ-Teil der Bedienungsanleitung zur Anbindung des Telefonsystems.