logo
Entwicklung
Suchen
Konfigurationsanleitung für den Audio Agent

Konfigurationsanleitung für den Audio Agent

Dieser Artikel erläutert die einzelnen Parameter in der Reihenfolge der Panels von oben nach unten auf der Konfigurationsseite: ihre Funktion, ihren Wertebereich und Standardwert sowie die zutreffenden Engine-Modi. Der Audio Agent behält die allgemeinen Fähigkeiten wie Wissen, Datenbank und Gedächtnis bei und ergänzt sie um fünf sprachbezogene Konfigurationsgruppen: Sprach-Engine, Eingabe, Ausgabe, Begrüßung und Gesprächssteuerung.

Wenn Sie mit den Grundkonzepten des Audio Agent und den drei Engine-Modi noch nicht vertraut sind, empfehlen wir, zunächst die Übersicht über den Audio Agent zu lesen.

Sprach-Engine

Oben im Panel Sprach-Engine befindet sich die Auswahl des Engine-Modus, mit der sich zwischen Real-time model, ASR-LLM-TTS und LLM+TTS umschalten lässt. Nach dem Umschalten ändern sich die darunter angezeigten Modelle und Parameter entsprechend.

Real-time model (REALTIME)

Ein einzelnes großes Echtzeit-Sprachmodell erledigt „Hören – Denken – Sprechen“ end-to-end; Audioeingabe und -ausgabe verbleiben in einem geschlossenen Kreislauf innerhalb desselben Modells, ohne separate Spracherkennung und -synthese – daher niedrigste Latenz und natürlichster Tonfall.

In der Regel empfehlen wir den Modus Real-time model: niedrigste Latenz, natürlicher Tonfall, geeignet für die meisten Echtzeit-Sprachszenarien. Das von OpenAI in Kürze erscheinende Live-Modell unterstützt nicht nur Vollduplex-Echtzeit-Sprache, sondern kann bei komplexen Aufgaben im Hintergrund ein leistungsfähigeres großes Textmodell aufrufen und wird künftig die erste Wahl für Echtzeit-Sprache sein.

loading...
graph LR
  U([Nutzersprache]) --> RT[Großes Echtzeit-Sprachmodell End-to-End-Verarbeitung]
  RT --> A([Sprachantwort])

Das Real-time model bündelt Erkennung, Inferenz und Synthese in einem einzigen Modell, daher sind die Konfigurationsoptionen am schlanksten:

Konfigurationsoption Erforderlich Erläuterung
Audio LLM Ja Wählen Sie das große Echtzeit-Modell, das Sprache end-to-end verarbeitet; Erkennung, Inferenz und Synthese übernimmt es vollständig.
Modellparameter Nein Temperature, Top P, maximale Antwortlänge, Klangfarbe usw. – wie bei den Parametern eines gewöhnlichen großen Modells; steuert Zufälligkeit, Länge und Klangfarbe der Antwort.
Identitäts-Prompt Nein Legt Identität und Rolle des Agenten fest und wird als System-Prompt in das Gespräch injiziert; für alle drei Modi verfügbar.

Das Real-time model hat keinen separaten ASR-/TTS-Schritt und bietet daher keine Einstellungen für Transkriptionsanweisung, Sprachsprache oder TTS-Symbolbereinigung (Entfernen / Ersetzen) – diese Fähigkeiten sind bereits im Modell verinnerlicht.

ASR-LLM-TTS

Dreistufige Kette: Die Sprache wird zunächst in Text erkannt, an das große Textmodell zur Inferenz übergeben und die Antwort anschließend in Sprache synthetisiert. Für jede der drei Stufen lässt sich ein eigenes Modell wählen – dies ist der Modus mit der höchsten Steuerbarkeit.

loading...
graph LR
  U([Nutzersprache]) --> ASR[ASR Spracherkennung]
  ASR -->|Text| LLM[Großes Textmodell Inferenz]
  LLM -->|Antworttext| TTS[TTS Sprachsynthese]
  TTS --> A([Sprachantwort])

Die stufenweise Konfiguration sieht wie folgt aus:

Schritt Konfigurationsoption Erläuterung
ASR Spracherkennungsmodell Wählen Sie das Erkennungsmodell, das die Nutzersprache in Text umwandelt.
Transkriptionsanweisung Leitet Erkennungsstil, gängige Begriffe, Eigennamen usw. an und verbessert die Erkennungsgenauigkeit in bestimmten Fachbereichen (z. B. Markennamen, Branchenbegriffe).
Sprachsprache Legen Sie die Ausgangssprache fest oder wählen Sie „Automatische Erkennung“, damit das Modell entscheidet; eine festgelegte Sprache ist in der Regel stabiler.
LLM Großes Textmodell Wählen Sie das für die Inferenz zuständige große Textmodell; es lässt sich mit Wissen, Datenbank, Gedächtnis, Tools usw. kombinieren.
Modellparameter Temperature, Top P, maximale Antwortlänge usw. – wie bei einem gewöhnlichen großen Modell.
Identitäts-Prompt Dient dazu, die Rolle und Verhaltensrichtlinien des Agenten festzulegen.
TTS Sprachsynthesemodell Wählen Sie das Modell und die Klangfarbe, die die Textantwort in Sprache synthetisieren.
Entfernen Geben Sie die zu entfernenden Symbole ein; diese werden vor der Übergabe an TTS gelöscht, damit sie nicht vorgelesen werden.
Ersetzen Geben Sie die durch Leerzeichen zu ersetzenden Symbole ein; sie werden vor der Übergabe an TTS ersetzt und dienen der Satztrennung oder dem Beseitigen abrupter Pausen.

Entfernen und Ersetzen trennen mehrere Symbole jeweils durch ein englisches Komma; paarweise Klammern (wie (), 《》) werden als Ganzes eingetragen.

LLM+TTS

Ein multimodales LLM mit Sprachunterstützung versteht die Sprache direkt und macht den separaten ASR-Schritt überflüssig; die Textantwort des Modells wird anschließend von TTS in Sprache synthetisiert.

loading...
graph LR
  U([Nutzersprache]) --> LLM[Multimodales großes Modell versteht Sprache direkt]
  LLM -->|Antworttext| TTS[TTS Sprachsynthese]
  TTS --> A([Sprachantwort])

Die Konfigurationsoptionen sind LLM (inkl. Modellparameter und Identitäts-Prompt) und TTS (inkl. Entfernen, Ersetzen), mit derselben Bedeutung wie bei ASR-LLM-TTS.

Eingabe

Das Panel Eingabe steuert, „wie der Agent hört“; im Zentrum stehen VAD (Sprachaktivitätserkennung) und die Anhangserkennung.

VAD-Steuerung

VAD (Sprachaktivitätserkennung) bestimmt, wie der Agent erkennt, wann Nutzer:innen fertig gesprochen haben und ob er unterbrochen werden kann. Die einstellbaren Parameter ändern sich mit dem Engine-Modus und dem Erkennungsmodus; nach dem Umschalten ändert sich auch das Formular:

  • Real-time model: Nutzt das modelleigene VAD; auf der Konfigurationsseite lässt sich der Erkennungsmodus wählen – Voreinstellungsmodus oder Semantikmodus, standardmäßig der Voreinstellungsmodus.
  • ASR-LLM-TTS / LLM+TTS: Nutzt das plattforminterne VAD, dessen Verhalten dem Voreinstellungsmodus entspricht; ein Umschalten des Erkennungsmodus wird nicht angeboten.

Voreinstellungsmodus

Satztrennung nach dem Tonsignal: Anhand von Lautstärkeschwelle und Dauer der Stille wird beurteilt, ob Nutzer:innen fertig gesprochen haben – das Verhalten ist anschaulich und vorhersehbar. Geeignet für das Real-time model (bei Wahl des Voreinstellungsmodus) sowie für ASR-LLM-TTS und LLM+TTS.

Konfigurationsoption Wertebereich Standardwert Zutreffend Erläuterung
Lautstärkeaktivierung 0 ~ 1 (Schrittweite 0,1) 0,5 Nur Real-time model Lautstärkeschwelle zum Auslösen der Erkennung; je höher, desto weniger leicht durch Umgebungsgeräusche fehlausgelöst.
Pausen-Satztrennung 0 ~ 5000 ms (Schrittweite 50) 500 Allgemein Nach wie vielen Millisekunden Stille nach dem Verstummen der Nutzer:innen ein Satzende festgestellt wird; je höher, desto weniger wird „ins Wort gefallen“.
Sprachunterbrechung 0 ~ 1 (Schrittweite 0,1) 0,5 Allgemein Empfindlichkeit dafür, dass Nutzer:innen den Agenten während des Sprechens unterbrechen (barge-in); je höher, desto leichter unterbrechbar; lässt sich auch ganz abschalten.

Semantikmodus

Wird nur vom Real-time model unterstützt. Das Modell beurteilt anhand der Semantik, ob Nutzer:innen fertig gesprochen haben, und stützt sich nicht mehr auf feste Lautstärke- und Stilleschwellen; die Satztrennung wirkt natürlicher und eignet sich für umgangssprachliche Gespräche mit vielen Pausen und lockerem Sprachfluss.

Konfigurationsoption Wertebereich Standardwert Zutreffend Erläuterung
Reaktionsgeschwindigkeit Niedrig / Mittel / Hoch Mittel Allgemein Reaktionstempo, nachdem festgestellt wurde, dass Nutzer:innen fertig gesprochen haben; je schneller, desto knapper, je langsamer, desto gelassener.
Sprachunterbrechung 0 ~ 1 (Schrittweite 0,1) 0,5 Allgemein Empfindlichkeit dafür, dass Nutzer:innen den Agenten während des Sprechens unterbrechen (barge-in); je höher, desto leichter unterbrechbar; lässt sich auch ganz abschalten.

Anhang

Konfigurationsoption Erläuterung
Bilderkennung Schalter. Nach dem Aktivieren können im Gespräch Bilder erkannt werden.
Anzahl der Anhänge Fest auf 1 Bild.
Anhangstyp Nur Bilder (Image) werden unterstützt.

Ausgabe

Das Panel Ausgabe steuert, „wie der Agent spricht“, und umfasst Hintergrundgeräusch und Wiedergabe-Pufferung.

Hintergrundgeräusch

Überlagert dem Gespräch ein Umgebungsgeräusch, damit die Sprachkonversation lebendiger wirkt; wir empfehlen, die Lautstärke auf etwa 0,2 einzustellen, damit sie die menschliche Stimme nicht übertönt.

Konfigurationsoption Wert Erläuterung
Hintergrundgeräusch-Modus Deaktiviert / Voreingestellt / Benutzerdefiniert Wählt, ob und aus welcher Quelle es aktiviert wird.
Voreingestellte Optionen Büro / Café / Regen / Natur / Weißes Rauschen Von der Plattform integrierte Umgebungsgeräusche.
Benutzerdefiniert mp3, ≤ 1 MB Laden Sie eigenes Hintergrundaudio hoch; verwenden Sie ein nahtloses Audio mit anschließendem Anfang und Ende.
Hintergrundlautstärke 1~50 % Standard 30 %

Wiedergabe-Pufferung

Konfigurationsoption Wertebereich Standardwert Erläuterung
Wiedergabe-Pufferung 0 ~ 1500 ms (Schrittweite 50) 200 Ein Teil der Antwortsprache wird zunächst gepuffert, bevor die Wiedergabe beginnt, um Ruckeln durch Netzwerkschwankungen zu verringern; je höher der Wert, desto flüssiger, aber die Latenz bis zum ersten Wort steigt leicht.

Begrüßung

Legt die Eröffnung zu Beginn des Gesprächs fest und unterstützt eine separate Konfiguration je Sprache.

Konfigurationsoption Anforderung Erläuterung
Sprechendes Erscheinungsbild mp4, ≤ 5 MB Schleifenvideo der virtuellen Person „spricht gerade“; Anfangs- und Endframe müssen aneinander anschließen, damit der Schleifenübergang natürlich ist.
Wartendes Erscheinungsbild mp4, ≤ 5 MB Schleifenvideo der virtuellen Person „hört gerade zu“; ebenfalls mit aneinander anschließenden Anfangs- und Endframes.
Begrüßungstext Text Wird beim Beginn des Gesprächs als Eröffnung einmal vom Modell vorgelesen.

Gesprächssteuerung

Die Gesprächssteuerung dient dazu, das Gespräch natürlicher zu gestalten und Leerlauf durch Gesprächspausen zu vermeiden. Durch das Einrichten eines Auflegemechanismus wird unbegrenzte Belegung verhindert und Ressourcen sowie Kosten werden gespart.

Steuerung von Gesprächspausen

Wird die Schweigeschwelle erreicht, fragt der Agent automatisch nach oder spielt einen Hinweis ab, um Nutzer:innen ins Gespräch zurückzuholen.

Konfigurationsoption Wertebereich Standardwert Erläuterung
Schweige-Timeout 5 ~ 60 Sekunden (Schrittweite 1) 10 Nach wie langem Schweigen der Nutzer:innen das Nachfragen bei Gesprächspausen ausgelöst wird.
Hinweis bei Gesprächspause Text Der beim Auslösen abgespielte bzw. an das Modell übergebene Nachfrage-/Hinweistext.

Gespräch auflegen

Sobald eine der Bedingungen maximale Gesprächsdauer oder maximale Anzahl an Schweigephasen erfüllt ist, wird das Auflegen ausgelöst.

Konfigurationsoption Wertebereich Standardwert Erläuterung
Maximale Gesprächsdauer 30 ~ 3600 Sekunden (Schrittweite 30) 600 Maximale Dauer eines einzelnen Gesprächs; bei Überschreitung endet es automatisch.
Maximale Anzahl an Schweigephasen 1 ~ 100 (Schrittweite 1) 5 Nachdem aufeinanderfolgende Gesprächspausen diese Anzahl erreicht haben, wird automatisch aufgelegt.
Auflegehinweis Text, ≤ 20 tokens Der Hinweistext, mit dem Nutzer:innen vor dem Auflegen informiert werden.
*Gespräch aktiv beenden Schalter Bald verfügbar; nach dem Aktivieren darf der AI Agent das Gespräch im Verlauf aktiv beenden und den Auflegehinweis auslösen.

Panel für gemeinsame Fähigkeiten

Der Audio Agent unterstützt ebenfalls allgemeine Agent-Fähigkeiten wie Wissen, Datenbank und Gedächtnis; die Konfiguration erfolgt wie bei einem gewöhnlichen Agenten, siehe die zugehörige Agent-Dokumentation. Zu beachten ist:

  • Das Panel Menschlicher Service zeigt beim Audio Agent vorerst „Bald verfügbar“ an.
  • Panels wie Tools und Workflow werden beim Audio Agent nicht angezeigt.

Gegenüberstellung der Konfigurationsoptionen je Modus

Je nach Engine-Modus unterscheiden sich die auf der Konfigurationsseite angezeigten Optionen geringfügig; vergleichen Sie die folgende Tabelle:

Konfigurationsoption Real-time model ASR-LLM-TTS LLM+TTS
Audio LLM
ASR (inkl. Transkriptionsanweisung / Sprachsprache)
LLM (großes Textmodell)
TTS (inkl. Entfernen / Ersetzen)
Identitäts-Prompt
Erkennungsmodus (Voreinstellung / Semantik)
Lautstärkeaktivierung ✓ (Voreinstellung)
Pausen-Satztrennung ✓ (Voreinstellung)
Reaktionsgeschwindigkeit ✓ (Semantik)
Sprachunterbrechung
Bilderkennung
Hintergrundgeräusch
Wiedergabe-Pufferung
Begrüßung
Gesprächssteuerung

Wie Sie die Parameter passend zu Ihrem Geschäft wählen, lesen Sie weiter in den Best Practices.