logo
開發者文件
搜尋
語音智能體配置指引

語音智能體配置指引

本文按設定頁由上到下的面板順序逐項說明各參數:它的作用、取值範圍與預設值、以及適用的引擎模式。語音智能體在保留知識、資料庫、記憶等通用能力的同時,新增了語音引擎、輸入、輸出、歡迎引導、通話控制五組語音相關設定。

若還不了解語音智能體的基本概念與三種引擎模式,建議先閱讀語音智能體概述

語音引擎

語音引擎面板頂部是引擎模式選擇器,可切換即時模型(Real-time model)、ASR-LLM-TTS、LLM+TTS。切換後,下方展示的模型與參數會隨之變化。

即時模型(REALTIME)

由單個即時語音大模型端對端完成「聽 — 想 — 說」,音訊的輸入與輸出都在同一模型內閉環,中間不經過獨立的語音辨識與合成,因此延遲最低、語氣最自然。

通常來說,我們更加推薦即時模型模式,延遲最低、語氣自然,適合大多數即時語音場景。OpenAI 即將發布的 Live 模型不僅支援全雙工即時語音,面對複雜任務可以後台呼叫更高能力的文字大模型,未來將成為即時語音的首選方案。

loading...
graph LR
  U([使用者語音]) --> RT[即時語音大模型 端對端處理]
  RT --> A([語音回覆])

即時模型把辨識、推理、合成都收斂在一個模型裡,因此設定項最精簡:

設定項 必選 說明
Audio LLM 選擇端對端處理語音的即時大模型,辨識、推理、合成均由它完成。
模型參數 Temperature、Top P、最大回應長度、音色等,與普通大模型參數一致,控制回覆的隨機性、長度與音色。
身分提示 設定 Agent 的身分與角色,作為系統提示注入對話;三種模式通用。

即時模型沒有獨立的 ASR / TTS 環節,因此不提供轉錄指令、語音語言、TTS 符號清理(移除 / 替換)等設定——這些能力已內化在模型中。

ASR-LLM-TTS

三段式鏈路:語音先辨識為文字,交由文字大模型推理,再把回覆合成為語音。三段可分別選擇模型,是可控性最高的模式。

loading...
graph LR
  U([使用者語音]) --> ASR[ASR 語音辨識]
  ASR -->|文字| LLM[文字大模型 推理]
  LLM -->|回覆文字| TTS[TTS 語音合成]
  TTS --> A([語音回覆])

逐段設定如下:

環節 設定項 說明
ASR 語音辨識模型 選擇把使用者語音轉寫成文字的辨識模型。
轉錄指令 引導辨識風格、常見用詞、專有名詞等,提升特定領域(如品牌名、行業術語)的辨識準確率。
語音語言 指定源語言,或選擇「自動辨識」由模型判斷;指定語言通常更穩定。
LLM 文字大模型 選擇負責推理的文字大模型,可搭配知識、資料庫、記憶、工具等能力。
模型參數 Temperature、Top P、最大回應長度等,與普通大模型一致。
身分提示 用於設定 Agent 的角色和行為準則。
TTS 語音合成模型 選擇把文字回覆合成為語音的模型與音色。
移除 輸入需移除的符號,這些符號會在提交給 TTS 前被刪除,避免被讀出。
替換 輸入需替換為空格的符號,在提交給 TTS 前替換,用於斷句或消除生硬停頓。

移除與替換均以英文逗號分隔多個符號;成對括號(如 ()《》)作為一個整體填寫即可。

LLM+TTS

支援語音輸入的多模態 LLM 直接理解語音,省去獨立 ASR 環節;模型的文字回覆再交給 TTS 合成為語音。

loading...
graph LR
  U([使用者語音]) --> LLM[多模態大模型 直接理解語音]
  LLM -->|回覆文字| TTS[TTS 語音合成]
  TTS --> A([語音回覆])

設定項為 LLM(含模型參數與身分提示)與 TTS(含移除、替換),含義同 ASR-LLM-TTS。

輸入

輸入面板控制「Agent 如何聽」,核心是 VAD(語音活動偵測)與附件辨識。

VAD 控制

VAD(語音活動偵測)決定 Agent 如何判斷使用者何時說完、能否被打斷。可調參數會隨引擎模式與辨識模式變化,切換後表單也隨之改變

  • 即時模型:使用模型自帶的 VAD,可在設定頁選擇辨識模式——預設模式或語義模式,預設為預設模式。
  • ASR-LLM-TTS / LLM+TTS:使用平台內建 VAD,行為等同預設模式,不提供辨識模式切換。

預設模式

按聲音訊號斷句:靠音量閾值與靜默時長判斷使用者是否說完,行為直觀、可預期。適用於即時模型(選預設模式時)以及 ASR-LLM-TTS、LLM+TTS。

設定項 取值範圍 預設值 適用 說明
音量激活 0 ~ 1(步長 0.1) 0.5 僅即時模型 觸發辨識的音量閾值,越大越不易被環境雜訊誤激活。
停頓斷句 0 ~ 5000 ms(步長 50) 500 通用 使用者停止說話後靜默多少毫秒判定為一句結束,越大越不易「搶話」。
語音打斷 0 ~ 1(步長 0.1) 0.5 通用 使用者在 Agent 說話時開口打斷(barge-in)的敏感度,越大越容易被打斷;也可整體關閉。

語義模式

即時模型支援。由模型理解語義來判斷使用者是否說完,不再依賴固定的音量與靜默閾值,斷句更自然,適合停頓多、語氣鬆散的口語對話。

設定項 取值範圍 預設值 適用 說明
回應速度 低 / 中 / 高 通用 判定使用者說完後的回應節奏;越快越緊湊,越慢越從容。
語音打斷 0 ~ 1(步長 0.1) 0.5 通用 使用者在 Agent 說話時開口打斷(barge-in)的敏感度,越大越容易被打斷;也可整體關閉。

附件

設定項 說明
圖片辨識 開關。開啟後對話中可辨識圖片。
附件數量 固定為 1 張。
附件類型 僅支援圖片(Image)。

輸出

輸出面板控制「Agent 如何說」,包含背景音與快取播放。

背景音

為通話疊加環境音,讓語音對話更有現場感,建議調整到 0.2 左右的音量即可,避免蓋過人聲。

設定項 取值 說明
背景音模式 停用 / 預置 / 自訂 選擇是否啟用及來源。
預置選項 辦公室 / 咖啡廳 / 雨聲 / 自然 / 白噪音 平台內建的環境音。
自訂 mp3,≤ 1 MB 上傳自有背景音訊,應使用首尾相連的無縫音訊。
背景音量 1~50% 預設 30%

快取播放

設定項 取值範圍 預設值 說明
快取播放 0 ~ 1500 ms(步長 50) 200 先快取一段回覆語音再開始播放,減少網路抖動造成的卡頓;數值越大越流暢,但首字延遲略增。

歡迎引導

設定通話開始時的開場表現,支援多語言分別設定。

設定項 要求 說明
講話形象 mp4,≤ 5 MB 虛擬人「正在說話」的循環影片,需首尾幀相連以保證循環過渡自然。
等待形象 mp4,≤ 5 MB 虛擬人「正在傾聽」的循環影片,同樣需首尾幀相連。
歡迎語 文字 開啟對話時作為開場白,由模型朗讀一次。

通話控制

通話控制用於讓通話更加自然,避免冷場空轉。透過設定掛斷機制防止無限佔用,節省資源和費用。

冷場控制

觸發沉默閾值時,自動追問或播放提示,把使用者拉回對話。

設定項 取值範圍 預設值 說明
沉默逾時 5 ~ 60 秒(步長 1) 10 使用者沉默多久後觸發冷場追問。
冷場提示 文字 觸發時播放或下發給模型的追問 / 提示文案。

掛斷通話

滿足最大通話時長最大沉默次數任一條件即觸發掛斷。

設定項 取值範圍 預設值 說明
最大通話時長 30 ~ 3600 秒(步長 30) 600 單通通話的最長時間,超過自動結束。
最大沉默次數 1 ~ 100(步長 1) 5 連續冷場累計達到該次數後自動掛斷。
掛斷提示 文字,≤ 20 tokens 掛斷前告知使用者的提示文案。
*主動結束通話 開關 即將支援,開啟後可在對話中允許 AI Agent 主動結束通話,觸發掛斷提示。

共享能力面板

語音智能體同樣支援知識、資料庫、記憶等通用 Agent 能力,設定方式與普通 Agent 一致,可參考智能體相關文件。需要注意:

  • 人工服務面板在語音智能體中暫顯示「即將支援」。
  • 工具、Workflow 等面板在語音智能體中不展示。

各模式配置項對照

不同引擎模式下,設定頁展示的項目略有差異,可對照下表:

設定項 即時模型 ASR-LLM-TTS LLM+TTS
Audio LLM
ASR(含轉錄指令 / 語音語言)
LLM(文字大模型)
TTS(含移除 / 替換)
身分提示
辨識模式(預設 / 語義)
音量激活 ✓(預設)
停頓斷句 ✓(預設)
回應速度 ✓(語義)
語音打斷
圖片辨識
背景音
快取播放
歡迎引導
通話控制

參數如何取值才更貼合業務,請繼續閱讀最佳實踐