語音智能體配置指引
本文按設定頁由上到下的面板順序逐項說明各參數:它的作用、取值範圍與預設值、以及適用的引擎模式。語音智能體在保留知識、資料庫、記憶等通用能力的同時,新增了語音引擎、輸入、輸出、歡迎引導、通話控制五組語音相關設定。
若還不了解語音智能體的基本概念與三種引擎模式,建議先閱讀語音智能體概述。
語音引擎
語音引擎面板頂部是引擎模式選擇器,可切換即時模型(Real-time model)、ASR-LLM-TTS、LLM+TTS。切換後,下方展示的模型與參數會隨之變化。
即時模型(REALTIME)
由單個即時語音大模型端對端完成「聽 — 想 — 說」,音訊的輸入與輸出都在同一模型內閉環,中間不經過獨立的語音辨識與合成,因此延遲最低、語氣最自然。
通常來說,我們更加推薦即時模型模式,延遲最低、語氣自然,適合大多數即時語音場景。OpenAI 即將發布的 Live 模型不僅支援全雙工即時語音,面對複雜任務可以後台呼叫更高能力的文字大模型,未來將成為即時語音的首選方案。
graph LR U([使用者語音]) --> RT[即時語音大模型 端對端處理] RT --> A([語音回覆])
即時模型把辨識、推理、合成都收斂在一個模型裡,因此設定項最精簡:
| 設定項 | 必選 | 說明 |
|---|---|---|
| Audio LLM | 是 | 選擇端對端處理語音的即時大模型,辨識、推理、合成均由它完成。 |
| 模型參數 | 否 | Temperature、Top P、最大回應長度、音色等,與普通大模型參數一致,控制回覆的隨機性、長度與音色。 |
| 身分提示 | 否 | 設定 Agent 的身分與角色,作為系統提示注入對話;三種模式通用。 |
即時模型沒有獨立的 ASR / TTS 環節,因此不提供轉錄指令、語音語言、TTS 符號清理(移除 / 替換)等設定——這些能力已內化在模型中。
ASR-LLM-TTS
三段式鏈路:語音先辨識為文字,交由文字大模型推理,再把回覆合成為語音。三段可分別選擇模型,是可控性最高的模式。
graph LR U([使用者語音]) --> ASR[ASR 語音辨識] ASR -->|文字| LLM[文字大模型 推理] LLM -->|回覆文字| TTS[TTS 語音合成] TTS --> A([語音回覆])
逐段設定如下:
| 環節 | 設定項 | 說明 |
|---|---|---|
| ASR | 語音辨識模型 | 選擇把使用者語音轉寫成文字的辨識模型。 |
| 轉錄指令 | 引導辨識風格、常見用詞、專有名詞等,提升特定領域(如品牌名、行業術語)的辨識準確率。 | |
| 語音語言 | 指定源語言,或選擇「自動辨識」由模型判斷;指定語言通常更穩定。 | |
| LLM | 文字大模型 | 選擇負責推理的文字大模型,可搭配知識、資料庫、記憶、工具等能力。 |
| 模型參數 | Temperature、Top P、最大回應長度等,與普通大模型一致。 | |
| 身分提示 | 用於設定 Agent 的角色和行為準則。 | |
| TTS | 語音合成模型 | 選擇把文字回覆合成為語音的模型與音色。 |
| 移除 | 輸入需移除的符號,這些符號會在提交給 TTS 前被刪除,避免被讀出。 | |
| 替換 | 輸入需替換為空格的符號,在提交給 TTS 前替換,用於斷句或消除生硬停頓。 |
移除與替換均以英文逗號分隔多個符號;成對括號(如
()、《》)作為一個整體填寫即可。
LLM+TTS
由支援語音輸入的多模態 LLM 直接理解語音,省去獨立 ASR 環節;模型的文字回覆再交給 TTS 合成為語音。
graph LR U([使用者語音]) --> LLM[多模態大模型 直接理解語音] LLM -->|回覆文字| TTS[TTS 語音合成] TTS --> A([語音回覆])
設定項為 LLM(含模型參數與身分提示)與 TTS(含移除、替換),含義同 ASR-LLM-TTS。
輸入
輸入面板控制「Agent 如何聽」,核心是 VAD(語音活動偵測)與附件辨識。
VAD 控制
VAD(語音活動偵測)決定 Agent 如何判斷使用者何時說完、能否被打斷。可調參數會隨引擎模式與辨識模式變化,切換後表單也隨之改變:
- 即時模型:使用模型自帶的 VAD,可在設定頁選擇辨識模式——預設模式或語義模式,預設為預設模式。
- ASR-LLM-TTS / LLM+TTS:使用平台內建 VAD,行為等同預設模式,不提供辨識模式切換。
預設模式
按聲音訊號斷句:靠音量閾值與靜默時長判斷使用者是否說完,行為直觀、可預期。適用於即時模型(選預設模式時)以及 ASR-LLM-TTS、LLM+TTS。
| 設定項 | 取值範圍 | 預設值 | 適用 | 說明 |
|---|---|---|---|---|
| 音量激活 | 0 ~ 1(步長 0.1) | 0.5 | 僅即時模型 | 觸發辨識的音量閾值,越大越不易被環境雜訊誤激活。 |
| 停頓斷句 | 0 ~ 5000 ms(步長 50) | 500 | 通用 | 使用者停止說話後靜默多少毫秒判定為一句結束,越大越不易「搶話」。 |
| 語音打斷 | 0 ~ 1(步長 0.1) | 0.5 | 通用 | 使用者在 Agent 說話時開口打斷(barge-in)的敏感度,越大越容易被打斷;也可整體關閉。 |
語義模式
僅即時模型支援。由模型理解語義來判斷使用者是否說完,不再依賴固定的音量與靜默閾值,斷句更自然,適合停頓多、語氣鬆散的口語對話。
| 設定項 | 取值範圍 | 預設值 | 適用 | 說明 |
|---|---|---|---|---|
| 回應速度 | 低 / 中 / 高 | 中 | 通用 | 判定使用者說完後的回應節奏;越快越緊湊,越慢越從容。 |
| 語音打斷 | 0 ~ 1(步長 0.1) | 0.5 | 通用 | 使用者在 Agent 說話時開口打斷(barge-in)的敏感度,越大越容易被打斷;也可整體關閉。 |
附件
| 設定項 | 說明 |
|---|---|
| 圖片辨識 | 開關。開啟後對話中可辨識圖片。 |
| 附件數量 | 固定為 1 張。 |
| 附件類型 | 僅支援圖片(Image)。 |
輸出
輸出面板控制「Agent 如何說」,包含背景音與快取播放。
背景音
為通話疊加環境音,讓語音對話更有現場感,建議調整到 0.2 左右的音量即可,避免蓋過人聲。
| 設定項 | 取值 | 說明 |
|---|---|---|
| 背景音模式 | 停用 / 預置 / 自訂 | 選擇是否啟用及來源。 |
| 預置選項 | 辦公室 / 咖啡廳 / 雨聲 / 自然 / 白噪音 | 平台內建的環境音。 |
| 自訂 | mp3,≤ 1 MB | 上傳自有背景音訊,應使用首尾相連的無縫音訊。 |
| 背景音量 | 1~50% | 預設 30% |
快取播放
| 設定項 | 取值範圍 | 預設值 | 說明 |
|---|---|---|---|
| 快取播放 | 0 ~ 1500 ms(步長 50) | 200 | 先快取一段回覆語音再開始播放,減少網路抖動造成的卡頓;數值越大越流暢,但首字延遲略增。 |
歡迎引導
設定通話開始時的開場表現,支援多語言分別設定。
| 設定項 | 要求 | 說明 |
|---|---|---|
| 講話形象 | mp4,≤ 5 MB | 虛擬人「正在說話」的循環影片,需首尾幀相連以保證循環過渡自然。 |
| 等待形象 | mp4,≤ 5 MB | 虛擬人「正在傾聽」的循環影片,同樣需首尾幀相連。 |
| 歡迎語 | 文字 | 開啟對話時作為開場白,由模型朗讀一次。 |
通話控制
通話控制用於讓通話更加自然,避免冷場空轉。透過設定掛斷機制防止無限佔用,節省資源和費用。
冷場控制
觸發沉默閾值時,自動追問或播放提示,把使用者拉回對話。
| 設定項 | 取值範圍 | 預設值 | 說明 |
|---|---|---|---|
| 沉默逾時 | 5 ~ 60 秒(步長 1) | 10 | 使用者沉默多久後觸發冷場追問。 |
| 冷場提示 | 文字 | — | 觸發時播放或下發給模型的追問 / 提示文案。 |
掛斷通話
滿足最大通話時長或最大沉默次數任一條件即觸發掛斷。
| 設定項 | 取值範圍 | 預設值 | 說明 |
|---|---|---|---|
| 最大通話時長 | 30 ~ 3600 秒(步長 30) | 600 | 單通通話的最長時間,超過自動結束。 |
| 最大沉默次數 | 1 ~ 100(步長 1) | 5 | 連續冷場累計達到該次數後自動掛斷。 |
| 掛斷提示 | 文字,≤ 20 tokens | — | 掛斷前告知使用者的提示文案。 |
| *主動結束通話 | 開關 | — | 即將支援,開啟後可在對話中允許 AI Agent 主動結束通話,觸發掛斷提示。 |
共享能力面板
語音智能體同樣支援知識、資料庫、記憶等通用 Agent 能力,設定方式與普通 Agent 一致,可參考智能體相關文件。需要注意:
- 人工服務面板在語音智能體中暫顯示「即將支援」。
- 工具、Workflow 等面板在語音智能體中不展示。
各模式配置項對照
不同引擎模式下,設定頁展示的項目略有差異,可對照下表:
| 設定項 | 即時模型 | ASR-LLM-TTS | LLM+TTS |
|---|---|---|---|
| Audio LLM | ✓ | — | — |
| ASR(含轉錄指令 / 語音語言) | — | ✓ | — |
| LLM(文字大模型) | — | ✓ | ✓ |
| TTS(含移除 / 替換) | — | ✓ | ✓ |
| 身分提示 | ✓ | ✓ | ✓ |
| 辨識模式(預設 / 語義) | ✓ | — | — |
| 音量激活 | ✓(預設) | — | — |
| 停頓斷句 | ✓(預設) | ✓ | ✓ |
| 回應速度 | ✓(語義) | — | — |
| 語音打斷 | ✓ | ✓ | ✓ |
| 圖片辨識 | ✓ | ✓ | ✓ |
| 背景音 | — | ✓ | ✓ |
| 快取播放 | ✓ | ✓ | ✓ |
| 歡迎引導 | ✓ | ✓ | ✓ |
| 通話控制 | ✓ | ✓ | ✓ |
參數如何取值才更貼合業務,請繼續閱讀最佳實踐。
