คู่มือการตั้งค่าเอเจนต์เสียง
บทความนี้อธิบายพารามิเตอร์แต่ละตัวตามลำดับแผงจากบนลงล่างของหน้าตั้งค่า: บทบาทของมัน ช่วงค่าและค่าเริ่มต้น ตลอดจนโหมดเอนจินที่ใช้ได้ เอเจนต์เสียงยังคงความสามารถทั่วไปอย่างความรู้ ฐานข้อมูล หน่วยความจำ ในขณะเดียวกันก็เพิ่มการตั้งค่าที่เกี่ยวกับเสียงห้ากลุ่ม ได้แก่ เอนจินเสียง อินพุต เอาต์พุต การนำทางต้อนรับ การควบคุมการโทร
หากยังไม่เข้าใจแนวคิดพื้นฐานของเอเจนต์เสียงและโหมดเอนจินสามแบบ แนะนำให้อ่านภาพรวมเอเจนต์เสียงก่อน
เอนจินเสียง
ด้านบนของแผงเอนจินเสียงคือตัวเลือกโหมดเอนจิน สามารถสลับ Real-time model, ASR-LLM-TTS, LLM+TTS ได้ หลังจากสลับแล้ว โมเดลและพารามิเตอร์ที่แสดงด้านล่างจะเปลี่ยนไปตามนั้น
Real-time model (REALTIME)
โมเดลเสียงเรียลไทม์ตัวเดียวทำ「ฟัง — คิด — พูด」ให้เสร็จแบบ end-to-end อินพุตและเอาต์พุตของเสียงอยู่ในลูปปิดภายในโมเดลเดียวกัน ตรงกลางไม่ผ่านการรู้จำเสียงและการสังเคราะห์เสียงอิสระ จึงมีความหน่วงต่ำที่สุดและน้ำเสียงเป็นธรรมชาติที่สุด
โดยทั่วไป เราแนะนำโหมด Real-time model มากกว่า เพราะความหน่วงต่ำที่สุด น้ำเสียงเป็นธรรมชาติ เหมาะกับสถานการณ์เสียงแบบเรียลไทม์ส่วนใหญ่ โมเดล Live ที่ OpenAI กำลังจะเปิดตัวไม่เพียงรองรับเสียงเรียลไทม์แบบฟูลดูเพล็กซ์ (full-duplex) เท่านั้น แต่เมื่อเจองานที่ซับซ้อนยังสามารถเรียกใช้โมเดลข้อความขนาดใหญ่ที่มีความสามารถสูงกว่าเบื้องหลังได้ ในอนาคตจะกลายเป็นทางเลือกอันดับแรกของเสียงเรียลไทม์
graph LR U([เสียงผู้ใช้]) --> RT[โมเดลเสียงเรียลไทม์ ประมวลผล end-to-end] RT --> A([ตอบกลับด้วยเสียง])
Real-time model รวมการรู้จำ การอนุมาน การสังเคราะห์ ไว้ในโมเดลเดียว จึงมีรายการตั้งค่าที่กระชับที่สุด:
| รายการตั้งค่า | จำเป็น | คำอธิบาย |
|---|---|---|
| Audio LLM | ใช่ | เลือกโมเดลเสียงเรียลไทม์ที่ประมวลผลเสียงแบบ end-to-end การรู้จำ การอนุมาน การสังเคราะห์ ทำโดยมันทั้งหมด |
| พารามิเตอร์โมเดล | ไม่ | Temperature, Top P, ความยาวการตอบสูงสุด, โทนเสียง ฯลฯ เหมือนพารามิเตอร์โมเดลขนาดใหญ่ทั่วไป ควบคุมความสุ่ม ความยาว และโทนเสียงของคำตอบ |
| พรอมป์ตัวตน | ไม่ | กำหนดตัวตนและบทบาทของ Agent โดยฉีดเข้าไปในการสนทนาเป็นพรอมป์ระบบ ใช้ร่วมกันได้ทั้งสามโหมด |
Real-time model ไม่มีช่วง ASR / TTS อิสระ จึงไม่มีการตั้งค่าคำสั่งถอดเสียง ภาษาของเสียง การล้างสัญลักษณ์ TTS (ลบ / แทนที่) ฯลฯ ความสามารถเหล่านี้ถูกรวมอยู่ภายในโมเดลแล้ว
ASR-LLM-TTS
เส้นทางแบบสามช่วง: เสียงถูกรู้จำเป็นข้อความก่อน ส่งให้โมเดลข้อความขนาดใหญ่อนุมาน แล้วสังเคราะห์คำตอบเป็นเสียง ทั้งสามช่วงเลือกโมเดลได้แยกกัน เป็นโหมดที่ควบคุมได้มากที่สุด
graph LR U([เสียงผู้ใช้]) --> ASR[ASR การรู้จำเสียง] ASR -->|ข้อความ| LLM[โมเดลข้อความขนาดใหญ่ อนุมาน] LLM -->|ข้อความคำตอบ| TTS[TTS การสังเคราะห์เสียง] TTS --> A([ตอบกลับด้วยเสียง])
การตั้งค่าทีละช่วงมีดังนี้:
| ช่วง | รายการตั้งค่า | คำอธิบาย |
|---|---|---|
| ASR | โมเดลการรู้จำเสียง | เลือกโมเดลการรู้จำที่แปลงเสียงผู้ใช้เป็นข้อความ |
| คำสั่งถอดเสียง | นำทางสไตล์การรู้จำ คำที่ใช้บ่อย คำเฉพาะ ฯลฯ เพื่อเพิ่มความแม่นยำในการรู้จำในโดเมนเฉพาะ (เช่น ชื่อแบรนด์ ศัพท์เฉพาะทาง) | |
| ภาษาของเสียง | ระบุภาษาต้นทาง หรือเลือก「รู้จำอัตโนมัติ」ให้โมเดลตัดสิน โดยทั่วไปการระบุภาษาจะเสถียรกว่า | |
| LLM | โมเดลข้อความขนาดใหญ่ | เลือกโมเดลข้อความขนาดใหญ่ที่รับผิดชอบการอนุมาน สามารถจับคู่กับความสามารถอย่างความรู้ ฐานข้อมูล หน่วยความจำ เครื่องมือ ได้ |
| พารามิเตอร์โมเดล | Temperature, Top P, ความยาวการตอบสูงสุด ฯลฯ เหมือนกับโมเดลขนาดใหญ่ทั่วไป | |
| พรอมป์ตัวตน | ใช้กำหนดบทบาทและหลักเกณฑ์พฤติกรรมของ Agent | |
| TTS | โมเดลการสังเคราะห์เสียง | เลือกโมเดลและโทนเสียงที่สังเคราะห์ข้อความคำตอบเป็นเสียง |
| ลบ | ป้อนสัญลักษณ์ที่ต้องลบ สัญลักษณ์เหล่านี้จะถูกลบก่อนส่งให้ TTS เพื่อหลีกเลี่ยงการอ่านออกมา | |
| แทนที่ | ป้อนสัญลักษณ์ที่ต้องแทนที่ด้วยช่องว่าง โดยแทนที่ก่อนส่งให้ TTS ใช้สำหรับตัดประโยคหรือขจัดการหยุดที่ไม่เป็นธรรมชาติ |
ทั้งลบและแทนที่ใช้จุลภาคภาษาอังกฤษคั่นสัญลักษณ์หลายตัว วงเล็บที่เป็นคู่ (เช่น
(),《》) กรอกเป็นชุดเดียวได้เลย
LLM+TTS
โมเดล LLM มัลติโมดัลที่รองรับอินพุตเสียงเข้าใจเสียงโดยตรง ตัดขั้นตอน ASR อิสระออกไป จากนั้นข้อความคำตอบของโมเดลจะส่งให้ TTS สังเคราะห์เป็นเสียง
graph LR U([เสียงผู้ใช้]) --> LLM[โมเดลมัลติโมดัลขนาดใหญ่ เข้าใจเสียงโดยตรง] LLM -->|ข้อความคำตอบ| TTS[TTS การสังเคราะห์เสียง] TTS --> A([ตอบกลับด้วยเสียง])
รายการตั้งค่าคือ LLM (รวมพารามิเตอร์โมเดลและพรอมป์ตัวตน) และ TTS (รวมลบ แทนที่) ความหมายเหมือนกับ ASR-LLM-TTS
อินพุต
แผงอินพุตควบคุม「Agent ฟังอย่างไร」แก่นหลักคือ VAD (การตรวจจับกิจกรรมเสียงพูด) และการรู้จำสิ่งแนบ
การควบคุม VAD
VAD (การตรวจจับกิจกรรมเสียงพูด) กำหนดว่า Agent จะตัดสินอย่างไรว่าผู้ใช้พูดจบเมื่อใด และสามารถถูกขัดจังหวะได้หรือไม่ พารามิเตอร์ที่ปรับได้จะเปลี่ยนไปตามโหมดเอนจินและโหมดการรู้จำ หลังจากสลับแล้วฟอร์มจะเปลี่ยนตามไปด้วย:
- Real-time model: ใช้ VAD ที่มากับโมเดล สามารถเลือกโหมดการรู้จำในหน้าตั้งค่าได้ — โหมดพรีเซ็ตหรือโหมดเชิงความหมาย ค่าเริ่มต้นคือโหมดพรีเซ็ต
- ASR-LLM-TTS / LLM+TTS: ใช้ VAD ในตัวของแพลตฟอร์ม พฤติกรรมเหมือนกับโหมดพรีเซ็ต ไม่มีการสลับโหมดการรู้จำ
โหมดพรีเซ็ต
ตัดประโยคตามสัญญาณเสียง: อาศัยเกณฑ์ระดับความดังและระยะเวลาความเงียบเพื่อตัดสินว่าผู้ใช้พูดจบหรือไม่ พฤติกรรมตรงไปตรงมา คาดเดาได้ ใช้ได้กับ Real-time model (เมื่อเลือกโหมดพรีเซ็ต) รวมถึง ASR-LLM-TTS, LLM+TTS
| รายการตั้งค่า | ช่วงค่า | ค่าเริ่มต้น | ใช้ได้กับ | คำอธิบาย |
|---|---|---|---|---|
| การกระตุ้นด้วยระดับความดัง | 0 ~ 1(ขั้น 0.1) | 0.5 | เฉพาะ Real-time model | เกณฑ์ระดับความดังที่ทริกเกอร์การรู้จำ ยิ่งมากยิ่งไม่ถูกเสียงรบกวนจากสภาพแวดล้อมกระตุ้นผิดพลาด |
| การหยุดตัดประโยค | 0 ~ 5000 ms(ขั้น 50) | 500 | ทั่วไป | หลังจากผู้ใช้หยุดพูด เงียบไปกี่มิลลิวินาทีจึงตัดสินว่าประโยคหนึ่งจบ ยิ่งมากยิ่งไม่「แย่งพูด」 |
| การขัดจังหวะด้วยเสียง | 0 ~ 1(ขั้น 0.1) | 0.5 | ทั่วไป | ความไวของการที่ผู้ใช้เปิดปากพูดขัดจังหวะขณะที่ Agent กำลังพูด (barge-in) ยิ่งมากยิ่งถูกขัดจังหวะได้ง่าย ปิดทั้งหมดก็ได้ |
โหมดเชิงความหมาย
รองรับเฉพาะ Real-time model โดยให้โมเดลเข้าใจความหมายเพื่อตัดสินว่าผู้ใช้พูดจบหรือไม่ ไม่พึ่งเกณฑ์ระดับความดังและความเงียบที่ตายตัวอีกต่อไป การตัดประโยคเป็นธรรมชาติกว่า เหมาะกับการสนทนาภาษาพูดที่มีการหยุดมากและน้ำเสียงหลวม ๆ
| รายการตั้งค่า | ช่วงค่า | ค่าเริ่มต้น | ใช้ได้กับ | คำอธิบาย |
|---|---|---|---|---|
| ความเร็วในการตอบสนอง | ต่ำ / กลาง / สูง | กลาง | ทั่วไป | จังหวะการตอบสนองหลังจากตัดสินว่าผู้ใช้พูดจบ ยิ่งเร็วยิ่งกระชับ ยิ่งช้ายิ่งใจเย็น |
| การขัดจังหวะด้วยเสียง | 0 ~ 1(ขั้น 0.1) | 0.5 | ทั่วไป | ความไวของการที่ผู้ใช้เปิดปากพูดขัดจังหวะขณะที่ Agent กำลังพูด (barge-in) ยิ่งมากยิ่งถูกขัดจังหวะได้ง่าย ปิดทั้งหมดก็ได้ |
สิ่งแนบ
| รายการตั้งค่า | คำอธิบาย |
|---|---|
| การรู้จำรูปภาพ | สวิตช์ เมื่อเปิดแล้วระหว่างการสนทนาจะรู้จำรูปภาพได้ |
| จำนวนสิ่งแนบ | คงที่ที่ 1 รูป |
| ประเภทสิ่งแนบ | รองรับเฉพาะรูปภาพ (Image) |
เอาต์พุต
แผงเอาต์พุตควบคุม「Agent พูดอย่างไร」ประกอบด้วยเสียงพื้นหลังและการเล่นจากแคช
เสียงพื้นหลัง
ซ้อนเสียงสภาพแวดล้อมลงในการโทร เพื่อให้การสนทนาด้วยเสียงมีบรรยากาศเหมือนอยู่ในสถานที่จริงมากขึ้น แนะนำให้ปรับระดับความดังไว้ที่ประมาณ 0.2 ก็พอ เพื่อหลีกเลี่ยงการกลบเสียงคน
| รายการตั้งค่า | ค่า | คำอธิบาย |
|---|---|---|
| โหมดเสียงพื้นหลัง | ปิดใช้งาน / พรีเซ็ต / กำหนดเอง | เลือกว่าจะเปิดใช้งานหรือไม่และมาจากแหล่งใด |
| ตัวเลือกพรีเซ็ต | สำนักงาน / คาเฟ่ / เสียงฝน / ธรรมชาติ / เสียงขาว | เสียงสภาพแวดล้อมในตัวของแพลตฟอร์ม |
| กำหนดเอง | mp3, ≤ 1 MB | อัปโหลดเสียงพื้นหลังของตนเอง ควรใช้เสียงที่ต่อหัวท้ายกันแบบไร้รอยต่อ |
| ระดับความดังพื้นหลัง | 1~50% | ค่าเริ่มต้น 30% |
การเล่นจากแคช
| รายการตั้งค่า | ช่วงค่า | ค่าเริ่มต้น | คำอธิบาย |
|---|---|---|---|
| การเล่นจากแคช | 0 ~ 1500 ms(ขั้น 50) | 200 | แคชเสียงคำตอบช่วงหนึ่งก่อนแล้วจึงเริ่มเล่น ลดการกระตุกที่เกิดจากความไม่เสถียรของเครือข่าย ยิ่งค่ามากยิ่งลื่นไหล แต่ความหน่วงของตัวอักษรแรกจะเพิ่มขึ้นเล็กน้อย |
การนำทางต้อนรับ
ตั้งค่าการแสดงเปิดฉากเมื่อเริ่มการโทร รองรับการตั้งค่าแยกตามหลายภาษา
| รายการตั้งค่า | ข้อกำหนด | คำอธิบาย |
|---|---|---|
| ภาพลักษณ์กำลังพูด | mp4, ≤ 5 MB | วิดีโอลูปของภาพลักษณ์เสมือน「กำลังพูด」ต้องให้เฟรมหัวและท้ายต่อกันเพื่อให้การเปลี่ยนลูปเป็นธรรมชาติ |
| ภาพลักษณ์กำลังรอ | mp4, ≤ 5 MB | วิดีโอลูปของภาพลักษณ์เสมือน「กำลังฟัง」เช่นกันต้องให้เฟรมหัวและท้ายต่อกัน |
| ประโยคต้อนรับ | ข้อความ | ใช้เป็นคำเปิดฉากเมื่อเริ่มการสนทนา อ่านโดยโมเดลหนึ่งครั้ง |
การควบคุมการโทร
การควบคุมการโทรใช้เพื่อทำให้การโทรเป็นธรรมชาติมากขึ้น หลีกเลี่ยงการเงียบและไม่คืบหน้า ป้องกันการครอบครองสายอย่างไม่สิ้นสุดด้วยการตั้งค่ากลไกวางสาย เพื่อประหยัดทรัพยากรและค่าใช้จ่าย
การควบคุมเมื่อเงียบ
เมื่อทริกเกอร์เกณฑ์ความเงียบ จะถามต่อโดยอัตโนมัติหรือเล่นข้อความแจ้ง เพื่อดึงผู้ใช้กลับสู่การสนทนา
| รายการตั้งค่า | ช่วงค่า | ค่าเริ่มต้น | คำอธิบาย |
|---|---|---|---|
| หมดเวลาเงียบ | 5 ~ 60 วินาที(ขั้น 1) | 10 | ผู้ใช้เงียบไปนานเท่าไรจึงทริกเกอร์การถามต่อเมื่อเงียบ |
| ข้อความแจ้งเมื่อเงียบ | ข้อความ | — | ข้อความถามต่อ / ข้อความแจ้งที่เล่นหรือส่งให้โมเดลเมื่อทริกเกอร์ |
วางสาย
เมื่อเข้าเงื่อนไขระยะเวลาการโทรสูงสุดหรือจำนวนครั้งของความเงียบสูงสุดอย่างใดอย่างหนึ่ง จะทริกเกอร์การวางสาย
| รายการตั้งค่า | ช่วงค่า | ค่าเริ่มต้น | คำอธิบาย |
|---|---|---|---|
| ระยะเวลาการโทรสูงสุด | 30 ~ 3600 วินาที(ขั้น 30) | 600 | เวลานานที่สุดของการโทรหนึ่งสาย เมื่อเกินจะสิ้นสุดโดยอัตโนมัติ |
| จำนวนครั้งของความเงียบสูงสุด | 1 ~ 100(ขั้น 1) | 5 | เมื่อความเงียบต่อเนื่องสะสมถึงจำนวนครั้งนี้จะวางสายโดยอัตโนมัติ |
| ข้อความแจ้งวางสาย | ข้อความ, ≤ 20 tokens | — | ข้อความแจ้งผู้ใช้ก่อนวางสาย |
| *จบการโทรเชิงรุก | สวิตช์ | — | กำลังจะรองรับ เมื่อเปิดแล้วสามารถให้ AI Agent จบการโทรเชิงรุกในระหว่างการสนทนาได้ ซึ่งจะทริกเกอร์ข้อความแจ้งวางสาย |
แผงความสามารถที่ใช้ร่วมกัน
เอเจนต์เสียงยังรองรับความสามารถทั่วไปของ Agent อย่างความรู้ ฐานข้อมูล หน่วยความจำ ด้วย วิธีตั้งค่าเหมือนกับ Agent ทั่วไป สามารถอ้างอิงเอกสารที่เกี่ยวกับ Agent ได้ สิ่งที่ต้องระวัง:
- แผงบริการโดยมนุษย์ในเอเจนต์เสียงแสดง「กำลังจะรองรับ」ไว้ชั่วคราว
- แผงอย่างเครื่องมือ Workflow ฯลฯ ไม่แสดงในเอเจนต์เสียง
ตารางเทียบรายการตั้งค่าของแต่ละโหมด
ในแต่ละโหมดเอนจิน รายการที่แสดงในหน้าตั้งค่าจะแตกต่างกันเล็กน้อย เทียบได้ตามตารางด้านล่าง:
| รายการตั้งค่า | Real-time model | ASR-LLM-TTS | LLM+TTS |
|---|---|---|---|
| Audio LLM | ✓ | — | — |
| ASR(รวมคำสั่งถอดเสียง / ภาษาของเสียง) | — | ✓ | — |
| LLM(โมเดลข้อความขนาดใหญ่) | — | ✓ | ✓ |
| TTS(รวมลบ / แทนที่) | — | ✓ | ✓ |
| พรอมป์ตัวตน | ✓ | ✓ | ✓ |
| โหมดการรู้จำ(พรีเซ็ต / เชิงความหมาย) | ✓ | — | — |
| การกระตุ้นด้วยระดับความดัง | ✓(พรีเซ็ต) | — | — |
| การหยุดตัดประโยค | ✓(พรีเซ็ต) | ✓ | ✓ |
| ความเร็วในการตอบสนอง | ✓(เชิงความหมาย) | — | — |
| การขัดจังหวะด้วยเสียง | ✓ | ✓ | ✓ |
| การรู้จำรูปภาพ | ✓ | ✓ | ✓ |
| เสียงพื้นหลัง | — | ✓ | ✓ |
| การเล่นจากแคช | ✓ | ✓ | ✓ |
| การนำทางต้อนรับ | ✓ | ✓ | ✓ |
| การควบคุมการโทร | ✓ | ✓ | ✓ |
พารามิเตอร์ควรตั้งค่าอย่างไรจึงจะเข้ากับธุรกิจมากขึ้น โปรดอ่านต่อที่แนวทางปฏิบัติที่ดีที่สุด
