คู่มือการตั้งค่าเอเจนต์เสียง

คู่มือการตั้งค่าเอเจนต์เสียง

บทความนี้อธิบายพารามิเตอร์แต่ละตัวตามลำดับแผงจากบนลงล่างของหน้าตั้งค่า: บทบาทของมัน ช่วงค่าและค่าเริ่มต้น ตลอดจนโหมดเอนจินที่ใช้ได้ เอเจนต์เสียงยังคงความสามารถทั่วไปอย่างความรู้ ฐานข้อมูล หน่วยความจำ ในขณะเดียวกันก็เพิ่มการตั้งค่าที่เกี่ยวกับเสียงห้ากลุ่ม ได้แก่ เอนจินเสียง อินพุต เอาต์พุต การนำทางต้อนรับ การควบคุมการโทร

หากยังไม่เข้าใจแนวคิดพื้นฐานของเอเจนต์เสียงและโหมดเอนจินสามแบบ แนะนำให้อ่านภาพรวมเอเจนต์เสียงก่อน

เอนจินเสียง

ด้านบนของแผงเอนจินเสียงคือตัวเลือกโหมดเอนจิน สามารถสลับ Real-time model, ASR-LLM-TTS, LLM+TTS ได้ หลังจากสลับแล้ว โมเดลและพารามิเตอร์ที่แสดงด้านล่างจะเปลี่ยนไปตามนั้น

Real-time model (REALTIME)

โมเดลเสียงเรียลไทม์ตัวเดียวทำ「ฟัง — คิด — พูด」ให้เสร็จแบบ end-to-end อินพุตและเอาต์พุตของเสียงอยู่ในลูปปิดภายในโมเดลเดียวกัน ตรงกลางไม่ผ่านการรู้จำเสียงและการสังเคราะห์เสียงอิสระ จึงมีความหน่วงต่ำที่สุดและน้ำเสียงเป็นธรรมชาติที่สุด

โดยทั่วไป เราแนะนำโหมด Real-time model มากกว่า เพราะความหน่วงต่ำที่สุด น้ำเสียงเป็นธรรมชาติ เหมาะกับสถานการณ์เสียงแบบเรียลไทม์ส่วนใหญ่ โมเดล Live ที่ OpenAI กำลังจะเปิดตัวไม่เพียงรองรับเสียงเรียลไทม์แบบฟูลดูเพล็กซ์ (full-duplex) เท่านั้น แต่เมื่อเจองานที่ซับซ้อนยังสามารถเรียกใช้โมเดลข้อความขนาดใหญ่ที่มีความสามารถสูงกว่าเบื้องหลังได้ ในอนาคตจะกลายเป็นทางเลือกอันดับแรกของเสียงเรียลไทม์

loading...
graph LR
  U([เสียงผู้ใช้]) --> RT[โมเดลเสียงเรียลไทม์ ประมวลผล end-to-end]
  RT --> A([ตอบกลับด้วยเสียง])

Real-time model รวมการรู้จำ การอนุมาน การสังเคราะห์ ไว้ในโมเดลเดียว จึงมีรายการตั้งค่าที่กระชับที่สุด:

รายการตั้งค่า จำเป็น คำอธิบาย
Audio LLM ใช่ เลือกโมเดลเสียงเรียลไทม์ที่ประมวลผลเสียงแบบ end-to-end การรู้จำ การอนุมาน การสังเคราะห์ ทำโดยมันทั้งหมด
พารามิเตอร์โมเดล ไม่ Temperature, Top P, ความยาวการตอบสูงสุด, โทนเสียง ฯลฯ เหมือนพารามิเตอร์โมเดลขนาดใหญ่ทั่วไป ควบคุมความสุ่ม ความยาว และโทนเสียงของคำตอบ
พรอมป์ตัวตน ไม่ กำหนดตัวตนและบทบาทของ Agent โดยฉีดเข้าไปในการสนทนาเป็นพรอมป์ระบบ ใช้ร่วมกันได้ทั้งสามโหมด

Real-time model ไม่มีช่วง ASR / TTS อิสระ จึงไม่มีการตั้งค่าคำสั่งถอดเสียง ภาษาของเสียง การล้างสัญลักษณ์ TTS (ลบ / แทนที่) ฯลฯ ความสามารถเหล่านี้ถูกรวมอยู่ภายในโมเดลแล้ว

ASR-LLM-TTS

เส้นทางแบบสามช่วง: เสียงถูกรู้จำเป็นข้อความก่อน ส่งให้โมเดลข้อความขนาดใหญ่อนุมาน แล้วสังเคราะห์คำตอบเป็นเสียง ทั้งสามช่วงเลือกโมเดลได้แยกกัน เป็นโหมดที่ควบคุมได้มากที่สุด

loading...
graph LR
  U([เสียงผู้ใช้]) --> ASR[ASR การรู้จำเสียง]
  ASR -->|ข้อความ| LLM[โมเดลข้อความขนาดใหญ่ อนุมาน]
  LLM -->|ข้อความคำตอบ| TTS[TTS การสังเคราะห์เสียง]
  TTS --> A([ตอบกลับด้วยเสียง])

การตั้งค่าทีละช่วงมีดังนี้:

ช่วง รายการตั้งค่า คำอธิบาย
ASR โมเดลการรู้จำเสียง เลือกโมเดลการรู้จำที่แปลงเสียงผู้ใช้เป็นข้อความ
คำสั่งถอดเสียง นำทางสไตล์การรู้จำ คำที่ใช้บ่อย คำเฉพาะ ฯลฯ เพื่อเพิ่มความแม่นยำในการรู้จำในโดเมนเฉพาะ (เช่น ชื่อแบรนด์ ศัพท์เฉพาะทาง)
ภาษาของเสียง ระบุภาษาต้นทาง หรือเลือก「รู้จำอัตโนมัติ」ให้โมเดลตัดสิน โดยทั่วไปการระบุภาษาจะเสถียรกว่า
LLM โมเดลข้อความขนาดใหญ่ เลือกโมเดลข้อความขนาดใหญ่ที่รับผิดชอบการอนุมาน สามารถจับคู่กับความสามารถอย่างความรู้ ฐานข้อมูล หน่วยความจำ เครื่องมือ ได้
พารามิเตอร์โมเดล Temperature, Top P, ความยาวการตอบสูงสุด ฯลฯ เหมือนกับโมเดลขนาดใหญ่ทั่วไป
พรอมป์ตัวตน ใช้กำหนดบทบาทและหลักเกณฑ์พฤติกรรมของ Agent
TTS โมเดลการสังเคราะห์เสียง เลือกโมเดลและโทนเสียงที่สังเคราะห์ข้อความคำตอบเป็นเสียง
ลบ ป้อนสัญลักษณ์ที่ต้องลบ สัญลักษณ์เหล่านี้จะถูกลบก่อนส่งให้ TTS เพื่อหลีกเลี่ยงการอ่านออกมา
แทนที่ ป้อนสัญลักษณ์ที่ต้องแทนที่ด้วยช่องว่าง โดยแทนที่ก่อนส่งให้ TTS ใช้สำหรับตัดประโยคหรือขจัดการหยุดที่ไม่เป็นธรรมชาติ

ทั้งลบและแทนที่ใช้จุลภาคภาษาอังกฤษคั่นสัญลักษณ์หลายตัว วงเล็บที่เป็นคู่ (เช่น (), 《》) กรอกเป็นชุดเดียวได้เลย

LLM+TTS

โมเดล LLM มัลติโมดัลที่รองรับอินพุตเสียงเข้าใจเสียงโดยตรง ตัดขั้นตอน ASR อิสระออกไป จากนั้นข้อความคำตอบของโมเดลจะส่งให้ TTS สังเคราะห์เป็นเสียง

loading...
graph LR
  U([เสียงผู้ใช้]) --> LLM[โมเดลมัลติโมดัลขนาดใหญ่ เข้าใจเสียงโดยตรง]
  LLM -->|ข้อความคำตอบ| TTS[TTS การสังเคราะห์เสียง]
  TTS --> A([ตอบกลับด้วยเสียง])

รายการตั้งค่าคือ LLM (รวมพารามิเตอร์โมเดลและพรอมป์ตัวตน) และ TTS (รวมลบ แทนที่) ความหมายเหมือนกับ ASR-LLM-TTS

อินพุต

แผงอินพุตควบคุม「Agent ฟังอย่างไร」แก่นหลักคือ VAD (การตรวจจับกิจกรรมเสียงพูด) และการรู้จำสิ่งแนบ

การควบคุม VAD

VAD (การตรวจจับกิจกรรมเสียงพูด) กำหนดว่า Agent จะตัดสินอย่างไรว่าผู้ใช้พูดจบเมื่อใด และสามารถถูกขัดจังหวะได้หรือไม่ พารามิเตอร์ที่ปรับได้จะเปลี่ยนไปตามโหมดเอนจินและโหมดการรู้จำ หลังจากสลับแล้วฟอร์มจะเปลี่ยนตามไปด้วย:

  • Real-time model: ใช้ VAD ที่มากับโมเดล สามารถเลือกโหมดการรู้จำในหน้าตั้งค่าได้ — โหมดพรีเซ็ตหรือโหมดเชิงความหมาย ค่าเริ่มต้นคือโหมดพรีเซ็ต
  • ASR-LLM-TTS / LLM+TTS: ใช้ VAD ในตัวของแพลตฟอร์ม พฤติกรรมเหมือนกับโหมดพรีเซ็ต ไม่มีการสลับโหมดการรู้จำ

โหมดพรีเซ็ต

ตัดประโยคตามสัญญาณเสียง: อาศัยเกณฑ์ระดับความดังและระยะเวลาความเงียบเพื่อตัดสินว่าผู้ใช้พูดจบหรือไม่ พฤติกรรมตรงไปตรงมา คาดเดาได้ ใช้ได้กับ Real-time model (เมื่อเลือกโหมดพรีเซ็ต) รวมถึง ASR-LLM-TTS, LLM+TTS

รายการตั้งค่า ช่วงค่า ค่าเริ่มต้น ใช้ได้กับ คำอธิบาย
การกระตุ้นด้วยระดับความดัง 0 ~ 1(ขั้น 0.1) 0.5 เฉพาะ Real-time model เกณฑ์ระดับความดังที่ทริกเกอร์การรู้จำ ยิ่งมากยิ่งไม่ถูกเสียงรบกวนจากสภาพแวดล้อมกระตุ้นผิดพลาด
การหยุดตัดประโยค 0 ~ 5000 ms(ขั้น 50) 500 ทั่วไป หลังจากผู้ใช้หยุดพูด เงียบไปกี่มิลลิวินาทีจึงตัดสินว่าประโยคหนึ่งจบ ยิ่งมากยิ่งไม่「แย่งพูด」
การขัดจังหวะด้วยเสียง 0 ~ 1(ขั้น 0.1) 0.5 ทั่วไป ความไวของการที่ผู้ใช้เปิดปากพูดขัดจังหวะขณะที่ Agent กำลังพูด (barge-in) ยิ่งมากยิ่งถูกขัดจังหวะได้ง่าย ปิดทั้งหมดก็ได้

โหมดเชิงความหมาย

รองรับเฉพาะ Real-time model โดยให้โมเดลเข้าใจความหมายเพื่อตัดสินว่าผู้ใช้พูดจบหรือไม่ ไม่พึ่งเกณฑ์ระดับความดังและความเงียบที่ตายตัวอีกต่อไป การตัดประโยคเป็นธรรมชาติกว่า เหมาะกับการสนทนาภาษาพูดที่มีการหยุดมากและน้ำเสียงหลวม ๆ

รายการตั้งค่า ช่วงค่า ค่าเริ่มต้น ใช้ได้กับ คำอธิบาย
ความเร็วในการตอบสนอง ต่ำ / กลาง / สูง กลาง ทั่วไป จังหวะการตอบสนองหลังจากตัดสินว่าผู้ใช้พูดจบ ยิ่งเร็วยิ่งกระชับ ยิ่งช้ายิ่งใจเย็น
การขัดจังหวะด้วยเสียง 0 ~ 1(ขั้น 0.1) 0.5 ทั่วไป ความไวของการที่ผู้ใช้เปิดปากพูดขัดจังหวะขณะที่ Agent กำลังพูด (barge-in) ยิ่งมากยิ่งถูกขัดจังหวะได้ง่าย ปิดทั้งหมดก็ได้

สิ่งแนบ

รายการตั้งค่า คำอธิบาย
การรู้จำรูปภาพ สวิตช์ เมื่อเปิดแล้วระหว่างการสนทนาจะรู้จำรูปภาพได้
จำนวนสิ่งแนบ คงที่ที่ 1 รูป
ประเภทสิ่งแนบ รองรับเฉพาะรูปภาพ (Image)

เอาต์พุต

แผงเอาต์พุตควบคุม「Agent พูดอย่างไร」ประกอบด้วยเสียงพื้นหลังและการเล่นจากแคช

เสียงพื้นหลัง

ซ้อนเสียงสภาพแวดล้อมลงในการโทร เพื่อให้การสนทนาด้วยเสียงมีบรรยากาศเหมือนอยู่ในสถานที่จริงมากขึ้น แนะนำให้ปรับระดับความดังไว้ที่ประมาณ 0.2 ก็พอ เพื่อหลีกเลี่ยงการกลบเสียงคน

รายการตั้งค่า ค่า คำอธิบาย
โหมดเสียงพื้นหลัง ปิดใช้งาน / พรีเซ็ต / กำหนดเอง เลือกว่าจะเปิดใช้งานหรือไม่และมาจากแหล่งใด
ตัวเลือกพรีเซ็ต สำนักงาน / คาเฟ่ / เสียงฝน / ธรรมชาติ / เสียงขาว เสียงสภาพแวดล้อมในตัวของแพลตฟอร์ม
กำหนดเอง mp3, ≤ 1 MB อัปโหลดเสียงพื้นหลังของตนเอง ควรใช้เสียงที่ต่อหัวท้ายกันแบบไร้รอยต่อ
ระดับความดังพื้นหลัง 1~50% ค่าเริ่มต้น 30%

การเล่นจากแคช

รายการตั้งค่า ช่วงค่า ค่าเริ่มต้น คำอธิบาย
การเล่นจากแคช 0 ~ 1500 ms(ขั้น 50) 200 แคชเสียงคำตอบช่วงหนึ่งก่อนแล้วจึงเริ่มเล่น ลดการกระตุกที่เกิดจากความไม่เสถียรของเครือข่าย ยิ่งค่ามากยิ่งลื่นไหล แต่ความหน่วงของตัวอักษรแรกจะเพิ่มขึ้นเล็กน้อย

การนำทางต้อนรับ

ตั้งค่าการแสดงเปิดฉากเมื่อเริ่มการโทร รองรับการตั้งค่าแยกตามหลายภาษา

รายการตั้งค่า ข้อกำหนด คำอธิบาย
ภาพลักษณ์กำลังพูด mp4, ≤ 5 MB วิดีโอลูปของภาพลักษณ์เสมือน「กำลังพูด」ต้องให้เฟรมหัวและท้ายต่อกันเพื่อให้การเปลี่ยนลูปเป็นธรรมชาติ
ภาพลักษณ์กำลังรอ mp4, ≤ 5 MB วิดีโอลูปของภาพลักษณ์เสมือน「กำลังฟัง」เช่นกันต้องให้เฟรมหัวและท้ายต่อกัน
ประโยคต้อนรับ ข้อความ ใช้เป็นคำเปิดฉากเมื่อเริ่มการสนทนา อ่านโดยโมเดลหนึ่งครั้ง

การควบคุมการโทร

การควบคุมการโทรใช้เพื่อทำให้การโทรเป็นธรรมชาติมากขึ้น หลีกเลี่ยงการเงียบและไม่คืบหน้า ป้องกันการครอบครองสายอย่างไม่สิ้นสุดด้วยการตั้งค่ากลไกวางสาย เพื่อประหยัดทรัพยากรและค่าใช้จ่าย

การควบคุมเมื่อเงียบ

เมื่อทริกเกอร์เกณฑ์ความเงียบ จะถามต่อโดยอัตโนมัติหรือเล่นข้อความแจ้ง เพื่อดึงผู้ใช้กลับสู่การสนทนา

รายการตั้งค่า ช่วงค่า ค่าเริ่มต้น คำอธิบาย
หมดเวลาเงียบ 5 ~ 60 วินาที(ขั้น 1) 10 ผู้ใช้เงียบไปนานเท่าไรจึงทริกเกอร์การถามต่อเมื่อเงียบ
ข้อความแจ้งเมื่อเงียบ ข้อความ ข้อความถามต่อ / ข้อความแจ้งที่เล่นหรือส่งให้โมเดลเมื่อทริกเกอร์

วางสาย

เมื่อเข้าเงื่อนไขระยะเวลาการโทรสูงสุดหรือจำนวนครั้งของความเงียบสูงสุดอย่างใดอย่างหนึ่ง จะทริกเกอร์การวางสาย

รายการตั้งค่า ช่วงค่า ค่าเริ่มต้น คำอธิบาย
ระยะเวลาการโทรสูงสุด 30 ~ 3600 วินาที(ขั้น 30) 600 เวลานานที่สุดของการโทรหนึ่งสาย เมื่อเกินจะสิ้นสุดโดยอัตโนมัติ
จำนวนครั้งของความเงียบสูงสุด 1 ~ 100(ขั้น 1) 5 เมื่อความเงียบต่อเนื่องสะสมถึงจำนวนครั้งนี้จะวางสายโดยอัตโนมัติ
ข้อความแจ้งวางสาย ข้อความ, ≤ 20 tokens ข้อความแจ้งผู้ใช้ก่อนวางสาย
*จบการโทรเชิงรุก สวิตช์ กำลังจะรองรับ เมื่อเปิดแล้วสามารถให้ AI Agent จบการโทรเชิงรุกในระหว่างการสนทนาได้ ซึ่งจะทริกเกอร์ข้อความแจ้งวางสาย

แผงความสามารถที่ใช้ร่วมกัน

เอเจนต์เสียงยังรองรับความสามารถทั่วไปของ Agent อย่างความรู้ ฐานข้อมูล หน่วยความจำ ด้วย วิธีตั้งค่าเหมือนกับ Agent ทั่วไป สามารถอ้างอิงเอกสารที่เกี่ยวกับ Agent ได้ สิ่งที่ต้องระวัง:

  • แผงบริการโดยมนุษย์ในเอเจนต์เสียงแสดง「กำลังจะรองรับ」ไว้ชั่วคราว
  • แผงอย่างเครื่องมือ Workflow ฯลฯ ไม่แสดงในเอเจนต์เสียง

ตารางเทียบรายการตั้งค่าของแต่ละโหมด

ในแต่ละโหมดเอนจิน รายการที่แสดงในหน้าตั้งค่าจะแตกต่างกันเล็กน้อย เทียบได้ตามตารางด้านล่าง:

รายการตั้งค่า Real-time model ASR-LLM-TTS LLM+TTS
Audio LLM
ASR(รวมคำสั่งถอดเสียง / ภาษาของเสียง)
LLM(โมเดลข้อความขนาดใหญ่)
TTS(รวมลบ / แทนที่)
พรอมป์ตัวตน
โหมดการรู้จำ(พรีเซ็ต / เชิงความหมาย)
การกระตุ้นด้วยระดับความดัง ✓(พรีเซ็ต)
การหยุดตัดประโยค ✓(พรีเซ็ต)
ความเร็วในการตอบสนอง ✓(เชิงความหมาย)
การขัดจังหวะด้วยเสียง
การรู้จำรูปภาพ
เสียงพื้นหลัง
การเล่นจากแคช
การนำทางต้อนรับ
การควบคุมการโทร

พารามิเตอร์ควรตั้งค่าอย่างไรจึงจะเข้ากับธุรกิจมากขึ้น โปรดอ่านต่อที่แนวทางปฏิบัติที่ดีที่สุด