ภาพรวมเอเจนต์เสียง (Audio Agent)
เอเจนต์เสียง (Audio Agent) เป็นประเภท Agent ที่มุ่งเน้นการโต้ตอบด้วยเสียงในพื้นที่นักพัฒนาของ GPTBots ผู้ใช้พูดแทนการพิมพ์ และ Agent ตอบกลับด้วยเสียง เพื่อสร้างประสบการณ์การสนทนาแบบเรียลไทม์ที่ใกล้เคียงกับคนจริง สามารถฝังลงในหน้าเว็บเป็นคอมโพเนนต์สนทนาด้วยเสียงได้ หรือรับสายเข้าโดยตรงผ่านระบบโทรศัพท์ก็ได้ เหมาะกับสถานการณ์อย่างบริการลูกค้าด้วยเสียง ระบบนำทางทางโทรศัพท์ ผู้ช่วยเสียง การฝึกสนทนาภาษาพูด เป็นต้น
เมื่อเทียบกับ Agent แบบข้อความ เอเจนต์เสียงมีความแตกต่างอยู่สามจุด:
- อินพุตและเอาต์พุตเป็นเสียง: ในแต่ละโหมด รูปแบบการประมวลผลเสียงจะแตกต่างกัน
- เซสชันแบบเรียลไทม์: อิงการเชื่อมต่อแบบคงอยู่ (long connection) เพื่อรักษาการสนทนาหนึ่งสาย รองรับการที่ผู้ใช้เปิดปากพูดขัดจังหวะได้ทุกเมื่อ (barge-in) และมีความสามารถในการเชื่อมต่อใหม่เมื่อสายหลุด
- คิดค่าบริการตามปริมาณการใช้เสียง: หักแต้มตามหลักเกณฑ์การวัดคือการรู้จำเสียง การสังเคราะห์เสียง และระยะเวลาการโทร ไม่ใช่ตามจำนวนข้อความแบบข้อความ
แนวคิดหลัก
การเข้าใจแนวคิดต่อไปนี้จะช่วยให้ตั้งค่าและดีบักเอเจนต์เสียงได้ง่ายขึ้น:
| แนวคิด | คำอธิบาย |
|---|---|
| ASR (การรู้จำเสียง) | Automatic Speech Recognition แปลงคำพูดของผู้ใช้เป็นข้อความเพื่อให้โมเดลขนาดใหญ่เข้าใจได้ |
| LLM (การอนุมานด้วยโมเดลขนาดใหญ่) | สร้างคำตอบตามข้อความที่รู้จำได้และบริบท ชั้นนี้เหมือนกับ Agent แบบข้อความ สามารถเรียกใช้ความสามารถอย่างฐานความรู้ ฐานข้อมูล หน่วยความจำ ได้ |
| TTS (การสังเคราะห์เสียง) | Text-To-Speech สังเคราะห์คำตอบข้อความที่โมเดลขนาดใหญ่สร้างขึ้นให้เป็นเสียงเพื่ออ่านให้ผู้ใช้ฟัง |
| VAD (การตรวจจับกิจกรรมเสียงพูด) | Voice Activity Detection ตัดสินว่าผู้ใช้เริ่มพูดเมื่อใดและพูดจบเมื่อใด เป็นพื้นฐานของการตัดประโยคตามธรรมชาติและการขัดจังหวะด้วยเสียง |
| การโทรแบบเรียลไทม์ | การสนทนาด้วยเสียงหนึ่งสายดำเนินอยู่บนการเชื่อมต่อแบบคงอยู่หนึ่งสาย โดย Agent ฟังไปตอบไป |
โหมดเอนจินเสียงสามแบบ
เอเจนต์เสียงมีโหมดเอนจินสามแบบ ซึ่งกำหนดว่าเส้นทาง「เสียง—ข้อความ—เสียง」นี้จะทำโดยใคร หลังจากสร้างแล้วสามารถสลับได้ที่ด้านบนของหน้าตั้งค่า แต่ละโหมดจะแสดงโมเดลและพารามิเตอร์ที่แตกต่างกัน
| โหมด | เส้นทาง | คุณลักษณะ | สถานการณ์ที่เหมาะสม |
|---|---|---|---|
| Real-time model (REALTIME) |
ความหน่วงต่ำที่สุด โมเดลเสียงเรียลไทม์ตัวเดียวประมวลผลอินพุตและเอาต์พุตเสียงแบบ end-to-end | ความหน่วงต่ำที่สุด น้ำเสียงเป็นธรรมชาติ แต่ความควบคุมได้ของโทนเสียงและข้อความค่อนข้างจำกัด | การโทรแบบเรียลไทม์ที่ต้องการความหน่วงต่ำที่สุดและเป็นภาษาพูด |
| ASR-LLM-TTS | การรู้จำเสียง → โมเดลข้อความขนาดใหญ่ → การสังเคราะห์เสียง แบบสามช่วง | ความหน่วงสูงสุด ความสามารถของโมเดลข้อความแข็งแกร่งที่สุด ควบคุมได้มากที่สุด สามารถจับคู่โมเดล ASR, LLM, TTS ได้อย่างอิสระ | บริการลูกค้าด้วยเสียงที่ต้องการลอจิกทางธุรกิจที่ซับซ้อน การเรียกใช้เครื่องมือ และการควบคุมสคริปต์บทพูดอย่างเข้มงวด |
| LLM+TTS | โมเดลขนาดใหญ่ที่รองรับอินพุตเสียงเข้าใจเสียงโดยตรง → การสังเคราะห์เสียง | ความหน่วงปานกลาง ตัดขั้นตอน ASR อิสระออกไป ให้โมเดลขนาดใหญ่「ฟังเข้าใจ」เสียงโดยตรง | โมเดลขนาดใหญ่ที่เลือกรองรับอินพุตเสียงในตัว และต้องการทำให้เส้นทางเรียบง่ายขึ้น |
คำแนะนำในการเลือกดูรายละเอียดได้ที่แนวทางปฏิบัติที่ดีที่สุด โหมดทั้งสามใช้ความสามารถอย่างฐานความรู้ ฐานข้อมูล หน่วยความจำ การควบคุมการโทร และการนำทางต้อนรับ ร่วมกัน เพียงแต่วิธีการทำงานของเส้นทางเสียงแตกต่างกันเท่านั้น
ฟังก์ชันหลัก
- การสนทนาด้วยเสียงแบบเรียลไทม์: ผู้ใช้พูด Agent ตอบแบบเรียลไทม์ ก่อเกิดการโทรแบบหลายรอบ
- การขัดจังหวะด้วยเสียง (barge-in): ผู้ใช้สามารถเปิดปากพูดขัดจังหวะขณะที่ Agent กำลังพูดได้ ปรับความไวได้ ใกล้เคียงกับพฤติกรรมการสนทนาของคนจริง
- การนำทางต้อนรับ: เล่นประโยคต้อนรับเมื่อเริ่มการโทร สามารถอัปโหลดวิดีโอลูปของภาพลักษณ์เสมือนสองช่วงคือ「กำลังพูด」และ「กำลังรอ」เพื่อให้การสนทนาด้วยเสียงมีภาพลักษณ์ที่มองเห็นได้
- การควบคุมการโทร: รองรับการถามต่อโดยอัตโนมัติเมื่อเงียบ การวางสายอัตโนมัติเมื่อหมดเวลาหรือเงียบเป็นเวลานาน เพื่อหลีกเลี่ยงการโทรที่ไม่คืบหน้าหรือการครอบครองสายอย่างไม่สิ้นสุด
- เสียงพื้นหลัง: สามารถซ้อนเสียงสภาพแวดล้อมที่ตั้งค่าไว้ล่วงหน้าอย่างสำนักงาน คาเฟ่ เสียงฝน ลงในการโทร หรืออัปโหลดเสียงกำหนดเองเพื่อสร้างบรรยากาศ (มีผลเฉพาะในโหมด ASR-LLM-TTS และ LLM+TTS)
- การล้างข้อความ TTS: ลบหรือแทนที่สัญลักษณ์อย่างวงเล็บ เครื่องหมาย Markdown ในข้อความคำตอบก่อนอ่านออกเสียง เพื่อหลีกเลี่ยงการอ่านสัญลักษณ์ออกมา
- การรู้จำรูปภาพ: ระหว่างการสนทนารองรับการรู้จำรูปภาพ 1 รูป เพื่อให้สถานการณ์เสียงประมวลผลข้อมูลรูปภาพได้ด้วย
- การตรวจสอบคุณภาพเสียง: แพลตฟอร์มมีการตรวจสอบในตัว กรองเสียงที่สั้นเกินไปและวลี「หูแว่ว」ที่พบบ่อยในการรู้จำโดยอัตโนมัติ (เช่น「ขอบคุณที่รับชม」「ยินดีต้อนรับติดตาม」เป็นต้น) เพื่อลดการทริกเกอร์ผิดพลาด
- การเชื่อมต่อโทรศัพท์ / SIP: สามารถผูกหมายเลข Twilio เพื่อรับสายเข้า หรือโอนสายเข้าผ่านระบบ SIP ของบุคคลที่สาม เพื่อให้ Agent รับสายโทรศัพท์ได้โดยตรง ดูรายละเอียดได้ที่คู่มือปฏิบัติการการเชื่อมต่อระบบโทรศัพท์
เริ่มต้นอย่างรวดเร็ว
- สร้าง: เข้าสู่พื้นที่นักพัฒนา → สร้าง Agent เลือกประเภท「เอเจนต์เสียง (Audio Agent)」
- เลือกโหมดเอนจินและโมเดล: เลือก Real-time model / ASR-LLM-TTS / LLM+TTS ในแผงเอนจินเสียงที่ด้านบนของหน้าตั้งค่า และเลือกโมเดลสำหรับแต่ละช่วง (Audio LLM / ASR / LLM / TTS)
- ตั้งค่าพารามิเตอร์เสียงและการโทร: ตั้งค่าการขัดจังหวะด้วยเสียง การหยุดตัดประโยค ประโยคต้อนรับ การถามต่อเมื่อเงียบ การวางสายอัตโนมัติ ฯลฯ ตามต้องการ ดูรายละเอียดได้ที่คู่มือการตั้งค่า
- ดีบักและทดลอง: เริ่มการสนทนาด้วยเสียงในหน้าต่างดีบัก ตรวจสอบว่าการรู้จำแม่นยำหรือไม่ การขัดจังหวะไวหรือไม่ โทนเสียงและความเร็วในการพูดเหมาะสมหรือไม่
- เชื่อมต่อและเผยแพร่: นำเอเจนต์เสียงไปเชื่อมต่อกับธุรกิจของคุณ รองรับสองวิธี:
- การฝังในหน้าเว็บ: เป็นคอมโพเนนต์สนทนาด้วยเสียงที่ฝังลงในเว็บไซต์
- การเชื่อมต่อระบบโทรศัพท์: ผูกหมายเลขหรือโอนสายเข้าผ่าน SIP
การคิดค่าบริการและการทำงานพร้อมกัน
การโทรด้วยเสียงหักแต้มตามปริมาณการใช้เสียง (การรู้จำเสียง การสังเคราะห์เสียง ระยะเวลาการโทร) เมื่อแต้มไม่พอหรือเกินขีดจำกัดการโทรพร้อมกัน สายเข้าใหม่จะถูกปฏิเสธ ก่อนเผยแพร่โปรดยืนยันว่าบัญชีมีแต้มเพียงพอ และโควตาการทำงานพร้อมกันตรงตามปริมาณการโทรที่คาดไว้ ปัญหาที่พบบ่อยของการเชื่อมต่อโทรศัพท์สามารถดูได้ที่ส่วน FAQ ของคู่มือปฏิบัติการการเชื่อมต่อระบบโทรศัพท์
