ภาพรวมเอเจนต์เสียง (Audio Agent)

ภาพรวมเอเจนต์เสียง (Audio Agent)

เอเจนต์เสียง (Audio Agent) เป็นประเภท Agent ที่มุ่งเน้นการโต้ตอบด้วยเสียงในพื้นที่นักพัฒนาของ GPTBots ผู้ใช้พูดแทนการพิมพ์ และ Agent ตอบกลับด้วยเสียง เพื่อสร้างประสบการณ์การสนทนาแบบเรียลไทม์ที่ใกล้เคียงกับคนจริง สามารถฝังลงในหน้าเว็บเป็นคอมโพเนนต์สนทนาด้วยเสียงได้ หรือรับสายเข้าโดยตรงผ่านระบบโทรศัพท์ก็ได้ เหมาะกับสถานการณ์อย่างบริการลูกค้าด้วยเสียง ระบบนำทางทางโทรศัพท์ ผู้ช่วยเสียง การฝึกสนทนาภาษาพูด เป็นต้น

เมื่อเทียบกับ Agent แบบข้อความ เอเจนต์เสียงมีความแตกต่างอยู่สามจุด:

  • อินพุตและเอาต์พุตเป็นเสียง: ในแต่ละโหมด รูปแบบการประมวลผลเสียงจะแตกต่างกัน
  • เซสชันแบบเรียลไทม์: อิงการเชื่อมต่อแบบคงอยู่ (long connection) เพื่อรักษาการสนทนาหนึ่งสาย รองรับการที่ผู้ใช้เปิดปากพูดขัดจังหวะได้ทุกเมื่อ (barge-in) และมีความสามารถในการเชื่อมต่อใหม่เมื่อสายหลุด
  • คิดค่าบริการตามปริมาณการใช้เสียง: หักแต้มตามหลักเกณฑ์การวัดคือการรู้จำเสียง การสังเคราะห์เสียง และระยะเวลาการโทร ไม่ใช่ตามจำนวนข้อความแบบข้อความ

แนวคิดหลัก

การเข้าใจแนวคิดต่อไปนี้จะช่วยให้ตั้งค่าและดีบักเอเจนต์เสียงได้ง่ายขึ้น:

แนวคิด คำอธิบาย
ASR (การรู้จำเสียง) Automatic Speech Recognition แปลงคำพูดของผู้ใช้เป็นข้อความเพื่อให้โมเดลขนาดใหญ่เข้าใจได้
LLM (การอนุมานด้วยโมเดลขนาดใหญ่) สร้างคำตอบตามข้อความที่รู้จำได้และบริบท ชั้นนี้เหมือนกับ Agent แบบข้อความ สามารถเรียกใช้ความสามารถอย่างฐานความรู้ ฐานข้อมูล หน่วยความจำ ได้
TTS (การสังเคราะห์เสียง) Text-To-Speech สังเคราะห์คำตอบข้อความที่โมเดลขนาดใหญ่สร้างขึ้นให้เป็นเสียงเพื่ออ่านให้ผู้ใช้ฟัง
VAD (การตรวจจับกิจกรรมเสียงพูด) Voice Activity Detection ตัดสินว่าผู้ใช้เริ่มพูดเมื่อใดและพูดจบเมื่อใด เป็นพื้นฐานของการตัดประโยคตามธรรมชาติและการขัดจังหวะด้วยเสียง
การโทรแบบเรียลไทม์ การสนทนาด้วยเสียงหนึ่งสายดำเนินอยู่บนการเชื่อมต่อแบบคงอยู่หนึ่งสาย โดย Agent ฟังไปตอบไป

โหมดเอนจินเสียงสามแบบ

เอเจนต์เสียงมีโหมดเอนจินสามแบบ ซึ่งกำหนดว่าเส้นทาง「เสียง—ข้อความ—เสียง」นี้จะทำโดยใคร หลังจากสร้างแล้วสามารถสลับได้ที่ด้านบนของหน้าตั้งค่า แต่ละโหมดจะแสดงโมเดลและพารามิเตอร์ที่แตกต่างกัน

โหมด เส้นทาง คุณลักษณะ สถานการณ์ที่เหมาะสม
Real-time model
(REALTIME)
ความหน่วงต่ำที่สุด โมเดลเสียงเรียลไทม์ตัวเดียวประมวลผลอินพุตและเอาต์พุตเสียงแบบ end-to-end ความหน่วงต่ำที่สุด น้ำเสียงเป็นธรรมชาติ แต่ความควบคุมได้ของโทนเสียงและข้อความค่อนข้างจำกัด การโทรแบบเรียลไทม์ที่ต้องการความหน่วงต่ำที่สุดและเป็นภาษาพูด
ASR-LLM-TTS การรู้จำเสียง → โมเดลข้อความขนาดใหญ่ → การสังเคราะห์เสียง แบบสามช่วง ความหน่วงสูงสุด ความสามารถของโมเดลข้อความแข็งแกร่งที่สุด ควบคุมได้มากที่สุด สามารถจับคู่โมเดล ASR, LLM, TTS ได้อย่างอิสระ บริการลูกค้าด้วยเสียงที่ต้องการลอจิกทางธุรกิจที่ซับซ้อน การเรียกใช้เครื่องมือ และการควบคุมสคริปต์บทพูดอย่างเข้มงวด
LLM+TTS โมเดลขนาดใหญ่ที่รองรับอินพุตเสียงเข้าใจเสียงโดยตรง → การสังเคราะห์เสียง ความหน่วงปานกลาง ตัดขั้นตอน ASR อิสระออกไป ให้โมเดลขนาดใหญ่「ฟังเข้าใจ」เสียงโดยตรง โมเดลขนาดใหญ่ที่เลือกรองรับอินพุตเสียงในตัว และต้องการทำให้เส้นทางเรียบง่ายขึ้น

คำแนะนำในการเลือกดูรายละเอียดได้ที่แนวทางปฏิบัติที่ดีที่สุด โหมดทั้งสามใช้ความสามารถอย่างฐานความรู้ ฐานข้อมูล หน่วยความจำ การควบคุมการโทร และการนำทางต้อนรับ ร่วมกัน เพียงแต่วิธีการทำงานของเส้นทางเสียงแตกต่างกันเท่านั้น

ฟังก์ชันหลัก

  • การสนทนาด้วยเสียงแบบเรียลไทม์: ผู้ใช้พูด Agent ตอบแบบเรียลไทม์ ก่อเกิดการโทรแบบหลายรอบ
  • การขัดจังหวะด้วยเสียง (barge-in): ผู้ใช้สามารถเปิดปากพูดขัดจังหวะขณะที่ Agent กำลังพูดได้ ปรับความไวได้ ใกล้เคียงกับพฤติกรรมการสนทนาของคนจริง
  • การนำทางต้อนรับ: เล่นประโยคต้อนรับเมื่อเริ่มการโทร สามารถอัปโหลดวิดีโอลูปของภาพลักษณ์เสมือนสองช่วงคือ「กำลังพูด」และ「กำลังรอ」เพื่อให้การสนทนาด้วยเสียงมีภาพลักษณ์ที่มองเห็นได้
  • การควบคุมการโทร: รองรับการถามต่อโดยอัตโนมัติเมื่อเงียบ การวางสายอัตโนมัติเมื่อหมดเวลาหรือเงียบเป็นเวลานาน เพื่อหลีกเลี่ยงการโทรที่ไม่คืบหน้าหรือการครอบครองสายอย่างไม่สิ้นสุด
  • เสียงพื้นหลัง: สามารถซ้อนเสียงสภาพแวดล้อมที่ตั้งค่าไว้ล่วงหน้าอย่างสำนักงาน คาเฟ่ เสียงฝน ลงในการโทร หรืออัปโหลดเสียงกำหนดเองเพื่อสร้างบรรยากาศ (มีผลเฉพาะในโหมด ASR-LLM-TTS และ LLM+TTS)
  • การล้างข้อความ TTS: ลบหรือแทนที่สัญลักษณ์อย่างวงเล็บ เครื่องหมาย Markdown ในข้อความคำตอบก่อนอ่านออกเสียง เพื่อหลีกเลี่ยงการอ่านสัญลักษณ์ออกมา
  • การรู้จำรูปภาพ: ระหว่างการสนทนารองรับการรู้จำรูปภาพ 1 รูป เพื่อให้สถานการณ์เสียงประมวลผลข้อมูลรูปภาพได้ด้วย
  • การตรวจสอบคุณภาพเสียง: แพลตฟอร์มมีการตรวจสอบในตัว กรองเสียงที่สั้นเกินไปและวลี「หูแว่ว」ที่พบบ่อยในการรู้จำโดยอัตโนมัติ (เช่น「ขอบคุณที่รับชม」「ยินดีต้อนรับติดตาม」เป็นต้น) เพื่อลดการทริกเกอร์ผิดพลาด
  • การเชื่อมต่อโทรศัพท์ / SIP: สามารถผูกหมายเลข Twilio เพื่อรับสายเข้า หรือโอนสายเข้าผ่านระบบ SIP ของบุคคลที่สาม เพื่อให้ Agent รับสายโทรศัพท์ได้โดยตรง ดูรายละเอียดได้ที่คู่มือปฏิบัติการการเชื่อมต่อระบบโทรศัพท์

เริ่มต้นอย่างรวดเร็ว

  1. สร้าง: เข้าสู่พื้นที่นักพัฒนา → สร้าง Agent เลือกประเภท「เอเจนต์เสียง (Audio Agent)」
  2. เลือกโหมดเอนจินและโมเดล: เลือก Real-time model / ASR-LLM-TTS / LLM+TTS ในแผงเอนจินเสียงที่ด้านบนของหน้าตั้งค่า และเลือกโมเดลสำหรับแต่ละช่วง (Audio LLM / ASR / LLM / TTS)
  3. ตั้งค่าพารามิเตอร์เสียงและการโทร: ตั้งค่าการขัดจังหวะด้วยเสียง การหยุดตัดประโยค ประโยคต้อนรับ การถามต่อเมื่อเงียบ การวางสายอัตโนมัติ ฯลฯ ตามต้องการ ดูรายละเอียดได้ที่คู่มือการตั้งค่า
  4. ดีบักและทดลอง: เริ่มการสนทนาด้วยเสียงในหน้าต่างดีบัก ตรวจสอบว่าการรู้จำแม่นยำหรือไม่ การขัดจังหวะไวหรือไม่ โทนเสียงและความเร็วในการพูดเหมาะสมหรือไม่
  5. เชื่อมต่อและเผยแพร่: นำเอเจนต์เสียงไปเชื่อมต่อกับธุรกิจของคุณ รองรับสองวิธี:

การคิดค่าบริการและการทำงานพร้อมกัน

การโทรด้วยเสียงหักแต้มตามปริมาณการใช้เสียง (การรู้จำเสียง การสังเคราะห์เสียง ระยะเวลาการโทร) เมื่อแต้มไม่พอหรือเกินขีดจำกัดการโทรพร้อมกัน สายเข้าใหม่จะถูกปฏิเสธ ก่อนเผยแพร่โปรดยืนยันว่าบัญชีมีแต้มเพียงพอ และโควตาการทำงานพร้อมกันตรงตามปริมาณการโทรที่คาดไว้ ปัญหาที่พบบ่อยของการเชื่อมต่อโทรศัพท์สามารถดูได้ที่ส่วน FAQ ของคู่มือปฏิบัติการการเชื่อมต่อระบบโทรศัพท์