คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 274/303 ตอน ดูสารบัญคอร์ส

OpenAI เปิดตัวสองบริการนักพัฒนา: GPT-Live-1 เข้าสู่ API และ Agents API เปิดทดสอบสาธารณะ

10/09/2026 211
≈5:30
OpenAI เปิดตัวสองบริการนักพัฒนา: GPT-Live-1 เข้าสู่ API และ Agents API เปิดทดสอบสาธารณะ
ภาพ/Photo by Julian Hochgesang on Unsplash

เมื่อ 10 กันยายน พ.ศ. 2569 OpenAI เปิดให้ใช้โมเดลเสียงฟูลดูเพล็กซ์ GPT-Live-1 ผ่าน API (ชั้นเสียงนาทีละ 0.05 ดอลลาร์สหรัฐ รองรับโทรศัพท์ SIP) และเปิด Agents API แบบ public beta ในวันเดียวกัน (ไม่มีค่าบริการแยก เลือกแซนด์บ็อกซ์ที่ OpenAI ดูแลหรือของตนเองได้) องค์กรจึงสร้างระบบรับสายลูกค้าและเอเจนต์ภายในด้วยเทคโนโลยีระดับเดียวกันได้

เมื่อวันที่ 10 กันยายน พ.ศ. 2569 OpenAI ประกาศการอัปเดตสองรายการบนแพลตฟอร์มนักพัฒนาในวันเดียวกัน รายการแรกคือโมเดลเสียง GPT-Live-1 เปิดให้ใช้งานผ่าน API แบบสาธารณะ รายการที่สองคือ Agents API ซึ่งเปิดให้นักพัฒนาทุกคนใช้งานแบบ public beta ตั้งแต่วันประกาศ ส่วนแรกช่วยให้องค์กรนำการสนทนาเสียงแบบฟูลดูเพล็กซ์ที่ “ฟังไปพูดไป” ไปเชื่อมกับผลิตภัณฑ์และคู่สายโทรศัพท์ของตนเองได้ ส่วนหลังช่วยให้นักพัฒนาสร้างเอเจนต์ที่ลงมือทำงานได้ด้วยการเรียก API เพียงครั้งเดียว ทั้งนี้ GPT-Live เคยเปิดใช้ในโหมดเสียงของ ChatGPT มาแล้วเมื่อเดือนกรกฎาคม ประเด็นสำคัญของข่าวนี้คือเทคโนโลยีชุดเดียวกันถูกส่งมอบให้องค์กรภายนอกนำไปใช้

GPT-Live-1 API: แยกคิดราคาชั้นเสียงกับชั้นประมวลผล

สเปกหลักของ GPT-Live-1 บน API มีดังนี้

  • สนทนาแบบฟูลดูเพล็กซ์: ฟังและพูดได้พร้อมกัน ผู้ใช้พูดแทรกได้โดยไม่ต้องรอให้โมเดลพูดจบ
  • ราคา: ชั้นเสียงนาทีละ 0.05 ดอลลาร์สหรัฐ ค่าโมเดลประมวลผลเบื้องหลังคิดแยกต่างหาก
  • เสียง: เพิ่มเสียงใหม่ 12 แบบ
  • การรู้จำเสียงในตัว: มี ASR ถอดข้อความ การถ่วงน้ำหนักคำสำคัญ (ช่วยให้จับชื่อเฉพาะได้แม่นยำขึ้น) และการตรวจจับจังหวะการผลัดกันพูด
  • ช่องทางเชื่อมต่อ: รองรับ WebRTC, WebSocket และโทรศัพท์ผ่าน SIP
  • การมอบหมายงาน: ส่งต่อการคิดวิเคราะห์และการดำเนินการให้ GPT-6 Astra โมเดลของผู้ให้บริการรายอื่น หรือ Codex thread ได้

หัวใจของการออกแบบนี้คือการแบ่งหน้าที่ระหว่าง “ชั้นเสียง” กับ “ชั้นความคิด” GPT-Live-1 รับหน้าที่ฟัง ตอบรับ และคุมจังหวะบทสนทนา เมื่อต้องค้นข้อมูลหรือตัดสินใจจึงส่งต่อให้โมเดลเบื้องหลัง องค์กรจึงเลือกโมเดลเบื้องหลังตามความยากของงาน และควบคุมต้นทุนแต่ละส่วนแยกกันได้

ตัวเลขผลการทดสอบจาก OpenAI

ผลการทดสอบที่ OpenAI เปิดเผย ได้แก่

  • Tau3: เมื่อใช้ GPT-6 Astra เป็นโมเดลเบื้องหลัง ได้คะแนน 83.6% เทียบกับ GPT-Realtime-2.1 รุ่นก่อนที่ 45.7%
  • Full Duplex Bench: OpenAI ระบุว่าคะแนนเพิ่มขึ้น 30 คะแนน
  • การประเมินของแอปฝึกภาษา Speak: การพูดขัดจังหวะผู้ใช้ลดลง 80%

องค์กรที่นำไปใช้แล้ว ได้แก่ Speak และ Yelp อย่างไรก็ตาม ตัวเลขข้างต้นเป็นข้อมูลที่ OpenAI เปิดเผยเอง ผลลัพธ์จริงยังขึ้นอยู่กับสถานการณ์ใช้งาน ภาษา และโมเดลเบื้องหลังที่แต่ละองค์กรเลือก

Agents API: สร้างเอเจนต์ด้วยการเรียกครั้งเดียว เลือกสภาพแวดล้อมการทำงานได้เอง

Agents API ที่เปิด public beta ในวันเดียวกันไม่มีค่าบริการแยก นักพัฒนาจ่ายเพียงค่า token และค่าใช้เครื่องมือ ความสามารถหลักมีดังนี้

  • สร้างเอเจนต์ได้ด้วยการเรียก API เพียงครั้งเดียว
  • สภาพแวดล้อมการทำงาน: ใช้แซนด์บ็อกซ์ที่ OpenAI ดูแลให้ (โครงสร้างพื้นฐานชุดเดียวกับ Codex และ ChatGPT) หรือใช้ VPC ของตนเองหรือแซนด์บ็อกซ์ของพันธมิตร ได้แก่ Cloudflare, Vercel, Modal, E2B, Daytona, DigitalOcean, Oracle, Blaxel และ Runloop
  • ความสามารถในตัว: บีบอัดบริบทอัตโนมัติ ค้นหาเครื่องมือ เรียกใช้เครื่องมือผ่านโปรแกรม เอเจนต์ย่อยทำงานคู่ขนาน MCP และ web search
  • สถาปัตยกรรมพื้นฐาน: ใช้ Codex harness แบบโอเพนซอร์ส

เดิมองค์กรที่ต้องการสร้างเอเจนต์เองต้องรับมือกับรายละเอียดทางวิศวกรรม เช่น บริบทยาวเกินไป การเชื่อมต่อเครื่องมือ และการแยกสภาพแวดล้อมการทำงาน Agents API รวบสิ่งเหล่านี้เป็นบริการบนแพลตฟอร์ม และเปิดให้วางสภาพแวดล้อมการทำงานไว้บนคลาวด์ขององค์กรเอง ซึ่งเป็นประเด็นที่องค์กรที่ให้ความสำคัญกับที่จัดเก็บข้อมูลควรพิจารณา

ความหมายต่อผู้บริหาร

ความสามารถพื้นฐานทั้งด้านเสียงและด้านเอเจนต์หาได้ในรูปแบบ API แล้ว ยกตัวอย่างระบบรับสายลูกค้า สามารถเชื่อมกับ GPT-Live-1 ผ่าน SIP และเมื่อถึงขั้นตอนที่ต้องดำเนินการ เช่น ตรวจสอบคำสั่งซื้อหรือเปลี่ยนการจอง ก็ส่งต่อให้โมเดลเบื้องหลังอย่าง GPT-6 Astra หรือ Codex thread จัดการ ส่วนการนำไปใช้ร่วมกับเอเจนต์ภายในที่สร้างด้วย Agents API เป็นแนวทางผสมผสานที่องค์กรต้องประเมินเอง ไม่ใช่ฟีเจอร์ที่ OpenAI ประกาศว่าเชื่อมกันแล้ว สำหรับธุรกิจที่มีสายเข้ามาก เช่น การจองห้องพักโรงแรม การจองโต๊ะร้านอาหาร และฝ่ายบริการลูกค้าอีคอมเมิร์ซ ผู้บริหารอาจเริ่มทดลองกับขั้นตอนรับสายที่ไม่ซับซ้อนหนึ่งขั้นตอนในวงเล็ก บันทึกจำนวนนาทีเสียงและค่าประมวลผลก่อนประเมินว่าจะขยายผลหรือไม่ พร้อมกำหนดให้ชัดตั้งแต่ต้นว่าข้อความถอดเสียงและข้อมูลลูกค้าจัดเก็บไว้ที่ใดและเก็บนานเท่าใด

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร Anthropic เปิดตัว Claude for Financial Advisors: ตัวเชื่อมต่อ 11 รายการและทักษะ 8 ชุดสำหรับที่ปรึกษาการลงทุน

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว