คอลัมน์ บันทึกเหตุการณ์ AI เพื่อผู้บริหาร ตอนที่ 129/217 ตอน ดูสารบัญคอร์ส

Anthropic เปิดตัว Claude Sonnet 4.5: SWE-bench ทำคะแนน 77.2% สูงสุดใหม่ ประกาศเป็น "โมเดลเขียนโค้ดที่ดีที่สุดในโลก"

29/09/2025 166
5:32
Anthropic เปิดตัว Claude Sonnet 4.5: SWE-bench ทำคะแนน 77.2% สูงสุดใหม่ ประกาศเป็น "โมเดลเขียนโค้ดที่ดีที่สุดในโลก"

Anthropic เปิดตัว Claude Sonnet 4.5 เมื่อวันที่ 29 กันยายน 2025 ระบุว่าเป็นโมเดลเขียนโค้ดที่ดีที่สุดในโลก ทำคะแนน SWE-bench Verified ได้ 77.2% สูงสุดใหม่ คงสมาธิได้นานกว่า 30 ชั่วโมง ราคาคงเดิม

วันที่ 29 กันยายน 2025 บริษัท Anthropic ได้เปิดตัวโมเดล AI รุ่นใหม่ Claude Sonnet 4.5 อย่างเป็นทางการ โดยประกาศระบุว่าเป็น "โมเดลเขียนโค้ดที่ดีที่สุดในโลก" (the best coding model in the world) นับเป็นการอัปเดตล่าสุดของตระกูล Claude Sonnet นับตั้งแต่เปิดตัวเวอร์ชัน 4.0 เมื่อเดือนพฤษภาคมที่ผ่านมา โมเดลนี้มีรหัสรุ่นว่า claude-sonnet-4-5-20250929 และสามารถเรียกใช้งานผ่าน Anthropic API ได้ทันที

ตามข้อมูลผลการทดสอบมาตรฐานที่บริษัทเปิดเผย Claude Sonnet 4.5 ทำคะแนนได้ 77.2% ในการทดสอบ SWE-bench Verified (ชุดทดสอบงานวิศวกรรมซอฟต์แวร์ วัดความสามารถในการแก้ปัญหาโค้ดจริงบน GitHub) ซึ่งเป็นคะแนนสูงสุดใหม่ในบันทึกสาธารณะ ณ ปัจจุบัน ส่วนการทดสอบ OSWorld (วัดความสามารถควบคุมอินเทอร์เฟซกราฟิกคอมพิวเตอร์และทำงานหลายขั้นตอน) ทำคะแนนได้ 61.4% Anthropic เน้นย้ำว่าโมเดลนี้คงสมาธิในงานที่ซับซ้อนหลายขั้นตอนได้นานกว่า 30 ชั่วโมงโดยไม่หลุดจากเป้าหมาย ที่น่าสังเกตคือ แม้ประสิทธิภาพเพิ่มขึ้น แต่ราคายังคงเดิมที่ 3 ดอลลาร์สหรัฐต่อล้านโทเคนสำหรับอินพุต และ 15 ดอลลาร์สหรัฐต่อล้านโทเคนสำหรับเอาต์พุต เท่ากับรุ่นก่อนหน้า Claude Sonnet 4 ทุกประการ

ความหมายเชิงเทคนิค: จาก "ตอบคำถาม" สู่ "ทำงานอัตโนมัติต่อเนื่องระยะยาว"

ตลอดปีที่ผ่านมา จุดแข่งขันของโมเดล AI ค่อยๆ เปลี่ยนจากความแม่นยำในการตอบคำถามครั้งเดียว ไปสู่ความสามารถทำงานหลายขั้นตอนต่อเนื่องโดยไม่ต้องมีคนคอยกำกับ จุดเน้นเรื่องสมาธิต่อเนื่องกว่า 30 ชั่วโมงของ Claude Sonnet 4.5 สะท้อนทิศทางนี้ชัดเจน โมเดลไม่ได้เป็นเพียงผู้ตอบคำถามเกี่ยวกับโค้ดข้อเดียว แต่ทำหน้าที่เหมือนวิศวกรที่วางแผน ดีบัก ทดสอบ และแก้ไขต่อเนื่องจนงานเสร็จสมบูรณ์ นี่คือเหตุผลที่คะแนน SWE-bench Verified ซึ่งวัด "การแก้ไขโค้ดในสถานการณ์จริง" ยังคงไต่ระดับสูงขึ้นเรื่อยๆ เพราะสิ่งที่วัดไม่ใช่ว่าโมเดลรู้ไวยากรณ์หรือไม่ แต่วัดว่าโมเดลแยกแยะปัญหาและลงมือแก้ไขได้เหมือนวิศวกรมนุษย์หรือไม่

กลยุทธ์ราคา: ประสิทธิภาพเพิ่ม ราคาคงเดิม

Claude Sonnet 4.5 ยังคงราคาเดียวกับ Sonnet 4 รุ่นก่อนหน้า คือ 3 ดอลลาร์ต่อล้านโทเคนสำหรับอินพุต และ 15 ดอลลาร์สำหรับเอาต์พุต โดยไม่ได้ปรับขึ้นตามประสิทธิภาพที่เพิ่มขึ้น กลยุทธ์ "ราคาเดิม ประสิทธิภาพสูงขึ้น" นี้สอดคล้องกับแนวโน้มทั่วไปของตลาดโมเดล AI ตลอดปีที่ผ่านมา คือผู้ให้บริการแต่ละรายอัปเดตโมเดลอย่างต่อเนื่องเพื่อมอบความคุ้มค่าที่สูงขึ้นภายใต้โครงสร้างราคาเดิม เพื่อรักษาฐานลูกค้าองค์กรและนักพัฒนาไว้

ปฏิกิริยาจากวงการ: โอกาสสั่นสะเทือนเครื่องมือช่วยเขียนโค้ด

โมเดลตระกูล Claude โดยเฉพาะ Sonnet เป็นหนึ่งในตัวเลือกเอนจินหลักที่เครื่องมือช่วยเขียนโค้ดด้วย AI ส่วนใหญ่ในตลาดเลือกใช้งานมาอย่างต่อเนื่อง การที่คะแนน SWE-bench Verified ถูกทำลายสถิติซ้ำแล้วซ้ำเล่า มักส่งผลโดยตรงต่อการตัดสินใจของนักพัฒนาว่าจะเลือกใช้โมเดลใดในเวิร์กโฟลว์ของตน เมื่อ Claude Sonnet 4.5 มีความสามารถด้านการดีบักอัตโนมัติและทำงานต่อเนื่องระยะยาวที่ดีขึ้น ผลิตภัณฑ์และทีมงานที่พึ่งพา AI ในการเขียนโค้ด ปรับโครงสร้างโปรแกรม และทดสอบอัตโนมัติ คาดว่าจะประเมินและเปรียบเทียบผู้ให้บริการโมเดลที่ใช้อยู่ใหม่อีกครั้ง

ความหมายสำหรับผู้บริหาร

ความสามารถ "ทำงานอัตโนมัติต่อเนื่องระยะยาว" ที่ Claude Sonnet 4.5 แสดงให้เห็น สะท้อนว่าเครื่องมือ AI กำลังเปลี่ยนบทบาทจาก "ผู้ช่วยพนักงานทำงานย่อยชิ้นเดียว" ไปสู่ "ผู้ที่สามารถรับมอบหมายงานทั้งช่วงของโปรเจกต์แล้ววางแผนลงมือทำเองได้" สำหรับผู้บริหารในสายงานที่ไม่ใช่เทคนิค สิ่งที่ควรให้ความสนใจจากข่าวนี้ไม่ใช่ตัวคะแนนโค้ดเอง แต่คือแนวโน้มที่ว่า "AI สามารถได้รับความไว้วางใจให้ทำงานชิ้นหนึ่งจนจบได้อย่างอิสระหรือไม่" ในอนาคตเมื่อประเมินการนำ AI มาใช้ในทีมงาน นอกจากดูว่าโมเดลตอบถูกหรือไม่แล้ว ควรเริ่มให้ความสำคัญกับว่ามันสามารถทำงานหนึ่งอย่างให้จบตั้งแต่ต้นจนจบได้เองหรือไม่ด้วยเช่นกัน

แบบทดสอบ: ยืนยันความเข้าใจ
5 บทความ · ตอบถูก 80% ผ่าน บันทึกลงโปรไฟล์การเรียนรู้ เข้าสู่ระบบเพื่อทำแบบทดสอบ
ถาม AI: บทความนี้ใช้กับการบริหารของคุณอย่างไร?
เนื้อหาสร้างโดย AI จากบทความนี้ โปรดใช้วิจารณญาณในการพิจารณาความถูกต้อง
ตอนถัดไป・บันทึกเหตุการณ์ AI เพื่อผู้บริหาร DeepSeek เปิดตัว V3.2-Exp รุ่นทดลอง กลไก Sparse Attention ลดต้นทุนประมวลผลลงครึ่งหนึ่ง

บทความที่เกี่ยวข้อง

เราใช้คุกกี้ที่จำเป็นเพื่อรักษาการเข้าสู่ระบบและภาษา และเก็บพฤติกรรมการใช้งานเพื่อปรับปรุงบริการ คุณเลือกเฉพาะที่จำเป็นได้ นโยบายความเป็นส่วนตัว