ค้นพบความสนใจของคุณ ไปด้วยกัน

ดีลจริง รีวิวตรงไปตรงมา และเรื่องราวการช้อปปิ้งจากคนที่มีความสนใจเดียวกับคุณ — ทุกวันบน ZestBuy

ค้นพบความสนใจของคุณ ไปด้วยกันดีลจริง รีวิวตรงไปตรงมา และเรื่องราวการช้อปปิ้งจากคนที่มีความสนใจเดียวกับคุณ — ทุกวันบน ZestBuy

GPT-6 Astra เบนช์มาร์กทางการชี้ก้าวกระโดดเหนือคู่แข่ง

GPT-6 Astra เบนช์มาร์กทางการชี้ก้าวกระโดดเหนือคู่แข่ง
ความสนใจ|สำรวจการใช้งาน AI

GPT-6 Astra คืออะไร และทำไมเบนช์มาร์กครั้งนี้จึงสำคัญ

GPT-6 Astra คือโมเดลปัญญาประดิษฐ์รุ่นล่าสุดจาก OpenAI ที่ถูกวางตัวให้เป็นการก้าวกระโดดด้านสมรรถนะ การจัดการงานซับซ้อน และความปลอดภัย โดยมีการเผยแพร่ GPT-6 Astra benchmarks อย่างเป็นทางการเพื่อเปรียบเทียบกับโมเดลชั้นนำอื่นในตลาด ทั้งด้านคอมพิวเตอร์เอเจนต์ การเขียนโค้ด งานวิชาการ และความปลอดภัยเชิงไซเบอร์ เพื่อสะท้อนสมรรถนะในโลกการใช้งานจริงมากกว่าคะแนนทดสอบเชิงทฤษฎีเพียงอย่างเดียว

สาระหลักของข่าวนี้คือ OpenAI เปิดตัว GPT-6 Astra พร้อมเบนช์มาร์กอย่างเป็นทางการ หลังจากบล็อกประกาศหลุดขึ้นเว็บก่อนแล้วถูกถอดออก และลิงก์ใช้งานไม่ได้อยู่ช่วงหนึ่ง ก่อนที่หน้าเว็บพร้อมข้อมูลเต็มชุดจะเข้าถึงได้ในที่สุด การเปิดตัวครั้งนี้มาพร้อมคำประกาศจากประธานบริษัท Greg Brockman ที่เรียก Astra ว่าเป็น “generational leap” และในบางบริบทถึงขั้นบอกว่าอาจเป็นจุดเริ่มต้นของ AGI ได้ พร้อมตารางเปรียบเทียบกับ GPT-5.6 Sol โมเดล Gemini 3.8 Flash และตระกูล Claude รวมถึง Fable 5.1 ทำให้ Astra กลายเป็นศูนย์กลางของการถกเถียงเรื่องผู้นำสมรรถนะในวงการทันที

GPT-6 Astra เบนช์มาร์กทางการชี้ก้าวกระโดดเหนือคู่แข่ง

Fable 5.1 vs Astra ศึกตัวต่อตัวที่เปลี่ยนผู้นำสมรรถนะ

จุดที่น่าจับตาที่สุดคือการเปรียบเทียบ Fable 5.1 vs Astra แบบตัวต่อตัว เบนช์มาร์กที่หลุดออกมาก่อนการยืนยันทางการชี้ว่า OpenAI ดูเหมือนจะทวง “มงกุฎ” สมรรถนะกลับมาจาก Anthropic ได้ หากเชื่อผลทดสอบเหล่านั้น ทั้งที่ Fable 5.1 เองเพิ่งสร้างชื่อด้วยการทำคะแนนสูงสุดบน Artificial Analysis Intelligence Index ที่ 66 แซง Claude Opus 5 และทำคะแนน Terminal-Bench Science 0.1 ได้มากกว่ารุ่นก่อน Fable 5 มากกว่าสองเท่า

ในด้านคณิตศาสตร์ FrontierMath Tier 4 Astra ทำได้ 97.6% เหนือ Fable 5.1 ที่ 87.8% และ GPT-5.6 Sol ที่ 83.0% อย่างชัดเจน บน Terminal-Bench Science 0.1 ซึ่งเคยถูกชูเป็นจุดเด่นของ Fable 5.1 Astra กลับทำได้ 64.6% เทียบกับ 52.6% ของ Fable 5.1 รวมถึง BenchCAD ที่ 95.9% ต่อ 84.3% และ DeepSWE v1.1 ที่ 74.1% ต่อ 67.4% ตามลำดับ ทำให้ภาพรวม Fable 5.1 vs Astra ในเชิง GPT-6 Astra benchmarks เอียงไปทาง Astra อย่างเห็นได้ชัด แม้จะยังมีบางหมวดที่ Fable 5.1 นำอยู่ก็ตาม

GPT-6 Astra เบนช์มาร์กทางการชี้ก้าวกระโดดเหนือคู่แข่ง

เหนือกว่าตัวเลข คือผลกระทบต่อการทำงานจริงของผู้ใช้

ความน่าสนใจของ GPT-6 Astra อยู่ตรงที่เบนช์มาร์กหลายตัวถูกออกแบบมาใกล้เคียงงานจริง ไม่ใช่แค่ข้อสอบมาตรฐาน OpenAI เน้นหมวดการใช้คอมพิวเตอร์แบบเอเจนต์เป็นพิเศษ โดย Brockman ถึงขั้นบอกว่า ผู้ใช้ Astra “จะไม่ต้องคลิกเมาส์หรือพิมพ์คีย์บอร์ดอีกต่อไป” ในอนาคต บน ScreenSpot-Pro Astra ทำได้ 92.7% แซง GPT-5.6 Sol ที่ 76.9% และเหนือ Claude Fable 5 ที่ 87.3% อย่างชัดเจน บน OSWorld 2.0 คะแนนอยู่ที่ 72.6% เหนือ Sol ที่ 65.7% และ Opus 5 ที่ 70.2% แม้ Fable 5.1 จะไม่มีตัวเลขเปรียบเทียบตรงชุดเบนช์มาร์กเดียวกัน

ในหมวดงานมืออาชีพ Astra นำบน AutomationBench ที่ 41.4% เทียบกับ Sol 18.1% และ BenchCAD 95.9% เทียบกับ 83.3% ของ Sol ซึ่งสะท้อนแนวคิดว่า GPT-6 Astra ถูกออกแบบเพื่อ “งานในที่ทำงานจริง” มากกว่าการทำข้อสอบ อย่างไรก็ตาม บน Artificial Analysis Intelligence Index v4.1.1 Fable 5.1 กลับทำได้สูงสุดที่ 65.7 แซง Astra ที่ 61.2 และ Sol ที่ 60.9 ภาพรวมจึงไม่ใช่การชนะขาดทุกสนาม แต่เป็น AI model performance comparison ที่บอกว่า Astra เหมาะกับงานที่ต้องการเอเจนต์จัดการกระบวนการยาวๆ มากขึ้น ในขณะที่ Fable 5.1 ยังแกร่งในคะแนนความฉลาดรวมแบบถัวเฉลี่ย

โค้ด วิชาการ และไซเบอร์ซีเคียวริตี้ Astra นำ แต่ไม่ใช่ทุกสนาม

ในสายงานเขียนโค้ด GPT-6 Astra ไม่ได้ทิ้งห่างคู่แข่งแบบขาดลอย บน Terminal-Bench 4.0 Astra ทำได้ 57.7% เหนือ Fable 5.1 ที่ 55.8% และ Opus 5 ที่ 52.3% แต่เมื่อมอง DeepSWE v1.1 สนามโค้ดเอเจนต์ 113 งาน คะแนนกลับเบียดกันใกล้มาก Astra 74.1% Opus 5 73.7% Gemini 3.8 Flash 73.8% ส่วน Fable 5.1 อยู่ที่ 67.4% เท่านั้น ซึ่งถือว่าเป็นช่องว่างไม่ใหญ่เท่าที่คำว่า “generational leap” ทำให้คาดหวัง

ด้านวิชาการ Astra โชว์พลังเต็มที่ FrontierMath Tier 4 ทำได้ 97.6% เหนือ Fable 5.1 และ Fable 5 ที่เท่ากันที่ 87.8% และเหนือ Opus 5 ที่ 73.2% อย่างมาก บน Terminal-Bench Science 0.1 Astra อยู่ที่ 64.6% เทียบกับ 52.6% ของ Fable 5.1 และ 30.0% ของ Opus 5 ขณะที่ GPQA Diamond กลายเป็นสนามที่ทุกโมเดลอัดกันจนคะแนนอยู่ช่วง 92.6% ถึง 96.0% แสดงว่าทดสอบใกล้แตะเพดานแล้ว จุดที่ Fable 5.1 พลิกนำคือ Humanity’s Last Exam แบบใช้เครื่องมือ Fable 5.1 ทำได้ 65.0% เหนือ Astra ที่ 57.2% ซึ่งตอกย้ำว่าไม่มีโมเดลไหนชนะทุกหมวดใน AI model performance comparison

GPT-6 Astra เบนช์มาร์กทางการชี้ก้าวกระโดดเหนือคู่แข่ง

ความปลอดภัย การจัดแนว และสิ่งที่ผู้ใช้ควรมองต่อจากนี้

Astra ไม่ได้เด่นแค่ความแรง แต่ยังถูกนำเสนอว่าเป็นโมเดลที่ “เชื่อฟัง” และปลอดภัยที่สุดของ OpenAI ด้วย บริษัทเผยตัวเลขการจัดแนวภายในเพื่อยืนยันว่า Astra เป็นโมเดลที่มีพฤติกรรมดีที่สุดของตนในตอนนี้ บนเบนช์มาร์กความปลอดภัยด้านการใช้คอมพิวเตอร์ภายใน (ยิ่งน้อยยิ่งดี) Astra อยู่ที่ 2.4% เทียบกับ Sol ที่ 22.0% และยังลดอัตราการพยายามหลบเลี่ยงข้อจำกัดใกล้ศูนย์ เทียบกับ 0.29% ของ Sol ที่น่าจับตาที่สุดคือการทดสอบ ExploitGym ที่ Astra ทำได้ 0.0% เทียบกับ 48.2% ของ Sol แปลว่าไม่พยายามออกนอกเป้าหมายที่อนุญาต แม้ถูกล่อให้ทำ

ด้านไซเบอร์ซีเคียวริตี้ ทางบริษัทถึงขั้นจัดให้ Astra เป็นโมเดลแรกที่ข้าม “ระดับวิกฤต” ในกรอบประเมินความพร้อมด้านความปลอดภัย พร้อมรายงานว่าทำ ExploitBench ได้ 100% และ SRE-Bench เฉลี่ย 99.2% ในสี่รอบทดสอบ ในสายวิทยาศาสตร์และสุขภาพ Astra ยังนำบน GeneBench Pro และ MedChemBench แม้ไม่มีตัวเลขจากฝั่ง Claude หรือ Gemini มาเทียบ ส่วน HealthBench Professional ที่มีโมเดลครบทุกค่าย Astra อยู่ที่ 63.4% เหนือ Sol 60.5% Fable 5 60.9% Fable 5.1 56.6% และ Opus 5 54.5% พร้อมข้อสังเกตว่า Fable 5.1 ทำคะแนนต่ำกว่ารุ่นก่อนของตัวเอง ซึ่ง Anthropic เคยโยงกับการเพิ่มความเข้มงวดด้านความปลอดภัย

บทสรุป: Astra นำเกม แต่ศึกโมเดลใหญ่ยังไม่จบ

เมื่อมองภาพรวม GPT-6 Astra benchmarks แสดงให้เห็นโมเดลที่นำหน้าคู่แข่งบนเบนช์มาร์กระดับยากหลายด้าน โดยเฉพาะ FrontierMath ไซเบอร์ซีเคียวริตี้ และงานเอเจนต์ที่ต้องใช้โครงสร้างพื้นฐานขนาดใหญ่ ขณะเดียวกันก็ยังเป็นเกมสูสีในหมวดโค้ดทั่วไปและคะแนนความฉลาดรวมที่ Fable 5.1 ยังมีจุดเด่นของตัวเอง สิ่งที่สำคัญต่อผู้ใช้ไม่ใช่แค่คำว่าใคร “แรงที่สุด” แต่คือโมเดลไหนเหมาะกับโจทย์งานและระดับความเสี่ยงที่ยอมรับได้มากกว่า

ในมุมเวลา การเปิดตัว GPT-6 Astra และ Fable 5.1 ห่างกันเพียงไม่กี่วัน ทำให้เป็นการชนกันโดยตรงที่ชัดที่สุดครั้งหนึ่งของปี และกลายเป็นจุดอ้างอิงใหม่ของตลาดโมเดลระดับบน Astra กำลังทยอยปล่อยให้ลูกค้าองค์กรในโปรแกรม Daybreak ใช้งานก่อน จากนั้นจึงตามด้วยผู้ใช้ ChatGPT Plus Pro Business Enterprise รวมถึงผ่าน API และแพลตฟอร์มคลาวด์ต่างๆ ในอีกไม่กี่วันข้างหน้า สำหรับผู้ใช้ทั่วไป สิ่งที่ควรทำคือเริ่มคิดเป็นภาพ “ราคาเฉลี่ยต่อภารกิจที่เสร็จสมบูรณ์” มากกว่าค่าบริการต่อโทเคน ตามแนวทางที่ OpenAI พยายามผลักดันผ่านตัวอย่างอย่าง DeepSWE v1.1 ที่ Astra ทำคะแนนสูงกว่ารุ่นก่อนด้วยต้นทุนต่อภารกิจที่ประเมินว่าลดลงราว 57% ศึกโมเดลใหญ่ยังไม่จบ แต่รอบนี้ Astra ขึ้นนำบนกระดานคะแนนอย่างชัดเจน

ZestBuy ได้รับค่าคอมมิชชั่นเมื่อคุณช้อปผ่านลิงก์ของเรา โดยคุณไม่ต้องจ่ายเพิ่ม บทความนี้สร้างขึ้นด้วย AI จากแหล่งข้อมูลที่เผยแพร่และข้อมูลสินค้า

You May Also Like

Comments
พูดอะไรบางอย่าง...
ยังไม่มีความคิดเห็น มาเป็นคนแรกที่แบ่งปันความคิดเห็นของคุณ!