ค้นพบความสนใจของคุณ ไปด้วยกัน

ดีลจริง รีวิวตรงไปตรงมา และเรื่องราวการช้อปปิ้งจากคนที่มีความสนใจเดียวกับคุณ — ทุกวันบน ZestBuy

ค้นพบความสนใจของคุณ ไปด้วยกันดีลจริง รีวิวตรงไปตรงมา และเรื่องราวการช้อปปิ้งจากคนที่มีความสนใจเดียวกับคุณ — ทุกวันบน ZestBuy

AI coding agents แตะระดับแนวหน้าในต้นทุนต่ำกว่า 70% เปลี่ยนเกมทีมพัฒนาอย่างไร

AI coding agents แตะระดับแนวหน้าในต้นทุนต่ำกว่า 70% เปลี่ยนเกมทีมพัฒนาอย่างไร
ความสนใจ|เพิ่มประสิทธิภาพงานด้วย AI

AI coding agents คืออะไร และทำไมช่วงนี้ถึงสำคัญขึ้นมา

AI coding agents คือระบบปัญญาประดิษฐ์ที่ทำหน้าที่คล้ายวิศวกรซอฟต์แวร์อัตโนมัติ สามารถอ่านโค้ด ทำความเข้าใจโครงสร้างโปรเจกต์ เขียนแก้ไขทดสอบและส่ง pull request ได้เอง โดยเป้าหมายคือให้ทีมพัฒนาปล่อยฟีเจอร์และแก้บั๊กได้เร็วขึ้น ลดงานซ้ำซ้อนด้านการเขียนและรีวิวโค้ด โดยยังคุมคุณภาพซอฟต์แวร์ให้อยู่ในระดับที่มนุษย์ยอมรับได้

จุดเปลี่ยนรอบนี้คือ Cognition ผู้อยู่เบื้องหลัง Devin ซึ่งเป็น AI coding agent แบบอัตโนมัติ ได้เปิดตัวโมเดล SWE-2 ที่ทำผลงานเข้าใกล้โมเดลระดับแนวหน้า แต่ใช้ทรัพยากรประมวลผลน้อยกว่ามาก หรือในคำพูดแบบ quotable คือ "SWE-2 อยู่ในระยะคะแนนเพียง 1 จุดจากโมเดลระดับ frontier แต่มีต้นทุนการรันต่ำลง 64%" ผลลัพธ์คือภาพของอนาคตที่การเขียนโค้ดระดับองค์กรไม่ต้องผูกกับค่าใช้จ่ายสูงอีกต่อไป และเปิดพื้นที่ให้ทีมพัฒนาโฟกัสที่การออกแบบระบบและคุณค่าทางธุรกิจมากกว่าโค้ดระดับบรรทัด

SWE-2: ประสิทธิภาพใกล้โมเดลแนวหน้า แต่ต้นทุนการเขียนโค้ดต่ำลงมหาศาล

หัวใจของการเปลี่ยนเกมรอบนี้คือ SWE-2 โมเดลสำหรับการเขียนโค้ดที่ทำคะแนน 50.0% บนชุดทดสอบ FrontierCode 1.1 Main ซึ่งออกแบบมาเพื่อดูว่า pull request จาก AI จะถูกเมิร์จโดยเมนเทนเนอร์มนุษย์หรือไม่ คะแนนนี้ทำให้ SWE-2 อยู่ห่างจาก Fable 5.1 โมเดลระดับ frontier เพียง 1 จุด แต่ Cognition ระบุว่าต้นทุนการรันต่ำลง 64% เมื่อเทียบที่ระดับคะแนนเดียวกัน และในบางเบนช์มาร์กประหยัดได้สูงสุดราว 70% ของต้นทุนเดิม

ที่น่าสนใจคือ SWE-2 ไม่ได้เกิดจากการฝึกโมเดลพื้นฐานตั้งแต่ศูนย์ แต่สร้างบน Kimi K3 โมเดลเปิดน้ำหนักขนาด 2.8 ล้านล้านพารามิเตอร์ ซึ่งผ่านการปรับด้วยการเรียนรู้แบบเสริมแรงด้านงานโค้ดมาพอสมควรแล้ว Cognition นำโมเดลนี้มาฝึกต่อให้เฉพาะทางสำหรับงาน software engineering ภายใน Devin ทำให้ได้ทั้งประสิทธิภาพและต้นทุนที่สมดุล SWE-2 ยังถูกออกแบบให้มีระดับ effort ต่างกันในโมเดลเดียว ทั้ง medium high และ max ผ่านการฝึก RL ครั้งเดียว ส่งผลให้ทั้งเส้นโค้งความคุ้มค่าและประสิทธิภาพถูกยกขึ้นพร้อมกัน ไม่ใช่ดีขึ้นเฉพาะโหมดแพงสุด

ในเชิงปฏิบัติ SWE-2 medium ทำคะแนนเทียบเท่าหรือดีกว่า SWE-1.7 บน FrontierCode 1.1 Main แต่ใช้จำนวนรอบน้อยลง 58% และลดต้นทุนเฉลี่ยลงถึง 81% เหตุผลคือโมเดลใหม่มีแนวโน้มสำรวจโค้ดอย่างตรงจุดมากขึ้น ทำการแก้ไขโค้ดครั้งแรกหลังเพียงค่ากลาง 18 ขั้นตอน เทียบกับ 48 ขั้นตอนใน SWE-1.7 ที่เคยถูกวิจารณ์ว่าใช้เวลาอ่านและสำรวจมากเกินไปแม้ในงานง่ายๆ เมื่อรวมกับการประเมินด้านความน่าเชื่อถือทั้งเรื่องโค้ดที่เสี่ยงช่องโหว่หรือเนื้อหาโฆษณาชวนเชื่อ SWE-2 จึงดูพร้อมสำหรับใช้งานในทีมพัฒนาที่ต้องการ automation สูงแต่ยังห่วงเรื่องความปลอดภัย

GPT-6 Astra ทำให้ Devin ตรวจสอบและทดสอบงานตัวเองได้จริง ไม่ใช่แค่เขียนโค้ด

AI coding agents จะเปลี่ยนทีมพัฒนาได้มากน้อยแค่ไหน ขึ้นอยู่กับสิ่งที่เกิดขึ้นหลังการเขียนโค้ดเสร็จ และนี่คือจุดที่ GPT-6 Astra เข้ามาเติมเต็ม Devin อย่างชัดเจน Cognition ใช้ Astra เพื่อให้ Devin ทดสอบงานของตัวเองและแสดงผลลัพธ์อย่างเป็นระบบ ทำให้ขั้นตอน code review มีประสิทธิภาพมากขึ้น ประโยคที่น่าจดคือ "หนึ่งในจุดสำคัญที่ Astra ทำได้ดีขึ้นคือความสามารถในการทดสอบและพิสูจน์ว่างานที่มันทำทำงานตามที่คาดหวัง"

Astra ถูกนำไปใช้ครอบคลุมทั้งผลิตภัณฑ์ของ Cognition ไม่ว่าจะเป็น Devin ในฐานะ cloud agent CLI หรือเดสก์ท็อป ในตัวอย่างหนึ่ง Devin ใช้ Astra ทดสอบเกม iPhone ชื่อ Otter Run โดยส่งคืนทั้งวิดีโอบันทึกการทำงานของแอปจาก simulator และรายงานว่าทดสอบเคสไหนแล้ว เคสไหนยังไม่ได้แตะ วิศวกรจึงไม่ต้องนั่งรันเทสต์ทุกอย่างเอง แต่สามารถดูพฤติกรรมแอปและอ่านรายงานเพื่อสรุปได้ทันทีว่าต้องโฟกัสจุดใดต่อ

ในงานบริการลูกค้า Astra ยังช่วยให้ทีมตอบกลับได้เร็วขึ้น เมื่อลูกค้าส่งภาพหน้าจอบั๊ก ทีมสามารถส่งต่อให้ Devin ผ่าน Astra เพื่อให้แก้ไขและส่งภาพหน้าจอผลลัพธ์กลับไป ที่สำคัญ Cognition มองว่าการให้ Devin ทดสอบงานตัวเองและแนบหลักฐานผลลัพธ์ จะช่วยลดเวลาที่วิศวกรต้องเปิดอ่านโค้ดทีละบรรทัด และคาดหวังว่าเมื่อเวลาผ่านไปจะต้องดูโค้ดน้อยลงแต่ส่งงานออกได้มากขึ้นในแต่ละวัน นี่คือการเลื่อนจุดเน้นจากคำถามว่า AI เขียนโค้ดเก่งแค่ไหน ไปเป็นคำถามว่า AI พิสูจน์คุณภาพงานของตัวเองได้ดีแค่ไหน

Devin กลายเป็นสายพาน end-to-end: จากการเขียนโค้ดถึงการส่งงานพร้อมหลักฐาน

เมื่อ SWE-2 และ GPT-6 Astra มารวมกัน Devin ไม่ได้เป็นแค่ AI ช่วยเขียนโค้ดอีกต่อไป แต่เริ่มกลายเป็นสายพาน software engineering automation แบบ end-to-end Devin ใช้ SWE-2 ในการสำรวจโค้ดเบส วางแผนแก้ไข เขียนและปรับโค้ด แล้วใช้ Astra เพื่อทดสอบและแสดงหลักฐานการทำงานของฟีเจอร์หรือการแก้บั๊กในรูปแบบที่มนุษย์เข้าใจได้ เช่น วิดีโอและรายงานผลเทสต์

ในเชิงโครงสร้างงาน นี่หมายความว่าทีมสามารถให้ Devin รับตั๋วงานเต็มใบ ตั้งแต่รับบั๊กจากภาพหน้าจอ ไปจนถึง commit โค้ดพร้อมหลักฐานว่าเทสต์ผ่าน โดยบทบาทของวิศวกรจะย้ายจากการลงมือเขียนและรันเทสต์เอง ไปเป็นผู้ดูแลคุณภาพภาพรวมและออกแบบสถาปัตยกรรม ความแตกต่างจากยุค AI โค้ดรุ่นก่อนคือโฟกัสไม่ใช่เพียงการช่วยเติมโค้ดบางส่วน แต่เป็นการจัด workflow ใหม่ทั้งชุดให้เอื้อต่อการใช้ AI coding agents เป็น first-class citizen ในทีม

SWE-2 ยังถูกปล่อยใช้งานใน Devin Desktop CLI Web และ Fusion ตั้งแต่วันนี้ ซึ่งหมายความว่าผู้ใช้ Devin รูปแบบต่างๆ จะได้รับประโยชน์จากทั้งประสิทธิภาพการเขียนโค้ดที่สูงขึ้นและต้นทุนที่ต่ำลงในทันที ขณะที่การผสาน Astra ให้ทดสอบและแสดงผลอย่างเป็นรูปธรรม ก็ทำให้ Devin มีความน่าเชื่อถือในบริบทองค์กรเพิ่มขึ้น เพราะทุกการเปลี่ยนแปลงมาพร้อมหลักฐาน ทำให้ทีมรีวิวยอมปล่อยให้ automation ทำงานได้ไกลขึ้นโดยไม่รู้สึกว่าควบคุมไม่ได้

มุมมองต่ออนาคตทีมพัฒนา: จากการนั่งรีวิวทุกบรรทัด สู่การออกแบบระบบและคุณค่า

สิ่งที่ SWE-2 และ GPT-6 Astra ส่งสัญญาณไม่ใช่แค่การลดต้นทุน code generation cost แต่คือการเปลี่ยนสมดุลงานของทีมพัฒนาในระยะยาว หาก AI coding agents อย่าง Devin สามารถเขียนโค้ดระดับใกล้โมเดลแนวหน้าแต่ใช้ต้นทุนต่ำกว่าอย่างมาก แถมยังทดสอบและแสดงหลักฐานผลลัพธ์ได้เอง การให้มนุษย์นั่งรีวิวทุกบรรทัดจะกลายเป็นต้นทุนโอกาสที่แพงเกินไป

แน่นอน สำหรับหลายองค์กร การเปิดทางให้ AI เขียนโค้ดจำนวนมากย่อมมาพร้อมคำถามเรื่องความปลอดภัย การดูแลช่องโหว่ และความรับผิดชอบ แต่การที่ Cognition ลงทุนประเมินความน่าเชื่อถือของ SWE-2 ทั้งในมิติช่องโหว่และพฤติกรรมด้านเนื้อหา รวมทั้งการใช้ Astra เพื่อสร้างหลักฐานการทดสอบที่ตรวจสอบได้ ทำให้บทสนทนาเริ่มเคลื่อนจากความกลัวแบบกำกวม ไปสู่คำถามเชิงวิศวกรรมว่าองค์กรจะออกแบบมาตรฐานและขั้นตอนควบคุมคุณภาพบนฐานที่มี AI อยู่แล้วอย่างไร

สำหรับทีมพัฒนา สิ่งที่ควรทำตอนนี้อาจไม่ใช่รอดูว่ามาตรฐานอุตสาหกรรมจะลงเอยที่จุดไหน แต่คือการทดลองสร้าง workflow ที่ให้ AI coding agents เข้ารับผิดชอบงานทั้งก้อน พร้อมออกแบบแนวทางตรวจสอบที่เหมาะกับบริบทของตัวเอง ยิ่งองค์กรเคลื่อนโฟกัสจากการวัดความเก่งดิบของโมเดล ไปสู่การวัดการส่งงานที่มีคุณภาพและตรวจสอบได้เร็วเพียงใด ก็ยิ่งเข้าใกล้อนาคตที่ AI เป็นส่วนหนึ่งของทีมอย่างเป็นธรรมชาติ ไม่ใช่แค่เครื่องมือเสริมปลายทาง

ZestBuy ได้รับค่าคอมมิชชั่นเมื่อคุณช้อปผ่านลิงก์ของเรา โดยคุณไม่ต้องจ่ายเพิ่ม

You May Also Like

Comments
พูดอะไรบางอย่าง...
ยังไม่มีความคิดเห็น มาเป็นคนแรกที่แบ่งปันความคิดเห็นของคุณ!