จากผู้ช่วยสู่ผู้ร่วมวิจัย ทำความเข้าใจปรากฏการณ์ใหม่ของ Claude
Claude AI ความสามารถในบริบทนี้หมายถึงโมเดลปัญญาประดิษฐ์ที่ไม่ได้แค่ตอบคำถามหรือช่วยเขียนโค้ด แต่สามารถรับโจทย์เชิงวิจัยระดับสูงจากมนุษย์ วิเคราะห์ ออกแบบแนวทางทดลอง และดำเนินงานส่วนใหญ่ตั้งแต่ต้นจนจบภายในกระบวนการวิจัย AI ของบริษัทเดียวกัน โดยมีมนุษย์ทำหน้าที่กำกับ ตรวจสอบ และตัดสินใจในขั้นตอนสำคัญ เพื่อให้ AI พัฒนาตัวเองผ่านการมีส่วนร่วมเชิงลึกในวงจรสร้างรุ่นถัดไปของโมเดลความสามารถสูง ปรากฏการณ์ที่น่าสนใจคือบริษัทผู้สร้าง Claude ออกมาเปิดเผยเองว่า ณ เดือนสิงหาคม Claude รับบทระดับนำงานในสัดส่วน 26% ของงานวิจัยและพัฒนาโมเดล AI ภายใน เพิ่มขึ้นจากราว 1% เพียงไม่กี่เดือนก่อนหน้านี้ การขยับจากตัวเลขหลักหน่วยไปสู่หลักยี่สิบภายในช่วงเวลาสั้น เป็นสัญญาณว่าบริษัทไม่ได้มอง AI เป็นแค่เครื่องมือเสริมกำลังทีมมนุษย์อีกต่อไป แต่กำลังยอมให้โมเดลเข้าไปอยู่ใจกลาง AI research workflow ของตัวเองอย่างเป็นทางการ ประเด็นที่สำคัญจึงไม่ใช่แค่ว่า Anthropic গবেষণา ใช้ AI มากขึ้นเท่าไร แต่คือมุมมองใหม่ต่อบทบาทของ AI ในฐานะเพื่อนร่วมงานวิจัยที่มีสิทธิ์นำงานบางส่วน แทนที่เดิมทุกอย่างต้องเริ่มจากมนุษย์คิด ลงมือ ทำเองทั้งหมด การเปลี่ยนจุดยืนเช่นนี้จะสะเทือนรูปแบบการทำงานของห้องทดลอง AI ทั่วโลกในระยะต่อไปอย่างหลีกเลี่ยงไม่ได้

เมื่อ 26% ของงานวิจัยถูกนำโดย AI ตัวเลขที่สะท้อนการเปลี่ยนขั้ว
ข้อมูลที่เผยแพร่ออกมาระบุชัดว่า ณ เดือนสิงหาคม Claude เข้ามารับบทนำงานวิจัยและพัฒนาโมเดลรุ่นใหม่คิดเป็น 26% ของงานทั้งหมด เพิ่มขึ้นรวดเร็วจากระดับราว 1% ในเดือนมีนาคม และมากกว่า 90% ของงานวิจัยของบริษัทมี AI ทำงานร่วมกับมนุษย์ในระดับใดระดับหนึ่ง นี่คือหนึ่งในคำกล่าวอ้างที่น่าจับตาที่สุดในวงการ AI ว่าโมเดลรุ่นปัจจุบันกำลังเป็นแรงขับหลักของการสร้างรุ่นถัดไป คำว่า leads ไม่ได้หมายความว่า Claude ทำงานแบบโดดเดี่ยว บริษัทใช้กรอบวัดระดับอัตโนมัติของ Epoch AI โดยระดับ AL4 หมายถึง AI สามารถทำงานส่วนใหญ่ตั้งแต่ต้นจนจบจากโจทย์ระดับสูง ขณะที่มนุษย์คอยกำกับและตรวจสอบ กล่าวอีกอย่างคือ งานจำนวนมากที่เดิมต้องเป็นหน้าที่เต็มเวลาของทีมนักวิจัยมนุษย์ ตอนนี้ถูกเปลี่ยนให้ Claude ลงมือทำเป็นหลัก แล้วให้มนุษย์มารับบทเป็นผู้กำกับแทน ในทางปฏิบัติ ภายในแพลตฟอร์มวิจัยหลักของบริษัทมี AI Agent ทำงานอยู่ราว 30,000 ตัวในเวลาเดียวกัน แต่ละการดำเนินการต้องผ่านระบบตรวจสอบก่อนลงมือจริง เพื่อควบคุมความเสี่ยงและป้องกันพฤติกรรมที่ไม่ต้องการ สิ่งนี้บอกเราว่า Anthropic গবেষণา ไม่ได้ทดลองใช้ Claude แบบเล่นๆ แต่กำลังสร้างเครื่องจักรงานวิจัยขนาดใหญ่ที่มี AI เป็นแรงงานหลักในสายพานการพัฒนาโมเดล

AI research workflow ใหม่ที่ให้ AI เป็นทั้งคนทำงานและคนประเมินงาน
ความเปลี่ยนแปลงไม่ได้อยู่แค่ตัวเลข 26% แต่มาในรูปแบบ AI research workflow ที่ออกแบบให้ AI ฝังตัวในทุกชั้นของงานวิจัย บริษัทระบุว่าในเดือนสิงหาคม งานวิจัยและพัฒนามากกว่า 90% มี Claude ทำงานร่วมกับนักวิจัยมนุษย์สะท้อนว่า AI ไม่ได้จำกัดอยู่ในงานสนับสนุนอย่างค้นข้อมูลหรือเขียนโค้ดอีกต่อไป แต่เข้าไปช่วยสร้างและพัฒนา AI รุ่นถัดไปจริงๆ ที่น่าสนใจยิ่งกว่านั้น คือวิธีวัดว่า AI มีบทบาทแค่ไหนต่อเนื้องาน บริษัทสุ่มพนักงานราว 20% จากแต่ละแผนกวิจัยในทุกสัปดาห์ของเดือนกรกฎาคม แล้วให้ Claude Agent ดึงรายการงานจาก Slack และเอกสารภายใน จากนั้นให้ Claude อีกตัวในบทบาทผู้ตัดสิน ให้คะแนนว่ากลุ่มงานแต่ละแบบมีระดับอัตโนมัติแค่ไหน กล่าวคือ AI ไม่เพียงทำงาน แต่ยังถูกใช้เป็นผู้ประเมินระดับอัตโนมัติของระบบตัวเองด้วย บริษัทยอมรับจุดอ่อนว่าเมื่อใช้โมเดลของตัวเองตัดสินโมเดลเดียวกัน ผู้ตัดสินอาจทำผิดแบบเดียวกับที่โมเดลทำผิด อย่างไรก็ตามการเปลี่ยนบทบาทให้ AI เป็นทั้งผู้ทำและผู้ตรวจงานใน workflow เดียวกัน แสดงให้เห็นชัดว่ากำลังทดลองรูปแบบใหม่ของ Anthropic গবেষণา ที่ให้ AI พัฒนาตัวเองผ่านวงจร feedback ที่เร่งความเร็วกว่าที่มนุษย์ล้วนจะทำได้ ในขณะที่ยังต้องพยายามวางรั้วคุมความเสี่ยงไปพร้อมกัน
โปร่งใส ความปลอดภัย และเส้นบางๆ ระหว่างการพัฒนาตัวเองกับอำนาจอัตโนมัติ
การเปิดตัวเลขนี้เกิดขึ้นท่ามกลางความสนใจของอุตสาหกรรมต่อแนวคิด AI พัฒนาตัวเองแบบวนซ้ำ กล่าวคือสถานการณ์ที่ AI มีบทบาทสำคัญในการสร้าง AI รุ่นใหม่ที่เก่งกว่าเดิม การที่ Claude นำงานวิจัย 26% ชวนให้ตั้งคำถามว่าเรากำลังเดินเข้าใกล้เส้นแบ่งของการมอบอำนาจให้ AI ตัดสินใจเกี่ยวกับวิวัฒนาการของตัวเองมากแค่ไหน บริษัทอธิบายว่าการเผยแพร่ตัวเลขเหล่านี้ เพื่อเพิ่มความโปร่งใสเกี่ยวกับความเร็วในการพัฒนา AI ภายใน และเสนอกรอบวัดสามด้านให้ห้องทดลองแนวหน้ารายอื่นใช้ตาม ได้แก่ สัดส่วนงานวิจัยที่ AI ทำเอง ระดับการเฝ้าดูการทำงานของ AI Agent และสัดส่วนทรัพยากรคอมพิวต์ที่ใช้กับงานด้านความปลอดภัย นี่เป็นสัญญาณว่าผู้เล่นรายใหญ่เริ่มยอมรับว่าการให้ AI เข้ามาเป็นแรงงานหลักในวงจรวิจัย ต้องมาพร้อมมาตรวัดและการกำกับดูแลชัดเจน ในระบบวิจัยหลักของบริษัท ตัวตรวจสอบอัตโนมัติได้บล็อกการตัดสินใจของ Agent เพียงราว 0.002% หรือประมาณหนึ่งครั้งในทุกๆ 47,000 การดำเนินการในเดือนสิงหาคม มนุษย์จะตรวจการกระทำที่ถูกบล็อกภายในหนึ่งสัปดาห์ และมีระบบตรวจหลังบ้านที่คัดกรองทรานสคริปต์ราว 100,000 รายการต่อสัปดาห์ โดยสุดท้ายมีเพียงประมาณ 50 รายการที่ถึงมือมนุษย์ ตัวเลขเล็กๆ บนฐานใหญ่เช่นนี้ตอกย้ำข้อเท็จจริงว่าแม้ Agent ส่วนใหญ่ทำงานปกติ แต่เมื่อเราปล่อยให้ AI ทำงานในระดับมหาศาล เหตุการณ์ผิดปกติที่เกิดขึ้นไม่บ่อยก็สามารถกลายเป็นเรื่องที่เกิดขึ้นเป็นประจำได้
ข้อสังเกตต่อยุคที่ AI พัฒนาตัวเองได้ แต่ยังต้องมีมนุษย์กำกับ
แม้บริษัทจะย้ำว่าในงานวิจัยทุกส่วนที่มีการวัด Claude ยังไม่ได้ทำงานแบบอัตโนมัติเต็มรูปแบบ และมนุษย์ยังคงกำหนดเป้าหมาย ตรวจสอบ และตัดสินใจในขั้นตอนสำคัญ แต่เมื่อดูภาพรวมของสัดส่วนงานที่ AI นำงาน ขนาดของเครือข่าย Agent จำนวนราว 30,000 ตัวที่ทำงานพร้อมกัน และบทบาทของ Claude ในการประเมินระบบตัวเอง เราก็เลี่ยงไม่ได้ที่จะมองว่านี่คือจุดเปลี่ยน ในมุมหนึ่ง นี่คือการใช้ Claude AI ความสามารถ สูงสุดเท่าที่ห้องทดลองหนึ่งจะทำได้ การปล่อยให้ AI ทำส่วนใหญ่ของงานวิจัยทำให้มนุษย์ขยับจากตำแหน่งผู้ลงมือไปสู่ผู้กำกับเชิงยุทธศาสตร์มากขึ้น ซึ่งอาจเปิดพื้นที่ใหม่ให้ทีมวิจัยคิดเรื่องจริยธรรม ความปลอดภัย และเป้าหมายระยะยาวได้ลึกกว่าเดิม แทนที่จะหมดแรงไปกับงานเชิงเทคนิคที่ AI ทำแทนได้ แต่อีกมุมหนึ่ง เส้นแบ่งระหว่าง AI พัฒนาตัวเองกับ AI มีอำนาจอัตโนมัติยังบางมาก การที่บริษัทต้องออกแบบมาตรวัดและให้คำมั่นว่าจะเปิดเผยตัวเลขเหล่านี้เป็นระยะ รวมถึงแผนที่จะให้ผู้ประเมินอิสระเข้าถึงระบบภายในเพื่อตรวจสอบ เป็นสัญญาณว่าความไว้วางใจต่อวงจรการพัฒนาตัวเองของ AI จะไม่เกิดจากคำอธิบายสวยหรู แต่ต้องสร้างผ่านข้อมูลที่เปิดเผยได้ ตรวจสอบได้ และพร้อมให้คนภายนอกตั้งคำถามต่อได้ตลอด สุดท้าย จุดยืนที่สมเหตุสมผลอาจไม่ใช่การตื่นตระหนกหรือปล่อยปละให้ AI วิจัยตัวเองไร้กรอบ แต่คือการยอมรับว่า AI research workflow ในวันนี้กำลังเปลี่ยนไปอย่างรวดเร็ว และถ้าเราอยากให้การเปลี่ยนแปลงนี้เดินไปในทิศทางที่รับผิดชอบ มนุษย์ต้องยังอยู่ในห่วงโซ่การกำกับ ไม่ใช่แค่ในชื่อ แต่ในอำนาจตัดสินใจที่แท้จริง






