จากแชตบอตสู่ AI agents ที่ทำงานอัตโนมัติและมองเห็นโลก
AI agents ที่ทำงานอัตโนมัติและมองเห็นได้ คือผู้ช่วย AI แบบใหม่ที่ไม่จำกัดตัวเองอยู่กับข้อความ แต่ใช้ความเข้าใจเชิงภาพและหน้าจอเพื่อรับรู้สิ่งรอบตัวบนอุปกรณ์ของผู้ใช้ สามารถอ่านหน้าจอ วิเคราะห์รูปภาพและอินเทอร์เฟซกราฟิก แล้วตัดสินใจลงมือทำงานแทนมนุษย์ เช่น คลิกเมนู กรอกแบบฟอร์ม หรือแปลงรูปถ่ายเป็นงานที่ต้องทำ โดยทำงานแบบ always‑on AI assistants อยู่เบื้องหลังอย่างต่อเนื่องเพื่อคอยช่วยผู้ใช้จัดการชีวิตดิจิทัลและงานส่วนตัวโดยไม่ต้องพิมพ์คำสั่งยาวทุกครั้ง หัวใจของการเปลี่ยนผ่านครั้งนี้คือความสามารถด้านภาพและ GUI automation ด้วย AI เมื่อก่อน ผู้ช่วย AI เชื่อมต่อกับระบบผ่านบรรทัดคำสั่งหรือ API ได้ดี แต่แทบจะ “มองไม่เห็น” หน้าจอกราฟิกที่คนใช้ทุกวัน ผลลัพธ์คือแชตบอตที่ตอบคำถามได้ แต่ช่วยจัดการงานจริงบนเครื่องของเราได้น้อยมาก สิ่งที่เกิดขึ้นตอนนี้คือการยกระดับจากการสนทนาไปสู่การลงมือทำอย่างอิสระ ซึ่งจะเปลี่ยนบทบาทของผู้ช่วยดิจิทัลไปโดยสิ้นเชิง
OpenAI Dots และคลื่นใหม่ของ always‑on AI assistants
การเปิดตัว Dots ของ OpenAI คือสัญญาณชัดเจนว่าเราเดินเข้าสู่ยุค always‑on AI assistants อย่างเต็มตัว Dots ถูกออกแบบเป็นเอเจนต์ขนาดเล็กที่อยู่ในแอป ChatGPT แต่สามารถทำงานเชื่อมกับเครื่องมือทำงานอย่าง Slack และ Microsoft Teams เพื่อเข้าถึงปฏิทิน ขออัปเดตจากเพื่อนร่วมทีม และเชื่อมต่อกับแหล่งข้อมูลธุรกิจที่ได้รับอนุมัติ นี่ไม่ใช่แค่บอตตอบแชต แต่เป็น AI agents ที่ทำงานอัตโนมัติบน “คอมพิวเตอร์บนคลาวด์” ของตัวเอง โดยเครื่องของผู้ใช้ยังแยกต่างหากจนกว่าจะอนุญาตให้เชื่อมต่อ คำกล่าวของผู้บริหารที่ว่า “Dots เป็นเอเจนต์แบบ always‑on ที่สามารถจัดการแทบทุกอย่างที่คุณคิดออกได้” เป็นประโยคที่บอกทิศทางชัดเจนว่าเป้าหมายคือให้ AI ช่วย “รันชีวิต” เราในภาพรวม ไม่ใช่แค่ช่วยตอบคำถามรายครั้ง ในทางปฏิบัติ นี่สะท้อนความเปลี่ยนแปลงจากยุคที่องค์กรเพิ่งเริ่มทดลองใช้เอเจนต์ในงานโค้ดและงานหลังบ้าน ไปสู่การปล่อยให้เอเจนต์วิ่งบนอุปกรณ์พนักงานตลอดเวลา คำถามคือ เราพร้อมให้ตัวแทนดิจิทัลแบบนี้เข้ามาเป็นชั้นกลางระหว่างเราและทุกแอปที่ใช้หรือยัง
| Spec | A | B |
|---|---|---|
| ลักษณะสำคัญ | always‑on AI assistants ที่อยู่ในแอปแชต | เชื่อมต่อเครื่องมือทำงานและข้อมูลองค์กร |
| บทบาท | ผู้ช่วยส่วนตัวและงานสำนักงาน | เอเจนต์จัดการงานอัตโนมัติในระดับทีม |
| การทำงาน | ใช้ GPT‑6‑Astra เป็นโมเดลหลัก | รันบนคลาวด์แยกจากอุปกรณ์ผู้ใช้ |

Holo 4 และการแก้ปัญหาบอต “ตาบอดหน้าจอ” ด้วย GUI automation
แม้ Dots จะผลักดันภาพของเอเจนต์อยู่ตลอดเวลา การทำให้ผู้ช่วย AI ใช้งานคอมพิวเตอร์แทนคนได้จริงยังต้องพึ่งความก้าวหน้าอีกด้าน คือการแก้ปัญหาที่บอตมองไม่เห็น GUI นักพัฒนาโมเดลรายหนึ่งออกแบบตระกูลโมเดล Holo 4 เพื่อให้โมเดลขนาดไม่ใหญ่มากสามารถใช้คอมพิวเตอร์ได้ทั้งผ่าน CLI API และ GUI รวมถึงการชี้ คลิก เลื่อน และพิมพ์ผ่านหน้าจอกราฟิกที่เดิมทีถูกออกแบบมาสำหรับคน นี่คือแกนของ GUI automation ด้วย AI ที่ทำให้เอเจนต์ไม่ถูกจำกัดอยู่ในโลกของข้อความและคำสั่งเท่านั้น ตัวอย่างเด่นคือการใช้ Holo 4 27B กับโปรแกรม FreeCAD โดยให้โมเดลเขียนแมโครออกแบบโมเดลสามมิติของหอไอเฟลแบบอัตโนมัติ แทนการให้คนค่อยๆ วางบล็อกทรงลูกบาศก์ด้วยมือ ในอีกตัวอย่าง โมเดลสร้างโลโก้บริษัทด้วยรูปทรงผสมที่ซับซ้อนกว่า เพื่อแสดงให้เห็นความยืดหยุ่นในการใช้เครื่องมือกราฟิกเดียวกันได้หลายแบบ จุดที่ต้องคิดต่อคือ โมเดลเหล่านี้ใช้โทเคน “การคิด” จำนวนมาก ทำให้ต้นทุนต่อภารกิจสูงกว่าโมเดลแนวหน้าอื่นบางตัว แม้จำนวนพารามิเตอร์จะน้อยกว่า จึงยังต้องชั่งน้ำหนักระหว่างความฉลาดเชิงการใช้คอมพิวเตอร์กับความคุ้มค่าด้านทรัพยากร ที่น่าสนใจอีกอย่างคือ โมเดลเหล่านี้ไม่ใช่ทุกอย่างเมื่อไม่มีโครงเอเจนต์รองรับ ผู้พัฒนาจึงออกแบบ harness สำหรับเอเจนต์ เช่น HAI‑Agents ให้ดาวน์โหลดไปใช้กับโมเดล เพื่อให้ AI agents ที่ทำงานอัตโนมัติสามารถเข้าถึงหน้าจอและลงมือทำกับ GUI ได้แทบเหมือนคน แนวทางนี้สะท้อนว่าการเห็นหน้าจอเป็นแค่ครึ่งหนึ่ง อีกครึ่งคือการออกแบบระบบตัวแทนที่กล้าตัดสินใจและลงมือทำเอง ในแผนต่อไปยังมีการเตรียมปล่อยน้ำหนักแบบร่าง DSpark เพื่อเร่งความเร็วการรันด้วยเทคนิค speculative decoding ซึ่งจะยิ่งผลักดันให้เอเจนต์เหล่านี้ตอบสนองทันใจมากขึ้นในชีวิตจริง
Dazzle AI ผู้ช่วย AI ที่มองเห็นได้สำหรับชีวิตส่วนตัว ไม่ใช่แค่งานออฟฟิศ
ถ้า Dots มองไปที่ผู้ใช้สายทำงาน Dazzle AI กลับตั้งคำถามใหม่กับชีวิตส่วนตัวที่เต็มไปด้วยรูปในมือถือ สตาร์ทอัพฝั่งผู้บริโภครายนี้เปิดตัว Dazzle ในฐานะผู้ช่วยส่วนบุคคลแบบ AI ที่ “เข้าใจผู้ใช้จากรูปภาพ ไม่ใช่จากคำสั่งเปล่า” และอ้างว่าทุกรูปถ่ายคือคำสั่งที่เป็นไปได้ตั้งแต่สิ่งที่ต้องซื้อ ซ่อม ไปจนถึงสิ่งที่ต้องเพิ่มลงปฏิทินหรือเก็บไว้จำ แนวคิดนี้โจมตีปัญหา cold‑start โดยตรง เพราะผู้ใช้ส่วนใหญ่เบื่อที่จะตอบคำถามยาวๆ ก่อนจะได้ผู้ช่วยที่เป็นส่วนตัวจริง Dazzle จึงเริ่มจากกล้องถ่ายรูป แปลงรูปและภาพหน้าจอที่เพิ่งถ่ายเป็นการกระทำผ่านฟีเจอร์ Get It Done ซึ่งจะวิเคราะห์ทันทีและเสนอสิ่งที่ต้องทำอย่างเชิงรุก เช่น ถ่ายรูปแจ็คเก็ตให้มันระบุรุ่น ค้นหาที่จำหน่าย และช่วยดำเนินการซื้อ หรือถ่ายรูปพื้นเสีย ยางแบน หรือประตูโรงรถเสีย แล้วให้มันค้นหาผู้เชี่ยวชาญที่เหมาะสมและจัดการนัดซ่อมให้ ฟีเจอร์นี้ยังช่วยเพิ่มเหตุการณ์จากใบปลิวหรือบัตรนัดลงปฏิทิน และบันทึกโค้ด QR ไว้ในกระเป๋าเงินดิจิทัลโดยที่เราแทบไม่ต้องพิมพ์อะไรเลย อีกด้านคือฟีเจอร์ Ideas ซึ่งหยิบรูปและภาพหน้าจอเก่าๆ มาสังเคราะห์เป็นข้อเสนอส่วนบุคคล เช่นร้านอาหาร คอนเสิร์ต หรือทริปท่องเที่ยวที่น่าจะตรงรสนิยมของผู้ใช้ เมื่อผู้ใช้ตอบรับข้อเสนอ Dazzle จะช่วยดำเนินการต่อในไม่กี่ครั้งแตะ โดยมีแชตที่ทำงานบนโมเดลระดับแนวหน้าซึ่งใส่บริบทส่วนตัวเข้าไปด้วย เพื่อให้ตอบคำถามอย่างเช่นควรซื้อของขวัญอะไรให้หลานชาย หรือใช้วันหยุดสุดสัปดาห์อย่างไรให้สนุก ทั้งหมดนี้ทำให้ Dazzle เป็นตัวอย่างชัดเจนของผู้ช่วย AI ที่มองเห็นได้ซึ่งเน้นผลิตภาพในชีวิตส่วนตัว ไม่ใช่แค่ในโลกออฟฟิศ
จากบอตตอบคำถามสู่เอเจนต์ตัดสินใจเอง: โอกาสและเส้นแบ่งที่ต้องวาง
เมื่อรวมภาพของ Dots Holo 4 และ Dazzle เข้าด้วยกัน เราจะเห็นแนวโน้มกว้างที่ชัดเจนมาก นั่นคือการขยับจากแชตบอตที่รอคำสั่ง ไปสู่ AI agents ที่ทำงานอัตโนมัติและมีอำนาจตัดสินใจเองในระดับหนึ่ง ทั้งในโลกงานและชีวิตส่วนตัว องค์กรเริ่มคุ้นเคยกับเอเจนต์ที่ช่วยเขียนโค้ดหรือทำงานหลังบ้าน ขณะเดียวกันผู้ใช้ทั่วไปก็เริ่มทดลองให้ผู้ช่วยเชิงภาพอย่าง Dazzle จัดการงานซื้อ‑ซ่อม‑วางแผนให้โดยแทบไม่พิมพ์คำสั่ง จุดร่วมของทั้งหมดคือการใช้ GUI automation ด้วย AI และการจำแนกงานจากรูปภาพเพื่อให้เอเจนต์ทำงานต่อเนื่องโดยไม่ต้องถูก “ปลุก” ทุกครั้ง คำถามสำคัญจึงไม่ใช่ว่าเทคโนโลยีทำได้หรือไม่ แต่คือเราจะออกแบบขอบเขตและความเป็นส่วนตัวอย่างไร ผู้ช่วยแบบ Dazzle เน้นว่าเป็นระบบเลือกเข้าร่วม ผู้ใช้จะให้สิทธิ์เข้าถึงทั้งคลังรูป เฉพาะรูป หรือไม่ให้เลยก็ได้ และตัวเอเจนต์ทำงาน “ในนามของคุณ ไม่ใช่ในฐานะคุณ” โดยมีบัญชีและเครื่องมือของตัวเอง ไม่แอบอ้างตัวตนผู้ใช้ ฝั่ง Dots ก็แบ่งคอมพิวเตอร์บนคลาวด์ของเอเจนต์ออกจากเครื่องของผู้ใช้เพื่อจำกัดการเข้าถึงข้อมูล แนวทางเหล่านี้เป็นสัญญาณว่าโลก AI agents เริ่มเห็นความเสี่ยงและพยายามวางรั้วตั้งแต่ต้น แต่สุดท้ายผู้ใช้และองค์กรต้องกล้าตั้งคำถามเองว่าจะยอมให้ผู้ช่วยดิจิทัล “เห็นและลงมือ” แค่ไหน ในมุมมองของผู้เขียน คลื่นนี้เป็นทั้งโอกาสและบททดสอบ โอกาสเพราะผู้ช่วย AI ที่มองเห็นได้และทำ GUI automation ด้วย AI สามารถลดงานจุกจิกลงอย่างมหาศาล ตั้งแต่คลิกปุ่มเดิมซ้ำๆ ไปจนถึงแปลงรูปถ่ายในมือถือเป็นแผนชีวิตอย่างเป็นระบบ บททดสอบเพราะเราต้องหาจุดสมดุลระหว่างความสะดวกกับการคงสิทธิ์ควบคุมข้อมูลและการตัดสินใจไว้กับมนุษย์ หากทำได้ดี AI agents ที่ทำงานอัตโนมัติแบบ always‑on AI assistants จะไม่ใช่ภัย แต่เป็นชั้นช่วยคิดและช่วยทำที่ทำให้ทั้งองค์กรและชีวิตส่วนตัวของเราจัดการได้ดีขึ้นอย่างเห็นได้ชัด






