ชิปอินเฟอร์เรนซ์เฉพาะโมเดลของ AMD ทางลัดใหม่สู่ AI องค์กร

ชิปอินเฟอร์เรนซ์เฉพาะโมเดลของ AMD ทางลัดใหม่สู่ AI องค์กร
ความสนใจ|วิเคราะห์ข้อมูลด้วย AI

ชิปอินเฟอร์เรนซ์เฉพาะโมเดลคืออะไร และเหตุใดดีล AMD–Taalas จึงสำคัญ

ชิปอินเฟอร์เรนซ์เฉพาะโมเดลคือฮาร์ดแวร์ที่ออกแบบให้รองรับโมเดล AI แบบหนึ่งหรือไม่กี่โมเดลโดยตรง โดยฝังพารามิเตอร์ของโมเดลลงในซิลิคอนแทนการเก็บไว้ในหน่วยความจำภายนอก เพื่อตัดขั้นตอนการดึงข้อมูลจากหน่วยความจำความเร็วสูง ลดความซับซ้อนด้านแพ็กเกจจิ้งและการระบายความร้อน และแลกความยืดหยุ่นกับประสิทธิภาพและต้นทุนต่อการใช้งานอินเฟอร์เรนซ์ในปริมาณสูงอย่างมีนัยสำคัญ

การที่ AMD เข้าซื้อ Taalas ไม่ใช่เพียงดีลเพิ่มทีมวิศวกรด้าน AI inference chips เท่านั้น แต่สะท้อนการยอมรับอย่างชัดเจนว่าตลาด AI กำลังแยกออกเป็นสองโลก คือโลกการฝึกโมเดลและโลกการให้บริการอินเฟอร์เรนซ์ที่มีรูปแบบงานเฉพาะเจาะจงมากขึ้นเรื่อยๆ ในขณะที่จีพียูยังเป็นดาราหลักของการฝึกโมเดลและงานต้นแบบ ชิปแบบ model-specific silicon ของ Taalas กลับถูกออกแบบเพื่อโจทย์อีกด้านที่ต่างกันอย่างสิ้นเชิง นั่นคือการรันโมเดลเดิมซ้ำแล้วซ้ำเล่าในสเกลระดับองค์กร โดยสนใจต้นทุนต่อคำตอบมากกว่าความยืดหยุ่นในการสลับโมเดล

ในมุมมองเชิงยุทธศาสตร์ ดีล AMD Taalas acquisition จึงเป็นการประกาศว่าบริษัทไม่ยอมจำกัดตัวเองอยู่แค่แข่งขันจีพียูกับคู่แข่งรายใหญ่ แต่เลือกเปิดแนวรบใหม่ในระดับซิลิคอนที่ผูกกับโมเดลชัดเจน เพื่อเตรียมรับยุคที่ตลาดอินเฟอร์เรนซ์โตเร็วกว่าการฝึกโมเดล และองค์กรเริ่มตั้งคำถามว่าทำไมต้องจ่ายค่าจีพียูระดับดาต้าเซ็นเตอร์เพื่อรันโมเดลที่แทบไม่เปลี่ยนแล้ว

ชิปอินเฟอร์เรนซ์เฉพาะโมเดลของ AMD ทางลัดใหม่สู่ AI องค์กร

ภายในสมองของ Taalas: เมื่อโมเดลกลายเป็นวงจรไฟฟ้า

หัวใจของ Taalas คือแนวคิดว่าการแยกหน่วยความจำกับหน่วยคำนวณใน AI inference chips ทำให้เกิด “กำแพงหน่วยความจำ” ที่จีพียูสมัยใหม่ต้องแก้ด้วย HBM หลายสแต็กและระบบระบายความร้อนแบบของเหลว Taalas เลือกทำตรงกันข้าม โดยผสานหน่วยความจำของโมเดลเข้ากับวงจรคำนวณในชิปเดียว ลดการพึ่งพา HBM และแพ็กเกจจิ้งขั้นสูงอย่างชัดเจน

สถาปัตยกรรม “ฮาร์ดคอร์โมเดล” ของ Taalas ใช้บล็อกฮาร์ดแวร์ที่คำนวณผลคูณที่เป็นไปได้ทั้งหมดของน้ำหนักแบบ quantized 4 บิตไว้ล่วงหน้า จากนั้นแต่ละทรานซิสเตอร์แบบ Mask ROM จะถูกเดินลายโลหะเชื่อมไปยังหนึ่งใน 16 ผลลัพธ์ที่คำนวณไว้ ทำให้วงจรทำหน้าที่เหมือนเราเตอร์เลือกผลลัพธ์มากกว่าตัวคำนวณ ผลคือไม่ต้องโหลดน้ำหนักจากหน่วยความจำเพราะ “วงจรคือโมเดล” ตั้งแต่ขั้นผลิต

ตามข้อมูลของบริษัท ชิป HC1 ที่ใส่โมเดล Llama 3.1 8B สามารถทำอินเฟอร์เรนซ์ได้ประมาณ 16,000–17,000 โทเค็นต่อวินาทีต่อผู้ใช้ ตัวเลขนี้สะท้อนข้อเท็จจริงสำคัญว่าเมื่อยอมแลกความยืดหยุ่นไปกับการตรึงโมเดลลงในซิลิคอน วงจรสามารถถูกจัดเรียงให้ throughput สูงกว่าจีพียูในงานที่ถูกปรับแต่งมาดีแล้วอย่างมีนัยสำคัญ แม้รุ่นแรกต้องแลกด้วยการ quantize 3 บิตที่กระทบคุณภาพผลลัพธ์บ้างก็ตาม

ชิปอินเฟอร์เรนซ์เฉพาะโมเดลของ AMD ทางลัดใหม่สู่ AI องค์กร

เหตุผลทางธุรกิจ: อินเฟอร์เรนซ์องค์กรโตเร็วกว่า และเฉพาะทางกว่า

สิ่งที่ทำให้ model-specific silicon น่าสนใจไม่ใช่ความแปลกใหม่ด้านวิศวกรรมเพียงอย่างเดียว แต่คือแนวโน้มของ enterprise AI deployment ที่กำลังเปลี่ยนจากยุคทดลองไปสู่ยุคปฏิบัติการจริงที่มีปริมาณงานคงที่และทำนายได้ งานอย่างระบบตอบคำถามลูกค้าอัตโนมัติ ตรวจจับการฉ้อโกง วิชั่นอุตสาหกรรม หรือ embedded copilots มักใช้โมเดลที่นิ่งนานเดือนหรือเป็นปี และรันโหลดแบบเดิมซ้ำๆ ในปริมาณสูงมาก

สำหรับเวิร์กโหลดลักษณะนี้ การใช้จีพียูเอนกประสงค์อาจกลายเป็นต้นทุนแฝงที่องค์กรต้องแบกรับเพื่อแลกกับความยืดหยุ่นที่แทบไม่ใช้ประโยชน์ ในทางกลับกัน ชิปเฉพาะโมเดลของ Taalas มีข้อเสนอที่ตรงไปตรงมามากกว่า นั่นคือ throughput สูงขึ้นหลายเท่า พลังงานลดลง และต้นทุนฮาร์ดแวร์ต่อคำตอบต่ำลง เมื่อดูในกรอบเวลาการใช้งานระยะยาว

แน่นอน พื้นที่การใช้งานของ model-specific silicon ไม่ได้ครอบคลุมทุกกรณี CIO ส่วนใหญ่ยังจำเป็นต้องพึ่งจีพียูเพื่อรองรับความต้องการด้าน multi-tenancy การหมุนเวียนโมเดลเร็ว และการทดลองโมเดลใหม่ แต่สำหรับกลุ่มเวิร์กโหลดที่โตแรงที่สุดและคาดเดาได้ เช่น อินเฟอร์เรนซ์ของโมเดลที่ mature แล้ว ทางเลือกอย่างชิปเฉพาะโมเดลเริ่มมองเห็นสมการประหยัดที่เหนือกว่าชัดเจน และนี่คือกลุ่มที่ AMD กำลังเล็งเป้า

กลยุทธ์ AMD: แยกตัวจากจีพียูคู่แข่งด้วยการผูกซิลิคอนกับโมเดล

เมื่อดูภาพรวมผลิตภัณฑ์ของ AMD การซื้อ Taalas คือชิ้น拼ที่ทำให้โครงสร้างเริ่มสมบูรณ์ Instinct GPUs และระบบ Helios rackscale รับบทฮาร์ดแวร์เอนกประสงค์สำหรับการฝึกและอินเฟอร์เรนซ์แบบยืดหยุ่น ขณะที่ดีลร่วมกับ Cerebras มุ่งตอบโจทย์อินเฟอร์เรนซ์ความหน่วงต่ำมากในระดับแร็ก ส่วน Taalas เติมช่องว่างสำคัญ: ฮาร์ดแวร์ acceleration AI สำหรับ decode อินเฟอร์เรนซ์ของโมเดลที่นิ่งแล้วและมีปริมาณการเรียกใช้มหาศาล

ทิศทางนี้ทำให้ AMD ไม่ต้องแข่งขันกับคู่แข่งรายใหญ่ในสนามเดียวกันแบบตัวต่อตัวเสมอไป แต่สามารถนำเสนอ “สแต็กอินเฟอร์เรนซ์แบบแบ่งบท” ที่แยก prefill บนจีพียูออกจาก decode บนชิปเฉพาะโมเดลได้ เมื่อปริมาณอินเฟอร์เรนซ์เติบโตถึงระดับหนึ่ง การจับคู่ระหว่างโมเดลกับซิลิคอนแต่ละรุ่นย่อมให้สมการต้นทุนที่น่าสนใจกว่าการโยนทุกอย่างลงบนจีพียูตัวเดียว

สำหรับองค์กร นี่หมายความว่าการวางแผน enterprise AI deployment ในอนาคตอาจไม่ใช่แค่เลือกจีพียูยี่ห้อไหน แต่ต้องเลือกด้วยว่าโมเดลใดควรอยู่บนฮาร์ดแวร์แบบทั่วไป โมเดลใดควรถูกตรึงลงในซิลิคอนเฉพาะ และโมเดลใดเหมาะกับสถาปัตยกรรมพิเศษอย่าง wafer-scale ดีล AMD Taalas acquisition จึงไม่ใช่การเติมผลิตภัณฑ์อีกตัว แต่เป็นการบอกใบ้ทิศทางใหม่ของตลาดอินเฟอร์เรนซ์ทั้งหมด

ข้อดี ข้อเสีย และอนาคตของการตรึงโมเดลลงในซิลิคอน

ข้อดีของชิปเฉพาะโมเดล

  • ประสิทธิภาพอินเฟอร์เรนซ์สูงมาก โดยมีรายงานว่าทำได้ราว 16,000–17,000 โทเค็นต่อวินาทีต่อผู้ใช้ในงานที่ปรับแต่งแล้ว
  • ลดการพึ่งพา HBM แพ็กเกจจิ้งขั้นสูง และการทำความเย็นแบบของเหลว ทำให้โครงสร้างระบบง่ายและคาดเดาได้มากขึ้น
  • ต้นทุนด้านพลังงานและฮาร์ดแวร์ต่อคำตอบต่ำกว่าจีพียูอย่างมีนัยสำคัญเมื่อโมเดลมีปริมาณเรียกใช้สูงและเปลี่ยนไม่บ่อย

ข้อเสียที่องค์กรต้องรับรู้

  • ขาดความยืดหยุ่น โมเดลเปลี่ยนบ่อยหรือยังอยู่ในช่วงทดลองไม่เหมาะกับการตรึงลงในซิลิคอน
  • คุณภาพผลลัพธ์อาจลดลงเมื่อใช้การ quantize หนักเกินไป เช่น เคส 3 บิตในชิปรุ่นแรกของ Taalas
  • ใช้ได้กับ subset ของ enterprise AI deployment เท่านั้น CIO ยังต้องคงโครงสร้างพื้นฐานจีพียูไว้สำหรับงานส่วนใหญ่

ในภาพรวม การมาของ model-specific silicon ไม่ได้ทำให้จีพียูหมดความหมาย แต่นิยามใหม่ว่าความคุ้มค่าในโลก AI คืออะไร หากในอดีตคำตอบคือ “ความยืดหยุ่นสูงสุด” วันนี้คำตอบสำหรับเวิร์กโหลดอินเฟอร์เรนซ์ปริมาณสูงอาจกลายเป็น “ประสิทธิภาพและต้นทุนต่อหน่วย” แทน

บทสรุปเชิงความเห็นคือ ดีล AMD–Taalas ทำให้เรามองเห็นรูปทรงของตลาด AI รุ่นถัดไปชัดขึ้น: ด้านหนึ่งคือจีพียูและระบบเอนกประสงค์สำหรับนวัตกรรม อีกด้านคือชิปเฉพาะโมเดลสำหรับงานที่นิ่งและใหญ่ การแยกบทบาทนี้ทำให้ AMD มีโอกาสตั้งคำถามกับความเป็นศูนย์กลางของจีพียูในตลาดอินเฟอร์เรนซ์องค์กร และเปิดพื้นที่ให้ผู้ใช้เลือกฮาร์ดแวร์ตามวัฏจักรชีวิตของโมเดล ไม่ใช่ตามตรายี่ห้อชิปเพียงอย่างเดียว

ZestBuy ได้รับค่าคอมมิชชั่นเมื่อคุณช้อปผ่านลิงก์ของเรา โดยคุณไม่ต้องจ่ายเพิ่ม

You May Also Like

Comments
พูดอะไรบางอย่าง...
ยังไม่มีความคิดเห็น มาเป็นคนแรกที่แบ่งปันความคิดเห็นของคุณ!