ทำไมชิป AI inference แบบเฉพาะโมเดลกำลังเปลี่ยนเกมของอุตสาหกรรม

ทำไมชิป AI inference แบบเฉพาะโมเดลกำลังเปลี่ยนเกมของอุตสาหกรรม
ความสนใจ|สำรวจการใช้งาน AI

ชิป AI inference แบบเฉพาะโมเดลคืออะไร และดีล AMD–Taalas บอกอะไรเรา

ชิป AI inference แบบเฉพาะโมเดลคือฮาร์ดแวร์ AI เฉพาะที่ออกแบบและปรับแต่งวงจรให้สอดคล้องกับสถาปัตยกรรมของโมเดลเดียวหรือชุดโมเดลจำเพาะ เพื่อเร่งความเร็ว AI ในขั้นตอนตอบสนองและลดการใช้พลังงาน โดยแลกกับความยืดหยุ่นในการรองรับโมเดลหลากหลาย ทำให้เหมาะกับงานที่ต้องประมวลผลโมเดลเดิมซ้ำจำนวนมากอย่างต่อเนื่อง เช่น ระบบแชตบอตระดับองค์กรหรือแพลตฟอร์มโมเดลที่ได้รับความนิยมสูงและมีเวิร์กโหลดคงที่ยาวนาน AMD เข้าสู่ข้อตกลงซื้อกิจการ Taalas สตาร์ตอัปที่สร้างชิป AI inference สำหรับโมเดลภาษาโดยเน้นความหน่วงต่ำเป็นพิเศษ การประกาศมาจากแถลงข่าวสำหรับนักลงทุนของ AMD และสะท้อนว่าบริษัทไม่ได้มองงาน AI inference เป็นส่วนเสริมเล็ก ๆ อีกต่อไป แต่เป็นสมรภูมิหลักที่กำลังเติบโตเร็วที่สุดในตลาด AI ดีลนี้จึงไม่ใช่แค่การซื้อทีมวิศวกรเพิ่ม หากเป็นการเลือกข้างในสงครามระหว่างโปรเซสเซอร์ AI แบบกำหนดเองกับจีพียูสารพัดประโยชน์อย่างชัดเจน.

ทำไมชิป AI inference แบบเฉพาะโมเดลกำลังเปลี่ยนเกมของอุตสาหกรรม

แนวคิด “The Model is The Computer” พลิกวิธีออกแบบโปรเซสเซอร์ AI แบบกำหนดเอง

จุดต่างของ Taalas อยู่ที่การไม่ทำชิป AI inference ให้รองรับทุกโมเดล แต่เลือกฝังสถาปัตยกรรมของโมเดลลงบนซิลิคอนโดยตรง บริษัทเรียกแนวทางนี้ว่า “Hardcore Models” พร้อมประโยคบอกเล่าชัดเจนว่า “The Model is The Computer” ซึ่งตีความได้ตรงตัวว่าโมเดลเองคือศูนย์กลางในการออกแบบฮาร์ดแวร์ ไม่ใช่ซอฟต์แวร์ที่วิ่งอยู่บนชิปสารพัดประโยชน์อีกชั้นหนึ่ง แทนที่จะโหลดน้ำหนักโมเดลจากหน่วยความจำความเร็วสูงอย่าง HBM แล้วใช้ส่วนที่ตั้งโปรแกรมได้บนชิปจัดการเมทริกซ์และการคำนวณเฉพาะโมเดล Taalas เลือก “burn โมเดลลงใน CMOS” ให้กลายเป็นส่วนหนึ่งของวงจรถาวร ผลคือเส้นทางข้อมูลถูกย่นให้สั้นที่สุด ลดทั้งความซับซ้อนของการคำนวณและโอเวอร์เฮดด้านหน่วยความจำเมื่อเทียบกับดีไซน์ทั่วไปที่เน้นความยืดหยุ่น นี่คือโปรเซสเซอร์ AI แบบกำหนดเองในความหมายที่แท้จริง: โมเดลเปลี่ยน ฮาร์ดแวร์ก็ต้องเปลี่ยนตาม.

ทำไมชิป AI inference แบบเฉพาะโมเดลกำลังเปลี่ยนเกมของอุตสาหกรรม

ตัวเลขสมรรถนะของ Taalas HC1 และเหตุผลที่ AMD ต้องรีบเดิมพัน

ชิปเดโมปัจจุบันของ Taalas คือ HC1 การ์ด AI inference ที่ออกแบบมารันโมเดล Llama 3.1 8B โดยตรง และบริษัทอ้างว่าทำความเร็วได้สูงถึง 17,000 โทเคนต่อวินาทีต่อผู้ใช้หนึ่งราย ตามข้อมูลเดิม HC1 สร้างบนเทคโนโลยีการผลิต 6nm ของ TSMC มีไดขนาด 815 ตารางมิลลิเมตรและทรานซิสเตอร์รวม 53 พันล้านตัว สเปกระดับนี้แสดงให้เห็นว่าแม้ Taalasจะไม่ใช้โหนดการผลิตก้าวหน้าที่สุด ก็ยังดันสมรรถนะได้ใกล้เคียงหรือเหนือกว่าชิป inference ทั่วไปด้วยการปรับแต่งตามโมเดลอย่างหนัก AMD มองว่างาน AI inference คือเซ็กเมนต์ที่เติบโตเร็วที่สุดของตลาด AI และเวิร์กโหลดกำลังเฉพาะทางมากขึ้นทุกเดือน ในขณะเดียวกันบริษัทกำลังพยายามลดช่องว่างด้านสมรรถนะ AI กับคู่แข่งรายใหญ่ด้วยการจับจ่ายด้านฮาร์ดแวร์และพันธมิตรเชิงกลยุทธ์อย่างต่อเนื่อง การซื้อ Taalas จึงเป็นการเดิมพันว่าความเร็วและประสิทธิภาพของชิปเฉพาะโมเดลจะเป็นข้อได้เปรียบสำคัญในยุคที่ลูกค้าต้องการเร่งความเร็ว AI โดยไม่เพิ่มค่าใช้จ่ายด้านพลังงานมากนัก.

ทำไมชิป AI inference แบบเฉพาะโมเดลกำลังเปลี่ยนเกมของอุตสาหกรรม

จากจีพียูสารพัดประโยชน์สู่ฮาร์ดแวร์ AI เฉพาะ: แนวโน้มที่ผู้ผลิตชิปไม่อาจหลีกเลี่ยง

ดีล AMD–Taalasไม่ได้เกิดอย่างโดดเดี่ยว แต่สะท้อนกระแสใหญ่ที่ผู้เล่นรายอื่นก็เริ่มขยับตาม แนวคิดว่าซิลิคอนเฉพาะโมเดลมีคุณค่ามากพอให้สร้างเองไม่ได้จำกัดอยู่ที่ AMD หรือ Taalas เท่านั้น มีการรายงานว่า OpenAI สร้างชิป inference ชื่อ Jalapeño ร่วมกับ Broadcom โดยออกแบบรอบโมเดลที่ใช้จริงในงานผลิต ไม่ใช่เพื่อความยืดหยุ่นทั่วไป ขณะเดียวกัน Google ก็มีข่าวว่ากำลังพัฒนาชิปภายในชื่อ “Frozen v2” เพื่อฝังสถาปัตยกรรม Gemini ลงในซิลิคอนโดยตรง ซึ่งเดินตามแนวคิดเดียวกับที่ Taalas นำเสนอ ชิป AI inference แบบเฉพาะโมเดลจึงแลกความยืดหยุ่นกับประสิทธิภาพ โดยย่อเวิร์กโหลดให้กลายเป็น dataflow ตรงไปตรงมา ลดทั้งโอเวอร์เฮดการคำนวณและหน่วยความจำจากดีไซน์ทั่วไป แม้จะทำให้แร็กที่สร้างรอบโมเดลเดียวเปลี่ยนเป้าหมายยาก แต่แนวทางนี้เปิดทางสู่การตอบสนองที่เร็วกว่ามากและต้นทุนการทำ inference ที่ถูกลงในงานปริมาณสูงต่อเนื่อง เมื่อผู้ผลิตรายใหญ่หันมาสร้างฮาร์ดแวร์ AI เฉพาะเอง สัญญาณชัดเจนคือยุคของจีพียูสารพัดประโยชน์เพียงอย่างเดียวกำลังจะผ่านไป.

อนาคตแพลตฟอร์ม AI ของ AMD: เมื่อชิปเฉพาะโมเดลกลายเป็นฟันเฟืองหลัก

ตามแผน AMD จะผนวกเทคโนโลยีของ Taalasเข้าในโร้ดแมปแอ็กเซเลอเรเตอร์ และสร้างโซลูชันระดับระบบร่วมกับ Instinct GPU ไม่ใช่แยกเป็นผลิตภัณฑ์เดี่ยว แพลตฟอร์ม AI เต็มสแต็กของ AMD ครอบคลุมแร็ก Helios, ซีพียู EPYC และซอฟต์แวร์ ROCm อยู่แล้ว การเติมชิป AI inference เฉพาะโมเดลเข้าไปจึงทำให้ลูกค้าเลือกชนิดการประมวลผลให้เหมาะกับงานแต่ละแบบได้ยืดหยุ่นขึ้น โดยเฉพาะงานที่ใช้โมเดลคงที่ปริมาณสูงและต้องการประสิทธิภาพสูงสุด ดีลนี้ยังอยู่ภายใต้เงื่อนไขการปิดดีลและการอนุมัติด้านกฎระเบียบตามปกติ และไม่ได้เปิดเผยรายละเอียดทางการเงิน แต่หากปิดดีลสำเร็จ AMD จะมีทางเลือกสองแนวทางในมือ: Instinct สำหรับงานทั่วไปที่ต้องการยืดหยุ่น และชิปเฉพาะโมเดลจาก Taalasสำหรับงาน inference ที่เสถียรและโหลดสูง การเคลื่อนจากฮาร์ดแวร์สารพัดประโยชน์สู่โปรเซสเซอร์ AI แบบกำหนดเองที่เร่งความเร็ว AI ได้สุดทางคือทิศทางใหม่ของอุตสาหกรรม และ AMD เลือกจะเป็นผู้นำมากกว่าผู้ตามในเกมนี้.

ZestBuy ได้รับค่าคอมมิชชั่นเมื่อคุณช้อปผ่านลิงก์ของเรา โดยคุณไม่ต้องจ่ายเพิ่ม

You May Also Like

Comments
พูดอะไรบางอย่าง...
ยังไม่มีความคิดเห็น มาเป็นคนแรกที่แบ่งปันความคิดเห็นของคุณ!