Nvidia เพิ่งพิสูจน์ว่า harness ไม่ใช่โมเดล AI ที่เป็นฮีโร่ที่แท้จริง
คะแนน 100% จากหนึ่งในเบนช์มาร์ก AI ที่ยากที่สุด — และโมเดลแทบไม่สมควรได้รับเครดิต งานวิจัยล่าสุดของ Nvidia ออกมาเงียบ ๆ ในวันศุกร์ แต่ผลกระทบของมันนั้นดังสนั่น: โครงสร้างพื้นฐานที่คุณสร้างรอบโมเดล AI มีความสำคัญมากกว่าโมเดลเอง
Nvidia เพิ่งพิสูจน์ว่า harness ไม่ใช่โมเดล AI ที่เป็นฮีโร่ที่แท้จริง
คะแนน 100% จากหนึ่งในเบนช์มาร์ก AI ที่ยากที่สุด — และโมเดลแทบไม่สมควรได้รับเครดิต งานวิจัยล่าสุดของ Nvidia ออกมาเงียบ ๆ ในวันศุกร์ แต่ผลกระทบของมันนั้นดังสนั่น: โครงสร้างพื้นฐานที่คุณสร้างรอบโมเดล AI มีความสำคัญมากกว่าโมเดลเอง โดยเฉพาะเมื่องานนั้นซับซ้อนและใช้เวลานาน หากคุณเป็นนักพัฒนาหรือผู้ก่อตั้งในเอเชียที่ยังคิดอยู่ว่าจะเลือกโมเดลพื้นฐานแบบไหน งานวิจัยนี้เป็นการท้าทายโดยตรงต่อสัญชาตญาณของคุณ
เกิดอะไรขึ้น
Nvidia เผยแพร่งานวิจัยใหม่ที่แสดงว่า Claude Opus 5 เมื่อห่อด้วย harness ที่สร้างเองได้คะแนน 100% บน ARC-AGI-3 — เบนช์มาร์กการให้เหตุผลแบบโต้ตอบที่กลายมาเป็นมาตรวัดที่มีความหมายของความสามารถ AI ทั่วไป โดยไม่มี harness Opus 5 ได้คะแนน 30% ซึ่งยังคงเป็นผลลัพธ์สูงสุดในบรรดาโมเดลทั้งหมดที่ทดสอบ ช่องว่างระหว่าง 30% และ 100% ไม่ได้ปิดด้วยการสลับไปใช้โมเดลที่ดีกว่า มันถูกปิดด้วยการสร้างโครงสร้างพื้นฐานที่ดีกว่ารอบโมเดลเดียวกัน
Harness ที่ Nvidia สร้าง — เรียกว่า AVO — มีสองส่วนประกอบที่สำคัญ: ระบบจัดการหน่วยความจำที่ออกแบบมาเพื่อจัดการบริบทระยะยาวโดยไม่เสื่อมสภาพ และส่วนประกอบ "supervisor" ที่ทำหน้าที่เหมือนเจ้านาย ให้เอเจนต์อยู่ในงานและป้องกันไม่ให้มันเดินเข้าไปในลูปการให้เหตุผลที่ไม่เกี่ยวข้อง ตามรายงานของ TechCrunch Adel El Hallak ผู้บริหารด้านผลิตภัณฑ์ของ Nvidia สำหรับหน่วย AI ของบริษัท กล่าวไว้อย่างชัดเจน: "มันคือโมเดล มันคือโครงสร้างพื้นฐานรอบโมเดล ซึ่งเราเรียกว่า harness นั่นคือชุดของเครื่องมือที่มันใช้ มันคือรันไทม์และทักษะและไลบรารีที่เกี่ยวข้องที่เราให้การเข้าถึง"
งานวิจัยมุ่งเน้นไปที่ งานระยะยาว — งานที่ต้องการเชื่อมการตัดสินใจหลายอย่างเข้าด้วยกัน บางครั้งในช่วงหลายวัน เพื่อสร้างผลลัพธ์ที่เสร็จสมบูรณ์ นี่แตกต่างจากการแลกเปลี่ยนพรอมต์-ตอบกลับครั้งเดียว การทำให้ AI ดำเนินงานระยะยาวได้อย่างน่าเชื่อถือโดยไม่ลอยไปในทิศทางอื่นเป็นหนึ่งในปัญหาเปิดที่ยากที่สุดในการวิจัย agentic AI Nvidia พบว่าคำตอบไม่ใช่โมเดลที่ฉลาดกว่า — มันคือ harness ที่ฉลาดกว่า
นี่คือการเปลี่ยนแปลงที่มีความหมายในวิธีที่อุตสาหกรรมควรคิดเกี่ยวกับการออกแบบระบบ AI โมเดลคือสมอง Harness คือระบบประสาท วินัย และหน่วยความจำ คุณต้องการทั้งสามอย่าง
ทำไมมันจึงสำคัญสำหรับเอเชีย
ระบบนิเวศของนักพัฒนาและสตาร์ทอัพในเอเชียมีความสัมพันธ์เฉพาะเจาะจงกับโมเดลพื้นฐานที่ทำให้งานวิจัยนี้มีความเกี่ยวข้องโดยเฉพาะ ทั่วเอเชียตะวันออกเฉียงใต้ อินเดีย ญี่ปุ่น เกาหลีใต้ และจีน ทีมส่วนใหญ่ไม่ได้สร้างโมเดลพื้นฐาน — พวกเขากำลังสร้างบนพื้นฐานของพวกเขา คำถามเชิงกลยุทธ์เสมอคือ: เราจะใช้โมเดลไหน? งานวิจัยของ Nvidia ทำให้คำถามนั้นกลายเป็นคำถามรองลงมา
ข้อได้เปรียบในการแข่งขัน AI ของเอเชียไม่ได้มาจากการเข้าถึงเฉพาะเจาะจงกับ GPT-5 หรือ Claude Opus 6 มันจะมาจากทีมที่สร้าง harness ที่ดีกว่า — สถาปัตยกรรมหน่วยความจำที่ดีกว่า การจัดการเครื่องมือที่ดีกว่า ตรรกะ supervisor ที่ดีกว่า — บนพื้นฐานของโมเดลใดก็ตามที่มีให้พวกเขา นี่คือเกมที่นักพัฒนาเอเชียสามารถชนะได้ เพราะมันเป็นปัญหาวิศวกรรมและผลิตภัณฑ์ ไม่ใช่ปัญหาด้านงบประมาณการคำนวณ
พิจารณาความเป็นจริงในทางปฏิบัติสำหรับผู้ก่อตั้งในจาการ์ตา แบงกอก หรือโฮจิมินห์ซิตี้ที่สร้างผลิตภัณฑ์เวิร์กโฟลว์ที่ขับเคลื่อนด้วย AI คุณไม่ได้ฝึกอบรมโมเดลชายแดนของคุณเอง คุณกำลังเรียก API คำถามจึงกลายเป็น: คุณสร้างอะไรรอบการเรียก API นั้น? คุณจัดการบริบทอย่างไรในงานที่ใช้เวลาหลายวัน? คุณจะป้องกันเอเจนต์ไม่ให้เบี่ยงเบนไปจากเส้นทางเมื่อมันพบสถานะที่ไม่คาดคิดได้อย่างไร? นี่คือปัญหา harness และสามารถแก้ไขได้ด้วยวิศวกรรมที่แข็งแกร่ง
นอกจากนี้ยังมีมิติด้านต้นทุนที่สำคัญอย่างเฉียบพลันในเอเชีย โมเดลที่เล็กกว่าพร้อมกับ harness ที่ยอดเยี่ยมสามารถเอาชนะโมเดลที่ใหญ่กว่าและมีราคาแพงกว่าที่ทำงานโดยไม่มี harness สำหรับสตาร์ทอัพที่ทำงานด้วยงบประมาณคลาวด์ที่จำกัด — ซึ่งเป็นสตาร์ทอัพส่วนใหญ่ในภูมิภาค — นั่นไม่ใช่เพียงข้อมูลเชิงสถาปัตยกรรมเท่านั้น มันเป็นกลยุทธ์ทางการเงิน สร้าง harness ที่ยอดเยี่ยม และคุณสามารถใช้โมเดลที่ประหยัดกว่าได้ ผลลัพธ์เบนช์มาร์กสนับสนุนสิ่งนี้ด้วยประสบการณ์
เทคโนโลยีเอเชียมักแข่งขันโดยการสร้างระบบที่ฉลาดกว่าบนส่วนประกอบที่มีให้ งานวิจัยนี้ยืนยันวิธีการนั้นในระดับสถาปัตยกรรมของ AI
นี่หมายถึงอะไรสำหรับนักพัฒนา
หากคุณกำลังสร้างระบบ agentic วันนี้ งานวิจัยของ Nvidia ให้กรอบการทำงานที่เป็นรูปธรรมเพื่อคิดเกี่ยวกับที่ที่จะลงทุนในความพยายามทางวิศวกรรมของคุณ หยุดการปฏิบัติต่อโมเดลเป็นกล่องดำที่ใช้ได้หรือไม่ได้ เริ่มการปฏิบัติต่อ harness เป็นพื้นผิววิศวกรรมหลัก
นี่คือสิ่งที่ harness ระดับการผลิตต้องจัดการ โดยยึดตามการค้นพบของ Nvidia:
- การจัดการหน่วยความจำ: งานระยะยาวสะสมบริบทอย่างรวดเร็ว โดยไม่มีสถาปัตยกรรมหน่วยความจำที่ชัดเจน — การตัดสินใจว่าจะเก็บอะไร บีบอะไร ทิ้งอะไร — บริบทที่มีประสิทธิผลของโมเดลจะเสื่อมสภาพเมื่อเวลาผ่านไป และประสิทธิภาพจะพังทลาย นี่ไม่ใช่ปัญหาโมเดล มันเป็นปัญหาระบบ
- ตรรกะ supervisor: Harness ของ Nvidia รวมถึงส่วนประกอบ supervisor ที่ตรวจสอบความก้าวหน้าของเอเจนต์และแทรกแซงเมื่อมันเบี่ยงเบน คิดว่านี่เป็นเมตา-เอเจนต์ที่เบาบางซึ่งมีหน้าที่เพียงอย่างเดียวคือให้เอเจนต์หลักสำคัญ การใช้งานนี้ไม่ต้องใช้โมเดลชายแดนที่สอง — โมเดลที่เล็กกว่าและราคาถูกกว่าสามารถเล่นบทบาท supervisor ได้อย่างมีประสิทธิผล
- การจัดการเครื่องมือ: เครื่องมือใดที่เอเจนต์สามารถเรียก ในลำดับใด ด้วยตรรกะการจัดการข้อผิดพลาดใด — นี่คือดินแดน harness การจัดการเครื่องมือที่ออกแบบไม่ดีเป็นหนึ่งในโหมดความล้มเหลวที่พบบ่อยที่สุดในการปรับใช้เอเจนต์ในการผลิต
- ลูปข้อเสนอแนะ: Harness ต้องป้อนผลลัพธ์กลับไปยังโมเดลในลักษณะที่มีโครงสร้าง ไม่ใช่แค่ทิ้งผลลัพธ์ดิบ วิธีที่คุณจัดรูปแบบข้อเสนอแนะนั้นมีรูปร่างของการตัดสินใจครั้งต่อไปของโมเดลอย่างมีนัยสำคัญ
ในทางปฏิบัติ นี่หมายความว่าการทบทวนสถาปัตยกรรมของคุณไม่ควรเริ่มต้นด้วย "โมเดลไหน?" มันควรเริ่มต้นด้วย "harness ของเราจัดการหน่วยความจำ การดูแล เรียกเครื่องมือ และข้อเสนอแนะอย่างไร?" ตอบคำถามสี่ข้อนั้นได้ดี และการเลือกโมเดลของคุณจะกลายเป็นการปรับให้เหมาะสมรองลงมา
สำหรับทีมที่สร้างบน MonstarX นี่แมปโดยตรงกับวิธีที่แพลตฟอร์มได้รับการออกแบบ — โมเดลพื้นฐานเป็นหนึ่งในเลเยอร์ แต่ตัวเชื่อมต่อ ตรรกะการจัดการ และสภาพแวดล้อมรันไทม์รอบ ๆ มันคือที่ที่ความแตกต่างที่แท้จริงอยู่ งานวิจัยของ Nvidia โดยพื้นฐานแล้วเป็นการตรวจสอบความถูกต้องของปรัชญาแพลตฟอร์มมากกว่าโมเดลที่การพัฒนา AI-native ที่จริงจังได้เคลื่อนไปในช่วง 18 เดือนที่ผ่านมา
จุดเริ่มต้นที่ใช้ได้จริงหนึ่งจุด: ตรวจสอบการใช้งานเอเจนต์ปัจจุบันของคุณและระบุว่าบริบทหายไปที่ไหนในขั้นตอนต่างๆ นั่นเกือบจะเป็นโหมดความล้มเหลวแรกในงานระยะยาว และมันเป็นปัญหา harness ทั้งหมด แก้ไขเลเยอร์หน่วยความจำก่อนที่คุณจะพิจารณาอัปเกรดโมเดล
ประเด็นสำคัญ
งานวิจัย AVO ของ Nvidia เป็นข้อโต้แย้งที่สะอาดและมีพื้นฐานจากประสบการณ์สำหรับสิ่งที่วิศวกร AI ที่มีประสบการณ์สงสัยมาพักใหญ่: harness คือผลิตภัณฑ์ โมเดลเป็นโครงสร้างพื้นฐาน นี่คือสิ่งที่ต้องนำไปข้างหน้า:
- การเลือกโมเดลเป็นจุดเริ่มต้น ไม่ใช่กลยุทธ์ Claude Opus 5 ไปจาก 30% ถึง 100% บน ARC-AGI-3 ด้วยน้ำหนักเดียวกันและ harness ที่ดีกว่า เดลต้าระหว่างโมเดลนั้นเป็นจริง แต่เดลต้าระหว่าง harness นั้นใหญ่กว่าสำหรับงานระยะยาว
- สถาปัตยกรรมหน่วยความจำเป็นสิ่งที่ไม่อาจปฏิเสธได้สำหรับระบบ agentic หากเอเจนต์ของคุณกำลังดำเนินงานที่ใช้เวลามากกว่าไม่กี่นาทีหรือมากกว่าไม่กี่การเรียกเครื่องมือ คุณต้องมีเลเยอร์การจัดการหน่วยความจำที่ชัดเจน