Sakana AI จากโตเกียวได้เปิดตัว Fugu ซึ่งเป็นระบบที่มอบประสิทธิภาพของโมเดล AI ระดับแนวหน้าโดยการประสานงานหลายโมเดลแบบไดนามิกในคราวเดียว แทนที่จะสร้างโครงข่ายประสาทเทียมขนาดใหญ่เพียงเครือข่ายเดียว Fugu ยังเป็นโมเดลภาษาที่ได้รับการฝึกให้เรียก LLM อื่นๆ จาก "กลุ่มตัวแทน" ที่ถอดเปลี่ยนได้ โดยรวบรวมทีมโมเดลเฉพาะสำหรับแต่ละงานและสังเคราะห์เอาต์พุตผ่าน API ที่เข้ากันได้กับ OpenAI เดียว

การเปิดตัวดังกล่าวครอบคลุมโดย THE DECODER, MarkTechPost และ MIT Sloan Management Review แสดงถึงการเดิมพันว่าประสิทธิภาพ AI ที่ก้าวกระโดดครั้งต่อไปอาจมาจากขนาดดิบที่น้อยลง และมากขึ้นจากการประสานงานที่ชาญฉลาดยิ่งขึ้นของโมเดลที่มีอยู่แล้ว For more context on this story, see our ongoing artificial intelligence updates.

แบบอย่างเดียวที่จะสั่งการพวกเขาทั้งหมด

สำหรับผู้ใช้ Fugu มีพฤติกรรมเหมือนรุ่นเดียว ภายใต้ประทุนนั้น จะจัดการคำขอด้วยตัวเองหรือดึงทีมแบบจำลองเฉพาะทางมารวมกัน จัดการการเลือก การมอบหมาย การตรวจสอบ และการสังเคราะห์ภายใน Sakana AI กล่าวว่าแนวทางนี้ต่อยอดจากงานก่อนหน้านี้ เช่น ALE-Agent ซึ่งจัดผู้เชี่ยวชาญที่เป็นมนุษย์อันดับที่ 21 จาก 1,000 คนในการแข่งขันเขียนโค้ดโดยใช้เทคนิคการจัดเรียบเรียง

บริษัทกำลังเปิดตัวสองรุ่น โมเดล Fugu พื้นฐานตั้งเป้าเวลาแฝงต่ำและประสิทธิภาพที่มั่นคงทุกวันในการเขียนโค้ด การตรวจสอบโค้ด และการใช้งานแชทบอท และช่วยให้ทีมแยกตัวแทนเฉพาะออกจากกลุ่มเพื่อความเป็นส่วนตัวหรือการปฏิบัติตามข้อกำหนด Fugu Ultra สร้างขึ้นเพื่อคุณภาพคำตอบสูงสุดสำหรับปัญหาที่ซับซ้อนหลายขั้นตอน เช่น การทำซ้ำเอกสารทางวิทยาศาสตร์ การวิเคราะห์ความปลอดภัยทางไซเบอร์ และการค้นหาสิทธิบัตรและวรรณกรรม

การเรียกร้องเกณฑ์มาตรฐานที่หันหัว

จากผลการวัดประสิทธิภาพที่ Sakana AI เผยแพร่ พบว่า Fugu Ultra มีประสิทธิภาพเทียบเท่ากับ Fable 5 และ Mythos Preview ของ Anthropic ในเกณฑ์มาตรฐานด้านการเขียนโค้ด การใช้เหตุผล และวิทยาศาสตร์ น่าสังเกตว่าทั้งโมเดล Anthropic ไม่ได้อยู่ในกลุ่มตัวแทนของ Fugu เนื่องจากไม่เปิดเผยต่อสาธารณะ ซึ่งหมายความว่า Fugu ได้คะแนนที่เทียบเคียงได้เมื่อใช้โมเดลอื่น

ตัวเลขที่เผยแพร่นั้นน่าทึ่งมาก ใน SWE-Bench Pro นั้น Fugu Ultra ได้คะแนน 73.7 เหนือกว่า Opus 4.8 ที่ 69.2, Gemini 3.1 Pro ที่ 54.2 และ GPT 5.5 ที่ 58.6 บน TerminalBench 2.1 ได้คะแนน 80.2 เทียบกับ Opus 4.8 ที่ 82.1 ใน LiveCodeBench ทำได้ 93.2 เทียบกับ GPT 5.5 ที่ 85.3 และใน Humanity's Last Exam ก็ทำได้ 50.0 แซงหน้า Opus 4.8 ที่ 49.8 และ GPT 5.5 ที่ 41.4

การทดสอบในโลกแห่งความเป็นจริงวาดภาพผสม

บทวิจารณ์ภาคปฏิบัติในช่วงแรกๆ มีความกระตือรือร้นน้อยกว่าเกณฑ์มาตรฐาน นักวิจัยด้าน AI Ethan Mollick เขียนใน X ว่า Fugu Ultra "ช้าอย่างไม่น่าเชื่อ" โดยการทดสอบการเขียนโค้ดตามปกติของเขาใช้เวลา 30 นาที และผลลัพธ์ที่ "ดี" แต่ต่ำกว่า Fable ในทางปฏิบัติ ผู้ใช้รายอื่นรายงานว่าใช้โควต้าห้าชั่วโมงเต็มสำหรับแผน $20 ด้วยการแจ้งเตือนเพียงครั้งเดียว ในขณะที่นักพัฒนาใน Hacker News บ่นว่าแผน $200 ต่อเดือนให้ผลตอบแทนน้อยกว่าสามชั่วโมงต่อสัปดาห์ในการใช้งาน

การตรวจสอบโค้ดกลายเป็นจุดสว่าง โดยมีคุณภาพใกล้เคียงกับ Opus 4.8 หรือ GPT 5.5 โดยประมาณ การทดสอบแบบตัวต่อตัวแสดงให้เห็นว่า Fugu Ultra ทำงานเขียนโค้ดเสร็จภายใน 22 นาทีด้วยราคา 7.32 ดอลลาร์ ซึ่งเร็วกว่าและถูกกว่ามากเมื่อเทียบกับ Opus 4.8 ที่ใช้เวลา 79 นาทีและ 37.85 ดอลลาร์ แม้ว่าผู้วิจารณ์จะชอบผลงานของ Opus ก็ตาม

Sakana AI ก่อตั้งขึ้นในโตเกียวในปี 2023 และได้รับการสนับสนุนจาก Nvidia ได้สร้างเอกลักษณ์จากการวิจัย AI ที่ได้รับแรงบันดาลใจจากธรรมชาติ โดยใช้อัลกอริธึมเชิงวิวัฒนาการและแนวคิดทางปัญญาโดยรวมเพื่อบีบประสิทธิภาพเพิ่มเติมจากโมเดลที่มีอยู่ Fugu ขยายปรัชญาดังกล่าวไปสู่ตลาดเชิงพาณิชย์ โดยเปลี่ยนการเรียบเรียงให้เป็นผลิตภัณฑ์ บริษัทยังวางตำแหน่งระบบสำหรับผู้ชมชาวญี่ปุ่นที่กังวลเกี่ยวกับการพึ่งพาผู้ให้บริการในสหรัฐฯ มากเกินไป โดยมีไซต์สองภาษาและราคาที่มุ่งเป้าไปที่ทั้งนักพัฒนารายบุคคลและทีมองค์กร

การป้องกันความเสี่ยงจากการล็อคอินของผู้ขาย

นอกเหนือจากประสิทธิภาพดิบแล้ว Sakana AI ยังเสนอ Fugu เพื่อป้องกันการพึ่งพาผู้ให้บริการ AI รายเดียว บริษัทชี้ไปที่การควบคุมการส่งออกของสหรัฐฯ เมื่อเร็วๆ นี้ ซึ่งดึงโมเดล Fable และ Mythos ของ Anthropic ออกจากตลาดต่างประเทศ เพื่อเป็นข้อพิสูจน์ว่าการเข้าถึงระบบชั้นนำสามารถหายไปได้ในชั่วข้ามคืน

“สำหรับองค์กรหรือประเทศ การใช้ API ของบริษัทเดียวสำหรับโครงสร้างพื้นฐานที่สำคัญ การเงิน หรือการกำกับดูแลถือเป็นช่องโหว่ที่สำคัญ” Sakana AI เขียนในประกาศ เนื่องจากพูลโมเดลของ Fugu สามารถสลับได้อย่างสมบูรณ์ ระบบจึงสามารถเปลี่ยนเส้นทางไปยังโมเดลอื่นได้ หากผู้ให้บริการรายหนึ่งปิดตัวลง

นักวิเคราะห์เตือนว่านี่ไม่เหมือนกับอำนาจอธิปไตยที่แท้จริง ประสิทธิภาพของ Fugu ขึ้นอยู่กับรุ่นที่อยู่ในกลุ่ม และผู้ให้บริการชั้นนำหลายรายที่จำกัดการเข้าถึงพร้อมกันก็ยังคงลดขนาดตัวเลือกลง บริษัทยังไม่ได้เปิดเผยว่าเลเยอร์ orchestration ช่วยเพิ่มการใช้งานโทเค็นและต้นทุนมากน้อยเพียงใด อย่างไรก็ตาม เนื่องจากโมเดลชายแดนกลายเป็นทรัพย์สินทางภูมิรัฐศาสตร์ และการล็อคอินของผู้ขายรายเดียวมีความเสี่ยงมากขึ้น Fugu จึงนำเสนอตัวอย่างอุตสาหกรรม AI ที่การประสานงานอาจมีความสำคัญพอๆ กับความสามารถ

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →