Google ประกาศเปิดตัว Gemini 4 Argon เมื่อวันอังคาร ซึ่งเป็นโมเดลใหม่ล่าสุดที่สร้างขึ้นสำหรับงานมืออาชีพในขอบเขตอันยาวนานในด้านวิศวกรรมซอฟต์แวร์ งานความรู้ระดับองค์กร และการป้องกันความปลอดภัยทางไซเบอร์ Koray Kavukcuoglu รองประธานอาวุโสของ Google DeepMind และหัวหน้าสถาปนิก AI เขียนในบล็อกอย่างเป็นทางการของ Google ว่าโมเดลนี้กำลังเปิดตัวในช่วงแรกให้กับกลุ่มผู้พิทักษ์ไซเบอร์ที่เชื่อถือได้ผ่านโปรแกรม Fairwind ของ Google พร้อมการเข้าถึงที่กว้างขึ้นเพื่อติดตามเมื่อรั้วแข็งแกร่งขึ้น

การประกาศดังกล่าวเกิดขึ้นในช่วงที่คึกคักที่สุดของปีสำหรับการเปิดตัว AI ระดับแนวหน้า เพื่อการรายงานข่าวการเปิดตัวโมเดล การต่อสู้เชิงนโยบาย และรอบการระดมทุนอย่างต่อเนื่อง AI Buzz Wire จะติดตามการพัฒนาที่สำคัญเมื่อเกิดขึ้น

การเปิดตัวแบบค่อยเป็นค่อยไปซึ่งกำหนดขึ้นด้วยความระมัดระวัง

ต่างจากการเปิดตัวโมเดลหลักทั่วไป ผู้ใช้ส่วนใหญ่ไม่สามารถลองใช้ Argon ได้ในปัจจุบัน Google กล่าวว่าตนมีส่วนร่วมในกระบวนการสมัครใจของรัฐบาลสหรัฐฯ สำหรับการเข้าถึงโมเดลก่อนเผยแพร่ และจะค่อยๆ ขยายความพร้อมใช้งาน เนื่องจากข้อเสนอแนะจากผู้ทดสอบในช่วงแรกกำหนดแนวทางป้องกัน สำนักข่าวรอยเตอร์รายงานว่าเรือธงมาถึงหลังจากเกิดความล่าช้าหลายเดือน และ VentureBeat ตั้งข้อสังเกตว่ากลยุทธ์การวางจำหน่ายแบบจำกัดยังคงช่วยให้ Google อ้างสิทธิ์ในการเป็นผู้นำเกณฑ์มาตรฐานที่ยึดคืนเหนือ OpenAI และ Anthropic Bloomberg รายงานความสงสัยที่วัดได้เกี่ยวกับโมเดลใหม่นี้ในหมู่พนักงานของ Google ก่อนเปิดตัว

เมื่อมีการเข้าถึงที่กว้างขึ้น Google กล่าวว่าจะเริ่มต้นด้วยลูกค้า API แบบชำระเงินและสมาชิก Google AI Ultra

สิ่งที่ Google บอกว่าอาร์กอนทำได้

การเปลี่ยนแปลงความสามารถพาดหัวคือความอดทน ขีดจำกัดโทเค็นเอาท์พุตของ Argon ได้รับการขยายเป็น 1 ล้านโทเค็นชั้นนำของอุตสาหกรรม เพิ่มขึ้นจาก 64K ก่อนหน้า Google ให้เหตุผลว่าการให้โมเดลมีพื้นที่ว่างในการให้เหตุผลกับโทเค็นนับแสนในวิถีเดียวช่วยให้สามารถแก้ไขปัญหายากๆ ได้ในรอบเดียว แทนที่จะแยกส่วนงานในเซสชันต่างๆ

Google เผยแพร่ผลการวัดประสิทธิภาพเพื่อสนับสนุนการอ้างสิทธิ์ชายแดน:

  • DeepSWE v1.1: 77.9% — ความล้ำสมัยใหม่ในเกณฑ์มาตรฐานวิศวกรรมซอฟต์แวร์ในโลกแห่งความเป็นจริง
  • Vals Index: อันดับ 1 — ประสิทธิภาพชั้นนำในด้านการเงิน การเขียนโค้ด กฎหมาย และภาษี ถ่วงน้ำหนักโดยการมีส่วนร่วมต่อ GDP ของสหรัฐอเมริกา
  • AutomationBench: 51.3% — เป็นที่หนึ่งในเกณฑ์มาตรฐานการดำเนินธุรกิจแบบครบวงจรของ Zapier
  • LVBench: 91.7% — ความทันสมัยในการทำความเข้าใจวิดีโอขนาดยาว
  • CWE-bench v1: 68% — เสมอกันเป็นอันดับแรกในด้านการแก้ไขช่องโหว่ด้านความปลอดภัย

เจาะลึกขั้นตอนการทำงานของ Google เอง

Argon กำลังขับเคลื่อนงานภายในของ Google อยู่แล้ว และบริษัทก็ได้เสนอตัวอย่างที่เป็นรูปธรรมที่ไม่ธรรมดา ในด้านการประมวลผลควอนตัม โมเดลดังกล่าวได้ปรับทรัพยากรของกาลอวกาศให้เหมาะสมสำหรับรูทีนย่อยคอขวด โดยเอาชนะค่าพื้นฐานที่เผยแพร่ไปได้ถึง 40% ในเวลาไม่กี่นาที จากการวิเคราะห์การวัดและส่งข้อมูลทางไกลของโปรไฟล์ทั่วทั้งกลุ่ม ทีมตัวแทนของ Argon ได้ระบุและใช้การเพิ่มประสิทธิภาพหน่วยความจำในศูนย์ข้อมูลของ Google ซึ่งปลดปล่อย TiB ได้มากกว่า 300 TiB เมื่อเปิดตัว โดยประหยัดได้ทั้งหมดประมาณ 500 TiB ถึง 1 PiB

โมเดลดังกล่าวยังขับเคลื่อนการย้ายโค้ดขนาดใหญ่จาก C/C++ ไปยัง Rust โดยปรับขนาดจากหลายหมื่นบรรทัดในไลบรารีหลัก เช่น re2 และ libgav1 ไปจนถึงมากกว่า 800,000 บรรทัดในเคอร์เนล Fuchsia Zircon สำหรับ libgav1 ซึ่งเป็นตัวถอดรหัสวิดีโอโอเพ่นซอร์สของ Google ตัวแทน Argon ได้แทนที่โค้ด SIMD 32,000 บรรทัดด้วย Rust ที่ปลอดภัยซึ่งเป็นมิตรกับคอมไพเลอร์ ทำให้ตัวถอดรหัสที่ปลอดภัยต่อหน่วยความจำทำงานได้เร็วกว่าพอร์ต Rust ก่อนหน้าถึง 2.7 เท่าโดยมีเอาต์พุตเหมือนกัน

การป้องกันความปลอดภัยทางไซเบอร์ต้องมาก่อน

Argon ได้รับการฝึกฝนอย่างชัดเจนสำหรับงานป้องกันทางไซเบอร์: การค้นหา ตรวจสอบ และแพตช์ช่องโหว่ของซอฟต์แวร์ที่สำคัญโดยอัตโนมัติ สำหรับกองหลังที่เชื่อถือได้และทีมงานภายในของ Google บริษัทจะปล่อยโมเดลที่ไม่มีราวกั้นทางไซเบอร์ เพื่อให้กองหลังได้รับความสามารถอย่างเต็มที่ บน CWE-bench v1 ซึ่งวัดการแก้ไขช่องโหว่ Argon สัมพันธ์กันเป็นที่หนึ่งที่ 68% โดยต่อยอดจากประสิทธิภาพระดับแนวหน้าของ 3.8 Flash Cyber ​​และ Google กล่าวว่า Argon มีประสิทธิภาพเหนือกว่าโมเดลนั้นในการค้นพบพื้นผิวการโจมตีและการสร้างการพิสูจน์แนวคิดตามเกณฑ์มาตรฐานการทดสอบการเจาะกล่องดำภายในของ Wiz

บริษัทรักษาความปลอดภัย Wiz กำลังใช้ Argon ผ่านโครงการริเริ่ม Scan for Good ซึ่งปกป้องโครงสร้างพื้นฐานสาธารณะที่สำคัญได้ฟรี ในการสาธิตเบื้องต้น Google กล่าวว่าโมเดลดังกล่าวได้เปิดเผยช่องโหว่ที่สำคัญซึ่งเปิดเผยข้อมูลส่วนบุคคลที่ละเอียดอ่อนในซอฟต์แวร์ด้านการดูแลสุขภาพที่โรงพยาบาลทั่วโลกใช้งาน ซึ่งเป็นความเสี่ยงที่โมเดลชายแดนก่อนหน้านี้จะพลาดไป

การป้องกันชายแดนสี่ชั้น

ก่อนที่จะเปิดให้บริการในวงกว้าง Google กำลังเสริมสร้างการป้องกันในสี่ด้าน เพื่อป้องกันการใช้งานในทางที่ผิด Argon ได้รับการออกแบบมาเพื่อปฏิเสธคำขอการโจมตีทางไซเบอร์และ CBRN ในขณะเดียวกันก็รักษาการวิจัยการใช้งานสองทางที่ถูกต้องตามกฎหมาย พร้อมด้วยเทคนิคใหม่ที่ตรวจสอบการเปิดใช้งานภายในของโมเดลเพื่อระบุการละเมิด การฝึกอบรมฝ่ายตรงข้ามทำให้ Argon Google กลายเป็นโมเดลที่มีความยืดหยุ่นมากที่สุด โดยเป็นผู้นำในเกณฑ์มาตรฐาน Indirect Prompt Injection ของ Grey Swan

สำหรับการวางแนวที่ไม่ตรง Google กำลังปรับใช้การบรรเทาที่ตรวจสอบห่วงโซ่ความคิดและการกระทำของ Argon โดยหยุดการดำเนินการเมื่อจำเป็น โดยมีการแจ้งเตือนที่ส่งไปยังทีมตอบสนองต่อเหตุการณ์โดยเฉพาะ นอกจากนี้บริษัทยังเสริมความแข็งแกร่งให้กับสภาพแวดล้อมการฝึกอบรมและการประเมินผลแบบแซนด์บ็อกซ์ โดยปิดผนึกไว้ก่อนที่จะดำเนินการที่มีความเสี่ยงสูง โดยเฉพาะอย่างยิ่ง Google กระตุ้นให้ส่วนที่เหลือในอุตสาหกรรมรักษาความโปร่งใสในการให้เหตุผล ดังนั้นความคิดแบบตัวอย่างยังคงมีประโยชน์สำหรับการวินิจฉัยการวางแนวที่ไม่ตรง

ราคาและห้องว่าง

Argon จะเปิดตัวในราคาเบื้องต้นที่ 2 ดอลลาร์ต่อโทเค็นอินพุต 1 ล้านโทเค็น และ 10 ดอลลาร์ต่อโทเค็นเอาต์พุต 10 ล้านดอลลาร์ โดยมีโทเค็นอินพุตที่แคชไว้อยู่ที่ 95% จากราคาอินพุต หลังจากช่วงแนะนำ ราคาเพิ่มขึ้นเป็น 4 ดอลลาร์ต่อโทเค็นอินพุต 1 ล้านดอลลาร์ และ 20 ดอลลาร์ต่อโทเค็นเอาท์พุต 1 ล้านดอลลาร์ ส่งผลให้ Argon ก้าวไปข้างหน้าอย่างแข็งแกร่งต่อข้อเสนอชายแดนของคู่แข่ง

การเปิดตัวแบบจัดฉากสะท้อนให้เห็นถึงความเป็นจริงใหม่สำหรับการเปิดตัวระดับแนวหน้า: ความสามารถกลายเป็นเดิมพันบนโต๊ะ และผู้ที่สร้างความแตกต่างกำลังแสดงให้เห็นถึงการควบคุม Google วางเดิมพันว่าผู้พิทักษ์ในโลกไซเบอร์ ซอฟต์แวร์ของโรงพยาบาล และการโยกย้ายของ Rust คือตัวอย่างที่ถูกต้อง และการเปิดตัวสู่สาธารณะที่ช้ากว่านั้นมีค่าใช้จ่ายน้อยกว่าเหตุการณ์ด้านความปลอดภัยอื่นๆ นักพัฒนาและองค์กรควรดูหน้าต่างการเข้าถึง API และ AI Ultra แบบชำระเงิน ซึ่ง Google กล่าวว่าจะเปิดทันทีที่การทดสอบ Guardrail อนุญาต

---

ก้าวนำหน้า AI

รับข่าวสาร AI การวิเคราะห์ และความก้าวหน้าล่าสุด ทั้งหมดในที่เดียว

อ่านข่าว AI เพิ่มเติม →