Google DeepMind ได้เปลี่ยนการใช้คอมพิวเตอร์เป็นเครื่องมือในตัวภายใน Gemini 3.5 Flash ช่วยให้นักพัฒนามีวิธีดั้งเดิมในการสร้างเอเจนต์ AI ที่สามารถโต้ตอบกับซอฟต์แวร์ข้ามแพลตฟอร์มโดยไม่ต้องใช้เฟรมเวิร์กของบุคคลที่สาม

การประกาศซึ่งเผยแพร่เมื่อวันที่ 24 มิถุนายน 2569 บนบล็อกคำหลักอย่างเป็นทางการของ Google ระบุว่า Gemini 3.5 Flash เป็นคู่แข่งในตลาดที่เปลี่ยนแปลงอย่างรวดเร็วสำหรับตัวแทนที่สามารถมองเห็นหน้าจอ เลื่อนเคอร์เซอร์ คลิก และพิมพ์ ซึ่งเป็นความสามารถที่จนกระทั่งเมื่อเร็ว ๆ นี้จำเป็นต้องมีวิศวกรรมแบบกำหนดเองที่สำคัญ For more context on this story, see our ongoing latest AI developments.

“การใช้คอมพิวเตอร์เป็นเครื่องมือในตัวใน Gemini 3.5 Flash เพื่อสร้างตัวแทนที่สามารถโต้ตอบข้ามแพลตฟอร์มได้” บริษัท เขียน โพสต์นี้เขียนโดย Mateo Quiros ผู้จัดการผลิตภัณฑ์ของ Google DeepMind

มันทำงานอย่างไร

การใช้คอมพิวเตอร์ช่วยให้โมเดลควบคุมคอมพิวเตอร์ได้เหมือนกับที่มนุษย์ทำ โดยการตีความสิ่งที่อยู่บนหน้าจอและดำเนินการต่างๆ เช่น การคลิก เลื่อน และป้อนข้อความ ด้วยการรวมความสามารถโดยตรงลงใน Gemini 3.5 Flash แทนที่จะนำเสนอเป็นผลิตภัณฑ์แยกต่างหาก Google กำลังลดอุปสรรคสำหรับนักพัฒนาที่ต้องการสร้างตัวแทนที่นำทางแอปพลิเคชัน เว็บไซต์ และระบบปฏิบัติการจริง

ตามโพสต์ในบล็อก นักพัฒนาและองค์กรสามารถเริ่มใช้คอมพิวเตอร์ใน 3.5 Flash ผ่านทาง Gemini API และ Gemini Enterprise Agent Platform ซึ่งเป็นสภาพแวดล้อมเฉพาะของ Google สำหรับการสร้างและปรับใช้ตัวแทนในวงกว้าง

Google แสดงให้เห็นความสามารถด้วยกรณีการใช้งานที่เป็นรูปธรรม ในตัวอย่างหนึ่ง Gemini 3.5 Flash ใช้คอมพิวเตอร์เพื่อวิเคราะห์แอป Gemini และส่งคืนรายการคุณสมบัติที่จัดหมวดหมู่ ในอีกทางหนึ่ง โมเดลได้ตรวจสอบเอกสารประกอบของตัวเองเกี่ยวกับปัญหาด้านการเข้าถึง ซึ่งเป็นงานอ้างอิงตนเองที่บอกเป็นนัยว่าวันหนึ่งเอเจนต์ที่ใช้คอมพิวเตอร์จะช่วยรักษาระบบนิเวศของซอฟต์แวร์ที่พวกเขาทำงานอยู่ได้อย่างไร

ความปลอดภัย: การฝึกอบรมฝ่ายตรงข้ามและแนวทาง 'การป้องกันเชิงลึก'

ส่วนที่เป็นผลสืบเนื่องมากที่สุดของการเปิดตัวอาจเป็นสิ่งที่ Google พูดเกี่ยวกับความปลอดภัย เจ้าหน้าที่ที่ทำงานในสภาพแวดล้อมจริงมีความเสี่ยงเป็นพิเศษที่จะถูกแทรกข้อมูลทันที — การโจมตีที่คำสั่งที่ซ่อนอยู่ฝังอยู่ในหน้าเว็บ อีเมล หรือเอกสาร จี้เจ้าหน้าที่ให้ดำเนินการโดยไม่ตั้งใจ

Google กล่าวว่าได้ใช้การฝึกอบรมฝ่ายตรงข้ามสำหรับการใช้คอมพิวเตอร์ใน Gemini 3.5 Flash เพื่อลดความเสี่ยงเหล่านั้น นอกจากนี้ ยังได้เปิดตัวระบบป้องกันองค์กรทางเลือกอีก 2 ระบบที่บริษัทกล่าวว่าช่วยให้องค์กรต่างๆ สามารถควบคุมสิ่งที่ตัวแทนของตนสามารถทำได้ได้ดีขึ้น

ด้วยแนวทาง "การป้องกันในเชิงลึก" Google สนับสนุนให้นักพัฒนารวมคุณสมบัติเหล่านี้เข้ากับแซนด์บ็อกซ์ที่ปลอดภัย การตรวจสอบโดยมนุษย์ในวง และการควบคุมการเข้าถึงที่เข้มงวด บริษัทเผยแพร่คำแนะนำเพิ่มเติมในเอกสารแนวทางปฏิบัติที่ดีที่สุดสำหรับคุณลักษณะนี้

การวางกรอบนั้นมีความสำคัญ การใช้คอมพิวเตอร์ถูกมองว่าเป็นหนึ่งในความสามารถของเอเจนต์ที่เป็นอันตรายมากกว่าในการใช้งาน เนื่องจากเอเจนต์ที่ถูกบุกรุกสามารถดำเนินการในโลกแห่งความเป็นจริงภายในบัญชีและระบบของผู้ใช้ได้ Google พยายามสร้างความมั่นใจให้กับผู้ซื้อระดับองค์กรที่ลังเลที่จะควบคุมเคอร์เซอร์ไปยัง AI ด้วยการเป็นผู้นำด้วยการฝึกอบรมฝ่ายตรงข้ามและการป้องกันแบบเป็นชั้น

เหตุใดการใช้คอมพิวเตอร์จึงกลายเป็นสมรภูมิ

การใช้คอมพิวเตอร์ของ Gemini 3.5 Flash มาถึงในขณะที่ห้องปฏิบัติการ AI หลักๆ แข่งขันกันเพื่อสร้างตัวแทนที่สามารถทำงานได้อย่างมีประโยชน์มากกว่าแค่ตอบคำถาม Anthropic เปิดตัวเครื่องมือการใช้งานคอมพิวเตอร์สำหรับ Claude ในปลายปี 2024 และผลิตภัณฑ์ของผู้ปฏิบัติงานและตัวแทนของ OpenAI ก็ผลักดันไปในทิศทางเดียวกัน การสร้างความสามารถแบบเนทีฟให้กับโมเดลที่รวดเร็วและประหยัดต้นทุน เช่น Flash แทนที่จะจองไว้สำหรับระดับพรีเมียม เป็นการส่งสัญญาณว่า Google ต้องการทำให้การควบคุมตัวแทนเป็นสินค้าอย่างรวดเร็ว

ตัวเลือกของ Flash นั้นมีความโดดเด่นในตัวมันเอง Flash คือโมเดลระดับประสิทธิภาพของ Google ซึ่งได้รับการปรับให้เหมาะสมกับความเร็วและต้นทุน การฝังการใช้คอมพิวเตอร์ไว้ที่นั่น แทนที่จะใช้เฉพาะในรุ่น Pro ที่ใหญ่กว่าเท่านั้น แสดงให้เห็นว่า Google คาดว่าจะมีปริมาณงานของเอเจนต์ที่มีความอ่อนไหวต่อเวลาแฝงในปริมาณมาก ซึ่งเป็นประเภทที่ทำให้งานซ้ำซ้อนเป็นอัตโนมัติในซอฟต์แวร์ธุรกิจในวงกว้าง

Google กล่าวว่าลูกค้าเห็นคุณค่าจากการใช้คอมพิวเตอร์แล้ว แม้ว่าโพสต์บนบล็อกจะไม่ได้ระบุชื่อการใช้งานเชิงพาณิชย์ที่เฉพาะเจาะจงหรือปริมาณผลลัพธ์ก็ตาม

เดิมพันการแข่งขัน

สำหรับนักพัฒนา สิ่งดึงดูดใจของเครื่องมือใช้งานคอมพิวเตอร์ในตัวนั้นตรงไปตรงมา: มีการผสานรวมน้อยลงในการบำรุงรักษาและผู้จำหน่ายรายเดียวที่รับผิดชอบทั้งแบบจำลองและเลเยอร์ตัวแทน แต่ยังทำให้การพึ่งพาแพลตฟอร์มของ Google ลึกซึ้งยิ่งขึ้น ซึ่งเป็นข้อแลกเปลี่ยนที่องค์กรต่างๆ จะต้องชั่งน้ำหนักเทียบกับความยืดหยุ่นของเฟรมเวิร์กตัวแทนที่ไม่เชื่อเรื่องพระเจ้าแบบโมเดล

การเปิดตัวดังกล่าวยังทำให้เกิดความตึงเครียดในวงกว้างมากขึ้นในระบบเศรษฐกิจแบบตัวแทนอีกด้วย เกตเวย์เอเจนต์โอเพ่นซอร์สที่พัฒนาอย่างอิสระ เช่น กรอบงาน Lightport ที่ทำให้ผู้ให้บริการ LLM หลายรายเข้ากันได้กับ OpenAI แสดงให้เห็นว่ามีความต้องการโครงสร้างพื้นฐานเอเจนต์แบบพกพามากเพียงใด การเดิมพันของ Google ก็คือเครื่องมือสำหรับการใช้คอมพิวเตอร์ของบุคคลที่หนึ่งและมีความปลอดภัยจะเอาชนะนักพัฒนาที่อาจรวมเครื่องมือของบุคคลที่สามเข้าด้วยกัน เมื่อโมเดลมีความสามารถในการทำงานบนหน้าจอ เส้นแบ่งระหว่างผู้ช่วย AI และผู้ปฏิบัติงานอัตโนมัติก็ค่อยๆ เลือนหายไป และเส้นแบ่งระหว่างการพัฒนาด้านประสิทธิภาพการทำงานและความรับผิดด้านความปลอดภัยก็เช่นกัน คำตอบของ Google ต่อความตึงเครียดดังกล่าวคือการปกป้องแบบหลายชั้นและการฝึกอบรมฝ่ายตรงข้าม ไม่ว่านั่นจะเพียงพอที่จะตอบสนององค์กรที่ไม่ชอบความเสี่ยงหรือไม่ก็ตาม จะเป็นตัวกำหนดว่าตัวแทนที่ใช้คอมพิวเตอร์จะเปลี่ยนจากการสาธิตไปสู่การใช้งานรายวันได้เร็วแค่ไหน

Google ได้วางเดิมพันที่ชัดเจนด้วย Gemini 3.5 Flash: อนาคตของ AI ไม่ใช่แค่โมเดลที่ตอบโจทย์ แต่เป็นโมเดลที่ทำหน้าที่ และต้องการให้นักพัฒนาสร้างโมเดลที่ทำหน้าที่เหล่านั้นบนแพลตฟอร์มของตน

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →