Google DeepMind는 컴퓨터 사용을 Gemini 3.5 Flash에 내장된 도구로 전환하여 개발자가 타사 프레임워크를 추가하지 않고도 플랫폼 전반에서 소프트웨어와 상호 작용할 수 있는 AI 에이전트를 구축할 수 있는 기본 방법을 제공합니다.
2026년 6월 24일 Google의 공식 키워드 블로그에 발표된 이 발표는 Gemini 3.5 Flash를 화면을 보고, 커서를 움직이고, 클릭하고, 입력할 수 있는 에이전트를 위한 빠르게 변화하는 시장에서 경쟁자로 자리매김했습니다. 이러한 기능은 최근까지 상당한 맞춤 엔지니어링이 필요했습니다. 이 이야기에 대한 자세한 내용은 AI 뉴스를 참조하세요.
"컴퓨터 사용은 이제 플랫폼 전반에 걸쳐 상호 작용할 수 있는 에이전트를 구축하기 위해 Gemini 3.5 Flash에 내장된 도구입니다."라고 회사는 썼습니다. 이 게시물은 Google DeepMind의 제품 관리자인 Mateo Quiros가 작성했습니다.
작동 방식
컴퓨터를 사용하면 모델이 화면에 표시된 내용을 해석하고 클릭, 스크롤, 텍스트 입력 등의 작업을 수행하여 인간과 마찬가지로 컴퓨터를 작동할 수 있습니다. Google은 이 기능을 별도의 제품으로 제공하는 대신 Gemini 3.5 Flash에 직접 적용함으로써 실제 애플리케이션, 웹사이트, 운영 체제를 탐색하는 에이전트를 구축하려는 개발자의 장벽을 낮추고 있습니다.
블로그 게시물에 따르면 개발자와 기업은 대규모 에이전트 구축 및 배포를 위한 Google의 전용 환경인 Gemini API 및 Gemini Enterprise Agent Platform을 통해 3.5 Flash에서 컴퓨터 사용을 시작할 수 있습니다.
Google은 구체적인 사용 사례를 통해 그 기능을 시연했습니다. 한 예에서 Gemini 3.5 Flash는 컴퓨터 사용을 통해 Gemini 앱 자체를 분석하고 분류된 기능 목록을 반환했습니다. 또 다른 모델은 접근성 문제에 대한 자체 문서를 감사했습니다. 이는 컴퓨터를 사용하는 에이전트가 언젠가 실행되는 소프트웨어 생태계를 유지하는 데 어떻게 도움이 될 수 있는지 암시하는 자체 참조 작업입니다.
안전: 적대적 훈련 및 '심층 방어' 접근 방식
이번 출시에서 가장 중요한 부분은 Google이 안전에 관해 말한 내용일 것입니다. 라이브 환경에서 작동하는 에이전트는 웹페이지, 이메일 또는 문서에 포함된 숨겨진 명령을 하이재킹하여 의도하지 않은 작업을 수행하는 공격인 프롬프트 주입에 특히 취약합니다.
Google은 이러한 위험을 완화하기 위해 Gemini 3.5 Flash에서 컴퓨터 사용에 대한 표적화된 적대적 훈련을 사용했다고 밝혔습니다. 또한 회사는 조직이 에이전트가 수행할 수 있는 작업을 더 잘 제어할 수 있도록 하는 두 가지 선택적 기업 보호 시스템을 출시하고 있습니다.
Google은 '심층 방어' 접근 방식을 취하여 개발자에게 이러한 기능을 안전한 샌드박싱, 인간 참여형 확인 및 엄격한 액세스 제어와 결합하도록 권장했습니다. 회사는 해당 기능에 대한 모범 사례 문서에 추가 지침을 게시했습니다.
그 프레임이 중요합니다. 컴퓨터 사용은 배포하기 가장 위험한 에이전트 기능 중 하나로 널리 알려져 있습니다. 손상된 에이전트는 사용자 계정 및 시스템 내에서 실제 작업을 수행할 수 있기 때문입니다. Google은 적대적인 교육과 계층화된 보호 장치를 통해 커서 제어권을 AI에 넘기는 것을 꺼려했던 기업 구매자를 안심시키려고 노력하고 있습니다.
컴퓨터 사용이 전쟁터가 되는 이유
Gemini 3.5 Flash의 컴퓨터 사용은 주요 AI 연구소가 단순히 질문에 대답하는 것이 아니라 유용한 작업을 수행할 수 있는 에이전트를 만들기 위해 경쟁하면서 시작되었습니다. Anthropic은 2024년 말 Claude를 위한 컴퓨터 사용 도구를 출시했으며 OpenAI의 운영자 및 에이전트 제품도 같은 방향으로 추진되었습니다. 이 기능을 프리미엄 계층용으로 예약하는 대신 Flash와 같은 빠르고 비용 효율적인 모델에 기본으로 추가하는 것은 Google이 상담원 제어를 신속하게 상품화하기를 원한다는 신호입니다.
플래시의 선택은 그 자체로 주목할 만합니다. Flash는 속도와 비용에 최적화된 Google의 효율성 등급 모델입니다. 더 큰 Pro 모델에만 컴퓨터를 사용하는 것이 아니라 여기에 컴퓨터를 내장한다는 것은 Google이 비즈니스 소프트웨어 전반에 걸쳐 대규모로 반복적인 작업을 자동화하는 종류의 대용량, 대기 시간에 민감한 에이전트 워크로드를 기대한다는 것을 의미합니다.
구글은 이미 고객이 컴퓨터 사용을 통해 가치를 창출하는 것을 목격하고 있다고 밝혔지만, 블로그 게시물에서는 구체적인 상용 구축 사례를 언급하거나 결과를 수량화하지 않았습니다.
경쟁 상황
개발자에게 내장된 컴퓨터 사용 도구의 매력은 간단합니다. 유지 관리할 통합이 적고 모델과 에이전트 계층을 모두 책임지는 단일 공급업체입니다. 그러나 이는 또한 Google 플랫폼에 대한 의존도를 심화시켜 기업이 모델에 구애받지 않는 에이전트 프레임워크의 유연성을 저울질하게 되는 절충안입니다.
이번 출시는 또한 에이전트 경제의 긴장을 더욱 심화시킵니다. 여러 LLM 공급자를 OpenAI와 호환되게 만드는 Lightport 프레임워크와 같이 독립적으로 개발된 오픈 소스 에이전트 게이트웨이는 휴대용 에이전트 인프라에 대한 수요가 얼마나 많은지 보여줍니다. Google은 안전이 강화된 자사의 컴퓨터 사용 도구가 타사 도구를 함께 사용하는 개발자의 마음을 사로잡을 것이라고 확신합니다. 모델이 화면에서 작동할 수 있게 되면서 AI 비서와 자율 운영자 사이의 경계가 점점 모호해지고 있으며, 생산성 향상과 보안 문제 사이의 경계도 모호해지고 있습니다. 이러한 긴장에 대한 Google의 대답은 계층화된 보호 장치와 적대적 훈련입니다. 이것이 위험을 회피하는 기업을 만족시키기에 충분한지 여부에 따라 컴퓨터 사용 에이전트가 얼마나 빨리 데모에서 일상 사용으로 전환되는지가 결정됩니다.
Gemini 3.5 Flash를 통해 Google은 AI의 미래는 단순히 대답하는 모델이 아니라 행동하는 모델이며 개발자가 플랫폼에서 이러한 행동 모델을 구축하기를 원한다는 점을 분명히 했습니다.
---
AI 최신 소식최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.
AI 뉴스 더 보기 →


