Google은 소프트웨어 엔지니어링, 기업 지식 작업 및 사이버 보안 방어 분야의 장기적인 전문 작업을 위해 구축된 최신 프론티어 모델인 Gemini 4 Argon을 화요일에 발표했습니다. Google DeepMind의 SVP이자 최고 AI 설계자인 Koray Kavukcuoglu는 공식 Google 블로그에 글을 작성하여 이 모델이 처음에는 Google의 Fairwind 프로그램을 통해 신뢰할 수 있는 사이버 방어자 집단에 출시될 예정이며, 일단 가드레일이 강화되면 따라갈 수 있는 범위가 더 넓어진다고 말했습니다.

이번 발표는 일년 중 프론티어 AI 출시가 가장 바쁜 시기에 이루어졌습니다. 모델 출시, 정책 싸움, 자금 조달 라운드에 대한 지속적인 보도를 위해 AI Buzz Wire는 중요한 발전 상황을 추적합니다.

주의를 기울여 단계적으로 출시

일반적인 주요 모델 출시와 달리 현재 대부분의 사용자는 Argon을 사용해 볼 수 없습니다. 구글은 사전 출시 모델 액세스를 위한 미국 정부의 자발적인 프로세스에 참여하고 있으며 초기 테스터의 피드백이 가드레일을 형성함에 따라 점차적으로 가용성을 확대할 것이라고 밝혔습니다. Reuters는 이 플래그십이 몇 달 지연된 후에 출시되었다고 보고했으며 VentureBeat는 제한적 출시 전략을 통해 Google이 여전히 OpenAI 및 Anthropic에 대해 다시 벤치마크 선두를 차지할 수 있다고 주장했습니다. Bloomberg는 출시에 앞서 Google 직원들 사이에서 새로운 모델에 대한 측정 가능한 회의론을 보도했습니다.

액세스 범위가 더 넓어지면 유료 API 고객과 Google AI Ultra 가입자부터 시작할 것이라고 Google은 말했습니다.

구글이 아르곤이 할 수 있다고 말하는 것

헤드라인 능력 변화는 지구력입니다. Argon의 출력 토큰 한도는 이전 64K에서 업계 최고의 100만 토큰으로 확장되었습니다. Google은 단일 궤적에서 수십만 개의 토큰을 추론할 수 있는 헤드룸을 모델에 제공하면 세션 전체에 걸쳐 작업을 단편화하는 대신 한 번에 어려운 문제를 해결할 수 있다고 주장합니다.

Google은 개척지 주장을 뒷받침하는 벤치마크 결과를 발표했습니다.

  • DeepSWE v1.1: 77.9% — 실제 소프트웨어 엔지니어링 벤치마크에 대한 새로운 최첨단 기술
  • Vals Index: 1위 — 미국 GDP 기여도에 따라 가중치를 적용한 금융, 코딩, 법률, 세금 업무 전반에서 최고의 성과
  • AutomationBench: 51.3% — Zapier의 엔드투엔드 비즈니스 실행 벤치마크에서 1위
  • LVBench: 91.7% — 장편 동영상 이해의 최첨단
  • CWE-bench v1: 68% — 보안 취약점 해결 부문 공동 1위

Google의 자체 워크플로 내부

Argon은 이미 Google의 내부 업무를 지원하고 있으며 회사는 매우 구체적인 사례를 제시했습니다. 양자 컴퓨팅에서 이 모델은 병목 현상 서브루틴에 대한 시공간 리소스를 최적화하여 게시된 기준을 몇 분 만에 40% 초과했습니다. Argon 에이전트 팀은 전체 프로파일링 원격 측정을 분석하여 Google 데이터 센터 전체에서 메모리 최적화를 식별하고 적용하여 출시 후 300TiB 이상을 확보했으며 총 절감액은 약 500TiB~1PiB입니다.

또한 이 모델은 re2 및 libgav1과 같은 핵심 라이브러리의 수만 줄에서 Fuchsia Zircon 커널의 최대 800,000줄 이상으로 확장하여 C/C++에서 Rust로 대규모 코드 마이그레이션을 추진하고 있습니다. Google의 오픈 소스 비디오 디코더인 libgav1의 경우 Argon 에이전트는 32,000줄의 SIMD 코드를 컴파일러 친화적인 안전한 Rust로 대체하여 동일한 출력으로 이전 Rust 포트보다 2.7배 빠르게 실행되는 메모리 안전 디코더를 생성했습니다.

사이버보안 방어가 최우선

Argon은 중요한 소프트웨어 취약점을 자동으로 찾아 검증하고 패치하는 등 방어적인 사이버 작업을 위해 명시적으로 교육을 받았습니다. 신뢰할 수 있는 방어자와 Google 내부 팀을 위해 회사는 사이버 가드레일 없이 모델을 출시하여 방어자가 완전한 기능을 얻을 수 있도록 할 것입니다. 취약성 교정을 측정하는 CWE-bench v1에서 Argon은 3.8 Flash Cyber의 최전선 성능을 기반으로 68%로 공동 1위를 차지했으며, Google은 Argon이 Wiz의 내부 블랙박스 침투 테스트 벤치마크에서 공격 표면 발견 및 개념 증명 생성에서 해당 모델을 능가했다고 밝혔습니다.

보안 회사인 Wiz는 중요한 공공 인프라를 무료로 보호하는 Scan for Good 이니셔티브를 통해 이미 Argon을 사용하고 있습니다. 초기 시연에서 Google은 이 모델이 전 세계 병원에서 사용하는 의료 소프트웨어에서 민감한 개인 정보를 노출시키는 중요한 취약점을 발견했다고 밝혔습니다. 이는 이전 개척 모델이 놓쳤던 위험입니다.

4중 국경 보호 장치

광범위한 출시 이전에 Google은 4가지 영역에서 보호 장치를 강화하고 있습니다. 오용에 대비하여 Argon은 남용을 발견하기 위해 모델의 내부 활성화를 모니터링하는 새로운 기술을 사용하여 합법적인 이중 용도 연구를 유지하면서 사이버 및 CBRN 공격 요청을 거부하도록 설계되었습니다. 프롬프트 주입에 반대하는 적대적 훈련을 통해 Argon Google의 가장 탄력적인 모델이 만들어졌으며 Gray Swan의 간접 프롬프트 주입 벤치마크에서 선두를 달리고 있습니다.

잘못된 정렬의 경우 Google은 Argon의 일련의 사고와 행동을 모니터링하여 필요한 경우 실행을 중단하고 알림을 전담 사고 대응 팀으로 전달하는 완화 조치를 배포하고 있습니다. 또한 회사는 샌드박스 교육 및 평가 환경을 강화하여 위험도가 높은 실행 전에 이를 봉인했습니다. 특히 Google은 나머지 업계에 추론 투명성을 유지하여 모델 사고가 정렬 불량 진단에 여전히 유용하도록 촉구했습니다.

가격 및 가용성

Argon은 입력 토큰 백만 개당 2달러, 출력 토큰 백만 개당 10달러의 출시 가격으로 출시되며 캐시된 입력 토큰은 입력 가격에서 95% 할인됩니다. 출시 기간이 지나면 가격은 백만 입력 토큰당 4달러, 출력 토큰 백만 달러당 20달러로 인상되어 Argon을 경쟁 프론티어 제품에 대해 공격적으로 포지셔닝합니다.

단계적 데뷔는 프론티어 릴리스의 새로운 현실을 반영합니다. 즉, 기능은 이제 중요한 요소이고 차별화 요소는 제어력을 입증하는 것입니다. Google은 사이버 방어자, 병원 소프트웨어 및 Rust 마이그레이션이 올바른 쇼케이스이며 느린 공개 출시가 다른 안전 사고보다 비용이 적게 든다고 확신합니다. 개발자와 기업은 가드레일 테스트가 허용되는 즉시 열릴 것이라고 Google이 말하는 유료 API 및 AI Ultra 액세스 창을 지켜봐야 합니다.

---

AI보다 앞서 나가세요

최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.

AI 뉴스 자세히 보기 →