Google은 화요일에 Gemini 3.8 Flash를 출시했습니다. 이 모델은 방어적인 사이버 보안 작업을 위해 구축된 Gemini 3.8 Flash Cyber라는 특수 변형과 함께 회사 최고의 추론 및 코딩 시스템으로 자리매김하면서도 이전 모델과 동일한 가격으로 제공되는 최신 주력 모델입니다. 제품 관리 수석 이사인 Tulsee Doshi와 Google DeepMind의 Gemini 보안 책임자인 Raluca Ada Popa가 Google의 공식 블로그에 게시한 이 발표는 단 6주 만에 Google의 세 번째 Flash 릴리스를 의미합니다.

이번 출시는 비정상적으로 붐비는 출시 시즌의 한가운데에 이루어졌으며 경쟁업체가 Google의 모델 라인에 가한 가격 및 성능 압박에 대한 직접적인 대답입니다. 프론티어 연구소가 어떻게 타격을 주고 있는지 더 폭넓게 살펴보기 위해 AI 속보 팀은 모든 주요 모델 출시를 실시간으로 추적합니다.

두 가지 변형, 하나의 기반

Gemini 3.8은 동일한 기본 인텔리전스를 기반으로 구축된 두 가지 버전으로 제공됩니다. Gemini 3.8 Flash는 범용 주력 제품입니다. Google에서는 입력 토큰 백만 개당 0.75달러, 출력 토큰 백만 개당 3.75달러라는 동일한 초기 가격으로 소프트웨어 엔지니어링, 에이전트 작업 및 전문 도메인의 다단계 추론 전반에 걸쳐 3.7 Flash보다 크게 향상된 기능을 제공한다고 밝혔습니다.

Gemini 3.8 Flash Cyber는 취약성 탐지 및 자동화된 패치 적용 분야에서 최전선 수준의 성능을 발휘하는 Google의 가장 유능한 사이버 보안 모델로 설명됩니다. 표준 Flash 모델과 달리 광범위하게 사용 가능하지 않습니다. Google은 Fairwind라는 새로운 프로그램을 통해 신뢰할 수 있는 방어자 집단에 배포하고 있습니다.

블로그 게시물에 따르면 공유 코어 전반의 코딩 및 추론 향상은 부분적으로 까다로운 사이버 보안 영역의 엄격한 교육에 의해 주도되었으며 두 모델 모두 기본 모델을 재귀적으로 평가하고 개선하도록 설계된 장기 실행 에이전트 루프에 의해 가속화되었습니다.

벤치마크: 단지 규모만 커지는 것이 아니라 더 열심히 일하는 것

Google의 벤치마크 주장은 회사가 명확하게 요약한 디자인 철학을 중심으로 합니다. 3.8 Flash는 "더 열심히 작동합니다." 복잡한 작업에서 모델은 추가 추론 단계를 실행하고 도구를 반복적으로 호출하며 때로는 더 높은 노력 수준에서 성능을 극대화하기 위해 더 많은 토큰을 소비합니다. 개발자는 토큰 오버헤드를 줄이기 위해 노력을 덜거나 효율성 우선 워크로드에 대해 완벽하게 지원되는 Gemini 3.7 Flash를 유지할 수 있습니다.

Google이 인용한 헤드라인 결과는 다음과 같습니다.

  • DeepSWE v1.1(장거리 소프트웨어 엔지니어링): 3.8 Flash는 Google에서 설명하는 비용의 일부만으로 복잡한 엔지니어링 문제를 처음부터 끝까지 자율적으로 해결하는 데 있어 대부분의 대규모 프론티어 모델보다 성능이 뛰어납니다.
  • Vals Finance Agent V2 및 Harvey's Legal Agent Benchmark: 3.8 Flash는 고급 분석 및 보고가 필요한 양적 및 전문 분야에서 3.7 Flash 및 기타 첨단 모델보다 성능이 뛰어납니다.
  • HLE 인증: 3.8 Flash는 54.9%를 달성하며, 이는 Google이 STEM, 인문학 및 전문 분야 전반에 걸친 다단계 추론의 증거로 제시합니다.

플래시 사이버: 공격보다 방어

사이버 변종은 더욱 특이한 릴리스입니다. 구글은 착취와 같은 공격적인 능력보다 취약성 수정을 의도적으로 우선시했다고 밝혔습니다. Collinear가 운영하는 외부 패치 벤치마크인 CWE-Bench에서 Gemini 3.8 Flash Cyber는 47.2%의 pass@1을 기록했습니다. Google에 따르면 선도적인 프론티어 모델의 47.8%에 바로 뒤쳐졌지만 훨씬 저렴한 비용으로 벤치마크의 파레토 프론티어에 올랐습니다.

취약점 발견을 위한 표준 산업 벤치마크인 CyberGym에서 Google은 사이버 모델이 이전 모델인 3.5 Flash Cyber와 훨씬 더 큰 프론티어 모델을 능가하는 프론티어 수준의 자율적 취약점 발견을 보여 준다고 말합니다. 20개 프로그래밍 언어로 된 복잡한 코드베이스를 포괄하는 Google의 내부 벤치마크에서 이 모델은 70%가 넘는 성공률을 달성했습니다.

이미 Google 자체 코드를 보호하고 있습니다.

Google은 사이버 모델이 이미 내부적으로 배포되었으며 제공되는 예가 구체적이라고 말합니다.

  • Chrome 보안 팀은 3.8 Flash Cyber가 훨씬 더 큰 최고의 상용 모델보다 Chrome 취약점에 대한 정확한 패치를 2.6배 더 많이 생성한다는 사실을 발견했습니다.
  • 보안업체 위즈(Wiz)에서 이 모델은 다른 주요 프론티어 모델에 비해 2.3~5.2배 낮은 비용으로 내부 침투 테스트 벤치마크에서 7.5~9.7% 더 높은 재현율을 달성했습니다.
  • Google의 Cloud Vulnerability Research 팀은 이 모델을 사용하여 2시간 이내에 중요한 기본 취약점을 발견했습니다. Google에서 언급한 이 취약점의 연구 및 발견에는 일반적으로 몇 달이 걸립니다.

개발자와 시장에 미치는 영향

개발자에게 실질적인 시사점은 최하위권에서의 가격 안정성입니다. 3.7의 초기 가격으로 3.8 플래시를 보유하면 경쟁력 있는 코딩 및 에이전트 모델의 비용이 백만 토큰당 $0.75/$3.75로 유지됩니다. 이 부문에서는 오픈 웨이트 도전자와 경쟁 연구실이 일년 내내 기존 연구실보다 가격을 낮췄습니다. Google의 메시지는 구매자가 더 이상 주력 계층에서 비용과 기능 중 하나를 선택할 필요가 없다는 것입니다.

Flash Cyber의 Fairwind 프로그램 배포 모델도 마찬가지입니다. 최전방 연구소에서는 점점 더 엘리트 사이버 보안 기능을 광범위하게 출시되기보다는 제한해야 하는 것으로 간주하고 있습니다. 즉, 검증된 방어자에게 최첨단 방어 도구를 제공하는 동시에 공격적인 오용 가능성을 제한하고 있습니다. 모델 교육에서 활용 기능보다 벤치마크 패치를 우선시하기로 한 Google의 결정도 동일한 논리를 따릅니다.

케이던스도 주목할 만하다. 6주 만에 3개의 Flash 릴리스(3주 전 3.7 Flash, 현재 3.8)는 Google이 2년 전의 연간 릴리스 주기보다 훨씬 빠르게 중간 계층 라인을 반복하고 있음을 보여줍니다. OpenAI의 GPT-6 출시로 인한 경쟁 압력과 중국에서 빠르게 움직이는 개방형 모델의 물결로 인해 모든 사람의 일정이 압축되었으며 Google은 최첨단 모델이 연구 깃발을 들고 있는 동안 주력 계층에서 속도를 선택하고 있습니다.

3.8 Flash의 "더 열심히 작업하는" 접근 방식(부지런한 다단계 추론에 더 많은 토큰을 소비)이 앞으로 몇 달 동안 개발자의 청구서에 표시될 원시 모델 규모보다 실제로 더 효율적인 것으로 입증되었습니다. Google의 자체 벤치마크에 따르면 거래가 근면을 선호할 수 있음을 시사합니다. 시장은 한 번에 하나의 API 법안에 대한 평결을 내릴 것입니다.

AI보다 앞서 나가세요

모든 모델 출시, 벤치마크 및 가격 변동을 실시간으로 추적 — AI 뉴스 자세히 읽기 →