Google ngluncurake Gemini 3.8 Flash dina Selasa, model workhorse paling anyar sing dipanggonke minangka sistem penalaran lan koding paling apik ing perusahaan kanthi rega sing padha karo sing sadurunge, bebarengan karo varian khusus sing diarani Gemini 3.8 Flash Cyber ​​sing dibangun kanggo kerja keamanan siber. Pengumuman kasebut, diterbitake ing blog resmi Google dening Tulsee Doshi, direktur senior manajemen produk, lan Raluca Ada Popa, pimpinan keamanan Gemini ing Google DeepMind, menehi tandha rilis Flash kaping telu Google mung nem minggu.

Peluncuran kasebut ana ing tengah musim rilis sing luar biasa rame, lan iki minangka jawaban langsung kanggo saingan tekanan rega-lan-kinerja sing wis dipasang ing garis model Google. Kanggo tampilan sing luwih akeh babagan kepiye laboratorium perbatasan dagang, tim [berita AI] (https://aibuzzwire.news) nglacak saben rilis model utama nalika kedadeyan kasebut.

Loro Varian, Siji Foundation

Gemini 3.8 kasedhiya ing rong versi sing dibangun ing intelijen dhasar sing padha. Gemini 3.8 Flash minangka workhorse tujuan umum: Google ujar manawa menehi dandan sing signifikan liwat 3.7 Flash ing rekayasa piranti lunak, tugas agen lan penalaran multi-langkah ing domain khusus, kanthi rega pambuka sing padha $0.75 saben yuta token input lan $3.75 saben yuta token output.

Gemini 3.8 Flash Cyber ​​diterangake minangka model keamanan siber Google sing paling mumpuni, kanthi apa sing diarani perusahaan kinerja tingkat wates ing deteksi kerentanan lan patching otomatis. Ora kaya model Flash standar, ora kasedhiya sacara umum - Google nyebarake menyang sakumpulan pembela sing dipercaya liwat program anyar sing diarani Fairwind.

Miturut kiriman blog kasebut, asil coding lan pertimbangan ing inti sing dienggo bareng didorong sebagian dening latihan sing ketat ing domain keamanan siber, lan model loro kasebut digawe cepet dening loop agenik sing wis suwe dirancang kanggo ngevaluasi lan nyaring model sing ndasari.

Patokan: Makarya Luwih Sregep, Ora Mung Gedhe

Pusat klaim benchmark Google babagan filosofi desain sing disimpulake perusahaan kanthi jelas: 3.8 Flash "kerja luwih keras." Ing tugas rumit, model nglakokake langkah-langkah penalaran ekstra lan nelpon piranti kanthi iteratif, kadhangkala nggunakake token luwih akeh kanggo ngoptimalake kinerja ing tingkat gaweyan sing luwih dhuwur. Pangembang bisa nggawe upaya kanggo nyuda overhead token, utawa tetep ing Gemini 3.7 Flash, sing tetep didhukung kanthi lengkap kanggo beban kerja sing luwih dhisik.

Hasil judhul Google nyebutake:

  • DeepSWE v1.1 (long-horizon software engineering): 3.8 Lampu kilat outperforms paling gedhe model wates ing autonomously mecahaken masalah engineering Komplek pungkasan kanggo mburi, ing apa Google njlèntrèhaké minangka bagian sekedhik saka biaya.
  • Vals Finance Agent V2 lan Harvey's Legal Agent Benchmark: 3.8 Flash outperforms 3.7 Flash lan model perbatasan liyane ing lapangan kuantitatif lan profesional sing mbutuhake analisis lan laporan lanjut.
  • HLE-Verified: 3.8 Flash entuk 54.9%, sing disedhiyakake Google minangka bukti penalaran multi-langkah ing STEM, kamanungsan lan lapangan profesional.

Flash Cyber: Defense Over Offense

Varian Cyber minangka rilis sing luwih ora biasa. Google ujar manawa kanthi sengaja menehi prioritas kanggo ndandani kerentanan tinimbang kemampuan nyerang kaya eksploitasi. Ing CWE-Bench, pathokan patching eksternal sing dikelola dening Collinear, Gemini 3.8 Flash Cyber ​​ngetung pass@1 saka 47.2% - mung ing mburi model frontier sing unggul ing 47.8%, miturut Google, nanging kanthi biaya sing luwih murah, dilebokake ing wates Pareto pathokan.

Ing CyberGym, pathokan industri standar kanggo nemokake kerentanan, Google ujar manawa model Cyber ​​nuduhake panemuan kerentanan otonom tingkat wates, ngluwihi 3.5 Flash Cyber ​​sadurunge lan uga model perbatasan sing luwih gedhe. Ing pathokan internal Google sing nyakup basis kode kompleks ing 20 basa pamrograman, model kasebut nggayuh tingkat sukses ngluwihi 70%.

Wis Ngamanake Kode Google Dhewe

Google ujar manawa model Cyber wis dipasang sacara internal, lan conto sing diwenehake khusus:

  • Tim Keamanan Chrome nemokake yen 3.8 Flash Cyber ​​ngasilake patch 2.6 kaping luwih bener kanggo kerentanan Chrome tinimbang model komersial paling apik, sing luwih gedhe.
  • Ing perusahaan keamanan Wiz, model kasebut entuk 7,5 nganti 9,7 poin persentase sing luwih dhuwur ing pathokan tes penetrasi internal kanthi biaya 2,3 nganti 5,2 kaping luwih murah dibandhingake karo model frontier liyane.
  • Tim Riset Kerentanan Awan Google nggunakake model kasebut kanggo nemokake kerentanan dhasar sing kritis sajrone rong jam - kelas kerentanan sing riset lan panemuan, cathetan Google, biasane mbutuhake pirang-pirang wulan.

Apa Tegese kanggo Pangembang lan Pasar

Kanggo pangembang, takeaway praktis yaiku stabilitas rega ing sisih ngisor wates. Nyekel 3.8 Flash ing rega pambuka 3.7 njaga biaya model coding-lan-agentik sing kompetitif ing $0.75/$3.75 saben yuta token, segmen ing ngendi para penantang bobot mbukak lan laboratorium saingan wis ngremehake incumbents kabeh taun. Pesen Google yaiku para panuku ora perlu maneh milih antarane biaya lan kemampuan ing tingkat tenaga kerja.

Model distribusi Program Fairwind kanggo Flash Cyber ​​padha. Laboratorium tingkat ngarep tambah akeh nganggep kemampuan cybersecurity elit minangka barang sing kudu digatekake tinimbang dikirim kanthi wiyar - nyedhiyakake alat pertahanan paling canggih kanggo para pembela sing wis diverifikasi nalika mbatesi potensial penyalahgunaan sing nyerang. Keputusan Google kanggo menehi prioritas patching pathokan tinimbang kapabilitas eksploitasi ing latihan model kasebut miturut logika sing padha.

Irama uga misuwur. Telung rilis Flash sajrone nem minggu - 3.7 Flash telung minggu kepungkur, saiki 3.8 - nuduhake Google ngulang garis tingkat tengah luwih cepet tinimbang siklus rilis gaya taunan rong taun kepungkur. Tekanan kompetitif saka peluncuran OpenAI's GPT-6 lan gelombang model bobot mbukak sing cepet saka China wis ngompres garis wektu saben wong, lan Google kanthi jelas milih kacepetan ing tingkat workhorse nalika model perbatasan nggawa bendera riset.

Apa pendekatan "kerja luwih keras" 3.8 Flash — mbuwang luwih akeh token kanggo pertimbangan multi-langkah sing sregep — mbuktekake luwih efisien ing praktik tinimbang skala model mentah bakal ditampilake ing tagihan pangembang sajrone sawetara wulan. Tolok ukur Google dhewe nyaranake perdagangan bisa milih rajin; pasar bakal nerjemahake putusan siji Bill API ing wektu.

Tetep Ahead saka AI

Saben peluncuran model, pathokan lan owah-owahan rega, dilacak nalika kedadeyan - waca warta AI liyane →