Google melancarkan Gemini 3.8 Flash pada hari Selasa, model terbaharunya yang diposisikan sebagai sistem penaakulan dan pengekodan terbaik syarikat namun pada harga yang sama seperti pendahulunya, di samping varian khusus yang dipanggil Gemini 3.8 Flash Cyber ​​yang dibina untuk kerja keselamatan siber pertahanan. Pengumuman yang diterbitkan di blog rasmi Google oleh Tulsee Doshi, pengarah kanan pengurusan produk, dan Raluca Ada Popa, peneraju keselamatan Gemini di Google DeepMind, menandakan keluaran Flash ketiga Google dalam masa enam minggu sahaja.

Pelancaran mendarat di tengah-tengah musim keluaran yang luar biasa sesak, dan ia merupakan jawapan langsung kepada saingan tekanan harga dan prestasi yang telah diletakkan pada barisan model Google. Untuk pandangan yang lebih luas tentang cara makmal sempadan berdagang, pasukan berita terbaharu AI menjejaki setiap keluaran model utama semasa ia berlaku.

Dua Varian, Satu Foundation

Gemini 3.8 datang dalam dua versi yang dibina berdasarkan kecerdasan asas yang sama. Gemini 3.8 Flash ialah kuda kerja tujuan umum: Google mengatakan ia memberikan peningkatan yang ketara ke atas 3.7 Flash merentas kejuruteraan perisian, tugas agen dan penaakulan berbilang langkah dalam domain khusus, pada harga pengenalan yang sama sebanyak $0.75 setiap juta token input dan $3.75 setiap juta token keluaran.

Gemini 3.8 Flash Cyber ​​digambarkan sebagai model keselamatan siber Google yang paling berkebolehan, dengan apa yang syarikat panggil prestasi peringkat sempadan dalam pengesanan kerentanan dan tampalan automatik. Tidak seperti model Flash standard, ia tidak tersedia secara meluas — Google mengedarkannya kepada satu set pembela yang dipercayai melalui program baharu yang dipanggil Fairwind.

Menurut catatan blog itu, keuntungan pengekodan dan penaakulan merentas teras dikongsi sebahagiannya didorong oleh latihan yang ketat dalam domain keselamatan siber yang menuntut, dan kedua-dua model telah dipercepatkan oleh gelung agenik jangka panjang yang direka untuk menilai dan memperhalusi model asas secara rekursif.

Penanda Aras: Bekerja Lebih Keras, Bukan Sekadar Menjadi Lebih Besar

Tuntutan penanda aras Google berpusat pada falsafah reka bentuk yang syarikat rumuskan dengan jelas: 3.8 Flash "bekerja lebih keras." Pada tugas yang rumit, model melaksanakan langkah penaakulan tambahan dan memanggil alat secara berulang, kadangkala menggunakan lebih banyak token untuk memaksimumkan prestasi pada tahap usaha yang lebih tinggi. Pembangun boleh mendail usaha untuk mengurangkan overhed token, atau kekal menggunakan Gemini 3.7 Flash, yang kekal disokong sepenuhnya untuk beban kerja yang mengutamakan kecekapan.

Hasil tajuk berita yang dipetik oleh Google:

  • DeepSWE v1.1 (kejuruteraan perisian ufuk panjang): 3.8 Flash mengatasi kebanyakan model sempadan yang lebih besar dalam menyelesaikan masalah kejuruteraan kompleks secara autonomi hujung ke hujung, pada perkara yang disifatkan oleh Google sebagai sebahagian kecil daripada kos.
  • Ejen Kewangan Vals V2 dan Penanda Aras Ejen Undang-undang Harvey: 3.8 Flash mengatasi prestasi 3.7 Flash dan model sempadan lain dalam bidang kuantitatif dan profesional yang memerlukan analisis dan pelaporan lanjutan.
  • HLE-Verified: 3.8 Flash mencapai 54.9%, yang Google bentangkan sebagai bukti penaakulan pelbagai langkah merentas STEM, kemanusiaan dan bidang profesional.

Siber Kilat: Pertahanan Atas Kesalahan

Varian Cyber adalah keluaran yang lebih luar biasa. Google mengatakan ia sengaja mengutamakan pembetulan kelemahan berbanding keupayaan menyinggung perasaan seperti eksploitasi. Pada CWE-Bench, penanda aras tampalan luaran yang dikendalikan oleh Collinear, Gemini 3.8 Flash Cyber ​​memperoleh lulus@1 sebanyak 47.2% — tepat di belakang model sempadan terkemuka pada 47.8%, menurut Google, tetapi pada kos yang jauh lebih rendah, meletakkannya di sempadan Pareto penanda aras.

Mengenai CyberGym, penanda aras industri standard untuk mencari kelemahan, Google berkata model Cyber ​​menunjukkan penemuan kelemahan autonomi peringkat sempadan, mengatasi pendahulunya 3.5 Flash Cyber ​​serta model sempadan yang jauh lebih besar. Pada penanda aras dalaman Google yang merangkumi pangkalan kod kompleks dalam 20 bahasa pengaturcaraan, model itu mencapai kadar kejayaan melebihi 70%.

Sudah Melindungi Kod Google Sendiri

Google mengatakan model Cyber telah digunakan secara dalaman, dan contoh yang diberikannya adalah khusus:

  • Pasukan Keselamatan Chrome mendapati bahawa 3.8 Flash Cyber ​​menghasilkan 2.6 kali lebih tampung yang betul kepada kelemahan Chrome daripada model komersial terbaik, yang jauh lebih besar.
  • Di firma keselamatan Wiz, model itu mencapai 7.5 hingga 9.7 mata peratusan lebih tinggi pada penanda aras ujian penembusan dalaman pada kos 2.3 hingga 5.2 kali lebih rendah berbanding model sempadan terkemuka yang lain.
  • Pasukan Penyelidikan Kerentanan Awan Google menggunakan model itu untuk mencari kelemahan asas yang kritikal dalam masa kurang dari dua jam — kelas kerentanan yang penyelidikan dan penemuannya, menurut Google, biasanya mengambil masa berbulan-bulan.

Maksudnya untuk Pemaju dan Pasaran

Bagi pemaju, amalan praktikal ialah kestabilan harga di hujung sempadan yang rendah. Memegang 3.8 Flash pada harga pengenalan 3.7 mengekalkan kos model pengekodan dan agen yang kompetitif pada $0.75/$3.75 bagi setiap juta token, segmen di mana pencabar berat terbuka dan makmal saingan telah mengurangkan penyandangnya sepanjang tahun. Mesej Google ialah pembeli tidak perlu lagi memilih antara kos dan keupayaan dalam peringkat pekerja keras.

Model pengedaran Program Fairwind untuk Flash Cyber ​​adalah sama menariknya. Makmal peringkat hadapan semakin menganggap keupayaan keselamatan siber elit sebagai sesuatu yang perlu dikawal dan bukannya dihantar secara meluas — menyediakan alatan pertahanan terkini kepada pembela yang telah disemak sambil mengehadkan potensi penyalahgunaan yang menyinggung perasaan. Keputusan Google untuk mengutamakan menampal penanda aras berbanding keupayaan eksploitasi dalam latihan model mengikut logik yang sama.

Iramanya juga ketara. Tiga keluaran Flash dalam enam minggu — 3.7 Flash tiga minggu lalu, kini 3.8 — menunjukkan Google melelang barisan peringkat pertengahannya jauh lebih pantas daripada kitaran keluaran gaya tahunan dua tahun lalu. Tekanan kompetitif daripada pelancaran GPT-6 OpenAI dan gelombang model pemberat terbuka yang bergerak pantas dari China telah memampatkan garis masa semua orang, dan Google jelas memilih kepantasan pada peringkat pekerja keras manakala model sempadannya membawa bendera penyelidikan.

Sama ada pendekatan "bekerja lebih keras" 3.8 Flash — membelanjakan lebih banyak token untuk penaakulan pelbagai langkah yang rajin — terbukti lebih cekap dalam amalan berbanding skala model mentah akan dipaparkan dalam bil pembangun dalam beberapa bulan akan datang. Penanda aras Google sendiri mencadangkan perdagangan boleh memihak kepada ketekunan; pasaran akan memberikan keputusannya satu bil API pada satu masa.

Kekal Mendahului AI

Setiap pelancaran model, penanda aras dan perubahan harga, dijejaki semasa ia berlaku — baca lebih lanjut berita AI →