Google đã ra mắt Gemini 3.8 Flash vào thứ Ba, mẫu xe ngựa mới nhất của hãng được coi là hệ thống lập luận và mã hóa tốt nhất của công ty nhưng có mức giá tương đương với phiên bản tiền nhiệm, cùng với một biến thể chuyên dụng có tên Gemini 3.8 Flash Cyber được thiết kế cho công việc phòng thủ an ninh mạng. Thông báo được công bố trên blog chính thức của Google bởi Tulsee Doshi, giám đốc cấp cao về quản lý sản phẩm và Raluca Ada Popa, trưởng nhóm bảo mật Gemini tại Google DeepMind, đánh dấu lần phát hành Flash thứ ba của Google chỉ sau sáu tuần.
Sự ra mắt diễn ra vào giữa mùa phát hành đông đúc bất thường và đó là câu trả lời trực tiếp cho áp lực về giá cả và hiệu suất mà các đối thủ đã đặt lên dòng sản phẩm mô hình của Google. Để có cái nhìn rộng hơn về cách các phòng thí nghiệm biên giới đang giao dịch, nhóm tin tức AI mới nhất theo dõi mọi phiên bản mô hình chính khi nó diễn ra.
Hai biến thể, một nền tảng
Gemini 3.8 có hai phiên bản được xây dựng trên cùng một nền tảng trí tuệ. Gemini 3.8 Flash là công cụ dành cho mục đích chung: Google cho biết nó mang lại những cải tiến đáng kể so với 3.7 Flash trên công nghệ phần mềm, tác vụ tác nhân và lý luận nhiều bước trong các miền chuyên biệt, với cùng mức giá giới thiệu là 0,75 USD trên một triệu mã thông báo đầu vào và 3,75 USD trên một triệu mã thông báo đầu ra.
Gemini 3.8 Flash Cyber được mô tả là mô hình an ninh mạng có khả năng nhất của Google, với cái mà công ty gọi là hiệu suất cấp cao trong việc phát hiện lỗ hổng và vá lỗi tự động. Không giống như mô hình Flash tiêu chuẩn, nó không được cung cấp rộng rãi — Google đang phân phối nó cho một nhóm người bảo vệ đáng tin cậy thông qua một chương trình mới có tên Fairwind.
Theo bài đăng trên blog, lợi ích mã hóa và lý luận trên lõi chia sẻ được thúc đẩy một phần nhờ quá trình đào tạo nghiêm ngặt trong lĩnh vực đòi hỏi khắt khe về an ninh mạng và cả hai mô hình đều được tăng tốc nhờ các vòng lặp tác nhân chạy dài được thiết kế để đánh giá đệ quy và tinh chỉnh các mô hình cơ bản.
Tiêu chuẩn: Làm việc chăm chỉ hơn, không chỉ trở nên to lớn hơn
Tuyên bố điểm chuẩn của Google tập trung vào triết lý thiết kế mà công ty tóm tắt một cách rõ ràng: 3.8 Flash "làm việc chăm chỉ hơn". Đối với các tác vụ phức tạp, mô hình thực hiện các bước suy luận bổ sung và gọi các công cụ lặp đi lặp lại, đôi khi tiêu tốn nhiều mã thông báo hơn để tối đa hóa hiệu suất ở mức nỗ lực cao hơn. Các nhà phát triển có thể giảm bớt nỗ lực để cắt giảm chi phí mã thông báo hoặc tiếp tục sử dụng Gemini 3.7 Flash, vốn vẫn được hỗ trợ đầy đủ cho khối lượng công việc đặt hiệu quả lên hàng đầu.
Kết quả tiêu đề Google trích dẫn:
- DeepSWE v1.1 (công nghệ phần mềm tầm xa): 3.8 Flash vượt trội hơn hầu hết các mô hình biên giới lớn hơn trong việc tự động giải quyết các vấn đề kỹ thuật phức tạp từ đầu đến cuối, với mức chi phí mà Google mô tả là một phần nhỏ.
- Điểm chuẩn của Đại lý Tài chính Vals V2 và Harvey's Legal Agent: 3.8 Flash vượt trội hơn 3.7 Flash và các mô hình tiên tiến khác trong các lĩnh vực định lượng và chuyên nghiệp yêu cầu phân tích và báo cáo nâng cao.
- HLE-Được xác minh: 3.8 Flash đạt 54,9%, được Google đưa ra làm bằng chứng về lý luận nhiều bước trong các lĩnh vực STEM, nhân văn và chuyên môn.
Flash Cyber: Phòng thủ trước tấn công
Biến thể Cyber là phiên bản khác thường hơn. Google cho biết họ cố tình ưu tiên việc sửa lỗ hổng hơn là các khả năng tấn công như khai thác. Trên CWE-Bench, một điểm chuẩn vá lỗi bên ngoài do Colline thực hiện, Gemini 3.8 Flash Cyber đạt điểm vượt qua 1 là 47,2% — chỉ sau mô hình tiên phong hàng đầu với tỷ lệ 47,8%, theo Google, nhưng với chi phí thấp hơn đáng kể, đưa nó lên trên giới hạn Pareto của điểm chuẩn.
Trên CyberGym, một chuẩn mực tiêu chuẩn của ngành để tìm kiếm lỗ hổng, Google cho biết mô hình Cyber thể hiện khả năng phát hiện lỗ hổng tự động ở cấp độ biên giới, vượt qua phiên bản tiền nhiệm 3.5 Flash Cyber cũng như các mô hình biên giới lớn hơn đáng kể. Trên tiêu chuẩn nội bộ của Google bao gồm các cơ sở mã phức tạp bằng 20 ngôn ngữ lập trình, mô hình đã đạt tỷ lệ thành công vượt quá 70%.
Đã bảo mật mã riêng của Google
Google cho biết mô hình Cyber đã được triển khai nội bộ và các ví dụ mà nó cung cấp rất cụ thể:
- Nhóm Bảo mật Chrome nhận thấy rằng 3.8 Flash Cyber tạo ra các bản vá chính xác cho các lỗ hổng của Chrome gấp 2,6 lần so với các mô hình thương mại tốt nhất, với số lượng lớn hơn nhiều.
- Tại công ty bảo mật Wiz, mô hình này đã đạt được mức thu hồi cao hơn từ 7,5 đến 9,7 điểm phần trăm trên tiêu chuẩn thử nghiệm thâm nhập nội bộ với chi phí thấp hơn 2,3 đến 5,2 lần so với các mô hình hàng đầu khác.
- Nhóm Nghiên cứu lỗ hổng đám mây của Google đã sử dụng mô hình này để tìm ra lỗ hổng cơ bản nghiêm trọng trong vòng chưa đầy hai giờ - một loại lỗ hổng mà quá trình nghiên cứu và khám phá, Google lưu ý, thường mất vài tháng.
Ý nghĩa của nó đối với Nhà phát triển và Thị trường
Đối với các nhà phát triển, điều rút ra được thực tế là sự ổn định về giá ở mức thấp nhất của biên giới. Giữ 3,8 Flash ở mức giá giới thiệu 3,7 giữ cho chi phí của mô hình mã hóa và đại lý cạnh tranh ở mức 0,75 USD/3,75 USD trên một triệu mã thông báo, một phân khúc mà những kẻ thách thức trọng lượng mở và các phòng thí nghiệm đối thủ đã cắt giảm các công ty đương nhiệm trong suốt cả năm. Thông điệp của Google là người mua không còn cần phải lựa chọn giữa chi phí và khả năng ở cấp độ phù hợp.
Mô hình phân phối Chương trình Fairwind cho Flash Cyber cũng có ý nghĩa tương tự. Các phòng thí nghiệm cấp cao đang ngày càng coi năng lực an ninh mạng ưu tú như thứ gì đó cần được kiểm soát thay vì được vận chuyển rộng rãi - cung cấp công cụ phòng thủ hiện đại cho những người bảo vệ đã được kiểm duyệt đồng thời hạn chế khả năng lạm dụng để tấn công. Quyết định của Google ưu tiên vá các điểm chuẩn hơn khả năng khai thác trong quá trình đào tạo của mô hình cũng tuân theo logic tương tự.
Nhịp điệu cũng đáng chú ý. Ba bản phát hành Flash trong sáu tuần - 3,7 Flash ba tuần trước, bây giờ là 3,8 - cho thấy Google đang lặp lại dòng sản phẩm tầm trung của mình nhanh hơn nhiều so với chu kỳ phát hành theo kiểu hàng năm của hai năm trước. Áp lực cạnh tranh từ việc triển khai GPT-6 của OpenAI và làn sóng các mô hình trọng lượng mở phát triển nhanh từ Trung Quốc đã nén dòng thời gian của mọi người và Google rõ ràng đang chọn tốc độ ở cấp độ phù hợp trong khi các mô hình tiên phong của họ mang cờ nghiên cứu.
Liệu cách tiếp cận "làm việc chăm chỉ hơn" của 3.8 Flash — chi tiêu nhiều mã thông báo hơn cho việc suy luận nhiều bước siêng năng — có chứng tỏ hiệu quả hơn trên thực tế hay không so với quy mô mô hình thô sẽ xuất hiện trong hóa đơn của các nhà phát triển trong những tháng tới. Các tiêu chuẩn riêng của Google cho thấy giao dịch có thể tạo điều kiện thuận lợi cho sự siêng năng; thị trường sẽ đưa ra phán quyết của mình từng hóa đơn API tại một thời điểm.
Đi trước AI
Mỗi lần ra mắt mẫu máy, điểm chuẩn và sự thay đổi về giá, đều được theo dõi khi nó diễn ra — đọc thêm tin tức AI →
