OpenAI đã công bố kết quả điểm chuẩn đầu tiên cho Jalapeño, chip suy luận tùy chỉnh của nó và những con số rất ấn tượng: trên điểm chuẩn InferenceX của SemiAnalysis, silicon mới đã đăng ký cả nhiều mã thông báo hơn cho mỗi người dùng và nhiều thông lượng hơn trên mỗi kilowatt so với bộ xử lý suy luận hiện đại nhất hiện có - một so sánh bao gồm các hệ thống Blackwell của Nvidia. Các kết quả đã được trình bày hôm thứ Ba tại hội nghị Hot Chips ở Palo Alto, cùng với cái nhìn kỹ thuật chi tiết về cách thức chế tạo con chip. Đối với độc giả theo dõi cuộc đua điện toán làm nền tảng cho mọi bản phát hành mô hình AI, đây là một trong những điểm dữ liệu phần cứng có ảnh hưởng lớn nhất trong năm.

Richard Ho, người đứng đầu phần cứng của OpenAI, cho biết trong một cuộc gọi báo chí do TechCrunch đưa tin: “Điểm mấu chốt là kết quả cho thấy sự tiến bộ về hiệu suất rất, rất đáng kể so với công nghệ hiện đại”. "Jalapeño có thể phục vụ nhiều công việc AI hơn trên mỗi đơn vị năng lượng, đồng thời trả lại phản hồi nhanh hơn. Việc phục vụ nhiều khách hàng rất hiệu quả nhưng cũng có thể có độ trễ rất thấp."

Một con chip được xây dựng cho toàn bộ đường dẫn suy luận

Jalapeño được ra mắt vào tháng 6 năm 2026 dưới dạng silicon tùy chỉnh đầu tiên của OpenAI, được phát triển với sự hợp tác chặt chẽ với Broadcom, với các mô hình AI của chính OpenAI hỗ trợ quá trình phát triển chip. Bản thân mối quan hệ hợp tác bắt đầu từ tháng 10 năm 2025, khi OpenAI đặt ra kế hoạch cho chương trình tăng tốc tùy chỉnh đa thế hệ cùng với gã khổng lồ mạng.

Theo OpenAI, điều khiến Jalapeño khác biệt so với GPU đa năng là nó được thiết kế phù hợp với các mẫu mà nó sẽ phục vụ. Bởi vì công ty kiểm soát toàn bộ — sản phẩm AI, mô hình, chip và bộ nhớ — nên các kỹ sư của công ty có thể tấn công các giai đoạn cụ thể của quá trình suy luận thường gây ra xung đột.

Đặc biệt, Jalapeño được thiết kế để giảm thiểu sự chậm trễ trong giai đoạn xử lý trước và giao tiếp, điều mà OpenAI cho biết thường đóng vai trò là điểm nghẽn khi phục vụ các mô hình ngôn ngữ lớn trên quy mô lớn.

Công ty viết trong một bài đăng trên blog trình bày kết quả: “Chúng tôi đã thiết kế Jalapeño để giảm thiểu sự chậm trễ trong việc di chuyển dữ liệu và liên lạc”. "Điều này có nghĩa là trạng thái mô hình, bao gồm cả bộ đệm KV được sử dụng trong khi tạo phản hồi, có thể được đặt và giữ cục bộ một cách rõ ràng trong khi hệ thống kích hoạt sự kết hợp phù hợp giữa điện toán, bộ nhớ và kết nối mạng cho từng giai đoạn suy luận."

Điểm cuối cùng đó rất quan trọng đối với bất kỳ ai đang chạy khối lượng công việc AI sản xuất. Bộ đệm KV — bối cảnh tích lũy mà một mô hình lưu giữ trong khi tạo phản hồi — là một trong những vấn đề đau đầu nhất về bộ nhớ và băng thông trong suy luận hiện đại. Giữ nó cục bộ và được quản lý rõ ràng, thay vì xáo trộn nó trên một cụm, là một cách cổ điển để giảm bớt độ trễ và sức mạnh.

Tốt hơn Blackwell — Hiện tại

Sự so sánh tiêu đề là dựa trên hệ thống Nvidia Blackwell, hiện là đặc tính của suy luận AI biên giới. Phân tích độc lập được SemiAnalysis công bố cùng ngày, có tiêu đề "OpenAI Jalapeño: Tốt hơn Nvidia Blackwell", đã đưa ra kết luận tương tự về kết quả ban đầu của con chip và câu chuyện nhanh chóng trở thành một trong những chủ đề được thảo luận nhiều nhất trên Hacker News.

Nhưng các giám đốc điều hành và nhà phân tích của OpenAI đều kêu gọi hãy thận trọng. Ho ước tính rằng Jalapeño sẽ triển khai vào cuối năm 2026 "với số lượng rất nhỏ", với việc triển khai đáng kể hơn vào năm 2027. Vào thời điểm Jalapeño đạt quy mô đầy đủ, sự cạnh tranh có thể đã tiến bộ đáng kể — lộ trình của Nvidia tiếp tục phát triển và các công ty siêu quy mô khác bao gồm Google, Amazon và Microsoft đều đang đẩy mạnh silicon tùy chỉnh của riêng họ.

Như TechCrunch đã lưu ý, điểm chuẩn được đo so với công nghệ tiên tiến ngày nay chỉ là ảnh chụp nhanh chứ không phải là sự đảm bảo. Một con chip chiến thắng về hiệu quả vào năm 2026 phải tiếp tục giành chiến thắng trước bất cứ thứ gì Nvidia và các đối thủ của nó xuất xưởng vào năm tới.

Tại sao OpenAI lại xây dựng Silicon của riêng mình

Logic chiến lược rất đơn giản: suy luận là chi phí định kỳ lớn nhất của OpenAI. Mọi truy vấn ChatGPT, mọi lệnh gọi API và mọi tác vụ đại lý đều đốt cháy điện toán và việc thuê điện toán đó từ Nvidia theo giá thị trường sẽ làm giảm tỷ suất lợi nhuận theo quy mô sử dụng. Một con chip tùy chỉnh được điều chỉnh theo các mô hình riêng của OpenAI - được thiết kế cùng với Broadcom và được định hình bởi chính các mô hình của OpenAI - mang lại cho công ty một cách để phục vụ nhiều người dùng hơn trên mỗi watt và trên mỗi đô la.

Jalapeño cũng được lên kế hoạch như một nền tảng đa thế hệ chứ không phải là một phần duy nhất. OpenAI cho biết họ có ý định cùng nhau phát triển các sản phẩm, mô hình, chip và bộ nhớ AI để mỗi thế hệ silicon được đồng tối ưu hóa với các mô hình mà nó sẽ chạy. Nếu kết quả của thế hệ đầu tiên được duy trì trong quá trình sản xuất thì Jalapeño sẽ trở thành khuôn mẫu cho mọi thứ tiếp theo.

Các cổ phần vượt ra ngoài OpenAI. Sự thống trị của Nvidia đối với các máy tăng tốc AI đã trở thành nút thắt thắt chặt nhất trong ngành trong ba năm và mọi giải pháp thay thế đáng tin cậy – cho dù từ nhóm TPU của Google, Amazon hay bây giờ là OpenAI – đều thay đổi bối cảnh đàm phán cho mọi người xây dựng cơ sở hạ tầng AI. Bản thân Nvidia được cho là đang cảnh báo khách hàng về việc tăng giá từ 15% trở lên đối với các máy chủ AI khi chi phí bộ nhớ tăng cao, điều này chỉ làm tăng thêm sức hấp dẫn của các lựa chọn thay thế nội bộ.

Điều gì xảy ra tiếp theo

Hiện tại, Jalapeño vẫn là phần tiền sản xuất với số lượng giấy tờ đầy hứa hẹn. Thử nghiệm thực sự sẽ diễn ra vào cuối năm 2026, khi khối lượng nhỏ đầu tiên được triển khai và đặc biệt là vào năm 2027, khi OpenAI mong đợi quy mô có ý nghĩa. Các câu hỏi chính vẫn chưa được trả lời: độ tin cậy trong thế giới thực ở quy mô trung tâm dữ liệu, tổng chi phí sở hữu so với công suất thuê của Blackwell và liệu lợi thế hiệu quả có còn tồn tại trước thế hệ tiếp theo của Nvidia hay không.

Tuy nhiên, điểm chuẩn đầu tiên đánh dấu một cột mốc quan trọng: lần đầu tiên một trong những phòng thí nghiệm AI lớn đã trình diễn công khai silicon suy luận tùy chỉnh dường như đánh bại phòng thí nghiệm hiện tại về hiệu quả tốt nhất. Đối với một ngành đã coi nguồn cung cấp của Nvidia như huyết mạch chiến lược, đó là một bước ngoặt thực sự.

---

Đi trước AI

Nhận tin tức, phân tích và đột phá mới nhất về AI — tất cả ở cùng một nơi.

Đọc thêm tin tức về AI →