OpenAI telah menerbitkan hasil penanda aras pertama untuk Jalapeño, cip inferens tersuainya, dan angka-angka yang menarik perhatian: pada penanda aras SemiAnalysis 'InferenceX, silikon baharu mendaftarkan kedua-dua lebih banyak token bagi setiap pengguna dan lebih banyak daya pengeluaran bagi setiap kilowatt daripada pemproses inferens terkini yang tersedia - perbandingan yang merangkumi sistem Blackwell Nvidia. Keputusan telah dibentangkan pada hari Selasa di persidangan Hot Chips di Palo Alto, di samping pandangan teknikal terperinci tentang bagaimana cip itu dibina. Bagi pembaca yang menjejaki perlumbaan pengiraan yang menyokong setiap keluaran model AI, ia merupakan salah satu titik data perkakasan yang paling penting pada tahun ini.

"Intinya ialah keputusan menunjukkan kemajuan prestasi yang sangat, sangat ketara berbanding keadaan seni," kata Richard Ho, ketua perkakasan OpenAI, dalam panggilan akhbar yang dilaporkan oleh TechCrunch. "Jalapeño boleh memberikan lebih banyak kerja AI bagi setiap unit kuasa, sementara juga mengembalikan respons dengan lebih cepat. Ia sangat cekap untuk melayani ramai pelanggan, tetapi ia juga boleh menjadi kependaman yang sangat rendah."

Cip Dibina untuk Saluran Paip Inferens Penuh

Jalapeño telah diumumkan pada Jun 2026 sebagai silikon tersuai pertama OpenAI, dibangunkan dengan kerjasama rapat dengan Broadcom, dengan model AI OpenAI sendiri membantu dalam proses pembangunan cip. Perkongsian itu sendiri bermula sejak Oktober 2025, apabila OpenAI membentangkan rancangan untuk program pemecut tersuai berbilang generasi bersama gergasi rangkaian itu.

Apa yang menjadikan Jalapeño berbeza daripada GPU tujuan umum, menurut OpenAI, ialah ia direka bentuk bersama dengan model yang akan disediakan. Oleh kerana syarikat mengawal susunan penuh — produk, model, cip dan memori AI — juruteranya dapat menyerang fasa tertentu proses inferens yang sering menyebabkan geseran.

Khususnya, Jalapeño direka untuk meminimumkan kelewatan semasa fasa praisi dan komunikasi pemprosesan, yang OpenAI katakan kerap bertindak sebagai kesesakan apabila menyediakan model bahasa yang besar pada skala.

"Kami mereka bentuk Jalapeño untuk meminimumkan pergerakan data dan kelewatan komunikasi, " tulis syarikat itu dalam catatan blog yang membentangkan hasilnya. "Ini bermakna keadaan model, termasuk cache KV yang digunakan semasa menjana respons, boleh diletakkan secara eksplisit dan disimpan setempat sementara sistem mengaktifkan gabungan pengiraan, memori dan rangkaian yang betul untuk setiap fasa inferens."

Perkara terakhir itu penting bagi sesiapa sahaja yang menjalankan beban kerja AI pengeluaran. Cache KV — konteks terkumpul yang dipegang oleh model semasa menjana respons — ialah salah satu masalah memori dan lebar jalur terbesar dalam inferens moden. Mengekalkannya secara setempat dan diurus secara eksplisit, dan bukannya merombaknya merentasi gugusan, ialah cara klasik untuk memulihkan kependaman dan kuasa.

Lebih Baik Daripada Blackwell — Buat Sekarang

Perbandingan tajuk adalah terhadap sistem Nvidia Blackwell, pada masa ini kuda kerja inferens AI sempadan. Analisis bebas yang diterbitkan pada hari yang sama oleh SemiAnalysis, bertajuk "OpenAI Jalapeño: Better than Nvidia Blackwell," mencapai kesimpulan yang sama tentang keputusan awal cip itu, dan cerita itu dengan cepat menjadi salah satu perkara yang paling banyak dibincangkan di Berita Hacker.

Tetapi eksekutif dan penganalisis OpenAI sama-sama menggesa berhati-hati. Ho menganggarkan bahawa Jalapeño akan digunakan pada penghujung tahun 2026 "dalam jumlah yang sangat kecil," dengan penggunaan yang lebih ketara akan datang pada tahun 2027. Pada masa Jalapeño mencapai skala penuh, persaingan mungkin telah meningkat dengan ketara — pelan hala tuju Nvidia terus bergerak, dan hyperscaler lain termasuk Google, Amazon, dan Microsoft semuanya mendorong silikon tersuai mereka sendiri.

Seperti yang dinyatakan oleh TechCrunch, penanda aras yang diukur terhadap keadaan seni hari ini adalah gambaran, bukan jaminan. Cip yang memenangi kecekapan pada tahun 2026 mesti terus menang terhadap apa sahaja yang dihantar oleh Nvidia dan pesaingnya tahun depan.

Mengapa OpenAI Membina Silikonnya Sendiri

Logik strategik adalah mudah: inferens ialah kos berulang terbesar OpenAI. Setiap pertanyaan ChatGPT, setiap panggilan API, dan setiap tugas agenik membakar pengiraan, dan menyewa pengiraan itu daripada Nvidia pada harga pasaran memerah margin sebagai skala penggunaan. Cip tersuai yang ditala kepada model OpenAI sendiri — direka bersama dengan Broadcom dan dibentuk oleh model OpenAI sendiri — memberi syarikat itu cara untuk memberi perkhidmatan kepada lebih ramai pengguna setiap watt dan setiap dolar.

Jalapeño juga dirancang sebagai platform berbilang generasi dan bukannya bahagian sekali sahaja. OpenAI berkata ia berhasrat untuk membangunkan produk AI, model, cip dan memori bersama-sama, supaya setiap generasi silikon dioptimumkan bersama dengan model yang akan dijalankannya. Jika hasil generasi pertama bertahan dalam pengeluaran, Jalapeño menjadi templat untuk semua yang berikut.

Pertaruhan melangkaui OpenAI. Penguasaan Nvidia terhadap pemecut AI telah menjadi hambatan tunggal yang paling ketat dalam industri selama tiga tahun, dan setiap alternatif yang boleh dipercayai — sama ada daripada pasukan TPU Google, Amazon, atau kini OpenAI — mengubah landskap perundingan untuk semua orang yang membina infrastruktur AI. Nvidia sendiri dilaporkan memberi amaran kepada pelanggan tentang kenaikan harga sebanyak 15 peratus atau lebih pada pelayan AI apabila kos memori melonjak, yang hanya mempertajam daya tarikan alternatif dalaman.

Apa Yang Akan Datang

Buat masa ini, Jalapeño kekal sebagai bahagian pra-pengeluaran dengan nombor kertas yang menjanjikan. Ujian sebenar tiba pada penghujung 2026, apabila volum kecil pertama digunakan, dan terutamanya pada 2027, apabila OpenAI menjangkakan skala yang bermakna. Soalan utama masih tidak terjawab: kebolehpercayaan dunia sebenar pada skala pusat data, jumlah kos pemilikan berbanding kapasiti Blackwell yang disewa, dan sama ada kelebihan kecekapan bertahan berbanding generasi seterusnya Nvidia.

Namun, penanda aras pertama menandakan peristiwa penting: kali pertama salah satu makmal AI besar telah menunjukkan secara terbuka silikon inferens tersuai yang nampaknya mengatasi kecekapan terbaik penyandangnya. Bagi industri yang telah menganggap bekalan Nvidia sebagai talian hayat strategik, itu adalah titik infleksi yang tulen.

---

Kekal Mendahului AI

Dapatkan berita, analisis dan penemuan terkini AI — semuanya di satu tempat.

Baca lebih banyak berita AI →