OpenAI a publicat primele rezultate de referință pentru Jalapeño, cipul său de inferență personalizat, iar cifrele sunt uimitoare: pe benchmark-ul InferenceX al SemiAnalysis, noul siliciu a înregistrat atât mai multe jetoane per utilizator, cât și mai mult debit per kilowatt decât procesoarele de inferență de ultimă generație disponibile în prezent - o comparație care include sistemele Blackwell de la Nvidia. Rezultatele au fost prezentate marți la conferința Hot Chips din Palo Alto, alături de o privire tehnică detaliată a modului în care a fost construit cipul. Pentru cititorii care urmăresc cursa de calcul care stă la baza fiecărei lansări de model AI, acesta este unul dintre cele mai importante puncte de date hardware ale anului.
„Concluzia este că rezultatele arată un avans de performanță foarte, foarte semnificativ față de stadiul tehnicii”, a declarat Richard Ho, șeful de hardware al OpenAI, într-un apel de presă raportat de TechCrunch. „Jalapeño poate servi mai multă muncă AI per unitate de putere, în același timp returnând răspunsuri mai rapid. Este foarte eficient să deserviți o mulțime de clienți, dar poate avea și o latență foarte scăzută.”
Un cip construit pentru conducta de inferență completă
Jalapeño a fost dezvăluit în iunie 2026 ca primul siliciu personalizat al OpenAI, dezvoltat în strânsă colaborare cu Broadcom, cu propriile modele AI ale OpenAI asistând în procesul de dezvoltare a cipului. Parteneriatul în sine datează din octombrie 2025, când OpenAI a prezentat planuri pentru un program de accelerare personalizat multigenerațional alături de gigantul de rețele.
Ceea ce face ca Jalapeño să fie diferit de un GPU de uz general, conform OpenAI, este că a fost proiectat în acord cu modelele pe care le va servi. Deoarece compania controlează întregul stack - produse AI, modele, cipuri și memorie - inginerii săi au reușit să atace faze specifice ale procesului de inferență care provoacă adesea frecare.
În special, Jalapeño este conceput pentru a minimiza întârzierile în timpul fazelor de pre-completare și comunicare ale procesării, despre care OpenAI spune că acționează frecvent ca blocaje atunci când deservesc modele de limbaj mari la scară.
„Am proiectat Jalapeño pentru a minimiza mișcarea datelor și întârzierile de comunicare”, a scris compania într-o postare pe blog care prezintă rezultatele. „Aceasta înseamnă că starea modelului, inclusiv memoria cache KV utilizată în timpul generării unui răspuns, poate fi plasată în mod explicit și menținut local în timp ce sistemul activează combinația potrivită de calcul, memorie și rețea pentru fiecare fază de inferență.”
Ultimul punct contează pentru oricine care execută sarcini de lucru AI de producție. Cache-ul KV - contextul acumulat pe care un model îl deține în timp ce generează un răspuns - este una dintre cele mai mari dureri de cap de memorie și lățime de bandă din inferența modernă. Menținerea locală și gestionată în mod explicit, în loc să-l amestecați într-un cluster, este o modalitate clasică de a recupera latența și puterea.
Better Than Blackwell — Pentru moment
Comparația principală este împotriva unui sistem Nvidia Blackwell, în prezent calul de muncă al inferenței AI de frontieră. Analiza independentă publicată în aceeași zi de SemiAnalysis, intitulată „OpenAI Jalapeño: Better than Nvidia Blackwell”, a ajuns la o concluzie similară cu privire la primele rezultate ale cipului, iar povestea a devenit rapid unul dintre cele mai discutate articole pe Hacker News.
Dar directorii și analiștii OpenAI îndeamnă la prudență. Ho a estimat că Jalapeño va fi implementat la sfârșitul anului 2026 „în volume foarte mici”, cu o implementare mai semnificativă în 2027. Până când Jalapeño va ajunge la scară maximă, concurența ar putea fi avansat semnificativ – foaia de parcurs Nvidia continuă să se miște, iar alți hiperscaleri, inclusiv Google, Amazon și Microsoft, își împing cu toții propriul siliciu personalizat.
După cum a menționat TechCrunch, benchmark-urile măsurate în raport cu stadiul actual al tehnicii sunt un instantaneu, nu o garanție. Un cip care câștigă în eficiență în 2026 trebuie să continue să câștige împotriva a ceea ce Nvidia și rivalii săi vor livra anul viitor.
De ce OpenAI își construiește propriul siliciu
Logica strategică este simplă: deducerea este cel mai mare cost recurent al OpenAI. Fiecare interogare ChatGPT, fiecare apel API și fiecare sarcină agentică arde calculul, iar închirierea acelei calculatoare de la Nvidia la prețurile pieței stoarce marjele pe măsură ce se scalează utilizarea. Un cip personalizat reglat pe propriile modele OpenAI – proiectat împreună cu Broadcom și modelat de modelele OpenAI în sine – oferă companiei o modalitate de a servi mai mulți utilizatori pe watt și pe dolar.
Jalapeño este, de asemenea, planificat ca o platformă multigenerațională, mai degrabă decât o parte unică. OpenAI a spus că intenționează să dezvolte împreună produse, modele, cipuri și memorie AI, astfel încât fiecare generație de siliciu să fie co-optimizată cu modelele pe care le va rula. Dacă rezultatele de prima generație țin în producție, Jalapeño devine șablonul pentru tot ce urmează.
Miza se extinde dincolo de OpenAI. Dominația Nvidia asupra acceleratoarelor AI a fost cel mai strâns blocaj din industrie timp de trei ani, iar fiecare alternativă credibilă – fie de la echipa TPU a Google, Amazon sau acum OpenAI – schimbă peisajul negocierilor pentru toți cei care construiesc infrastructura AI. Nvidia însăși avertizează clienții cu privire la creșteri de preț cu 15% sau mai mult pe serverele AI, pe măsură ce costurile memoriei cresc, ceea ce nu face decât să accentueze atractivitatea alternativelor interne.
Ce urmează
Deocamdată, Jalapeño rămâne o piesă de pre-producție cu numere de hârtie promițătoare. Adevăratul test ajunge la sfârșitul anului 2026, când sunt implementate primele volume mici, și mai ales în 2027, când OpenAI se așteaptă la o scară semnificativă. Întrebările cheie rămân fără răspuns: fiabilitatea reală la scara centrului de date, costul total de proprietate față de capacitatea Blackwell închiriată și dacă avantajul de eficiență supraviețuiește față de următoarea generație a Nvidia.
Totuși, primele repere marchează o piatră de hotar: prima dată când unul dintre marile laboratoare de inteligență artificială a demonstrat public siliciul de inferență personalizat care pare să depășească cel mai bine eficiența operatorului. Pentru o industrie care a tratat aprovizionarea Nvidia ca pe un colac strategic de salvare, acesta este un adevărat punct de inflexiune.
---
Rămâneți înaintea AIObțineți cele mai recente știri, analize și descoperiri despre AI - toate într-un singur loc.
Citește mai multe știri AI →