OpenAI har publicerat de första benchmarkresultaten för Jalapeño, dess anpassade slutledningschip, och siffrorna är slående: på SemiAnalysis InferenceX benchmark registrerade det nya kislet både fler tokens per användare och mer genomströmning per kilowatt än de för närvarande tillgängliga toppmoderna slutledningsprocessorerna – en jämförelse som inkluderar Nvidias Blackwell-system. Resultaten presenterades på tisdagen vid Hot Chips-konferensen i Palo Alto, tillsammans med en detaljerad teknisk titt på hur chipet byggdes. För läsare som spårar beräkningsloppet som ligger till grund för varje AI-modellrelease, är det en av årets hårdvarudatapunkter.
"Sammanfattningen är att resultaten visar ett mycket, mycket betydande prestandaframsteg jämfört med den senaste tekniken", säger Richard Ho, OpenAI:s hårdvaruchef, i ett presssamtal rapporterat av TechCrunch. "Jalapeño kan betjäna mer AI-arbete per kraftenhet, samtidigt som det ger svar snabbare. Det är mycket effektivt att betjäna många kunder, men det kan också vara väldigt låg latens."
Ett chip byggt för hela inferensrörledningen
Jalapeño avtäcktes i juni 2026 som OpenAI:s första anpassade kisel, utvecklat i nära samarbete med Broadcom, med OpenAI:s egna AI-modeller som hjälper till i chipets utvecklingsprocess. Själva partnerskapet går tillbaka till oktober 2025, då OpenAI lade upp planer för ett multigenerationellt anpassat acceleratorprogram tillsammans med nätverksjätten.
Det som skiljer Jalapeño från en allmän GPU, enligt OpenAI, är att den designades i samklang med de modeller den kommer att tjäna. Eftersom företaget kontrollerar hela stacken – AI-produkter, modeller, chips och minne – kunde dess ingenjörer attackera specifika faser av slutledningsprocessen som ofta orsakar friktion.
I synnerhet är Jalapeño utformad för att minimera förseningar under förfyllnings- och kommunikationsfaserna av bearbetningen, vilket OpenAI säger ofta fungerar som flaskhalsar när man servar stora språkmodeller i stor skala.
"Vi designade Jalapeño för att minimera datarörelse och kommunikationsförseningar", skrev företaget i ett blogginlägg som presenterade resultaten. "Detta innebär att modelltillstånd, inklusive KV-cachen som används när ett svar genereras, kan explicit placeras och hållas lokalt medan systemet aktiverar rätt kombination av beräkning, minne och nätverk för varje inferensfas."
Den sista punkten är viktig för alla som kör produktions AI-arbetsbelastningar. KV-cachen – det ackumulerade sammanhanget som en modell har medan den genererar ett svar – är en av de största minnes- och bandbreddsproblemen i modern slutledning. Att hålla det lokalt och explicit hanterat, snarare än att blanda det över ett kluster, är ett klassiskt sätt att ta tillbaka latens och kraft.
Bättre än Blackwell — för nu
Rubrikjämförelsen är mot ett Nvidia Blackwell-system, för närvarande arbetshästen för frontier AI-inferens. Oberoende analys publicerad samma dag av SemiAnalysis, med titeln "OpenAI Jalapeño: Better than Nvidia Blackwell," nådde en liknande slutsats om chipets tidiga resultat, och historien blev snabbt en av de mest diskuterade artiklarna på Hacker News.
Men både OpenAI-chefer och analytiker manar till försiktighet. Ho uppskattade att Jalapeño skulle distribueras i slutet av 2026 "i mycket små volymer", med mer betydande utbyggnad 2027. När Jalapeño når full skala kan konkurrensen ha avancerat avsevärt – Nvidias färdplan fortsätter att röra sig, och andra hyperskalare inklusive Google, Amazon och Microsoft driver alla sina egna anpassade.
Som TechCrunch noterade är riktmärken mätt mot dagens toppmoderna en ögonblicksbild, inte en garanti. Ett chip som vinner på effektivitet 2026 måste fortsätta vinna mot vad Nvidia och dess rivaler än levererar nästa år.
Varför OpenAI bygger sitt eget kisel
Den strategiska logiken är enkel: slutledning är OpenAI:s största återkommande kostnad. Varje ChatGPT-fråga, varje API-anrop och varje agentuppgift bränner datorer, och att hyra den datorn från Nvidia till marknadspriser pressar marginalerna när användningsskalor. Ett skräddarsytt chip anpassat till OpenAIs egna modeller – designat tillsammans med Broadcom och format av OpenAIs modeller själva – ger företaget ett sätt att betjäna fler användare per watt och per dollar.
Jalapeño är också planerad som en multigenerationell plattform snarare än en engångsdel. OpenAI har sagt att de har för avsikt att utveckla AI-produkter, modeller, chips och minne tillsammans, så att varje generation av kisel samoptimeras med de modeller som den kommer att köra. Om den första generationens resultat håller i produktionen blir Jalapeño mallen för allt som följer.
Insatserna sträcker sig bortom OpenAI. Nvidias dominans av AI-acceleratorer har varit den enskilt hårdaste flaskhalsen i branschen i tre år, och varje trovärdigt alternativ – oavsett om det kommer från Googles TPU-team, Amazon eller nu OpenAI – förändrar förhandlingslandskapet för alla som bygger AI-infrastruktur. Nvidia självt varnar enligt uppgift kunder för prishöjningar på 15 procent eller mer på AI-servrar när minneskostnaderna ökar, vilket bara skärper attraktionskraften hos interna alternativ.
Vad kommer härnäst
Tills vidare är Jalapeño fortfarande en förproduktionsdel med lovande pappersnummer. Det verkliga testet kommer i slutet av 2026, när de första små volymerna distribueras, och speciellt 2027, när OpenAI förväntar sig meningsfull skala. Nyckelfrågor förblir obesvarade: verklig tillförlitlighet i datacenterskala, total ägandekostnad kontra hyrd Blackwell-kapacitet och om effektivitetsfördelen överlever mot Nvidias nästa generation.
Ändå markerar de första riktmärkena en milstolpe: första gången ett av de stora AI-labben offentligt har demonstrerat anpassat slutledningskisel som verkar slå den dominerande operatörens bästa på effektivitet. För en bransch som har behandlat Nvidia-försörjningen som en strategisk livlina, är det en genuin vändpunkt.
---
Stay ahead of AIFå de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.
Läs mer AI-nyheter →