OpenAI heeft de eerste benchmarkresultaten gepubliceerd voor Jalapeño, zijn aangepaste inferentie-chip, en de cijfers zijn opvallend: op de InferenceX-benchmark van SemiAnalysis registreerde het nieuwe silicium zowel meer tokens per gebruiker als meer doorvoer per kilowatt dan de momenteel beschikbare state-of-the-art inferentieprocessors - een vergelijking die Nvidia's Blackwell-systemen omvat. De resultaten werden dinsdag gepresenteerd op de Hot Chips-conferentie in Palo Alto, naast een gedetailleerd technisch overzicht van hoe de chip werd gebouwd. Voor lezers die de computerrace volgen die ten grondslag ligt aan elke [AI-modelrelease] (https://aibuzzwire.news), is dit een van de meest consequente hardwaredatapunten van het jaar.

"Het komt erop neer dat de resultaten een zeer, zeer significante prestatieverbetering laten zien ten opzichte van de stand van de techniek", zegt Richard Ho, hoofd hardware van OpenAI, in een persoproep gerapporteerd door TechCrunch. "Jalapeño kan meer AI-werk per stroomeenheid leveren, en tegelijkertijd sneller reacties retourneren. Het is zeer efficiënt om veel klanten te bedienen, maar het kan ook een zeer lage latentie hebben."

Een chip gebouwd voor de volledige inferentiepijplijn

Jalapeño werd in juni 2026 onthuld als OpenAI's eerste aangepaste silicium, ontwikkeld in nauwe samenwerking met Broadcom, waarbij OpenAI's eigen AI-modellen hielpen bij het ontwikkelingsproces van de chip. Het partnerschap zelf dateert van oktober 2025, toen OpenAI samen met de netwerkgigant plannen maakte voor een multigenerationeel aangepast acceleratorprogramma.

Wat Jalapeño volgens OpenAI anders maakt dan een GPU voor algemeen gebruik, is dat hij is ontworpen in samenhang met de modellen die hij zal dienen. Omdat het bedrijf de volledige stack beheert – AI-producten, modellen, chips en geheugen – konden de ingenieurs specifieke fasen van het inferentieproces aanvallen die vaak wrijving veroorzaken.

Jalapeño is met name ontworpen om vertragingen tijdens de prefill- en communicatiefasen van de verwerking tot een minimum te beperken, wat volgens OpenAI vaak een knelpunt vormt bij het op grote schaal aanbieden van grote taalmodellen.

"We hebben Jalapeño ontworpen om databewegingen en communicatievertragingen tot een minimum te beperken", schreef het bedrijf in een blogpost waarin de resultaten werden gepresenteerd. "Dit betekent dat de modelstatus, inclusief de KV-cache die wordt gebruikt bij het genereren van een antwoord, expliciet lokaal kan worden geplaatst en gehouden, terwijl het systeem voor elke inferentiefase de juiste combinatie van rekenkracht, geheugen en netwerken activeert."

Dat laatste punt is van belang voor iedereen die productie-AI-workloads uitvoert. De KV-cache – de geaccumuleerde context die een model vasthoudt tijdens het genereren van een reactie – is een van de grootste problemen op het gebied van geheugen en bandbreedte in moderne gevolgtrekkingen. Het lokaal en expliciet beheren ervan, in plaats van het over een cluster te verdelen, is een klassieke manier om latentie en kracht terug te winnen.

Beter dan Blackwell — voorlopig

De kopvergelijking is tegen een Nvidia Blackwell-systeem, momenteel het werkpaard van grensverleggende AI-inferentie. Onafhankelijke analyse die dezelfde dag door SemiAnalysis werd gepubliceerd, getiteld "OpenAI Jalapeño: Better than Nvidia Blackwell", kwam tot een soortgelijke conclusie over de eerste resultaten van de chip, en het verhaal werd al snel een van de meest besproken items op Hacker News.

Maar zowel leidinggevenden als analisten van OpenAI dringen aan op voorzichtigheid. Ho schatte dat Jalapeño eind 2026 "in zeer kleine volumes" zou worden ingezet, en dat er in 2027 een grotere implementatie zou plaatsvinden. Tegen de tijd dat Jalapeño de volledige schaal bereikt, kan de concurrentie aanzienlijk zijn gevorderd: de routekaart van Nvidia blijft in beweging, en andere hyperscalers, waaronder Google, Amazon en Microsoft, pushen allemaal hun eigen aangepaste silicium.

Zoals TechCrunch opmerkte, zijn benchmarks gemeten tegen de huidige stand van de techniek een momentopname en geen garantie. Een chip die in 2026 op het gebied van efficiëntie wint, moet volgend jaar blijven winnen van wat Nvidia en zijn rivalen ook uitbrengen.

Waarom OpenAI zijn eigen silicium bouwt

De strategische logica is eenvoudig: gevolgtrekking is de grootste terugkerende kostenpost van OpenAI. Elke ChatGPT-query, elke API-aanroep en elke agent-taak verbrandt rekenkracht, en het huren van die rekenkracht bij Nvidia tegen marktprijzen drukt de marges naarmate het gebruik toeneemt. Een op maat gemaakte chip die is afgestemd op de eigen modellen van OpenAI – ontworpen in samenwerking met Broadcom en gevormd door de modellen van OpenAI zelf – geeft het bedrijf een manier om meer gebruikers per watt en per dollar te bedienen.

Jalapeño is ook gepland als een platform voor meerdere generaties in plaats van als een eenmalig onderdeel. OpenAI heeft gezegd dat het van plan is AI-producten, -modellen, -chips en -geheugen samen te ontwikkelen, zodat elke generatie silicium wordt geoptimaliseerd met de modellen die erop zullen draaien. Als de resultaten van de eerste generatie standhouden in de productie, wordt Jalapeño het sjabloon voor alles wat volgt.

De inzet reikt verder dan OpenAI. De dominantie van Nvidia op het gebied van AI-versnellers is al drie jaar het grootste knelpunt in de branche, en elk geloofwaardig alternatief – of het nu van het TPU-team van Google, Amazon of nu OpenAI is – verandert het onderhandelingslandschap voor iedereen die een AI-infrastructuur bouwt. Nvidia zelf waarschuwt klanten naar verluidt voor prijsstijgingen van 15 procent of meer op AI-servers naarmate de geheugenkosten stijgen, wat de aantrekkingskracht van interne alternatieven alleen maar vergroot.

Wat komt erna

Voorlopig blijft Jalapeño een pre-productiedeel met veelbelovende papieraantallen. De echte test komt eind 2026, wanneer de eerste kleine volumes worden ingezet, en vooral in 2027, wanneer OpenAI een betekenisvolle schaal verwacht. Belangrijke vragen blijven onbeantwoord: betrouwbaarheid in de echte wereld op datacenterschaal, de totale eigendomskosten versus gehuurde Blackwell-capaciteit, en of het efficiëntievoordeel standhoudt ten opzichte van de volgende generatie van Nvidia.

Toch markeren de eerste benchmarks een mijlpaal: de eerste keer dat een van de grote AI-laboratoria publiekelijk op maat gemaakte inferentie-silicium heeft gedemonstreerd dat de beste van de gevestigde exploitant lijkt te verslaan op het gebied van efficiëntie. Voor een sector die het Nvidia-aanbod als een strategische reddingslijn heeft beschouwd, is dat een echt keerpunt.

---

Blijf AI een stap voor

Ontvang het laatste AI-nieuws, analyses en doorbraken – allemaal op één plek.

Lees meer AI-nieuws →