Intel öppnade årets Hot Chips-konferens med en djupdykning i Crescent Island, datacentrets GPU som man satsar på för nästa fas av AI-arbetsbelastningar: agentinferens. Presenterat av Chief Enterprise AI Systems Architect Sumit Mohan och Intel Fellow Hong Jiang, var diskussionen centrerad kring tre mått som företaget säger definierar den agentiska eran - tokens per watt, stor minneskapacitet och en öppen mjukvarustack.
Tidpunkten spelar roll. Nvidia använde samma konferens för att detaljera sitt Vera Rubin NVL72 rack-system, och varje acceleratorleverantör på Hot Chips 2026 pitchar nu effektivitet snarare än rå toppprestanda. Intels svar är en del som byter ut minnestekniken som vanliga AI GPU:er använder mot något billigare per gigabyte, och det ger slående rubriksiffror. For more context on this story, see our ongoing AI trends.
Ett 480 GB PCIe-kort på 350 watt
Crescent Island är en 350-watts, luftkyld PCIe GPU. Intels märkeskort levereras med 160 GB LPDDR5X-minne, men designen gör det möjligt för ODM-partner att bygga varianter med upp till 480 GB ombord – ungefär tredubbla kapaciteten för typiska avancerade acceleratorkort och tillräckligt för att hålla mycket stora KV-cacher inbyggda för långa kontexter och agenter för flera sessioner. Designen täcker datatyper från FP4 och MXFP4 upp till FP64.
Minnesvalet är det strategiska beslutet i produkten. LPDDR5X byter ut bandbredd mot kapacitet och kostnad, vilket passar en inferensarbetsbelastningsprofil där enorma kontextfönster och verktygsanropsslingor förbrukar minneskapacitet mer än råberäkning. Intel ramar in hela designen kring "tokens per watt" - vilket ger mer användbar effekt per energienhet snarare än att vinna peak-FLOPS-jämförelser.
Xe3P Silicon: 32 kärnor, 256 XMX-motorer
Under huven är Crescent Island Intels Xe3P-arkitektur, och Intel presenterade den som ett generationssprång över den Battlemage-baserade Xe2-generationen. Där Xe2 erbjöd 20 Xe-kärnor och en 4-djup systolisk XMX-array, har Crescent Island 32 Xe-kärnor och en 16-djup systolisk array, som matar 256 XMX-motorer totalt.
Den tredje generationens Xe Matrix Extensions lägger till en trevägs utökad Xe-matrisdesign med FP4-precisionsutgåva och FP64-stöd. Varje Xe-kärna har en 1MB allmän registerfil och 512KB L1-cache, med en 32MB unified L2 delad över enheten. En mediamotor med fyra avkodare och fyra kodare sitter bredvid, och hela SoC ansluts över PCIe Gen5 x16 med stöd för uppskalning över ett öppet switch-tyg. Intel listar en aktiv tomgångseffekt på 50 watt eller mindre i G0-tillståndet och ungefär 10 watt i G8-tillståndet med låg effekt, uppnådd genom distribuerade kraftdomäner, paketbaserade nätverks-på-chip-routrar med aggressiva klockportar och oberoende DVFS-skenor för grafik och media.
RAS-funktioner lånade från serverns spelbok
För en datacenterdel fick tillförlitlighetsteknik lika mycket scentid som genomströmning - ett tema som Nvidia också lutade sig åt med Vera Rubin. Crescent Island bär ECC och paritet över nyckelminnesstrukturer, felkontroll vid varje hopp i det interna sammankopplingstyget, dynamisk sidofflinering, hård reparation efter paketering och PCI Express Advanced Error Reporting. Intel säger att kombinationen minskar korruptionen av tyst data, det felläge som är viktigast för långvariga oövervakade slutsatser.
Intel placerade också delen i en portfölj som sträcker sig från Arc Pro-arbetsstations GPU:er till SambaNova SN50 RDU:er som det förvärvade, med Crescent Island som företagets datacenterankare i toppen. Företaget visade en färdplan som sträcker sig mer än sex år tillbaka i tiden, och gjuter GPU:n som en mogen tredje generationens design snarare än ett första försök. Kortet presenterades först på Computex i juni; Hot Chips levererade den arkitektoniska detaljen bakom.
Varför Agentic Inference favoriserar denna design
Argumentet för arbetsbelastning är den mest intressanta delen av Intels pitch. Agentisk AI - modeller som kedjer verktygsanrop, håller långa sammanhang öppna och koordinerar mellan CPU och GPU - beskattar latens, minneskapacitet och systemgenomströmning samtidigt, snarare än batch-genomströmningsprofilen för chatbot-servering. KV-cachekapacitet för långa sammanhang och samtidiga sessioner med komprimerade domäner är explicit inbyggd i SoC-designen.
Den inramningen förklarar också LPDDR5X-satsningen. Om nästa våg av AI-beräkningar är minneshungriga agenter snarare än träningskörningar, är ett 480 GB-kort på 350 watt ett trovärdigt alternativ till premium HBM-baserade delar - förutsatt att mjukvarustacken levererar. Intels betoning på en öppen stack och ett öppet switch-tyg riktar sig rakt mot köpare som är försiktiga med Nvidias integrerade plattformslåsning.
Crescent Island kommer inte att ersätta träningsacceleratorerna som dominerar AI-rubriker, och Intel avslöjade inte priser eller tillgänglighet på konferensen. Men som ett uttalande om vart Intel tror att slutsatser är på väg - fett minne, magert kraft, öppet tyg - är det en av de tydligare arkitekturhistorierna i årets Hot Chips.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →