Cerebras Systems și OpenAI au împărtășit o privire timpurie asupra Ultrafast Mode, un nou nivel de servicii lansat pentru prima dată în API-ul OpenAI și alimentat de tehnologia Cerebras Wafer-Scale. Parteneriatul permite GPT-5.6 Sol să ruleze cu până la 750 de jetoane de ieșire pe secundă, oferind informații la nivel de frontieră la viteze în timp real. Pentru cele mai recente știri despre hardware AI, accesați AI Buzz Wire.

Eliminarea compromisului între viteză și inteligență

Constructorii de inteligență artificială s-au confruntat de mult timp cu un compromis fundamental: pe măsură ce modelele cresc în dimensiune și inteligență, acestea implică costuri mai mari de calcul și de mișcare a datelor, încetinind timpii de răspuns. Dezvoltatorii au fost forțați să aleagă între așteptarea rezultatelor de înaltă calitate sau acceptarea rezultatelor inferioare în mai puțin timp.

GPT-5.6 Sol în modul ultrarapid este conceput pentru a rezolva această dilemă. Potrivit Cerebras, serviciul rulează de 11 ori mai rapid decât Claude Fable de la Anthropic și de 5 ori mai rapid decât Opus 4.8 în modul Fast, pe baza vitezelor de ieșire raportate de Artificial Analysis.

Ultimul examen al umanității: testul de viteză

Cerebras a pus Ultrafast la încercare față de modele concurente la Humanity's Last Exam (HLE), un punct de referință provocator constând din 2.500 de întrebări la care de obicei răspund numai cei care dețin doctorat în domenii precum chimie, economie și literatură.

În evaluările efectuate de Cerebras, GPT-5.6 Sol în modul ultrarapid a răspuns la toate cele 2.500 de întrebări HLE în 11 ore și 11 minute. Claude Fable 5 a avut nevoie de 78 de ore și 27 de minute, mai mult de trei zile de calcul continuu, pentru a ajunge la aceleași concluzii. Cu alte cuvinte, Ultrafast a procesat granița cunoștințelor umane într-o singură zi de lucru, obținând o precizie comparabilă de aproape șapte ori mai rapid.

Benchmarking-ul a fost efectuat de Cerebras folosind GPT-5.6 Sol Ultrafast cu Codex pe setări de raționament ridicate pe 10 iulie și Claude Fable 5 cu Claude Code pe setări de raționament ridicate între 13 și 15 iulie.

Impact asupra afacerilor în lumea reală

Pe GDP-Val, un punct de referință pentru sarcinile de lucru cu cunoștințe valoroase din punct de vedere economic, Ultrafast a furnizat o accelerare de la capăt la capăt de 5,6 ori fără degradare a calității. Acest lucru demonstrează cât de rapidă deducerea poate accelera munca valoroasă din punct de vedere economic fără a sacrifica calitatea rezultatelor.

Cerebras vede Ultrafast ca un instrument pentru scenarii în care fiecare secundă contează. Companiile care operează servicii web ar putea folosi tehnologia pentru a determina și rezolva mai rapid întreruperile producției, păstrând încrederea clienților și prevenind pierderea veniturilor. În situațiile de securitate cibernetică cu mize mari, echipele de securitate ar putea folosi Ultrafast pentru a detecta și a răspunde rapid la atacuri.

Tehnologia din spatele vitezei

Avantajul de performanță provine din arhitectura Wafer-Scale Engine a Cerebras, care este concepută special pentru sarcinile de lucru AI de frontieră. Provocarea principală a inferenței rapide la frontieră este o problemă de mișcare a datelor: pe GPU-urile tradiționale, inferența pe modelele mari este blocată de lățimea de bandă a memoriei, deoarece greutățile modelului trebuie transferate în mod repetat între memoria pe cip și stocarea off-chip pentru a genera token-uri succesive.

Cerebras adoptă o abordare fundamental diferită. Fiecare cip de dimensiunea unei plăci conține 44 GB de SRAM direct pe siliciu. Greutățile modelului rămân pe cip, iar jetoanele curg neîntrerupt prin straturi de model așezate peste plachete. Acest lucru elimină mișcarea ineficientă a datelor care încetinește inferența bazată pe GPU și se scalează fără probleme cu dimensiunea modelului, deschizând calea pentru un avantaj continuu al vitezei pe viitoarele modele de frontieră.

Disponibilitate și poziționare pe piață

GPT-5.6 Sol în modul ultrarapid este disponibil în prezent într-o previzualizare limitată pentru un grup select de clienți, accesul crescând în timp pe măsură ce capacitatea crește. Cerebras descrie parteneriatul ca fiind propulsorul următorului val de inovare AI și ridicând plafonul pentru ceea ce organizațiile pot realiza cu IA receptivă.

Colaborarea reprezintă o piatră de hotar semnificativă pentru Cerebras, care urmărește mult timp calculul la scară wafer ca alternativă la piața hardware AI dominată de GPU. Prin parteneriatul direct cu OpenAI pentru a accelera unul dintre cele mai capabile modele de frontieră disponibile, Cerebras demonstrează că arhitectura sa oferă un avantaj competitiv real pentru sarcinile de lucru de inferență de mare viteză.

Pe măsură ce modelele continuă să devină mai mari și mai inteligente, capacitatea de a le servi la viteze în timp real ar putea deveni un factor competitiv definitoriu pe piața infrastructurii AI. Parteneriatul Cerebras-OpenAI semnalează că cursa pentru viteza de inferență este acum la fel de importantă ca și cursa pentru inteligența modelului.

Rămâi înaintea AI

Pentru mai multe știri privind hardware-ul AI, analiza performanței modelului și evoluțiile din industrie, marcați AI Buzz Wire.

Citiți mai multe știri AI →