Když tento týden vypadlo jediné elektrické vedení mimo Washington, D.C., regionální elektrická síť by se normálně zotavila během několika sekund. Místo toho trvalo více než deset minut, než se stabilizovala – protože více než 3 gigawatty datových center přestaly odebírat energii téměř současně, což způsobilo nárůst napětí v síti, která se táhne od Severní Virginie po Chicago.

Incident, poprvé podrobně popsaný TechCrunch a potvrzený daty PJM Interconnection, odhalil rostoucí chybovou linii v boomu AI: masivní datová centra pohánějící umělou inteligenci mohou destabilizovat samotnou síť, na které jsou závislí. Pro probíhající pokrytí infrastruktury AI a analýzu toho, jak výstavba zatěžuje energetické systémy, níže uvedené podrobnosti vysvětlují, proč se rutinní výpadek stal regionální událostí.

Co se stalo na PJM Grid

Porucha přenosové linky spustila automatickou reakci mezi hyperškálovými datovými centry seskupenými v Severní Virginii, kde se nachází největší koncentrace datových center na světě. Zařízení zaregistrovalo pokles napětí a přepnulo na záložní napájení a zhruba 3,1 gigawattu zátěže zmizelo ze sítě během asi 30 sekund, podle údajů PJM, které zveřejnila agentura Reuters.

Síť se částečně zotavila, ale krátce poté odpadly další zátěže. Síť PJM na svém vrcholu přenášela dalších 3,49 gigawattu elektřiny a neměla kam jít. Trvalo dalších 11 minut, než operátoři uvedli systém zpět do rovnováhy. Odpojená datová centra představovala v té době přibližně 3 % celkové poptávky po PJM.

I když událost nezpůsobila výpadek proudu, způsobila blikání světel v celém regionu. Data shromážděná společností Ting Labs, startupem, který provozuje senzorovou síť internetu věcí instalovanou v elektrických zásuvkách lidí, ukázala napěťové špičky šířící se po celém území. PJM Interconnection spravuje sítě od New Jersey po Illinois a obsluhuje 67 milionů zákazníků, což z něj dělá největšího provozovatele sítě ve Spojených státech.

Kanár v uhelném dole

Energetickí experti varovali, že událost je předzvěstí věcí příštích. "Je to kanárek v uhelném dole," řekl TechCrunch Ricardo de Azevedo, technologický ředitel ON.Energy. Události zahrnující velké, koncentrované zatížení, jako jsou datová centra, se „stávají stále častěji,“ dodal.

Tato epizoda odráží podobnou poruchu, ke které došlo před dvěma lety na stejné síti PJM, a mohla by předznamenat větší selhání, pokud datová centra nebudou zkonstruována tak, aby zvládala výpadky napájení elegantněji. Hlavním problémem je rovnováha: elektrická síť musí udržovat nabídku a poptávku téměř dokonale sladěnou. Když se od sebe vzdalují, napětí klesá nebo stoupá. Síť a připojená zařízení tolerují malé výkyvy, ale ty větší vypínají pojistky, které nutí zařízení offline.

Když výpadek elektrického vedení způsobil počáteční pokles napětí, všechna sousední datová centra učinila ve zlomku sekundy stejné rozhodnutí odpojit se od sítě a použít vlastní záložní systémy. Jak každé zařízení klesalo, odebíralo více zátěže, což zase posunulo nabídku ještě výše. Ali Zain Banatwala, hlavní specialista na tržní modely v Independent Electricity System Operator, řekl TechCrunch, že „všechna zařízení se rozhodla odpojit během několika sekund od sebe“.

Koordinované odpojení a systémy „Ride-Through“.

Grid specialisté tvrdí, že cesta vpřed spočívá ve zvýšení předvídatelnosti chování datových center během poruch, než aby bylo umožněno stovkám zařízení reagovat nezávisle ve stejný okamžik. "Musíme vymyslet způsob, jak se tyto zátěže, které jsou umístěny vedle sebe, postupně buď odpojí, nebo znovu připojí," řekl Banatwala. Spořádanější, etapovitý proces by umožnil provozovatelům sítí předem vyvinout robustní postupy místo toho, aby se snažili absorbovat náhlé výkyvy.

Alternativou je vybudování datových center, která dokážou absorbovat výpadky, spíše než opouštět síť v okamžiku, kdy napětí kolísá – což je schopnost, kterou průmysl nazývá „průjezdnost“. ON.Energy patří mezi startupy, které vyvíjejí produkty, které mají pomoci datovým centrům a samotné mřížce, počasí, jako je ta, která udeřila tento týden. Spíše než okamžité přerušování vazeb by průchozí systémy udržely zařízení připojené dostatečně dlouho, aby provozovatelé sítí mohli znovu vyvážit nabídku a poptávku.

Proč AI problém zhoršuje

Vybudování umělé inteligence urychluje přesně podmínky, které způsobily incident z tohoto týdne. Školení a provozování velkých jazykových modelů vyžaduje enormní nepřetržitý odběr energie a zařízení, která jej poskytují, se stále více soustřeďují v několika regionech, kde jsou pozemky, vlákna a elektřina levné. Samotná Severní Virginie hostí tisíce megawattů výpočetní kapacity a frontě PJM nevyřízených požadavků na propojení dominují vývojáři datových center.

Tato koncentrace znamená, že jediná lokální chyba se nyní může kaskádovitě šířit napříč vícestátní oblastí. Několik procent celkové poptávky může znít jako skromné, ale když toto zatížení zmizí do 30 sekund, síť nemá čas snížit produkci, aby odpovídala. Výsledkem je přebytek energie, který není kam jít – zrcadlový obraz nedostatků, které způsobují postupné výpadky, ale neméně destabilizující.

Provozovatelé sítí a regulátoři nyní zvažují, zda by se s hyperškálovými zařízeními mělo zacházet jinak než s běžnými průmyslovými zákazníky, s přísnějšími pravidly pro to, jak rychle se mohou odpojit a znovu připojit. Vzhledem k tomu, že se očekává, že se poptávka po AI v nadcházejících letech znásobí, sázky na správné nastavení tohoto rámce rychle rostou.

Udržujte si náskok před AI

Kolize mezi AI computingem a energetickou sítí teprve začíná a další narušení by mohlo být větší. Chcete-li číst další zprávy o AI a sledovat, jak operátoři, regulační orgány a startupy reagují, pokračujte ve sledování AI Buzz Wire.

Přečtěte si další zprávy o AI →