Google ostrzega przed „memory wall”. HBM i DRAM odpowiadają za ponad 75% kosztu serwera AI

Pamięć staje się jednym z najważniejszych ograniczeń rozwoju infrastruktury sztucznej inteligencji. Nikhil Cherian, Senior Director of Supply Chain Infrastructure w Google Cloud, powiedział podczas SEMICON Taiwan 2026, że HBM i zaawansowana pamięć DRAM odpowiadają już za ponad 75% wartości sprzętowej listy materiałowej serwera AI.
Według Google rozwój modeli multimodalnych, architektur Mixture-of-Experts oraz agentów powoduje przejście od systemów ograniczanych mocą obliczeniową do infrastruktury ograniczanej przede wszystkim pamięcią.
Wartość 75% dotyczy sprzętowego BOM, czyli kosztu podzespołów systemu, a nie całkowitego kosztu posiadania serwera czy centrum danych. Mimo tego skala pokazuje, jak bardzo ekonomika infrastruktury AI zmieniła się wraz z rozpowszechnieniem HBM i gwałtownym wzrostem zapotrzebowania na przepustowość pamięci.
Google mówi już wprost o „memory wall”
Według Cheriana hierarchia pamięci w dużych systemach AI zbliża się do fizycznych ograniczeń jednocześnie pod względem pojemności, przepustowości, opóźnień i zużycia energii. Problem jest szczególnie widoczny przy długich kontekstach i agentowych przepływach pracy, ponieważ pamięć robocza modeli, w tym KV Cache, rośnie wraz z ilością przetwarzanych danych i długością interakcji.
Google próbuje odpowiadać na te ograniczenia zarówno sprzętem, jak i oprogramowaniem. Firma rozdzieliła ósmą generację własnych akceleratorów na TPU 8i zoptymalizowany pod kątem inferencji o niskich opóźnieniach oraz TPU 8t przeznaczony do treningu w bardzo dużej skali.
TPU 8i wyposażono w 288 GB HBM oraz 384 MiB pamięci SRAM na chipie, której pojemność została zwiększona trzykrotnie. Ma to pozwolić na przechowywanie części aktywnych stanów konwersacji i KV Cache bliżej jednostek obliczeniowych. TPU 8t jest z kolei projektowany do pracy w klastrach obejmujących nawet 9600 chipów ze współdzieloną pulą HBM sięgającą 2 PB. Google wykorzystuje również TPU Direct Storage, aby ograniczyć oczekiwanie akceleratorów na dane.
Samsung rezerwuje produkcję pamięci HBM3E dla liderów sztucznej inteligencji
Oprogramowanie ma zmniejszyć apetyt na pamięć
Drugą częścią strategii jest TurboQuant. Według materiałów z SEMICON Taiwan algorytm pozwala kompresować pamięć KV Cache modeli z 32 do 3 bitów, zmniejszając jej zajętość sześciokrotnie i przyspieszając obliczenia mechanizmu attention nawet ośmiokrotnie bez utraty dokładności w przedstawionych testach.
Problem nie zniknie jednak wyłącznie dzięki optymalizacji. Organizatorzy Memory Executive Summit wskazują, że pamięć przestaje być standardowym komponentem dobieranym na końcu projektu i staje się elementem wpływającym na architekturę całych platform. Dla producentów HBM, DRAM i storage oznacza to coraz głębszą współpracę z projektantami chipów i hyperscalerami.
Jeżeli obserwacja Google znajduje odzwierciedlenie w szerszej części rynku, rozbudowa infrastruktury AI będzie coraz silniej zależeć nie tylko od dostępności GPU i akceleratorów, lecz także od możliwości zwiększania podaży pamięci. To istotna zmiana dla całego łańcucha dostaw serwerów i centrów danych.


















