AMD wyprzedza własny plan efektywności energetycznej dla AI

AMD twierdzi, że w ciągu dwóch lat około czterokrotnie zwiększyło efektywność energetyczną infrastruktury przeznaczonej do sztucznej inteligencji. To wynik lepszy od zakładanego na obecnym etapie planu, którego celem jest 20-krotna poprawa efektywności całych szaf serwerowych do 2030 roku.
Punktem odniesienia dla AMD jest rok 2024. Firma zakładała, że do połowy 2026 roku osiągnie około trzykrotną poprawę współczynnika wydajności do zużywanej energii. Według najnowszych danych wzrost wynosi już około czterech razy. Trzeba jednak zaznaczyć, że część wyniku opiera się na modelowaniu, ponieważ dla niektórych rozwiązań końcowe dane dotyczące wydajności nie były jeszcze dostępne.
AMD patrzy na całą szafę, a nie tylko na GPU
Rosnące zapotrzebowanie energetyczne infrastruktury AI sprawia, że sama poprawa sprawności procesorów graficznych przestaje wystarczać. AMD chce optymalizować cały system, obejmujący procesory CPU i GPU, pamięć, połączenia między układami, sieć, oprogramowanie, zasilanie oraz chłodzenie.
Dużą rolę mają odgrywać nowe procesy technologiczne, zmiany architektury oraz zwiększanie przepustowości pamięci. Szczególnie ważne są pamięci HBM, większe pamięci podręczne i ograniczanie odległości, na jakie trzeba przesyłać dane. Każda taka operacja kosztuje energię, dlatego zmniejszenie ilości zbędnego ruchu danych może poprawiać efektywność całego systemu.
Podobne znaczenie mają szybkie połączenia pomiędzy akceleratorami i innymi elementami infrastruktury. Wraz ze wzrostem wielkości modeli coraz większa część wydajności zależy bowiem nie tylko od samych układów obliczeniowych, lecz także od tempa wymiany informacji między nimi.

Źródło: AMD
– Kolejna fala efektywności AI będzie zależeć od ściślejszej współoptymalizacji układów obliczeniowych, pamięci, połączeń, oprogramowania i projektowania systemów na poziomie całej szafy. Szacowana przez nas czterokrotna poprawa do 2026 roku pokazuje siłę tego podejścia i postęp AMD w całym systemie, dzięki czemu wyprzedzamy zakładane tempo realizacji celu na 2030 rok – powiedział Sam Naffziger, starszy wiceprezes i Corporate Fellow w AMD.
Dwie szafy zamiast 570, ale to na razie prognoza
Najbardziej efektownie brzmi prognoza dotycząca infrastruktury z 2030 roku. Według AMD w reprezentatywnym zadaniu trenowania AI około dwie przyszłe szafy serwerowe miałyby zapewniać taką samą moc obliczeniową jak 570 szaf z 2024 roku. Firma szacuje, że przy takim scenariuszu zużycie energii podczas eksploatacji mogłoby spaść 20 razy, a emisje dwutlenku węgla 28 razy. Alternatywnie ta sama ilość energii miałaby pozwolić na wykonanie 20 razy większej liczby operacji zmiennoprzecinkowych.
Liczb tych nie należy jednak traktować jako bezpośredniego porównania dwóch istniejących generacji sprzętu. AMD wyraźnie zaznacza, że prognoza opiera się na reprezentatywnych konfiguracjach szaf, przewidywanych parametrach przyszłych układów oraz modelowaniu zmian wydajności i poboru energii.
Dla operatorów centrów danych kierunek pozostaje jednak istotny. W coraz większej liczbie instalacji ograniczeniem rozwoju infrastruktury AI staje się nie tylko dostępność akceleratorów, ale również możliwość dostarczenia odpowiedniej mocy elektrycznej i odprowadzenia generowanego ciepła. Poprawa wydajności z każdego wata może więc bezpośrednio przekładać się na możliwość instalowania większej mocy obliczeniowej w istniejących obiektach i ograniczanie kosztów eksploatacji.





















