Jakie akceleratory AI znajdują się w AMD Instinct?

Nie ma wątpliwości, że NVIDIA nadal dominuje w dziedzinie obliczeń równoległych dzięki swojej popularnej i zróżnicowanej ofercie kart graficznych. Jednak dzięki akceleratorom AMD Instinct AI, napędzającym dwa z jej najnowszych i największych superkomputerów (Frontier i El Capitan), oraz rosnącemu wsparciu społeczności dla platformy open source ROCm, NVIDIA może znaleźć swojego największego konkurenta.

Czym właściwie są akceleratory AI AMD Instinct? Co sprawia, że są tak wydajne i jak wypadają w porównaniu z procesorami graficznymi Tensor firmy NVIDIA? Sprawdź Jaka jest różnica między płytą główną z procesorem AMD a płytą główną z procesorem Intel?

Czym jest AMD Instinct?

Procesory graficzne AMD Instinct to urządzenia klasy korporacyjnej wykorzystywane do obliczeń o wysokiej wydajności (HPC) i przetwarzania akcelerowanego przez sztuczną inteligencję. W przeciwieństwie do standardowych procesorów graficznych klasy konsumenckiej, procesory graficzne Instinct są zoptymalizowane pod kątem obsługi uczenia maszynowego, przetwarzania dużych zbiorów danych i innych zadań wymagających wysokiej wydajności dzięki innowacjom programowym i sprzętowym.

Seria procesorów AMD Instinct posłużyła do stworzenia pierwszego superkomputera, który przełamał barierę obliczeń eksaskalowych, osiągając 1.1 EFLOP-a operacji na sekundę o podwójnej precyzji. Superkomputery z procesorami graficznymi Instinct są obecnie wykorzystywane w badaniach nad leczeniem raka, zrównoważoną energią i zmianami klimatu.

Obliczenia o wysokiej wydajności (HPC) stały się nieodłączną częścią współczesnego świata, umożliwiając wykonywanie złożonych symulacji i obliczeń niezbędnych do badań naukowych, inżynierii, bezpieczeństwa i innych dziedzin. Jednak wraz ze wzrostem zapotrzebowania na obliczenia HPC, często w superkomputerach i dużych centrach danych, wzrosły obawy dotyczące ich wpływu na środowisko. W ostatnich latach coraz większy nacisk kładzie się na zrównoważony rozwój centrów danych, biorąc pod uwagę wpływ na całkowity koszt posiadania (TCO) i kwestie klimatyczne.

Jak procesory graficzne Instinct przyspieszają inteligencję i obliczenia o wysokiej wydajności

Aby umożliwić najpotężniejszym komputerom mainframe i superkomputerom osiągnięcie przetwarzania eksaskalowego, akceleratory AMD Instinct musiały zostać wyposażone w liczne usprawnienia technologiczne i innowacje.

Omówmy niektóre nowe i udoskonalone technologie zastosowane w procesorach graficznych AMD Instinct.

1. Technologia architektury CDNA

Najnowsze akceleratory AMD Instinct (począwszy od MI100) wykorzystują architekturę CDNA tej firmy.

CDNA koncentruje się przede wszystkim na takich funkcjach, jak przetwarzanie równoległe, hierarchia pamięci i zwiększona wydajność obliczeniowa dzięki autorskiej technologii Matrix Core. Nawet obliczenia HPC, sztuczna inteligencja (AI) czy uczenie maszynowe działające na pojedynczych serwerach mogą być obsługiwane przez CDNA, podobnie jak masywne komputery eksaskalowe.

Technologia AMD Matrix Core przyspiesza uczenie się sztucznej inteligencji (AI) poprzez obsługę operacji o mieszanej precyzji. Możliwość wykonywania obliczeń z różną precyzją pozwala procesorom graficznym Instinct na wydajne obliczanie operacji macierzowych w oparciu o pożądany poziom precyzji.

Najpopularniejsze formaty arytmetyki precyzyjnej to FP64, FP32, FP16, BF16 i INT8. FP oznacza zmiennoprzecinkową liczbę całkowitą, BF – zmiennoprzecinkową liczbę zmiennoprzecinkową, a INT – całkowitą. Im większa liczba odpowiadająca temu formatowi, tym wyższa precyzja. Operacje na 64 bitach nazywane są podwójną precyzją. Operacje na 32 bitach to pojedyncza precyzja, 16 bitów to połowiczna precyzja itd.

Ponieważ znaczna część trenowania modeli głębokiego uczenia nie wymaga dużej precyzji, możliwość obliczania operacji macierzowych z połową, a nawet jedną czwartą precyzji w celu wnioskowania znacznie zmniejsza obciążenie, przyspieszając tym samym uczenie się sztucznej inteligencji. Sprawdź Moja sztuczna inteligencja ze Snapchata czy ChatGPT: którą powinieneś wybrać?

2. Pamięć o dużej przepustowości (HBM)

Każdy akcelerator AMD Instinct jest wyposażony w maksymalnie 880 rdzeni Matrix. Procesory AMD Matrix Core potrafią wykonywać obliczenia z wydajnością 383 teraflopów (TFLOP) z połową precyzji, dlatego szybka pamięć jest niezbędna. Najnowsze modele Instinct firmy AMD są wyposażone w pamięć o dużej przepustowości (HBM) zamiast standardowej pamięci RAM DDR4 lub DDR5.

W przeciwieństwie do tradycyjnej pamięci, HBM wykorzystuje tzw. trójwymiarową architekturę stosową. Ten typ architektury odnosi się do podejścia projektowego, w którym moduły DRAM są układane pionowo jeden na drugim. Umożliwia to układanie modułów zarówno w osi pionowej, jak i poziomej, stąd termin „układanie trójwymiarowe”.

Dzięki technologii łączenia 5D, pamięć HBM może osiągnąć fizyczną pojemność pamięci do kilkuset gigabajtów na moduł, podczas gdy pamięć DRRXNUMX obsługuje jedynie dziesiątki gigabajtów na moduł. Oprócz pojemności, pamięć HBM charakteryzuje się również wyższą przepustowością i lepszą efektywnością energetyczną niż standardowa pamięć DDR.

3. Tkanina nieskończoności

Kolejną innowacją w procesorach graficznych Instinct jest technologia AMD Infinity Fabric. Infinity Fabric to rodzaj systemu połączeń, który inteligentnie i dynamicznie łączy procesory i karty graficzne. Pozwala to na efektywną komunikację między komponentami.

Dzięki Infinity Fabric zamiast łączyć komponenty za pomocą zwykłej magistrali, są one teraz łączone w konfiguracji przypominającej siatkę, gdzie przepustowość może sięgać kilkuset gigabitów na sekundę.

Oprócz połączeń o strukturze siatki Infinity Fabric korzysta również z czujników wbudowanych w każdy moduł, które umożliwiają dynamiczne sterowanie częstotliwością, szybkością przesyłania danych i innymi adaptacyjnymi zachowaniami, co przekłada się na poprawę wydajności i zmniejszenie opóźnień.

4. Platforma programistyczna ROCm

CUDA (Compute Unified Device Architecture) firmy NVIDIA to najpowszechniej używana platforma programistyczna do trenowania modeli AI. Problem z CUDA polega na tym, że działa ona tylko z procesorami graficznymi NVIDIA. To jeden z głównych powodów, dla których NVIDIA posiada zdecydowaną większość udziału w rynku akceleratorów HPC i AI.

Aby AMD mogło zdobyć większy udział w rynku HPC i sztucznej inteligencji (AI), firma musiała opracować własną platformę ROCm (Radeon Open Compute). ROCm to platforma oprogramowania typu open source, która pozwala na wykorzystanie kart graficznych Instinct jako akceleratorów AI.

Choć ROCm nie jest koniecznie częścią sprzętu Instinct, jest niezbędny do przetrwania linii procesorów graficznych Instinct. Dzięki ROCm programiści i badacze otrzymują narzędzia ROCm, kompilator, sterowniki jądra, pełen zestaw bibliotek oraz dostęp do frameworków takich jak TensorFlow i PyTorch, co pozwala im tworzyć aplikacje w ich ulubionym języku programowania AI.

Jak akceleratory AMD Instinct AI wypadają w porównaniu z ich odpowiednikami Radeon?

AMD oferuje serię Instinct dla procesorów graficznych klasy korporacyjnej oraz Radeon dla przeciętnego użytkownika. Jak wspomniano wcześniej, procesor Instinct wykorzystuje architekturę CDNA AMD, HBM oraz połączenia Infinity Fabric. Natomiast procesory Radeon korzystają z architektury RDNA AMD, pamięci DDR6 oraz pamięci podręcznej Infinity Cache.

Chociaż seria akceleratorów AI Radeon jest mniej wydajna, nadal zawiera jeden lub dwa rdzenie akceleracji AI na jednostkę obliczeniową. Najnowszy procesor graficzny Radeon RX7900 XT oferuje dwa rdzenie akceleracji AI na jednostkę obliczeniową, co pozwala na osiągnięcie 103 terafalopów mocy obliczeniowej w trybie połowicznej precyzji i 52 terafalopów mocy obliczeniowej w trybie pojedynczej precyzji.

Chociaż seria procesorów graficznych Instinct lepiej nadaje się do obliczeń LLM i HPC, akceleratory Radeon AI można wykorzystywać do precyzyjnego dostrajania wstępnie wytrenowanych modeli, wnioskowania i zadań wymagających dużej intensywności grafiki.

Porównanie AMD Instinct i NVIDIA Tensor

Według badania TrendForce NVIDIA posiada około 80% udziału w rynku procesorów graficznych do serwerów, podczas gdy AMD posiada jedynie pozostałe 20%. Ogromny sukces NVIDII wynika z jej doświadczenia w projektowaniu i montażu procesorów graficznych. Pozwala to firmie projektować procesory graficzne o najwyższej wydajności, których nie dorównują inne produkty.

Porównajmy procesory AMD Instinct MI205X i NVIDIA H100SXM5, korzystając ze specyfikacji Oficjalna strona internetowa AMDArkusz danych NVIDIA Jej własne:

Typ GPUFP64 (TFLOP-y)FP32 (TFLOP-y)FP16 (TFLOP-y)INT8 (TFLOP-y)
AMD Instynkt MI250X30.060.010002000
NVIDIA H100SXMS47.995.7383.2383

Jak widać w tabeli, układ AMD MI250X lepiej radzi sobie z obliczeniami o podwójnej i połowicznej precyzji, podczas gdy układ NVIDIA H100SXMS znacznie lepiej radzi sobie z obliczeniami macierzowymi o połowicznej i ćwierć precyzji. Dzięki temu układ AMD MI250X lepiej nadaje się do obliczeń HPC, a układ NVIDIA H100SXMS do uczenia się i wnioskowania w sztucznej inteligencji. Sprawdź Karty graficzne AMD kontra NVIDIA w systemie Linux: Której powinieneś używać?

Przyszłość procesorów AMD Instinct

Podczas gdy najnowszy produkt AMD, MI250X, jest przeznaczony do obliczeń o wysokiej wydajności (HPC), nadchodzący MI300 jest bardziej ukierunkowany na szkolenie sztucznej inteligencji (AI). Ten akcelerator AI jest reklamowany jako APU, łączący procesor graficzny (GPU) i procesor główny (CPU) w jednej obudowie. Dzięki temu procesor graficzny MI300 może wykorzystać architekturę CNDA3 Unified Memory APU, w której procesor graficzny i główny korzystają tylko z jednej pamięci, co zwiększa wydajność i obniża cenę.

Chociaż AMD nie będzie obecnie konkurować z NVIDIĄ na rynku akceleratorów AI, to po premierze MI300 i ulepszeniu ROCm, seria Instinct firmy AMD może okazać się wystarczająco dobra, aby przejąć znaczną część rynku akceleratorów AI od NVIDII. Możesz to sprawdzić już teraz. Jaka jest różnica między Nvidia GTX i Nvidia RTX?

Idź do góry przycisk