Zum Inhalt springen
AMD Instinct im GIGABYTE-Server · Stand Oktober 2026

AMD Instinct MI355X und MI325X Server kaufen

Acht MI355X mit zusammen 2.304 GB HBM3E in einem GIGABYTE-Server, luftgekühlt mit 8 HE oder flüssiggekühlt mit 4 HE. Beide Server sind über GIGABYTE bestellbar - Preis und Liefertermin stehen im Angebot. Die MI325X bleibt die Alternative für Rechnen in doppelter Genauigkeit.

IT-Systemhaus für HPC & AI-Infrastruktur · Lieferung EU-weit · Konfiguration, Angebot und Lieferung aus einer Hand

ÜBER GIGABYTE BESTELLBARPREIS UND LIEFERTERMIN IM ANGEBOTNUR ALS KOMPLETTER SERVER
Vier Wege zu AMD Instinct bei GIGABYTE
1
G893-ZX1-AAX48 × MI355X, Luft, 8 HE - bestellbar
2
G4L3-ZX1-LAT48 × MI355X, Flüssigkeit, 4 HE - bestellbar
3
G893-ZX1-AAX2 / G4L3-ZX1-LAX28 × MI325X, Luft oder Flüssigkeit - bestellbar
4
G494-ZB0-AAP2bedingt 8 × MI350P als PCIe-Karte

Alle vier Wege sind über GIGABYTE bestellbar. Preis und Liefertermin stehen im Angebot.

288 GBHBM3E je MI355X
256 GBHBM3E je MI325X
8 TB/sBandbreite der MI355X (Peak)
8 GPUsje Server, als OAM-Module

Was bekommt man, wenn man einen MI355X-Server kauft?

Server mit AMD Instinct MI355X führt GIGABYTE in zwei Bauformen: luftgekühlt als G893-ZX1-AAX4 mit 8 HE und flüssiggekühlt als G4L3-ZX1-LAT4 mit 4 HE. Beide tragen acht GPUs mit je 288 GB HBM3E, zusammen 2.304 GB. Die AMD Instinct MI325X mit 256 GB je GPU ist die Alternative für Rechnen in doppelter Genauigkeit. Beide MI355X-Server sind bei Nelpx über GIGABYTE bestellbar; Preis und Liefertermin stehen im Angebot. Einzeln steckbar ist keine der beiden Karten.

Speicher im Server
2.304 GB8 × MI355X, laut AMD 2,3 TB
Leistungsaufnahme je GPU
1.400 WMI355X; MI325X 1.000 W Peak
Bezug
bestellbarüber GIGABYTE; Preis und Liefertermin im Angebot

Quellen: AMD- und GIGABYTE-Produktseiten, Abruf 05.10.2026. Peak-Werte sind theoretische Herstellerangaben.

MI355X gegen NVIDIA H200, B200 und B300: die Herstellerwerte nebeneinander

Beim Speicher liegt die MI355X vorn: 288 GB gegen 270 GB je GPU im HGX B300 laut jeweiligem Datenblatt. Die 4-Bit-Werte sind nicht direkt vergleichbar: MXFP4 und NVFP4 sind unterschiedliche Zahlenformate, und NVIDIA nennt Systemwerte, AMD Werte je GPU.

MerkmalAMD MI325XAMD MI355XNVIDIA H200NVIDIA B200NVIDIA B300
Speicher je GPU256 GB HBM3E288 GB HBM3E141 GB HBM3e180 GB HBM3e270 GB HBM3e
Speicherbandbreite je GPU6 TB/s8 TB/s4,8 TB/s7,7 TB/s7,7 TB/s
Leistungsaufnahme je GPU1.000 W Peak1.400 Wbis 700 Wbis 1.000 Wbis 1.100 W
4-Bit-Format, PFLOPSnicht vorhandenMXFP4: 10,1 je GPU, 80,5 je Plattformnicht vorhandenNVFP4, System: 72 dicht, 144 mit SparsityNVFP4, System: 108 dicht, 144 mit Sparsity
FP8, dicht / mit Sparsityje GPU 2,61 / 5,22 PFLOPSje GPU 5 / 10,1 PFLOPSje GPU 3.958 TFLOPS mit SparsitySystem: 36 / 72 PFLOPSSystem: 72 PFLOPS
FP64je GPU 163,4 TFLOPS Matrix, 81,7 Vektorje GPU 78,6 TFLOPS, Plattform 628,8System: 272 TFLOPS, Tensor-Kerne 536System: 296 TFLOPSSystem: 10 TFLOPS
Kopplung der 8 GPUsInfinity Fabric, 128 GB/s je LinkInfinity Fabric, 153 GB/s je LinkNVLink, 900 GB/s je GPUNVLink 5, 1,8 TB/s je GPUNVLink 5, 14,4 TB/s je Domäne

Quellen: AMD-Produktseiten, NVIDIA-Datenblätter und NVIDIA Blackwell Technical Brief V2.1, Abruf 05.10.2026. B200 im HGX B200: 7,7 TB/s laut Technical Brief; 8 TB/s nennt NVIDIA dort für das GB200. NVIDIAs Entwicklerblog und die Referenzarchitektur nennen 288 GB verbauten Speicher je B300; das Datenblatt weist für das HGX B300 270 GB aus. Eine Erklärung der Differenz haben wir in den NVIDIA-Unterlagen nicht gefunden. Systeme: HGX H200, HGX B200 und HGX B300. Mehr: B300 und B200. Die oft zitierten 20,1 PFLOPS MXFP4 nennt AMDs Produktseite nicht.

MLPerf-Stand: wo die MI355X gegen B200 und B300 gemessen steht

Gegen die B300 lag die MI355X im April 2026 bei 92 bis 93 %, im September bei GPT-OSS-120B davor. Diese Werte stehen in den MLCommons-Rohprotokollen; die Vergleiche mit der B200 sind die Lesart der AMD-Auswertung.

01.04.2026MLPerf Inference v6.0

Llama 2 70B, Server-Szenario: 100.282 Token/s mit 8 MI355X, 107.318 mit dem HGX B300. Giga Computing reichte den luftgekühlten G893-ZX1-AAX4 ein: 98.157 Token/s. Gegen die B200 laut AMD-Auswertung: Gleichstand offline, 97 % Server, 119 % Interactive.

16.09.2026MLPerf Inference v6.1

GPT-OSS-120B auf denselben 8 MI355X: 113.241 Token/s im Server-Szenario, 38 % mehr als in v6.0 und laut AMD allein durch Software. Die B300-Einreichung von NVIDIA liegt bei 100.630. In AMDs v6.1-Einreichung fehlt die MI325X.

Quellen: MLCommons-Ergebnisarchive Inference v6.0 und v6.1 (Rohprotokolle von AMD, NVIDIA und GigaComputing), AMD-Blogs zu beiden Runden. Abruf 05.10.2026.

In vier Klicks: Welcher Instinct-Server passt - oder keiner?

Drei Angaben und die Stückzahl. Sie erhalten eine Einordnung - auch dann, wenn ein NVIDIA-System die bessere Wahl ist - und schicken die Auswahl als Anfrage ab.

01

Was soll der Server tun?

02

Welche Kühlung gibt es am Standort?

03

Worauf läuft Ihre Software heute?

04

Stückzahl Server

ANFRAGE

Angebot anfordern

Optional - die Angaben wandern in die E-Mail und ins PDF. Sie erhalten ein Angebot mit Nettopreis und Liefertermin.

Ihre Eingaben bleiben beim Ausfüllen vollständig in Ihrem Browser - übertragen wird erst beim aktiven Absenden der E-Mail. Datenschutzerklärung

Welche Sprachmodelle passen in 8 × MI325X und 8 × MI355X?

DeepSeek-R1 mit 671 Mrd. Parametern passt in voller FP16-Präzision in einen einzelnen Knoten. Rechenweg: Gewichte (Parameter × 2 Byte bei FP16) plus Zwischenspeicher für 8.000 Token Kontext und 20 parallele Anfragen, darauf 15 % Reserve - ergibt 1.556 GB. Als nutzbar zählen 92 % des Speichers: 2.048 GB × 0,92 = 1.884 GB bei 8 × MI325X, 2.304 GB × 0,92 = 2.120 GB bei 8 × MI355X.

8 × MI355X2.120 GB nutzbar - DeepSeek-R1 FP16 passt
HGX B3001.932 GB nutzbar - passt
8 × MI325X1.884 GB nutzbar - passt
Bedarf DeepSeek-R1 in FP161.556 GB
HGX B2001.288 GB nutzbar - passt nur in FP8
HGX H2001.038 GB nutzbar - passt nur in FP8

Eigene Rechnung nach der Formel des Modell-Rechners auf der LLM-Server-Seite; in FP8 braucht DeepSeek-R1 785 GB. Auf einer einzelnen Karte läuft Llama 3.3 70B in FP16 (223 GB). Grenzen: Die Formel behandelt alle acht GPUs als einen Speichertopf. Ein Modell, das größer ist als eine Karte, wird verteilt - das kostet Durchsatz. Speicher sagt nichts über Token je Sekunde.

MI355X oder MI325X: neuer ist nicht in allem schneller

Für KI-Inferenz und Training ist die MI355X die richtige Karte, für Simulation in doppelter Genauigkeit die MI325X. AMD hat CDNA 4 auf niedrige KI-Präzisionen ausgelegt und dafür FP64-Leistung aufgegeben.

AMD Instinct MI355X (CDNA 4, Marktstart 12.06.2025)

  • MXFP4 und MXFP6 in Hardware, je 10,1 PFLOPS
  • Beide GIGABYTE-Server sind bestellbar
  • 1.400 W je GPU statt 1.000 W Peak
  • FP64 nur 78,6 TFLOPS, FP32 157,3 TFLOPS; TF32 nur per Software-Emulation

AMD Instinct MI325X (CDNA 3, Marktstart 10.10.2024)

  • FP64 Matrix 163,4 TFLOPS - rund das Doppelte der MI355X
  • FP32 163,4 TFLOPS und TF32 in Hardware (653,7 TFLOPS)
  • Kein MXFP4, kein MXFP6
Wer Strömung, Chemie oder Wettermodelle in FP64 rechnet, kauft mit der MI355X am Bedarf vorbei und fragt die MI325X an. Auch ihre Server sind über GIGABYTE bestellbar.

Zwei Irrtümer, die seit dem Marktstart kursieren

Irrtum 1„Die MI355X gibt es nur flüssiggekühlt“

Falsch. Das war der Stand der Launch-Meldungen vom Juni 2025. Heute führt GIGABYTE den G893-ZX1-AAX4 als luftgekühlten Server mit 8 × MI355X. Luftgekühlt heißt aber nicht anspruchslos: 8 HE, 923 mm Bautiefe, 131 kg netto, zwölf Netzteile (6+6) mit je 3.000 W und eine zulässige Umgebungstemperatur von 10 bis 30 °C. Die flüssiggekühlte Variante G4L3-ZX1-LAT4 braucht 4 HE, wiegt 56,5 kg netto und verlangt 200-240 V für ihre 3+3 Netzteile mit je 5.200 W sowie einen Kühlkreislauf. Fehlt der Raum: Server-Colocation.

Irrtum 2„Die MI355X stecke ich einzeln in meinen Server“

Falsch. MI355X und MI325X sind OAM-Module auf einem Baseboard mit acht GPUs und kommen nur als kompletter Server. „PCIe 5.0 x16“ in Händlerlisten beschreibt die Bus-Anbindung, kein Steckplatzformat. Die Steckkarte der Serie ist die AMD Instinct MI350P: 144 GB HBM3E, 4 TB/s, höchstens 600 W, Dual-Slot, 267 mm lang. GIGABYTE nennt für den G494-ZB0-AAP2 mit 4 HE eine bedingte Unterstützung von 8 Karten bei 25 °C Umgebungstemperatur. Mehr dazu: GPU-Kompatibilität.

Quellen: GIGABYTE-Produktseiten G893-ZX1-AAX4, G4L3-ZX1-LAT4 und G494-ZB0-AAP2; AMD-Produktseite MI350P. Abruf 05.10.2026. Die AMD-Seite nennt für die MI350P keine Infinity-Fabric-Links.

GIGABYTE-Server für AMD Instinct: Modelle und Infrastrukturdaten

Alle aufgeführten Server sind über GIGABYTE bestellbar. Preis und Liefertermin nennen wir im Angebot.

ModellGPUBauhöheKühlungNetzteileGewicht nettoStatus 05.10.2026
G893-ZX1-AAX48 × MI355X8 HELuft6+6 × 3.000 W131 kgbestellbar
G4L3-ZX1-LAT48 × MI355X4 HEDLC für CPU und GPU3+3 × 5.200 W, 200-240 V56,5 kgbestellbar
G893-ZX1-AAX28 × MI325X8 HELuft6+6 × 3.000 W91,5 kgbestellbar
G4L3-ZX1-LAX28 × MI325X4 HEDLC für CPU und GPU4+4 × 3.000 Wnicht belegtbestellbar
G494-ZB0-AAP2bedingt 8 × MI350P (PCIe)4 HELuft, MI350P bis 25 °C4 × 3.000 W66,8 kgTermin im Angebot

Alle ZX1-Modelle: 2 × AMD EPYC 9005 oder 9004, 24 DIMM-Steckplätze DDR5. Die Leistungsaufnahme des Gesamtsystems hat GIGABYTE nicht veröffentlicht; wir leiten keinen kW-Wert aus den Netzteilen ab. Mehr: GIGABYTE-Server. Quelle: GIGABYTE-Produktseiten, Abruf 05.10.2026.

Läuft meine Software auf AMD Instinct? Der ROCm-Stand im Oktober 2026

Was auf offenen Frameworks aufsetzt, läuft. Aktuell ist ROCm 10.0.0 vom 26.08.2026 für MI355X, MI350X, MI350P und MI325X. Laut Kompatibilitätsmatrix validiert sind PyTorch 2.13.0, TensorFlow 2.21, JAX 0.11.0, vLLM 0.27.0 und SGLang 0.5.15.

Was nicht läuft: CUDA-Binärcode und NVIDIA-eigene Bausteine wie TensorRT, NIM oder NVIDIA AI Enterprise. Eigener CUDA-Quellcode lässt sich mit HIPIFY nach HIP übersetzen; laut AMD deckt das nicht alles ab, und Bibliotheken ohne HIP-Gegenstück bleiben außen vor. Der Aufwand hängt vom Code ab und lässt sich vorab nicht beziffern.

Die Release Notes zu ROCm 10.0.0 führen einen bekannten Fehler, durch den Hugging-Face-Trainingsläufe auf der MI350X (Kennung gfx950, zu der auch die MI355X zählt) 9 bis 25 % langsamer sein können; AMD nennt als Abhilfe einen Neubau von PyTorch. ZLUDA ist keine Grundlage für einen Produktivserver: Laut Projektbericht vom 29.06.2026 fehlt die kommerzielle Finanzierung.

Quellen: ROCm Release Notes und Kompatibilitätsmatrix, HIPIFY-Dokumentation (AMD), ZLUDA-Projektblog. Abruf 05.10.2026.

Für wen ein AMD-Instinct-Server passt - und für wen nicht

Ein Instinct-Server passt, wenn Ihre Software auf offenen Frameworks läuft. Hängt sie an CUDA, raten wir ab.

AMD Instinct passt

  • Inferenz und Training auf PyTorch, vLLM, SGLang, TensorFlow oder JAX
  • HPC-Code in FP64, der bereits auf HIP oder OpenMP läuft (MI325X)

NVIDIA ist die bessere Wahl

  • Die Anwendung setzt CUDA, TensorRT, NIM oder NVIDIA AI Enterprise voraus
  • Mehr als 8 direkt gekoppelte GPUs: Infinity Fabric verbindet 8, NVLink im Rack 72
Für CUDA-Software als Einzelkarte: NVIDIA H200. Mehrere Knoten koppelt das Netzwerk, nicht Infinity Fabric: KI-Cluster kaufen.

Jetzt MI355X kaufen oder auf die MI400 warten?

Das sind zwei verschiedene Anschaffungen. Die MI400-Serie kommt als Helios-Rack mit vollständiger Flüssigkühlung und 225 bis 245 kW je Rack. Laut AMD ist sie seit dem 23. Juli 2026 in Produktion, erste Auslieferungen waren für Ende Q3 2026 angekündigt; öffentlich bestätigt sind sie bis 05.10.2026 nicht. Die MI355X ist die jüngste Instinct-Spitzenkarte, die GIGABYTE als luftgekühlten Einzelserver führt. Details: AMD Instinct MI400 mit Helios-Rack.

Häufige Fragen zu MI355X, MI325X und MI350P

Was kostet ein Server mit AMD Instinct MI355X?

Nelpx nennt den Preis im Angebot. Er hängt an Prozessoren, Arbeitsspeicher, Netzwerkkarten und der Kühlvariante (8 HE Luft oder 4 HE Flüssigkeit). AMD und GIGABYTE veröffentlichen keine Listenpreise. Cloud-Stundenpreise sagen über den Kaufpreis eines Servers mit 8 GPUs nichts aus. Beide MI355X-Server sind über GIGABYTE bestellbar.

Was kostet die AMD Instinct MI350P und wo läuft sie?

Auch für die MI350P nennt Nelpx Preis und Liefertermin im Angebot; AMD hat zum Marktstart am 07.05.2026 keinen Preis genannt. Die PCIe-Steckkarte hat 144 GB HBM3E und nimmt höchstens 600 W auf, konfigurierbar auf 450 W. Bei GIGABYTE unterstützt der G494-ZB0-AAP2 bedingt 8 Karten bei 25 °C.

Wie steht die MI325X gegen die NVIDIA H200?

Die MI325X hat 256 GB Speicher bei 6 TB/s, die H200 141 GB bei 4,8 TB/s. In der Double-Precision-Matrixleistung rechnet AMD 163,4 gegen 66,9 TFLOPS vor und hat dafür die mit Sparsity veröffentlichten NVIDIA-Werte halbiert. Die H200 nimmt bis 700 W auf, die MI325X 1.000 W Peak.

Ist die MI355X schneller als die NVIDIA B200?

Je nach Test. In MLPerf Inference v6.0 lag sie laut AMD-Auswertung bei Llama 2 70B zwischen 97 % und 119 % der B200, bei GPT-OSS-120B bei 111 % (offline) und 115 % (Server). Im Training v6.0 (16.06.2026) blieb sie innerhalb von 5 bis 6 %. Fest steht der Speichervorteil: 288 statt 180 GB je GPU.

Kann ich meinen CUDA-Code auf einem Instinct-Server weiterverwenden?

Nicht unverändert. Frameworks wie PyTorch 2.13.0 oder vLLM 0.27.0 laufen auf ROCm 10.0.0 ohne CUDA. Eigener CUDA-Quellcode muss nach HIP übersetzt werden; AMDs Werkzeug HIPIFY deckt das laut AMD nicht vollständig ab. NVIDIA-Software wie TensorRT fällt weg. Ist CUDA zwingend, empfiehlt Nelpx ein NVIDIA-System.

Was ist mit „AMD GPU Server“ gemeint - EPYC oder Instinct?

Beides kommt vor. Meist ist ein GPU-Server mit AMD-EPYC-Prozessoren und NVIDIA-Karten gemeint. Ein Server mit AMD-GPUs trägt dagegen AMD Instinct: acht MI355X oder MI325X als OAM-Module oder bis zu 8 MI350P als Steckkarten. In den GIGABYTE-Instinct-Servern stecken 2 AMD EPYC 9005 oder 9004.

Weiterführende Seiten

Angebot für Ihren Instinct-Server anfordern

Nennen Sie uns Karte, Stückzahl, Kühlung und Software-Stand. Die MI355X-Server sind über GIGABYTE bestellbar; Sie erhalten ein Angebot mit Nettopreis und Liefertermin. Lieferung EU-weit.