GPU-Cluster kaufen: KI-Cluster aus 2 bis 32 GPU-Servern
Wer nur Inferenz skaliert, braucht laut NVIDIA kein GPU-Netz zwischen den Servern. HGX B300 und HGX B200 sind lieferbar mit Slots nach Allokation, HGX H200 nur noch aus Restverfügbarkeit.
IT-Systemhaus für HPC & AI-Infrastruktur · Lieferung EU-weit · Konfiguration, Angebot und Lieferung aus einer Hand
Kriterien nach der NVIDIA Enterprise Reference Architecture, Abruf 05.10.2026
Was ist ein GPU-Cluster und ab wann braucht man ihn?
Ein GPU-Cluster, auch KI-Cluster genannt, verbindet mehrere GPU-Server über ein schnelles Netz zu einem Rechenverbund. Nötig wird er, wenn ein Vorhaben mehr als die 2,1 TB GPU-Speicher eines NVIDIA HGX B300 braucht oder wenn über mehrere Knoten trainiert wird. NVIDIA baut Unternehmens-Cluster aus Einheiten zu 4 Knoten und beschreibt den Bereich bis 32 Knoten mit 256 GPUs. Für reine Inferenz ist laut NVIDIA kein GPU-Netz zwischen den Knoten nötig. Nelpx liefert die Knoten auf GIGABYTE-Basis EU-weit, den HGX B300 ab 450.000 € netto je Knoten.
- Baustein
- 4 Knoteneine Scalable Unit laut NVIDIA
- Enterprise-Bereich
- 4 bis 32 Knotenbis 256 GPUs laut NVIDIA White Paper
- Reine Inferenz
- kein GPU-Netzzwischen den Knoten nötig
Quellen: NVIDIA Enterprise RA „HGX AI Factory“ (18.05.2026) und Enterprise AI Factory White Paper (27.05.2026), docs.nvidia.com; Nelpx-Produktseiten. Abruf 05.10.2026.
Wann reicht ein GPU-Server, wann brauchen Sie einen Cluster?
Ein einzelner Knoten reicht für die meisten Inferenz-Vorhaben. Vier Gründe sprechen für mehrere Knoten, nur zwei davon für das GPU-Netz dazwischen.
Ein HGX B300 bringt laut NVIDIA-Datenblatt 2,1 TB GPU-Speicher je System (270 GB je GPU), ein HGX B200 1,4 TB, ein HGX H200 1.128 GB. Braucht ein Trainingslauf mehr, müssen Knoten gekoppelt werden.
Den Verkehr zwischen HGX-Systemen (Ost-West) ordnet NVIDIA dem Training, Fine-Tuning und HPC über mehrere Knoten zu.
NVIDIA schreibt: „For the use case of pure inference, a compute network may not be necessary.“ Eine B300-GPU trägt Modelle bis etwa 120 Mrd. Parameter, größere bleiben im Knoten.
Zwei Knoten fangen den Ausfall eines Servers ab. Für die Knotenzahl je Nutzerzahl verweist NVIDIA auf seine Sizing Guides.
Nachrüsten des GPU-Netzes geht laut NVIDIA, „albeit with potentially significant downtime and reconfiguration“. Quelle: NVIDIA Enterprise RA HGX AI Factory (Stand 18.05.2026), Networking Physical Topologies, Abruf 05.10.2026.
Ihr Vorhaben einordnen: Cluster oder einzelne Server?
Drei Angaben und die Knotenzahl. Sie erhalten eine Einordnung nach der NVIDIA-Referenzarchitektur, die Sie als Anfrage senden können.
Wofür soll der Cluster arbeiten?
Welcher Knotentyp?
Wo soll der Cluster stehen?
Anzahl Knoten
NVIDIA baut in Einheiten zu 4 Knoten. Über 32 Knoten: GIGABYTE GIGAPOD und NVIDIA GB300 NVL72.
Angebot anfordern
Optional - die Angaben wandern in die E-Mail und ins PDF. Sie erhalten ein Angebot mit Nettopreis und Liefertermin.
Ihre Eingaben bleiben beim Ausfüllen vollständig in Ihrem Browser - übertragen wird erst beim aktiven Absenden der E-Mail. Datenschutzerklärung
Wie baut NVIDIA einen Cluster aus 4 bis 32 Knoten auf?
In Scalable Units zu 4 Knoten, nach drei Mustern je Knotentyp. Die Ziffern nennen CPUs, GPUs, Netzwerkadapter und die Bandbreite in Gb/s.
| Muster | Knotentyp | GPU-Netz je Knoten (Ost-West) | Storage-Netz je Knoten (Nord-Süd) | Dokumentierte Größen | Knoten bei Nelpx |
|---|---|---|---|---|---|
| 2-8-5-200 | RTX PRO Server (8 RTX PRO 6000 Blackwell SE) | 4 Ports 400 Gb/s (BlueField-3 B3140H), 200 Gb/s je GPU | 2 Ports 200 GbE (BlueField-3 B3220) | 16 und 32 Knoten | GIGABYTE XL44-SX2-AAS1 |
| 2-8-9-400 | NVIDIA HGX H200 und HGX B200 | 8 Ports 400 Gb/s (BlueField-3 B3140H) | 2 Ports 200 GbE (BlueField-3 B3220) | 32, 64 und 128 Knoten | HGX H200, HGX B200 |
| 2-8-9-800 | NVIDIA HGX B300 | 8 ConnectX-8 mit je 800 Gb/s (2 mal 400 Gb/s auf zwei Ebenen) | 2 Ports 400 GbE (BlueField-3 B3240) | 32, 64 und 128 Knoten | HGX B300 |
Die Stücklisten der beiden HGX-Architekturen beginnen bei 32 Knoten, kleinere Größen legen wir im Angebot aus. Quellen: NVIDIA Enterprise RA „RTX PRO AI Factory“ und „HGX AI Factory“ (Stand 18.05.2026), „HGX AI Factory H100/H200/B200“ (Stand 31.08.2026), Abruf 05.10.2026.
Was gehört zu einem Cluster aus 32 HGX-B300-Knoten?
Laut NVIDIA 8 Leaf- und 4 Spine-Switches sowie 1.024 Kabel allein im GPU-Netz, aufgebaut mit zwei Netzebenen (Dual-Plane).
| Baustein | Stückzahl laut NVIDIA | Aufgabe |
|---|---|---|
| Compute-Knoten HGX B300 | 32 (8 Scalable Units, 256 GPUs) | je Knoten 8 GPUs |
| Leaf-Switches im GPU-Netz | 8 (4 je Ebene) | Spectrum-4 SN5600/SN5610 mit 64 Ports 800 GbE |
| Spine-Switches im GPU-Netz | 4 | verbinden die Leaf-Switches |
| Kabel im GPU-Netz | 512 Knoten zu Leaf, 512 Switch zu Switch | dazu 256 + 256 + 512 Transceiver |
| Storage- und Kundennetz | Fabric aus 2 Switches | mindestens 12,5 Gb/s je GPU für Storage, 25 Gb/s für das Kundennetz |
| Out-of-Band-Switches SN2201 | 4 | Fernwartung |
| Steuer- und Verwaltungsserver | bis 8 | Cluster-Manager, Slurm, Kubernetes |
Günstiger ist Single-Plane mit einem Port 400 Gb/s je GPU: halbe Bandbreite, laut NVIDIA später umstellbar. Quelle: NVIDIA Enterprise RA HGX AI Factory (Stand 18.05.2026), Tabellen 5 bis 7 und Abschnitt „32 Nodes“; NVIDIA-Certified Storage. Abruf 05.10.2026.
InfiniBand oder Ethernet für den KI-Cluster?
Für Unternehmens-Cluster ist Ethernet der von NVIDIA dokumentierte Weg. InfiniBand bleibt sinnvoll, wenn Ihr Team es schon betreibt.
Spectrum-X Ethernet (RoCE)
- Grundlage der drei genannten NVIDIA-Referenzarchitekturen
- Dell’Oro, 02.06.2026: Ethernet stellt im 1. Quartal 2026 etwa zwei Drittel der Switch-Umsätze in KI-Clustern
- Offener Standard im Ethernet-Lager: Ultra-Ethernet-Spezifikation 1.0 vom 11.06.2025
- Nicht das vorhandene Ethernet: Spectrum-X braucht eigene Switches und SuperNICs
- Die Marktzahl sagt nichts über Cluster aus 4 bis 32 Knoten
InfiniBand (Quantum-2, Quantum-X800)
- Passt, wenn das Team bereits InfiniBand mit UFM und MPI-Lasten betreibt
- Kein Auslaufmodell: Umsätze laut Dell’Oro im selben Quartal mehr als verdreifacht
- Die drei genannten Referenzarchitekturen sind für Spectrum-X Ethernet geschrieben, nicht für InfiniBand
Welche GPU-Server kommen als Cluster-Knoten in Frage?
Vier GIGABYTE-Systeme decken die drei NVIDIA-Muster ab. Preise je Knoten, ohne Netzwerk, Storage und Software.
| Knoten | GPU-Speicher | Netzwerk ab Werk | Bauform | Preis netto | Verfügbarkeit |
|---|---|---|---|---|---|
| HGX B300, GIGABYTE G894 | 2,1 TB HBM3e | 8 ConnectX-8 mit 800 Gb/s onboard | 8 HE Luft, 4 HE flüssig | ab 450.000 € | Lieferbar - Slots nach Allokation |
| HGX B200, GIGABYTE G893 | 1,4 TB HBM3e | bis 8 Ports 400 Gb/s als Steckkarten | 8 HE Luft, 4 HE flüssig | ab 370.000 € | Lieferbar - Slots nach Allokation |
| HGX H200, GIGABYTE G593 | 1.128 GB HBM3e | bis 8 Ports 400 Gb/s als Steckkarten | 5 HE | Preis auf Anfrage | Restverfügbarkeit im OEM-Kanal |
| GIGABYTE XL44-SX2-AAS1 | 768 GB GDDR7 | 4 ConnectX-8 SuperNIC, 1 BlueField-3 | 4 HE luftgekühlt | ab 149.000 € | Lieferbar · 6-12 Wochen |
Preise zzgl. MwSt., Stand Nelpx-Produktseiten 05.10.2026. Siehe auch Vergleich H100, H200, B200 und B300 und NVIDIA B300 und B200. Alternative von AMD: AMD Instinct MI355X und MI325X.
Was braucht ein GPU-Cluster außer den GPU-Servern?
Netzwerk, Storage, Verwaltungsserver und Software. Diese vier Posten fehlen in Angeboten, die nur Knoten aufführen.
GPU-Netz über RDMA, Storage- und Kundennetz über Ethernet mit RoCE, Out-of-Band-Netz für die Fernwartung. NVIDIA empfiehlt im GPU-Netz zwei Ebenen: Fällt eine aus, sinkt nur die Bandbreite. Häufiger Fehler: Manche BlueField-3-Karten ziehen laut NVIDIA über 75 W und brauchen einen zusätzlichen PCIe-Stromstecker.
NVIDIA rechnet linear: 16 GPUs brauchen rund 200 Gb/s. Als Laufwerk bietet sich etwa die KIOXIA PM7-R mit 30,72 TB an (SAS-SSD, kein NVMe).
KIOXIA PM7-R ansehenIm NVIDIA-Beispiel je Server 2 CPUs mit 32 Kernen und mindestens 256 GB RAM. Dafür reichen CPU-Server ohne GPU.
AMD-EPYC-9005-Server konfigurierenNVIDIA AI Enterprise wird je GPU lizenziert. Base Command Manager ist bis 8 Beschleuniger je Server kostenfrei nutzbar, dann ohne Enterprise-Support. Slurm bleibt nach der Übernahme von SchedMD durch NVIDIA am 15.12.2025 quelloffen.
Quellen: NVIDIA Enterprise RA HGX AI Factory, AI Enterprise Licensing Guide, Base Command Manager Licensing and Support, NVIDIA-Blog vom 15.12.2025; Abruf 05.10.2026.
Wie viel Strom braucht ein GPU-Cluster je Rack?
Luftgekühlt plant GIGABYTE 4 HGX-Server je Rack, mit Flüssigkeitskühlung 8. Beides liegt weit über der üblichen Rackdichte.
Quellen: GIGABYTE GIGAPOD Rack Scale und POD Scale, gigabyte.com, Abruf 05.10.2026; Uptime Institute 2026 nach datacenterknowledge.com vom 31.07.2026; Colocation-Wert laut Betreiber.
Passt ein GPU-Cluster in Ihr Rechenzentrum?
Oft nur mit Umbau. Ein GIGABYTE G894 mit HGX B300 ist 923 mm tief, wiegt voll bestückt rund 180 kg und liegt als Richtwert bei etwa 14 kW. Nach unserer Installationserfahrung braucht er ein Rack mit 1.200 mm Tiefe und ab 1.200 kg Traglast. Die 12 Netzteile mit je 3.000 W sind redundant und nicht als 36 kW zu rechnen, eine einzelne 32-A-Zuleitung reicht trotzdem nicht.
Trägt der eigene Raum das nicht, bleibt Colocation: Racks mit 47 HE, 1.200 mm Tiefe und 2N-Stromversorgung, zertifiziert nach EN 50600 VK 3 und ISO 27001. Standard sind 10 kW je Rack, höhere Dichte nach Prüfung, Flüssigkühlung als Option (Angaben des Betreibers).
Quellen: Nelpx-Produktseite HGX B300 (Datenblatt, eigene Installationserfahrung); Nelpx-Colocation-Seite, Stand 24.09.2026.
Wie groß ist ein Cluster aus 32 Knoten im Vergleich?
Mit 256 GPUs liegt er in der Größenklasse eines Hochschul-KI-Rechners. Verglichen werden Stückzahlen, nicht die Rechenleistung.
| System | Knoten | GPUs |
|---|---|---|
| Cluster nach NVIDIA Enterprise RA | 32 | 256 |
| Alpha Centauri, TU Dresden (2021) | 39 | 8 NVIDIA A100 je Knoten |
| fortytwo, hessian.AI | 79 | 632 NVIDIA A100-80GB |
| Capella, TU Dresden (2024) | 156 | 4 NVIDIA H100 je Knoten |
Quellen: hessian.ai/de/infrastruktur und compendium.hpc.tu-dresden.de, Abruf 05.10.2026.
Was bestimmt den Liefertermin eines GPU-Clusters?
Die GPU-Allokation. NVIDIA hat am 26.08.2026 erklärt, dass das Angebot mindestens bis Ende des Geschäftsjahres 2028 der Engpass bleibt. Bei einem Cluster müssen alle Knoten zugleich zugeteilt werden. Auch die CPU-Basis zählt: Intel-Xeon-CPUs hatten im August 2026 sehr lange Lieferzeiten, für HGX B200 und HGX H200 empfehlen wir deshalb AMD EPYC.
Die nächste Generation, Vera Rubin NVL72, führen wir mit Auslieferung ab H1 2027.
Quelle: NVIDIA, Telefonkonferenz zum zweiten Quartal des Geschäftsjahres 2027 vom 26.08.2026; Nelpx-Produktseiten, Abruf 05.10.2026.
Für wen ein GPU-Cluster nicht das Richtige ist
Ein Server, bei wachsender Last ein zweiter, ohne GPU-Netz.
KI-Server für UnternehmenDann ist die Knotenzahl geraten. Die Kosten eines einzelnen Systems zeigt Was kostet ein GPU-Server.
Zum KI-LösungsfinderDann planen Sie in Racks: GIGABYTE GIGAPOD oder die NVIDIA GB300 NVL72.
GIGABYTE GIGAPOD ansehenWir legen Cluster nach der veröffentlichten NVIDIA-Referenzarchitektur mit GIGABYTE-Servern aus. Verbünde aus Mini-PCs oder Consumer-Karten behandelt diese Seite nicht.
Häufige Fragen zum GPU-Cluster
Was ist der Unterschied zwischen GPU-Cluster und KI-Cluster?
Technisch keiner: Beide Begriffe meinen mehrere GPU-Server, die über ein schnelles Netz gemeinsam rechnen. „KI-Cluster“ heißt in Deutschland oft auch ein Forschungsverbund. Diese Seite meint die Hardware: 2 bis 32 Server mit je 8 GPUs samt Netzwerk, Storage und Verwaltungsservern.
Kann ich mit zwei oder vier Servern anfangen und später erweitern?
Ja, das geht. NVIDIA baut in Einheiten zu 4 Knoten, und die OSFP-Ports erlauben den späteren Wechsel von einer auf zwei Netzebenen. Switch-Ports, Rackplätze und Stromanschlüsse für den Endausbau gehören schon in den ersten Kauf, sonst wird die Erweiterung zum Umbau.
Was kostet ein GPU-Cluster?
Den größten Posten bilden die Knoten: bei Nelpx ab 450.000 € netto je HGX B300, ab 370.000 € netto je HGX B200 und ab 149.000 € netto je GIGABYTE XL44. Switches, Kabel, Storage, Verwaltungsserver und Lizenzen je GPU kommen hinzu und stehen im Angebot.
Slurm oder Kubernetes für den GPU-Cluster?
Die NVIDIA-Referenzarchitektur ist auf Kubernetes ausgelegt und sieht daneben Slurm vor. Ein Beispiel von NVIDIA nennt dafür 7 Steuerserver: 2 für den Base Command Manager, 2 Slurm-Head-Nodes und 3 für Kubernetes. Slurm passt zu Trainingsjobs mit Warteschlange, Kubernetes zu dauerhaft laufenden Diensten.
Machen mehr Knoten ein Sprachmodell schneller?
Nicht die einzelne Antwort. Wird ein Modell über mehrere GPUs verteilt, leistet nach NVIDIA jede GPU weniger als bei unabhängigen Modell-Instanzen. Mehr Knoten bedeuten mehr gleichzeitige Anfragen. Dafür reichen einzelne Server mit 8 GPUs und ein Lastverteiler, ein GPU-Netz ist nicht nötig.
Welcher Knotentyp eignet sich für HPC und Simulation?
Für Simulationen mit doppelter Genauigkeit (FP64) führt Nelpx den HGX H200 als erste Wahl: 1.128 GB GPU-Speicher in 5 HE, NVIDIA-Muster 2-8-9-400, nur noch aus Restverfügbarkeit im OEM-Kanal. Lieferbare Alternative mit FP64 ist der HGX B200. Der HGX B300 ist auf KI-Zahlenformate ausgelegt und für FP64 nicht die richtige Wahl.
Weiterführende Seiten
GPU-Cluster anfragen
Nennen Sie uns Zweck, Knotentyp, Stückzahl und Aufstellort. Sie erhalten ein Angebot mit Knoten, Netzwerk, Storage und Verwaltungsservern, mit Nettopreis und Liefertermin nach Allokationsprüfung.
GPU-Cluster kaufen: KI-Cluster aus 2 bis 32 GPU-Servern
Wer nur Inferenz skaliert, braucht laut NVIDIA kein GPU-Netz zwischen den Servern. HGX B300 und HGX B200 sind lieferbar mit Slots nach Allokation, HGX H200 nur noch aus Restverfügbarkeit.
IT-Systemhaus für HPC & AI-Infrastruktur · Lieferung EU-weit · Konfiguration, Angebot und Lieferung aus einer Hand
Kriterien nach der NVIDIA Enterprise Reference Architecture, Abruf 05.10.2026
Was ist ein GPU-Cluster und ab wann braucht man ihn?
Ein GPU-Cluster, auch KI-Cluster genannt, verbindet mehrere GPU-Server über ein schnelles Netz zu einem Rechenverbund. Nötig wird er, wenn ein Vorhaben mehr als die 2,1 TB GPU-Speicher eines NVIDIA HGX B300 braucht oder wenn über mehrere Knoten trainiert wird. NVIDIA baut Unternehmens-Cluster aus Einheiten zu 4 Knoten und beschreibt den Bereich bis 32 Knoten mit 256 GPUs. Für reine Inferenz ist laut NVIDIA kein GPU-Netz zwischen den Knoten nötig. Nelpx liefert die Knoten auf GIGABYTE-Basis EU-weit, den HGX B300 ab 450.000 € netto je Knoten.
- Baustein
- 4 Knoteneine Scalable Unit laut NVIDIA
- Enterprise-Bereich
- 4 bis 32 Knotenbis 256 GPUs laut NVIDIA White Paper
- Reine Inferenz
- kein GPU-Netzzwischen den Knoten nötig
Quellen: NVIDIA Enterprise RA „HGX AI Factory“ (18.05.2026) und Enterprise AI Factory White Paper (27.05.2026), docs.nvidia.com; Nelpx-Produktseiten. Abruf 05.10.2026.
Wann reicht ein GPU-Server, wann brauchen Sie einen Cluster?
Ein einzelner Knoten reicht für die meisten Inferenz-Vorhaben. Vier Gründe sprechen für mehrere Knoten, nur zwei davon für das GPU-Netz dazwischen.
Ein HGX B300 bringt laut NVIDIA-Datenblatt 2,1 TB GPU-Speicher je System (270 GB je GPU), ein HGX B200 1,4 TB, ein HGX H200 1.128 GB. Braucht ein Trainingslauf mehr, müssen Knoten gekoppelt werden.
Den Verkehr zwischen HGX-Systemen (Ost-West) ordnet NVIDIA dem Training, Fine-Tuning und HPC über mehrere Knoten zu.
NVIDIA schreibt: „For the use case of pure inference, a compute network may not be necessary.“ Eine B300-GPU trägt Modelle bis etwa 120 Mrd. Parameter, größere bleiben im Knoten.
Zwei Knoten fangen den Ausfall eines Servers ab. Für die Knotenzahl je Nutzerzahl verweist NVIDIA auf seine Sizing Guides.
Nachrüsten des GPU-Netzes geht laut NVIDIA, „albeit with potentially significant downtime and reconfiguration“. Quelle: NVIDIA Enterprise RA HGX AI Factory (Stand 18.05.2026), Networking Physical Topologies, Abruf 05.10.2026.
Ihr Vorhaben einordnen: Cluster oder einzelne Server?
Drei Angaben und die Knotenzahl. Sie erhalten eine Einordnung nach der NVIDIA-Referenzarchitektur, die Sie als Anfrage senden können.
Wofür soll der Cluster arbeiten?
Welcher Knotentyp?
Wo soll der Cluster stehen?
Anzahl Knoten
NVIDIA baut in Einheiten zu 4 Knoten. Über 32 Knoten: GIGABYTE GIGAPOD und NVIDIA GB300 NVL72.
Angebot anfordern
Optional - die Angaben wandern in die E-Mail und ins PDF. Sie erhalten ein Angebot mit Nettopreis und Liefertermin.
Ihre Eingaben bleiben beim Ausfüllen vollständig in Ihrem Browser - übertragen wird erst beim aktiven Absenden der E-Mail. Datenschutzerklärung
Wie baut NVIDIA einen Cluster aus 4 bis 32 Knoten auf?
In Scalable Units zu 4 Knoten, nach drei Mustern je Knotentyp. Die Ziffern nennen CPUs, GPUs, Netzwerkadapter und die Bandbreite in Gb/s.
| Muster | Knotentyp | GPU-Netz je Knoten (Ost-West) | Storage-Netz je Knoten (Nord-Süd) | Dokumentierte Größen | Knoten bei Nelpx |
|---|---|---|---|---|---|
| 2-8-5-200 | RTX PRO Server (8 RTX PRO 6000 Blackwell SE) | 4 Ports 400 Gb/s (BlueField-3 B3140H), 200 Gb/s je GPU | 2 Ports 200 GbE (BlueField-3 B3220) | 16 und 32 Knoten | GIGABYTE XL44-SX2-AAS1 |
| 2-8-9-400 | NVIDIA HGX H200 und HGX B200 | 8 Ports 400 Gb/s (BlueField-3 B3140H) | 2 Ports 200 GbE (BlueField-3 B3220) | 32, 64 und 128 Knoten | HGX H200, HGX B200 |
| 2-8-9-800 | NVIDIA HGX B300 | 8 ConnectX-8 mit je 800 Gb/s (2 mal 400 Gb/s auf zwei Ebenen) | 2 Ports 400 GbE (BlueField-3 B3240) | 32, 64 und 128 Knoten | HGX B300 |
Die Stücklisten der beiden HGX-Architekturen beginnen bei 32 Knoten, kleinere Größen legen wir im Angebot aus. Quellen: NVIDIA Enterprise RA „RTX PRO AI Factory“ und „HGX AI Factory“ (Stand 18.05.2026), „HGX AI Factory H100/H200/B200“ (Stand 31.08.2026), Abruf 05.10.2026.
Was gehört zu einem Cluster aus 32 HGX-B300-Knoten?
Laut NVIDIA 8 Leaf- und 4 Spine-Switches sowie 1.024 Kabel allein im GPU-Netz, aufgebaut mit zwei Netzebenen (Dual-Plane).
| Baustein | Stückzahl laut NVIDIA | Aufgabe |
|---|---|---|
| Compute-Knoten HGX B300 | 32 (8 Scalable Units, 256 GPUs) | je Knoten 8 GPUs |
| Leaf-Switches im GPU-Netz | 8 (4 je Ebene) | Spectrum-4 SN5600/SN5610 mit 64 Ports 800 GbE |
| Spine-Switches im GPU-Netz | 4 | verbinden die Leaf-Switches |
| Kabel im GPU-Netz | 512 Knoten zu Leaf, 512 Switch zu Switch | dazu 256 + 256 + 512 Transceiver |
| Storage- und Kundennetz | Fabric aus 2 Switches | mindestens 12,5 Gb/s je GPU für Storage, 25 Gb/s für das Kundennetz |
| Out-of-Band-Switches SN2201 | 4 | Fernwartung |
| Steuer- und Verwaltungsserver | bis 8 | Cluster-Manager, Slurm, Kubernetes |
Günstiger ist Single-Plane mit einem Port 400 Gb/s je GPU: halbe Bandbreite, laut NVIDIA später umstellbar. Quelle: NVIDIA Enterprise RA HGX AI Factory (Stand 18.05.2026), Tabellen 5 bis 7 und Abschnitt „32 Nodes“; NVIDIA-Certified Storage. Abruf 05.10.2026.
InfiniBand oder Ethernet für den KI-Cluster?
Für Unternehmens-Cluster ist Ethernet der von NVIDIA dokumentierte Weg. InfiniBand bleibt sinnvoll, wenn Ihr Team es schon betreibt.
Spectrum-X Ethernet (RoCE)
- Grundlage der drei genannten NVIDIA-Referenzarchitekturen
- Dell’Oro, 02.06.2026: Ethernet stellt im 1. Quartal 2026 etwa zwei Drittel der Switch-Umsätze in KI-Clustern
- Offener Standard im Ethernet-Lager: Ultra-Ethernet-Spezifikation 1.0 vom 11.06.2025
- Nicht das vorhandene Ethernet: Spectrum-X braucht eigene Switches und SuperNICs
- Die Marktzahl sagt nichts über Cluster aus 4 bis 32 Knoten
InfiniBand (Quantum-2, Quantum-X800)
- Passt, wenn das Team bereits InfiniBand mit UFM und MPI-Lasten betreibt
- Kein Auslaufmodell: Umsätze laut Dell’Oro im selben Quartal mehr als verdreifacht
- Die drei genannten Referenzarchitekturen sind für Spectrum-X Ethernet geschrieben, nicht für InfiniBand
Welche GPU-Server kommen als Cluster-Knoten in Frage?
Vier GIGABYTE-Systeme decken die drei NVIDIA-Muster ab. Preise je Knoten, ohne Netzwerk, Storage und Software.
| Knoten | GPU-Speicher | Netzwerk ab Werk | Bauform | Preis netto | Verfügbarkeit |
|---|---|---|---|---|---|
| HGX B300, GIGABYTE G894 | 2,1 TB HBM3e | 8 ConnectX-8 mit 800 Gb/s onboard | 8 HE Luft, 4 HE flüssig | ab 450.000 € | Lieferbar - Slots nach Allokation |
| HGX B200, GIGABYTE G893 | 1,4 TB HBM3e | bis 8 Ports 400 Gb/s als Steckkarten | 8 HE Luft, 4 HE flüssig | ab 370.000 € | Lieferbar - Slots nach Allokation |
| HGX H200, GIGABYTE G593 | 1.128 GB HBM3e | bis 8 Ports 400 Gb/s als Steckkarten | 5 HE | Preis auf Anfrage | Restverfügbarkeit im OEM-Kanal |
| GIGABYTE XL44-SX2-AAS1 | 768 GB GDDR7 | 4 ConnectX-8 SuperNIC, 1 BlueField-3 | 4 HE luftgekühlt | ab 149.000 € | Lieferbar · 6-12 Wochen |
Preise zzgl. MwSt., Stand Nelpx-Produktseiten 05.10.2026. Siehe auch Vergleich H100, H200, B200 und B300 und NVIDIA B300 und B200. Alternative von AMD: AMD Instinct MI355X und MI325X.
Was braucht ein GPU-Cluster außer den GPU-Servern?
Netzwerk, Storage, Verwaltungsserver und Software. Diese vier Posten fehlen in Angeboten, die nur Knoten aufführen.
GPU-Netz über RDMA, Storage- und Kundennetz über Ethernet mit RoCE, Out-of-Band-Netz für die Fernwartung. NVIDIA empfiehlt im GPU-Netz zwei Ebenen: Fällt eine aus, sinkt nur die Bandbreite. Häufiger Fehler: Manche BlueField-3-Karten ziehen laut NVIDIA über 75 W und brauchen einen zusätzlichen PCIe-Stromstecker.
NVIDIA rechnet linear: 16 GPUs brauchen rund 200 Gb/s. Als Laufwerk bietet sich etwa die KIOXIA PM7-R mit 30,72 TB an (SAS-SSD, kein NVMe).
KIOXIA PM7-R ansehenIm NVIDIA-Beispiel je Server 2 CPUs mit 32 Kernen und mindestens 256 GB RAM. Dafür reichen CPU-Server ohne GPU.
AMD-EPYC-9005-Server konfigurierenNVIDIA AI Enterprise wird je GPU lizenziert. Base Command Manager ist bis 8 Beschleuniger je Server kostenfrei nutzbar, dann ohne Enterprise-Support. Slurm bleibt nach der Übernahme von SchedMD durch NVIDIA am 15.12.2025 quelloffen.
Quellen: NVIDIA Enterprise RA HGX AI Factory, AI Enterprise Licensing Guide, Base Command Manager Licensing and Support, NVIDIA-Blog vom 15.12.2025; Abruf 05.10.2026.
Wie viel Strom braucht ein GPU-Cluster je Rack?
Luftgekühlt plant GIGABYTE 4 HGX-Server je Rack, mit Flüssigkeitskühlung 8. Beides liegt weit über der üblichen Rackdichte.
Quellen: GIGABYTE GIGAPOD Rack Scale und POD Scale, gigabyte.com, Abruf 05.10.2026; Uptime Institute 2026 nach datacenterknowledge.com vom 31.07.2026; Colocation-Wert laut Betreiber.
Passt ein GPU-Cluster in Ihr Rechenzentrum?
Oft nur mit Umbau. Ein GIGABYTE G894 mit HGX B300 ist 923 mm tief, wiegt voll bestückt rund 180 kg und liegt als Richtwert bei etwa 14 kW. Nach unserer Installationserfahrung braucht er ein Rack mit 1.200 mm Tiefe und ab 1.200 kg Traglast. Die 12 Netzteile mit je 3.000 W sind redundant und nicht als 36 kW zu rechnen, eine einzelne 32-A-Zuleitung reicht trotzdem nicht.
Trägt der eigene Raum das nicht, bleibt Colocation: Racks mit 47 HE, 1.200 mm Tiefe und 2N-Stromversorgung, zertifiziert nach EN 50600 VK 3 und ISO 27001. Standard sind 10 kW je Rack, höhere Dichte nach Prüfung, Flüssigkühlung als Option (Angaben des Betreibers).
Quellen: Nelpx-Produktseite HGX B300 (Datenblatt, eigene Installationserfahrung); Nelpx-Colocation-Seite, Stand 24.09.2026.
Wie groß ist ein Cluster aus 32 Knoten im Vergleich?
Mit 256 GPUs liegt er in der Größenklasse eines Hochschul-KI-Rechners. Verglichen werden Stückzahlen, nicht die Rechenleistung.
| System | Knoten | GPUs |
|---|---|---|
| Cluster nach NVIDIA Enterprise RA | 32 | 256 |
| Alpha Centauri, TU Dresden (2021) | 39 | 8 NVIDIA A100 je Knoten |
| fortytwo, hessian.AI | 79 | 632 NVIDIA A100-80GB |
| Capella, TU Dresden (2024) | 156 | 4 NVIDIA H100 je Knoten |
Quellen: hessian.ai/de/infrastruktur und compendium.hpc.tu-dresden.de, Abruf 05.10.2026.
Was bestimmt den Liefertermin eines GPU-Clusters?
Die GPU-Allokation. NVIDIA hat am 26.08.2026 erklärt, dass das Angebot mindestens bis Ende des Geschäftsjahres 2028 der Engpass bleibt. Bei einem Cluster müssen alle Knoten zugleich zugeteilt werden. Auch die CPU-Basis zählt: Intel-Xeon-CPUs hatten im August 2026 sehr lange Lieferzeiten, für HGX B200 und HGX H200 empfehlen wir deshalb AMD EPYC.
Die nächste Generation, Vera Rubin NVL72, führen wir mit Auslieferung ab H1 2027.
Quelle: NVIDIA, Telefonkonferenz zum zweiten Quartal des Geschäftsjahres 2027 vom 26.08.2026; Nelpx-Produktseiten, Abruf 05.10.2026.
Für wen ein GPU-Cluster nicht das Richtige ist
Ein Server, bei wachsender Last ein zweiter, ohne GPU-Netz.
KI-Server für UnternehmenDann ist die Knotenzahl geraten. Die Kosten eines einzelnen Systems zeigt Was kostet ein GPU-Server.
Zum KI-LösungsfinderDann planen Sie in Racks: GIGABYTE GIGAPOD oder die NVIDIA GB300 NVL72.
GIGABYTE GIGAPOD ansehenWir legen Cluster nach der veröffentlichten NVIDIA-Referenzarchitektur mit GIGABYTE-Servern aus. Verbünde aus Mini-PCs oder Consumer-Karten behandelt diese Seite nicht.
Häufige Fragen zum GPU-Cluster
Was ist der Unterschied zwischen GPU-Cluster und KI-Cluster?
Technisch keiner: Beide Begriffe meinen mehrere GPU-Server, die über ein schnelles Netz gemeinsam rechnen. „KI-Cluster“ heißt in Deutschland oft auch ein Forschungsverbund. Diese Seite meint die Hardware: 2 bis 32 Server mit je 8 GPUs samt Netzwerk, Storage und Verwaltungsservern.
Kann ich mit zwei oder vier Servern anfangen und später erweitern?
Ja, das geht. NVIDIA baut in Einheiten zu 4 Knoten, und die OSFP-Ports erlauben den späteren Wechsel von einer auf zwei Netzebenen. Switch-Ports, Rackplätze und Stromanschlüsse für den Endausbau gehören schon in den ersten Kauf, sonst wird die Erweiterung zum Umbau.
Was kostet ein GPU-Cluster?
Den größten Posten bilden die Knoten: bei Nelpx ab 450.000 € netto je HGX B300, ab 370.000 € netto je HGX B200 und ab 149.000 € netto je GIGABYTE XL44. Switches, Kabel, Storage, Verwaltungsserver und Lizenzen je GPU kommen hinzu und stehen im Angebot.
Slurm oder Kubernetes für den GPU-Cluster?
Die NVIDIA-Referenzarchitektur ist auf Kubernetes ausgelegt und sieht daneben Slurm vor. Ein Beispiel von NVIDIA nennt dafür 7 Steuerserver: 2 für den Base Command Manager, 2 Slurm-Head-Nodes und 3 für Kubernetes. Slurm passt zu Trainingsjobs mit Warteschlange, Kubernetes zu dauerhaft laufenden Diensten.
Machen mehr Knoten ein Sprachmodell schneller?
Nicht die einzelne Antwort. Wird ein Modell über mehrere GPUs verteilt, leistet nach NVIDIA jede GPU weniger als bei unabhängigen Modell-Instanzen. Mehr Knoten bedeuten mehr gleichzeitige Anfragen. Dafür reichen einzelne Server mit 8 GPUs und ein Lastverteiler, ein GPU-Netz ist nicht nötig.
Welcher Knotentyp eignet sich für HPC und Simulation?
Für Simulationen mit doppelter Genauigkeit (FP64) führt Nelpx den HGX H200 als erste Wahl: 1.128 GB GPU-Speicher in 5 HE, NVIDIA-Muster 2-8-9-400, nur noch aus Restverfügbarkeit im OEM-Kanal. Lieferbare Alternative mit FP64 ist der HGX B200. Der HGX B300 ist auf KI-Zahlenformate ausgelegt und für FP64 nicht die richtige Wahl.
Weiterführende Seiten
GPU-Cluster anfragen
Nennen Sie uns Zweck, Knotentyp, Stückzahl und Aufstellort. Sie erhalten ein Angebot mit Knoten, Netzwerk, Storage und Verwaltungsservern, mit Nettopreis und Liefertermin nach Allokationsprüfung.