Kurz beantwortet: Bei einer KI-Workstation entscheidet der Grafikspeicher, welche Modelle überhaupt lokal laufen. 24 bis 32 GB reichen für Modelle der 8B-Klasse und für Bildgenerierung, 48 bis 72 GB für 70B-Modelle in 4-Bit-Quantisierung, 96 GB für 70B-Modelle mit großem Kontext, und für Training oder 70B in FP16 braucht es mehrere Karten. Der Arbeitsspeicher sollte mindestens so groß sein wie der Grafikspeicher, bei Training doppelt so groß. Bei Nelpx beginnt eine KI-Workstation bei 4.900 € netto, Einstiegskonfiguration mit einer GPU.
Wer zum ersten Mal eine Workstation für Sprachmodelle, Bildgenerierung oder Machine Learning zusammenstellt, steht vor denselben drei Fragen: Welche Grafikkarte, wie viel Grafikspeicher, wie viel Arbeitsspeicher. Dieser Leitfaden beantwortet sie in der Reihenfolge, in der sie beim Konfigurieren tatsächlich anfallen, mit Richtwerten aus den offiziellen Speichertabellen von Hugging Face und den Herstellerdaten von NVIDIA und AMD. Am Ende stehen drei Beispielkonfigurationen und eine Checkliste für die Anfrage.
Tower-Workstation mit einer GPU und 360-mm-Wasserkühlung (Symbolbild)
Erst der Einsatzzweck, dann die Hardware
Die Hardwarefrage lässt sich nicht beantworten, bevor der Einsatzzweck klar ist. In der Praxis gibt es vier typische Fälle, die sehr unterschiedliche Anforderungen stellen:
- Inferenz, also lokale Sprachmodelle betreiben: Ein fertiges Modell beantwortet Anfragen, zum Beispiel als interner Assistent oder in einer RAG-Anwendung über Firmendokumente. Hier zählt fast nur der Grafikspeicher.
- Fine-Tuning: Ein vorhandenes Modell wird mit eigenen Daten nachtrainiert, meist mit speichersparenden Verfahren wie LoRA oder QLoRA. Braucht mehr Grafikspeicher als reine Inferenz und deutlich mehr Arbeitsspeicher.
- Training und klassisches Machine Learning: Lange Rechenläufe über Tage. Hier zählen Dauerbetrieb, Fehlerkorrektur im Speicher (ECC) und Kühlung.
- Generative Bild- und Videomodelle: SDXL, Flux und Vergleichbares. Moderat im Speicherbedarf, aber dankbar für schnelle Einzelkarten.
Mischbetrieb ist üblich, etwa ein Team, das tagsüber Inferenz nutzt und nachts Fine-Tuning laufen lässt. Dann gilt die jeweils höhere Anforderung.
Grafikspeicher: die wichtigste Zahl
Ein Sprachmodell muss komplett in den Grafikspeicher passen, sonst läuft es gar nicht oder nur quälend langsam. Wie viel ein Modell braucht, hängt von der Zahl der Parameter und der Genauigkeit ab, mit der die Gewichte gespeichert werden. Die folgenden Richtwerte stammen aus den offiziellen Speichertabellen von Hugging Face für die Llama-3.1-Modellfamilie und gelten für die Modellgewichte. Der Kontextspeicher (KV-Cache) kommt bei langen Eingaben noch obendrauf.
| Workload | Grafikspeicher (Richtwert) | Passende Kartenklasse |
|---|---|---|
| 8B-Modell, Inferenz in 4-Bit | ca. 4 GB | jede Karte im Konfigurator (ab 24 GB) |
| 8B-Modell, Inferenz in FP16 | ca. 16 GB | 24 bis 32 GB (RTX PRO 4000, RTX PRO 4500, GeForce RTX 5090) |
| Bildgenerierung SDXL / Flux | ca. 8 bis 12 GB, Flux komfortabel ab 24 GB | 24 bis 32 GB |
| 8B-Modell, Fine-Tuning mit QLoRA / LoRA | ca. 6 GB / ca. 16 GB (Schätzwerte laut Hugging Face) | 24 bis 32 GB |
| 70B-Modell, Inferenz in 4-Bit | ca. 35 GB für die Gewichte, in der Praxis 40 GB und mehr | 48 GB knapp, 72 GB oder 96 GB (RTX PRO 5000, RTX PRO 6000) |
| 70B-Modell, Fine-Tuning mit QLoRA | ca. 48 GB (Schätzwert) | 72 GB oder 96 GB |
| 70B-Modell mit 128K Kontext | zusätzlich ca. 39 GB KV-Cache in FP16 | 96 GB, bei FP16 mehrere Karten |
| 70B-Modell, Inferenz in FP16 | ca. 140 GB | nur verteilt über 2 oder mehr Karten mit je 96 GB |
Zwei Lehren aus der Tabelle: Erstens ist eine 32-GB-Karte für die 8B-Klasse und für Bildgenerierung vollkommen ausreichend. Zweitens beginnt die 70B-Klasse realistisch bei 48 GB und wird erst mit 96 GB komfortabel, weil dann auch ein großer Kontext hineinpasst. Wer heute 70B-Modelle plant, sollte nicht auf 32 GB sparen.
Welche Grafikkarte: GeForce RTX 5090 oder RTX PRO Blackwell?
Für Workstations stehen bei NVIDIA zwei Welten zur Wahl: die GeForce RTX 5090 aus dem Consumer-Segment und die Serie RTX PRO Blackwell für den professionellen Einsatz. Die Zahlen nach Herstellerangaben:
| Karte | Grafikspeicher | ECC | Leistungsaufnahme | Besonderheit |
|---|---|---|---|---|
| GeForce RTX 5090 | 32 GB GDDR7 | nein | 575 W | schnellste Consumer-Karte, kein MIG, kein RTX-Enterprise-Treiber |
| RTX PRO 4000 Blackwell | 24 GB GDDR7 | ja | 145 W | sparsamer Einstieg mit ECC |
| RTX PRO 4500 Blackwell | 32 GB GDDR7 | ja | 200 W | 32 GB mit ECC |
| RTX PRO 5000 Blackwell | 48 GB oder 72 GB GDDR7 | ja | 300 W | MIG mit bis zu 2 Instanzen, 72-GB-Variante seit Dezember 2025 |
| RTX PRO 6000 Blackwell Workstation Edition | 96 GB GDDR7 | ja | 600 W | MIG mit bis zu 4 Instanzen, Durchström-Kühlung; Nelpx setzt sie in Systemen mit einer Karte ein |
| RTX PRO 6000 Blackwell Max-Q | 96 GB GDDR7 | ja | 300 W | Radiallüfter, von NVIDIA für Systeme mit bis zu 4 Karten vorgesehen |
Die RTX 5090 ist die richtige Wahl für Entwicklung, Prototyping, Bildgenerierung und Modelle bis zur 8B-Klasse in FP16. Sie bietet das beste Preis-Leistungs-Verhältnis, hat aber keinen ECC-Speicher, und NVIDIA lizenziert die GeForce-Treiber nicht für den Einsatz im Rechenzentrum. Für den Dauerbetrieb, für 70B-Modelle und für alles, was mehrere isolierte Instanzen braucht, führt der Weg zur RTX PRO 6000 mit 96 GB: dreifacher Speicher bei gleicher Speicherbandbreite von 1.792 GB/s.
Ein Punkt wird oft falsch verstanden: Zwei Karten mit je 96 GB ergeben keinen gemeinsamen, per NVLink gepoolten Speicher von 192 GB. Weder die RTX 5090 noch die RTX PRO 6000 haben NVLink. Ein Modell, das nicht in eine Karte passt, wird in Software über PCIe 5.0 auf mehrere Karten verteilt (Tensor- oder Pipeline-Parallelismus, etwa mit vLLM). Das funktioniert, skaliert aber nicht verlustfrei. Einen echten Speicherverbund mit NVLink gibt es nur in der Serverklasse, zum Beispiel in NVIDIA-HGX-Systemen. Mehr dazu auf der Seite RTX PRO 6000 Max-Q und im Beitrag RTX 5090 im Server.
Mehrere GPUs: wann es sich lohnt
Mehrere Karten in einer Workstation lohnen sich in drei Fällen: wenn ein Team parallel auf getrennten Karten experimentieren will, wenn ein 70B-Modell in FP16 oder mit sehr großem Kontext laufen soll, oder wenn Fine-Tuning großer Modelle ansteht. Für Systeme mit bis zu vier Karten sieht NVIDIA die Max-Q-Variante der RTX PRO 6000 mit 300 W vor. Sie hat einen Radiallüfter, der die Abluft nach hinten aus dem Gehäuse führt; die 600-W-Workstation-Edition nutzt ein Durchström-Design, bei dem eine untere Karte die warme Luft in die Ansaugung der oberen drückt (so beschreibt es Puget Systems in seinem Vergleich beider Karten). Vier Karten mit zusammen 384 GB Grafikspeicher sind das Maximum, das NVIDIA für die Max-Q vorsieht; darüber beginnt die Serverklasse.
Mit der Zahl der Karten wachsen Netzteil, Wärme und Lautstärke. Ein Quad-GPU-System benötigt ein Netzteil um 2.200 W und sollte in einem eigenen Raum stehen; Nelpx empfiehlt dafür einen eigenen Stromkreis. Ein System mit einer Karte läuft dagegen an einer normalen 230-V-Steckdose und ist mit guter Luftkühlung oder einer 360-mm-Wasserkühlung bürotauglich.
Arbeitsspeicher: die Faustregel 1x, 1,5x, 2x
Der Arbeitsspeicher wird beim Konfigurieren oft unterschätzt. Modelle werden vor dem Laden in die GPU im Arbeitsspeicher entpackt, konvertiert und zwischengespeichert; bei Training laufen zusätzlich Datenpipelines. Ist der Arbeitsspeicher zu klein, lagert das System aus und wird langsam. Der Nelpx-Konfigurator rechnet mit dieser Faustregel:
- Inferenz: mindestens so viel Arbeitsspeicher wie Grafikspeicher (1x)
- Mischbetrieb: das 1,5-Fache
- Training und Fine-Tuning: das Doppelte (2x)
Für eine 96-GB-Karte heißt das 96 GB für Inferenz und 192 GB für Training. Für eine Karte mit 24 bis 32 GB sind 32 bis 64 GB der Startpunkt. Die Plattform bestimmt dabei Kanalzahl und ECC-Fähigkeit: Ryzen und Core Ultra arbeiten mit zwei Speicherkanälen, Threadripper mit vier ECC-RDIMM-Kanälen, Threadripper PRO mit acht. Der Nelpx-Konfigurator bietet nur voll bestückte Kanäle an und reicht auf Ryzen und Core Ultra bis 192 GB, auf Threadripper bis 256 GB und auf Threadripper PRO bis 512 GB. Die Plattformen selbst erlauben laut AMD und Intel mehr (AM5 und Z890 bis 256 GB, Threadripper bis 1 TB, Threadripper PRO bis 2 TB), für Workstation-Aufgaben sind die Konfigurator-Stufen aber die praxisgerechten Ausbaustufen.
ECC-Arbeitsspeicher korrigiert Bitfehler, die sonst lange Rechenläufe abbrechen oder stille Rechenfehler verursachen. Für Training und dauerhafte Inferenz ist er empfehlenswert; die Threadripper-Plattformen bieten ihn mit ECC RDIMM, die RTX-PRO-Karten bringen ECC-Grafikspeicher ab Werk mit. Für Entwicklung und Prototyping genügt schneller Standard-DDR5 ohne ECC.
Plattform und Prozessor
Der Prozessor ist bei KI-Workloads selten der Engpass, die Plattform dahinter aber schon: Sie bestimmt Speicherkanäle, ECC-Fähigkeit und die Zahl der PCIe-Lanes und damit, wie viele Karten mit voller Anbindung laufen.
| Plattform | Prozessoren | Speicher im Konfigurator | GPUs im Konfigurator | Typischer Einsatz |
|---|---|---|---|---|
| AMD AM5 | Ryzen 9 9900X / 9950X, 12 bis 16 Kerne | 2 Kanäle DDR5, bis 192 GB | 1 | Einstieg, Entwicklung, Inferenz mit einer Karte |
| Intel Z890 | Core Ultra 7 / 9, bis 24 Kerne | 2 Kanäle DDR5, bis 192 GB | 1 | wie AM5, Intel-Präferenz |
| AMD TRX50 | Threadripper 9960X bis 9980X, 24 bis 64 Kerne | 4 Kanäle DDR5 ECC RDIMM, bis 256 GB | 1 bis 2 | Dual-GPU-Labor, Fine-Tuning |
| AMD WRX90 | Threadripper PRO bis 9995WX, bis 96 Kerne | 8 Kanäle DDR5 ECC RDIMM, bis 512 GB | 1 bis 4 | Quad-GPU, Training, Mehrbenutzerbetrieb |
Die Threadripper-PRO-Plattform bietet laut AMD 128 PCIe-5.0-Lanes, genug für vier Karten mit je 16 Lanes plus schnellen NVMe-Speicher. Auf AM5 und Z890 bleibt es im Nelpx-Konfigurator bei einer Karte mit voller x16-Anbindung; dafür sind diese Systeme deutlich günstiger und leiser.
Speicher, Kühlung, Strom
- NVMe-SSD: 2 TB sind der Startpunkt für Inferenz, ab 96 GB Grafikspeicher 4 TB, für Training mit großen Datensätzen 8 TB. Modelle in FP16 sind groß: ein 70B-Modell belegt allein rund 140 GB auf der Platte.
- Kühlung: Bei Training und bei RTX 5090 oder RTX PRO 6000 auf Ryzen oder Core Ultra empfiehlt sich eine 360-mm-Wasserkühlung für den Prozessor; Threadripper-Systeme, auch mit mehreren Karten, werden mit großen Luftkühlern betrieben.
- Netzteil: wird zur Konfiguration passend dimensioniert; als Orientierung 1.000 W für eine RTX 5090, 1.600 W ab zwei Karten, 2.200 W ab drei Karten.
- Betriebssystem: Standard ist die Lieferung ohne Betriebssystem. Auf Wunsch lässt sich das System mit Betriebssystem bestellen; ein vorinstallierter KI-Stack mit Treibern, CUDA und Frameworks ist dann wählbar, Umfang und Lizenz nennt das Angebot.
Drei Beispielkonfigurationen
Die folgenden drei Systeme sind Startpunkte aus dem Nelpx-Konfigurator. Jede Komponente lässt sich dort anpassen; der Konfigurator markiert zu Plattform und Einsatzzweck die passende Option.
| System | Prozessor | Grafikkarte | Arbeitsspeicher | Speicher | Wofür |
|---|---|---|---|---|---|
| Einstieg (ab 4.900 € netto) | AMD Ryzen 9 9900X, 12 Kerne | RTX PRO 4000 Blackwell, 24 GB ECC | 64 GB DDR5 | 2 TB NVMe | quantisierte 8B-Modelle, SDXL, klassisches ML |
| LLM-Inferenz | AMD Ryzen 9 9950X, 16 Kerne | RTX PRO 6000 Blackwell, 96 GB ECC | 96 GB DDR5 | 4 TB NVMe | 70B-Modelle in 4-Bit mit großem Kontext, bis 4 MIG-Instanzen |
| Maximalausbau | Threadripper PRO 9995WX, 96 Kerne | 4x RTX PRO 6000 Max-Q, 4x 96 GB ECC | 512 GB DDR5 ECC RDIMM | 8 TB NVMe | 384 GB Grafikspeicher für große Modelle und Mehrbenutzer-Inferenz |
Den konkreten Preis nennt Nelpx im Angebot, netto und mit Liefertermin, nachdem die Konfiguration über den KI-Workstation-Konfigurator angefragt wurde.
Workstation, Mini-Supercomputer oder Server?
Eine Workstation ist die richtige Wahl, solange ein Team direkt an der Maschine arbeitet. Zwei Alternativen sollten trotzdem bekannt sein:
- Kompakte GB10-Systeme wie der NVIDIA DGX Spark: ein Komplettsystem im Desktop-Format mit 128 GB gemeinsamem Speicher für CPU und GPU; ab 23. Oktober 2026 bieten Hersteller-Partner laut NVIDIA zusätzlich eine 64-GB-Variante an. Außer Speicherausbau und SSD-Größe nicht konfigurierbar, dafür klein und leise; für Modelle, die in den gemeinsamen Speicher passen, eine ernsthafte Alternative zur Tower-Workstation. Details auf der Seite DGX Spark kaufen.
- GPU-Server: sobald mehrere Nutzer oder Dienste gleichzeitig auf die GPUs zugreifen, Trainingsläufe Tage dauern, mehr als vier Karten oder NVLink nötig werden. Dann führt der Weg zu RTX-PRO-Servern mit bis zu acht Karten oder zu NVIDIA-HGX-Systemen. Einen Überblick, welche Klasse zu wie vielen gleichzeitigen Anfragen passt, gibt die Seite KI-Server für Unternehmen; die Kostenseite behandelt Was kostet ein GPU-Server?.
Wer sich unsicher ist, welche Klasse passt, kann den Bedarf im KI-Lösungsfinder eingrenzen: Er fragt Modellgröße, Nutzerzahl und Betriebsart ab und schlägt die passende Systemklasse vor.
Checkliste vor der Anfrage
- Welche Modelle sollen laufen, in welcher Größe und Genauigkeit (4-Bit, 8-Bit, FP16)?
- Nur Inferenz, oder auch Fine-Tuning und Training?
- Wie viele Personen oder Dienste nutzen das System gleichzeitig?
- Wie lang sind die Kontexte, etwa bei Dokumentenanalyse?
- Wo steht das Gerät: Büro oder Technikraum, normale Steckdose oder eigener Stromkreis?
- Mit oder ohne Betriebssystem, mit oder ohne vorinstallierten KI-Stack?
- Wächst der Bedarf absehbar über vier Karten hinaus? Dann lohnt der Blick auf die Serverklasse.
Häufige Fragen
Reicht eine GeForce RTX 5090 für ein 70B-Modell?
Nein, auch nicht in 4-Bit-Quantisierung: Die Gewichte allein brauchen rund 35 GB, die Karte hat 32 GB. Für 70B-Modelle beginnt die Auswahl bei 48 GB, komfortabel sind 72 oder 96 GB.
Kann ich mit zwei RTX 5090 den Speicher verdoppeln?
Nicht als gemeinsamen Speicher. Ohne NVLink werden Modelle in Software über PCIe auf die Karten verteilt. Für die 70B-Klasse ist eine RTX PRO 6000 mit 96 GB der sauberere Weg als zwei 32-GB-Karten.
Brauche ich ECC?
Für Dauerbetrieb und lange Trainingsläufe ja. Für Entwicklung und Prototyping mit einer Karte genügt Standard-DDR5; die RTX-PRO-Karten haben ECC-Grafikspeicher ohnehin ab Werk.
Was kostet eine KI-Workstation?
Bei Nelpx beginnt eine KI-Workstation bei 4.900 € netto in der Einstiegskonfiguration mit einer GPU. Ein System mit vier RTX PRO 6000 liegt um ein Vielfaches darüber; den konkreten Preis nennt das Angebot zur jeweiligen Konfiguration.
Weiterführend: KI-Workstation konfigurieren und kaufen · LLM-Server mit Modell-Rechner · NVIDIA RTX Spark Geräte
Quellen: Hugging Face, Speichertabellen zu Llama 3.1 (Inferenz und Fine-Tuning); NVIDIA Produktseiten GeForce RTX 5090 und RTX PRO Blackwell (Speicher, Leistungsaufnahme, MIG, NVLink); AMD Produktseiten Ryzen 9000, Threadripper 9000 und Threadripper PRO 9000 WX (Kerne, Speicherkanäle, PCIe-Lanes). Richtwerte für Bildgenerierung sind Erfahrungswerte aus der Community. Stand: Oktober 2026.