LLM-Server kaufen: Sprachmodelle im eigenen Haus betreiben
Die entscheidende Frage ist nicht die Rechenleistung, sondern der Grafikspeicher: Das Modell muss hineinpassen, dazu der Zwischenspeicher für jede laufende Unterhaltung. Wir rechnen Ihnen den Bedarf aus und sagen, welches System ihn trägt.
IT-Systemhaus für HPC & AI-Infrastruktur · Lieferung EU-weit · Konfiguration, Angebot und Lieferung aus einer Hand
Zusammen rund 111 GB - das passt auf eine H200 NVL mit 141 GB, aber auf keine 96-GB-Karte. Verdoppeln Sie die gleichzeitigen Anfragen, sind es schon 141 GB und eine Karte reicht nicht mehr. Genau solche Sprünge macht der Rechner unten sichtbar.
Was ist ein LLM-Server?
Ein LLM-Server ist ein GPU-Server, auf dem ein großes Sprachmodell im eigenen Haus läuft statt über eine fremde Programmierschnittstelle. Ob ein Modell darauf läuft, entscheidet der Grafikspeicher: Parameterzahl mal Byte je Parameter, plus Zwischenspeicher für jede gleichzeitige Anfrage, plus rund 15 % Reserve. Llama 3.3 70B braucht in FP8 rund 71 GB allein für die Gewichte und passt damit auf eine H200 NVL; DeepSeek-R1 mit 671 Milliarden Parametern braucht rund 671 GB und damit einen Knoten mit acht GPUs.
- Kleines Modell
- ab 4.400 €eine Karte mit 32 GB, netto
- 70 Mrd. Parameter
- ab 26.200 €H200 NVL mit 141 GB, netto
- Frontier-Modell
- ab 149.000 €Acht-GPU-Knoten, netto
Speicherbedarf gerechnet aus den offiziellen Modell-Konfigurationen (Hugging Face, abgerufen am 26.08.2026); Preise sind unsere eigenen Angebotspreise, netto zzgl. USt. Alle Angaben sind Richtwerte für den Inferenzbetrieb - die tatsächliche Belegung hängt am eingesetzten Inferenz-Server.
Passt mein Modell auf welche Hardware?
Modell wählen, Präzision, Kontextlänge und gleichzeitige Anfragen setzen - wir rechnen den Speicherbedarf und nennen das kleinste System aus unserem Programm, das ihn trägt.
Modell
Neun verbreitete offene Modelle sind hinterlegt, mit Parameterzahl und Zwischenspeicher-Bedarf aus ihrer offiziellen Konfiguration. Für alles andere gibt es die freie Eingabe.
Dichtes Modell, 80 Schichten, 8 KV-Köpfe.
Bei eigener Eingabe die Gesamtzahl, nicht die aktiven Parameter.
Aus der Modell-Konfiguration gerechnet. Unbekannt? 250 MiB sind ein brauchbarer Ansatz für ein dichtes Modell.
FP8 wird von vLLM und TensorRT-LLM unterstützt und kostet in der Praxis kaum Qualität.
Präzision der Gewichte
Der größte Hebel überhaupt: Von FP16 auf FP8 halbiert sich der Speicherbedarf, auf INT4 viertelt er sich.
Betrieb
Diese beiden Werte entscheiden über den Zwischenspeicher - und der wird bei langen Kontexten schnell größer als das Modell selbst.
Eine DIN-A4-Seite entspricht grob 500 bis 1.000 Token. 8.000 reichen für Chat, 32.000 für Dokumentenarbeit.
Nicht die Zahl der Nutzer, sondern wie viele davon im selben Moment eine Antwort erzeugen lassen.
Kontakt für die Auslegung
Optional. Ohne Kontaktdaten können Sie die Auslegung trotzdem als PDF mitnehmen.
Ihre Eingaben bleiben beim Ausfüllen vollständig in Ihrem Browser. Es werden keine Daten übertragen, solange Sie nicht aktiv die E-Mail absenden.
Rechenweg: Gewichte = Parameter × Byte je Parameter (FP16 = 2, FP8 = 1, INT4 = 0,5). Zwischenspeicher = Wert je 1.000 Token × Kontext ÷ 1.000 × gleichzeitige Anfragen, bei FP8-Zwischenspeicher halbiert. Reserve = 15 % auf beides zusammen. Die hinterlegten Modellwerte stammen aus den offiziellen Konfigurationsdateien der Modelle.
Vom Entwicklungsgerät bis zum Acht-GPU-Knoten
Was ein System trägt, steht in der ersten Spalte. Wie schnell es antwortet, entscheidet die zweite - dazu gleich mehr.
| System | Speicher | Bandbreite je GPU | Typische Modellklasse | Preis netto |
|---|---|---|---|---|
| NVIDIA DGX SparkEntwicklungsgerät | 128 GB gemeinsam | 273 GB/s | Erprobung bis ca. 70 Mrd. in INT4, ein Nutzer | 5.180 € |
| RTX PRO 4500 Server EditionServerkarte, Single-Slot | 32 GB | - | bis ca. 8 Mrd. in FP8, kleine Modelle in hoher Dichte | ab 4.400 € |
| NVIDIA L40SServerkarte | 48 GB | 864 GB/s | bis ca. 8 Mrd. in FP16, bis 32 Mrd. in INT4 | ab 9.600 € |
| RTX PRO 6000 Server EditionServerkarte | 96 GB | 1.597 GB/s | bis ca. 32 Mrd. in FP16, 70 Mrd. in INT4 | 15.200 € |
| NVIDIA H200 NVLServerkarte, NVLink-Brücken | 141 GB | 4,8 TB/s | 70 Mrd. in FP8 auf einer Karte | ab 26.200 € |
| GIGABYTE XL448 × RTX PRO 6000 | 768 GB | 1.597 GB/s | Modelle bis ca. 400 Mrd. in FP8 | ab 149.000 € |
| HGX H2008 GPUs, NVLink | 1,1 TB | 4,8 TB/s | DeepSeek-R1 671 Mrd. in FP8, ein Knoten | auf Anfrage |
| HGX B2008 Blackwell-GPUs | 1,4 TB | - | Frontier-Modelle mit Reserve für Kontext | ab 370.000 € |
| HGX B3008 Blackwell-GPUs | 2,1 TB | - | größte Modelle, viele parallele Nutzer | ab 450.000 € |
Speicher- und Bandbreitenangaben aus unseren Produktseiten. Für die RTX PRO 4500 Server Edition sowie HGX B200 und B300 nennen wir hier bewusst keine Bandbreite, weil auf unseren Seiten dazu keine eindeutigen Werte je GPU belegt sind. „Typische Modellklasse" ist eine Einordnung für den Inferenzbetrieb, keine Zusage - maßgeblich ist die Rechnung oben. Die Lieferlage unterscheidet sich je Produkt: H200 NVL und HGX B200 laufen derzeit über Allokation, den tagesaktuellen Stand nennen wir im Angebot.
Speicher entscheidet ob, Bandbreite entscheidet wie schnell
Beim Erzeugen einer Antwort liest die GPU für jedes einzelne Token die benötigten Gewichte erneut aus dem Speicher. Deshalb hängt die Ausgabegeschwindigkeit fast vollständig an der Speicherbandbreite - nicht an der Rechenleistung.
128 GB gemeinsamer Speicher klingen nach mehr als die 141 GB einer H200. Bei 273 GB/s gegenüber 4,8 TB/s liegen zwischen beiden aber Welten in der Ausgabegeschwindigkeit. Als Entwicklungsgerät hervorragend, als Produktionsserver für ein Team nicht geeignet.
Modelle mit Experten aktivieren pro Token nur einen Teil ihrer Gewichte - bei DeepSeek-R1 sind es 37 von 671 Milliarden. Sie brauchen viel Speicher, lesen daraus aber wenig. Das macht sie auf großen Knoten überraschend flott.
Verteilt sich ein Modell über mehrere GPUs, tauschen die Karten bei jedem Token Zwischenergebnisse aus. Über NVLink geht das deutlich schneller als über PCIe. Auf einer einzelnen Karte spielt es keine Rolle - über acht Karten hinweg entscheidet es mit.
Bandbreiten: DGX Spark 273 GB/s, L40S 864 GB/s, RTX PRO 6000 Server Edition 1.597 GB/s, H200 NVL 4,8 TB/s - jeweils Herstellerangaben von unseren Produktseiten. Tokens pro Sekunde nennen wir bewusst nicht: Der Durchsatz hängt an Inferenz-Server, Batchgröße und Kontextlänge, jede pauschale Zahl wäre eine Zusage, die wir nicht halten könnten.
Neun Modelle, nachgerechnet aus ihrer Konfiguration
Diese Werte liegen dem Rechner zugrunde. Der Zwischenspeicher ist aus Schichtzahl, KV-Köpfen und Kopfbreite der offiziellen Konfigurationsdatei gerechnet, nicht geschätzt.
| Modell | Parameter | Gewichte FP8 | Gewichte INT4 | Zwischenspeicher je 1.000 Token |
|---|---|---|---|---|
| Llama 3.1 8B | 8,0 Mrd. | 8 GB | 4 GB | 125 MiB |
| gpt-oss-20bMoE, nativ MXFP4 | 20,9 Mrd. | 21 GB | 10 GB | 47 MiB |
| Mistral Small 24B | 23,6 Mrd. | 24 GB | 12 GB | 156 MiB |
| Qwen3 32B | 32,8 Mrd. | 33 GB | 16 GB | 250 MiB |
| Llama 3.3 70B | 70,6 Mrd. | 71 GB | 35 GB | 312 MiB |
| Llama 4 ScoutMoE, 17 Mrd. aktiv | 109 Mrd. | 109 GB | 55 GB | 188 MiB |
| gpt-oss-120bMoE, nativ MXFP4 | 116,8 Mrd. | 117 GB | 58 GB | 70 MiB |
| Qwen3 235B-A22BMoE, 22 Mrd. aktiv | 235 Mrd. | 235 GB | 118 GB | 184 MiB |
| DeepSeek-R1MoE, 37 Mrd. aktiv, MLA | 671 Mrd. | 671 GB | 336 GB | 67 MiB |
Quelle: die offiziellen config.json-Dateien der Modelle auf Hugging Face, abgerufen am 26.08.2026. Zwischenspeicher gerechnet als 2 × Schichten × KV-Köpfe × Kopfbreite × 2 Byte je Token; bei DeepSeek-R1 nach dem Verfahren der latenten Aufmerksamkeit als Schichten × 576 × 2 Byte, was den auffällig niedrigen Wert erklärt. Bei gpt-oss liegen die Expertengewichte bereits nativ in MXFP4 vor - FP8- und INT4-Spalte sind dort rechnerische Größen; in der Praxis belegt gpt-oss-120b rund 60 bis 65 GB. Der DeepSeek-R1-Prüfpunkt enthält zusätzlich rund 14 Mrd. Parameter für Multi-Token-Prediction, zusammen also 685 statt 671 Milliarden - wer sie mitlädt, rechnet entsprechend 14 GB mehr.
Eigener Server oder fremde Programmierschnittstelle?
Wir verkaufen Hardware, deshalb hier die Gegenrede gleich mit: Nicht jedes Vorhaben braucht einen eigenen LLM-Server.
Für den eigenen Server spricht
- Kein Prompt und kein Dokument verlässt das Haus - das vereinfacht Datenschutzprüfung, Betriebsvereinbarung und Berufsgeheimnisse erheblich.
- Planbare Kosten statt Abrechnung je Token, gerade bei Massenverarbeitung von Dokumenten.
- Ein Modellstand, den Sie selbst festlegen - keine stille Aktualisierung unter laufenden Anwendungen.
- Feinabstimmung auf eigene Daten bleibt im Haus.
- Keine Abhängigkeit von Verfügbarkeit und Preisliste eines Anbieters.
Dagegen spricht
- Geringe oder schubweise Nutzung: Ein Server, der zu 5 % ausgelastet ist, rechnet sich selten.
- Die stärksten geschlossenen Modelle bekommen Sie nicht auf eigene Hardware - offene Modelle sind gut, aber nicht in jeder Disziplin gleichauf.
- Betrieb, Aktualisierung und Überwachung muss jemand übernehmen.
- Unklarer Bedarf: Wer die Modellgröße noch sucht, kauft leicht am Ziel vorbei.
- Strom, Kühlung und Stellplatz kommen dazu - je nach System spürbar.
Fragen zum LLM-Server
Was ist ein LLM-Server?
Ein LLM-Server ist ein GPU-Server, auf dem ein großes Sprachmodell im eigenen Haus läuft, statt über eine fremde Programmierschnittstelle. Entscheidend ist der Grafikspeicher: Das Modell muss vollständig hineinpassen, dazu der Zwischenspeicher für die laufenden Unterhaltungen. Bei Nelpx reicht die Spanne von einer einzelnen Karte mit 32 GB für kleine Modelle bis zu einem Acht-GPU-Knoten mit 1,1 bis 2,1 TB für Modelle mit mehreren hundert Milliarden Parametern.
Wie viel VRAM braucht ein Sprachmodell?
Als Rechnung: Parameterzahl mal Byte je Parameter, plus Zwischenspeicher, plus rund 15 Prozent Reserve. Ein Byte je Parameter entspricht FP8, zwei Byte FP16, ein halbes Byte INT4. Llama 3.3 70B braucht damit rund 71 GB in FP8 und rund 141 GB in FP16, jeweils vor dem Zwischenspeicher. DeepSeek-R1 mit 671 Milliarden Parametern liegt in FP8 bei rund 671 GB und passt damit in einen Acht-GPU-Knoten, nicht auf eine einzelne Karte.
Welche GPU für welches Modell?
Modelle bis etwa 8 Milliarden Parameter laufen auf einer RTX PRO 4500 Server Edition mit 32 GB oder einer NVIDIA L40S mit 48 GB. Für Modelle bis rund 32 Milliarden Parameter passt eine RTX PRO 6000 Server Edition mit 96 GB, für 70 Milliarden in FP8 eine H200 NVL mit 141 GB. Ab etwa 100 Milliarden Parametern braucht es mehrere Karten in einem Knoten, ab mehreren hundert Milliarden eine HGX-Plattform mit acht GPUs. Der Rechner auf dieser Seite ordnet Ihr Modell konkret zu.
Was ist der KV-Cache und warum ist er wichtig?
Der KV-Cache hält die bereits verarbeiteten Token einer Unterhaltung im Speicher, damit das Modell sie nicht erneut berechnen muss. Er wächst mit der Kontextlänge und mit jeder gleichzeitigen Anfrage. Bei Llama 3.3 70B sind es rund 312 MiB je 1.000 Token und Anfrage: 20 gleichzeitige Unterhaltungen mit 8.000 Token Kontext belegen damit etwa 50 GB zusätzlich - so viel wie eine komplette L40S.
Reicht ein DGX Spark als LLM-Server?
Für Entwicklung und Erprobung ja, für den Mehrbenutzerbetrieb nein. Der DGX Spark hat zwar 128 GB gemeinsamen Speicher und damit mehr als eine H200 NVL, erreicht aber nur 273 GB/s Speicherbandbreite gegenüber 4,8 TB/s bei der H200. Da die Textausgabe eines Sprachmodells fast vollständig von der Bandbreite abhängt, ist der Spark ein hervorragendes Entwicklungsgerät und ein schlechter Produktionsserver.
Was kostet ein LLM-Server?
Bei Nelpx beginnt eine einzelne Serverkarte für kleine Modelle bei 4.400 € netto (RTX PRO 4500 Server Edition, 32 GB); die nächstgrößere Stufe ist eine NVIDIA L40S mit 48 GB ab 9.600 € netto. Eine RTX PRO 6000 Server Edition mit 96 GB kostet 15.200 € netto, eine H200 NVL mit 141 GB ab 26.200 € netto. Ein kompletter Acht-GPU-Server mit RTX-PRO-Karten liegt ab 149.000 € netto, eine HGX-Plattform ab 370.000 € netto. Die laufenden Kosten rechnen Sie auf unserer Seite zu den Gesamtkosten eines GPU-Servers durch.
Welche Software läuft auf einem LLM-Server?
Verbreitet sind vLLM und NVIDIA TensorRT-LLM als Inferenz-Server, dazu NVIDIA NIM als fertig paketierte Variante und Ollama für Einzelplätze. Alle stellen eine zur OpenAI-Schnittstelle kompatible Programmierschnittstelle bereit, sodass bestehende Anwendungen meist nur die Adresse wechseln müssen. Nelpx liefert die Hardware vorbereitet aus; die Auswahl des Inferenz-Servers klären wir im Projektgespräch.
Warum ein eigener LLM-Server statt einer Programmierschnittstelle?
Vor allem wegen der Daten: Auf eigener Hardware verlässt kein Prompt und kein Dokument das Haus, was Betriebsvereinbarungen, Berufsgeheimnisse und Datenschutzprüfungen deutlich vereinfacht. Dazu kommen planbare Kosten ohne Abrechnung je Token und die Freiheit, ein Modell dauerhaft in einer geprüften Version zu betreiben. Dagegen sprechen der einmalige Anschaffungsaufwand und der Betrieb, den jemand übernehmen muss.
Wie viele Nutzer schafft ein LLM-Server?
Eine seriöse Zahl lässt sich ohne Test nicht nennen, weil sie an Modell, Kontextlänge, Antwortlänge und Inferenz-Server hängt. Planbar ist dagegen der Speicher: Jede gleichzeitige Anfrage belegt Zwischenspeicher, und wenn der voll ist, stellt der Server weitere Anfragen in die Warteschlange. Der Rechner auf dieser Seite zeigt genau diesen Zusammenhang - Nelpx nennt bewusst keine Tokens-pro-Sekunde-Zusage.
Was bedeutet Quantisierung für den Speicherbedarf?
Quantisierung speichert die Modellgewichte mit weniger Bit. Von FP16 auf FP8 halbiert sich der Speicherbedarf, von FP16 auf INT4 sinkt er auf ein Viertel. Moderne Modelle mit vielen Experten vertragen das gut, weil der Fehler auf einzelne Experten begrenzt bleibt. Manche Modelle liegen bereits nativ in kleinem Format vor: gpt-oss wird in MXFP4 ausgeliefert und passt deshalb mit 117 Milliarden Parametern auf eine einzelne 80-GB-Karte.
Braucht ein LLM-Server NVLink?
Sobald ein Modell über mehrere GPUs verteilt wird, tauschen die Karten bei jedem Token Zwischenergebnisse aus. Über NVLink läuft das deutlich schneller als über PCIe. Für ein Modell, das auf eine Karte passt, spielt NVLink keine Rolle; für ein auf acht Karten verteiltes Modell ist es der Unterschied zwischen flüssig und zäh. Die H200 NVL lässt sich dafür über steckbare Brücken zu Zweier- oder Vierergruppen koppeln - eine Vierergruppe wirkt wie ein Beschleuniger mit 564 GB. HGX-Plattformen haben NVLink fest auf der Platine.
Wo kann ich einen LLM-Server kaufen?
Nelpx liefert LLM-Server EU-weit, von der einzelnen Beschleunigerkarte bis zur HGX-Plattform mit acht GPUs, als offizieller GIGABYTE-Partner auch direkt über den Herstellerkanal. Sie schicken uns Modell, Kontextlänge und die erwartete Zahl gleichzeitiger Nutzer; wir stellen das passende System zusammen und nennen Preis und Liefertermin.
Schicken Sie uns Ihr Modell, wir legen den Server aus
Modell, Kontextlänge und die erwartete Zahl gleichzeitiger Nutzer genügen. Sie bekommen einen Vorschlag mit Speicherreserve, Preis und Liefertermin - und eine ehrliche Rückmeldung, wenn ein kleineres System reicht.
LLM-Server kaufen: Sprachmodelle im eigenen Haus betreiben
Die entscheidende Frage ist nicht die Rechenleistung, sondern der Grafikspeicher: Das Modell muss hineinpassen, dazu der Zwischenspeicher für jede laufende Unterhaltung. Wir rechnen Ihnen den Bedarf aus und sagen, welches System ihn trägt.
IT-Systemhaus für HPC & AI-Infrastruktur · Lieferung EU-weit · Konfiguration, Angebot und Lieferung aus einer Hand
Zusammen rund 111 GB - das passt auf eine H200 NVL mit 141 GB, aber auf keine 96-GB-Karte. Verdoppeln Sie die gleichzeitigen Anfragen, sind es schon 141 GB und eine Karte reicht nicht mehr. Genau solche Sprünge macht der Rechner unten sichtbar.
Was ist ein LLM-Server?
Ein LLM-Server ist ein GPU-Server, auf dem ein großes Sprachmodell im eigenen Haus läuft statt über eine fremde Programmierschnittstelle. Ob ein Modell darauf läuft, entscheidet der Grafikspeicher: Parameterzahl mal Byte je Parameter, plus Zwischenspeicher für jede gleichzeitige Anfrage, plus rund 15 % Reserve. Llama 3.3 70B braucht in FP8 rund 71 GB allein für die Gewichte und passt damit auf eine H200 NVL; DeepSeek-R1 mit 671 Milliarden Parametern braucht rund 671 GB und damit einen Knoten mit acht GPUs.
- Kleines Modell
- ab 4.400 €eine Karte mit 32 GB, netto
- 70 Mrd. Parameter
- ab 26.200 €H200 NVL mit 141 GB, netto
- Frontier-Modell
- ab 149.000 €Acht-GPU-Knoten, netto
Speicherbedarf gerechnet aus den offiziellen Modell-Konfigurationen (Hugging Face, abgerufen am 26.08.2026); Preise sind unsere eigenen Angebotspreise, netto zzgl. USt. Alle Angaben sind Richtwerte für den Inferenzbetrieb - die tatsächliche Belegung hängt am eingesetzten Inferenz-Server.
Passt mein Modell auf welche Hardware?
Modell wählen, Präzision, Kontextlänge und gleichzeitige Anfragen setzen - wir rechnen den Speicherbedarf und nennen das kleinste System aus unserem Programm, das ihn trägt.
Modell
Neun verbreitete offene Modelle sind hinterlegt, mit Parameterzahl und Zwischenspeicher-Bedarf aus ihrer offiziellen Konfiguration. Für alles andere gibt es die freie Eingabe.
Dichtes Modell, 80 Schichten, 8 KV-Köpfe.
Bei eigener Eingabe die Gesamtzahl, nicht die aktiven Parameter.
Aus der Modell-Konfiguration gerechnet. Unbekannt? 250 MiB sind ein brauchbarer Ansatz für ein dichtes Modell.
FP8 wird von vLLM und TensorRT-LLM unterstützt und kostet in der Praxis kaum Qualität.
Präzision der Gewichte
Der größte Hebel überhaupt: Von FP16 auf FP8 halbiert sich der Speicherbedarf, auf INT4 viertelt er sich.
Betrieb
Diese beiden Werte entscheiden über den Zwischenspeicher - und der wird bei langen Kontexten schnell größer als das Modell selbst.
Eine DIN-A4-Seite entspricht grob 500 bis 1.000 Token. 8.000 reichen für Chat, 32.000 für Dokumentenarbeit.
Nicht die Zahl der Nutzer, sondern wie viele davon im selben Moment eine Antwort erzeugen lassen.
Kontakt für die Auslegung
Optional. Ohne Kontaktdaten können Sie die Auslegung trotzdem als PDF mitnehmen.
Ihre Eingaben bleiben beim Ausfüllen vollständig in Ihrem Browser. Es werden keine Daten übertragen, solange Sie nicht aktiv die E-Mail absenden.
Rechenweg: Gewichte = Parameter × Byte je Parameter (FP16 = 2, FP8 = 1, INT4 = 0,5). Zwischenspeicher = Wert je 1.000 Token × Kontext ÷ 1.000 × gleichzeitige Anfragen, bei FP8-Zwischenspeicher halbiert. Reserve = 15 % auf beides zusammen. Die hinterlegten Modellwerte stammen aus den offiziellen Konfigurationsdateien der Modelle.
Vom Entwicklungsgerät bis zum Acht-GPU-Knoten
Was ein System trägt, steht in der ersten Spalte. Wie schnell es antwortet, entscheidet die zweite - dazu gleich mehr.
| System | Speicher | Bandbreite je GPU | Typische Modellklasse | Preis netto |
|---|---|---|---|---|
| NVIDIA DGX SparkEntwicklungsgerät | 128 GB gemeinsam | 273 GB/s | Erprobung bis ca. 70 Mrd. in INT4, ein Nutzer | 5.180 € |
| RTX PRO 4500 Server EditionServerkarte, Single-Slot | 32 GB | - | bis ca. 8 Mrd. in FP8, kleine Modelle in hoher Dichte | ab 4.400 € |
| NVIDIA L40SServerkarte | 48 GB | 864 GB/s | bis ca. 8 Mrd. in FP16, bis 32 Mrd. in INT4 | ab 9.600 € |
| RTX PRO 6000 Server EditionServerkarte | 96 GB | 1.597 GB/s | bis ca. 32 Mrd. in FP16, 70 Mrd. in INT4 | 15.200 € |
| NVIDIA H200 NVLServerkarte, NVLink-Brücken | 141 GB | 4,8 TB/s | 70 Mrd. in FP8 auf einer Karte | ab 26.200 € |
| GIGABYTE XL448 × RTX PRO 6000 | 768 GB | 1.597 GB/s | Modelle bis ca. 400 Mrd. in FP8 | ab 149.000 € |
| HGX H2008 GPUs, NVLink | 1,1 TB | 4,8 TB/s | DeepSeek-R1 671 Mrd. in FP8, ein Knoten | auf Anfrage |
| HGX B2008 Blackwell-GPUs | 1,4 TB | - | Frontier-Modelle mit Reserve für Kontext | ab 370.000 € |
| HGX B3008 Blackwell-GPUs | 2,1 TB | - | größte Modelle, viele parallele Nutzer | ab 450.000 € |
Speicher- und Bandbreitenangaben aus unseren Produktseiten. Für die RTX PRO 4500 Server Edition sowie HGX B200 und B300 nennen wir hier bewusst keine Bandbreite, weil auf unseren Seiten dazu keine eindeutigen Werte je GPU belegt sind. „Typische Modellklasse" ist eine Einordnung für den Inferenzbetrieb, keine Zusage - maßgeblich ist die Rechnung oben. Die Lieferlage unterscheidet sich je Produkt: H200 NVL und HGX B200 laufen derzeit über Allokation, den tagesaktuellen Stand nennen wir im Angebot.
Speicher entscheidet ob, Bandbreite entscheidet wie schnell
Beim Erzeugen einer Antwort liest die GPU für jedes einzelne Token die benötigten Gewichte erneut aus dem Speicher. Deshalb hängt die Ausgabegeschwindigkeit fast vollständig an der Speicherbandbreite - nicht an der Rechenleistung.
128 GB gemeinsamer Speicher klingen nach mehr als die 141 GB einer H200. Bei 273 GB/s gegenüber 4,8 TB/s liegen zwischen beiden aber Welten in der Ausgabegeschwindigkeit. Als Entwicklungsgerät hervorragend, als Produktionsserver für ein Team nicht geeignet.
Modelle mit Experten aktivieren pro Token nur einen Teil ihrer Gewichte - bei DeepSeek-R1 sind es 37 von 671 Milliarden. Sie brauchen viel Speicher, lesen daraus aber wenig. Das macht sie auf großen Knoten überraschend flott.
Verteilt sich ein Modell über mehrere GPUs, tauschen die Karten bei jedem Token Zwischenergebnisse aus. Über NVLink geht das deutlich schneller als über PCIe. Auf einer einzelnen Karte spielt es keine Rolle - über acht Karten hinweg entscheidet es mit.
Bandbreiten: DGX Spark 273 GB/s, L40S 864 GB/s, RTX PRO 6000 Server Edition 1.597 GB/s, H200 NVL 4,8 TB/s - jeweils Herstellerangaben von unseren Produktseiten. Tokens pro Sekunde nennen wir bewusst nicht: Der Durchsatz hängt an Inferenz-Server, Batchgröße und Kontextlänge, jede pauschale Zahl wäre eine Zusage, die wir nicht halten könnten.
Neun Modelle, nachgerechnet aus ihrer Konfiguration
Diese Werte liegen dem Rechner zugrunde. Der Zwischenspeicher ist aus Schichtzahl, KV-Köpfen und Kopfbreite der offiziellen Konfigurationsdatei gerechnet, nicht geschätzt.
| Modell | Parameter | Gewichte FP8 | Gewichte INT4 | Zwischenspeicher je 1.000 Token |
|---|---|---|---|---|
| Llama 3.1 8B | 8,0 Mrd. | 8 GB | 4 GB | 125 MiB |
| gpt-oss-20bMoE, nativ MXFP4 | 20,9 Mrd. | 21 GB | 10 GB | 47 MiB |
| Mistral Small 24B | 23,6 Mrd. | 24 GB | 12 GB | 156 MiB |
| Qwen3 32B | 32,8 Mrd. | 33 GB | 16 GB | 250 MiB |
| Llama 3.3 70B | 70,6 Mrd. | 71 GB | 35 GB | 312 MiB |
| Llama 4 ScoutMoE, 17 Mrd. aktiv | 109 Mrd. | 109 GB | 55 GB | 188 MiB |
| gpt-oss-120bMoE, nativ MXFP4 | 116,8 Mrd. | 117 GB | 58 GB | 70 MiB |
| Qwen3 235B-A22BMoE, 22 Mrd. aktiv | 235 Mrd. | 235 GB | 118 GB | 184 MiB |
| DeepSeek-R1MoE, 37 Mrd. aktiv, MLA | 671 Mrd. | 671 GB | 336 GB | 67 MiB |
Quelle: die offiziellen config.json-Dateien der Modelle auf Hugging Face, abgerufen am 26.08.2026. Zwischenspeicher gerechnet als 2 × Schichten × KV-Köpfe × Kopfbreite × 2 Byte je Token; bei DeepSeek-R1 nach dem Verfahren der latenten Aufmerksamkeit als Schichten × 576 × 2 Byte, was den auffällig niedrigen Wert erklärt. Bei gpt-oss liegen die Expertengewichte bereits nativ in MXFP4 vor - FP8- und INT4-Spalte sind dort rechnerische Größen; in der Praxis belegt gpt-oss-120b rund 60 bis 65 GB. Der DeepSeek-R1-Prüfpunkt enthält zusätzlich rund 14 Mrd. Parameter für Multi-Token-Prediction, zusammen also 685 statt 671 Milliarden - wer sie mitlädt, rechnet entsprechend 14 GB mehr.
Eigener Server oder fremde Programmierschnittstelle?
Wir verkaufen Hardware, deshalb hier die Gegenrede gleich mit: Nicht jedes Vorhaben braucht einen eigenen LLM-Server.
Für den eigenen Server spricht
- Kein Prompt und kein Dokument verlässt das Haus - das vereinfacht Datenschutzprüfung, Betriebsvereinbarung und Berufsgeheimnisse erheblich.
- Planbare Kosten statt Abrechnung je Token, gerade bei Massenverarbeitung von Dokumenten.
- Ein Modellstand, den Sie selbst festlegen - keine stille Aktualisierung unter laufenden Anwendungen.
- Feinabstimmung auf eigene Daten bleibt im Haus.
- Keine Abhängigkeit von Verfügbarkeit und Preisliste eines Anbieters.
Dagegen spricht
- Geringe oder schubweise Nutzung: Ein Server, der zu 5 % ausgelastet ist, rechnet sich selten.
- Die stärksten geschlossenen Modelle bekommen Sie nicht auf eigene Hardware - offene Modelle sind gut, aber nicht in jeder Disziplin gleichauf.
- Betrieb, Aktualisierung und Überwachung muss jemand übernehmen.
- Unklarer Bedarf: Wer die Modellgröße noch sucht, kauft leicht am Ziel vorbei.
- Strom, Kühlung und Stellplatz kommen dazu - je nach System spürbar.
Fragen zum LLM-Server
Was ist ein LLM-Server?
Ein LLM-Server ist ein GPU-Server, auf dem ein großes Sprachmodell im eigenen Haus läuft, statt über eine fremde Programmierschnittstelle. Entscheidend ist der Grafikspeicher: Das Modell muss vollständig hineinpassen, dazu der Zwischenspeicher für die laufenden Unterhaltungen. Bei Nelpx reicht die Spanne von einer einzelnen Karte mit 32 GB für kleine Modelle bis zu einem Acht-GPU-Knoten mit 1,1 bis 2,1 TB für Modelle mit mehreren hundert Milliarden Parametern.
Wie viel VRAM braucht ein Sprachmodell?
Als Rechnung: Parameterzahl mal Byte je Parameter, plus Zwischenspeicher, plus rund 15 Prozent Reserve. Ein Byte je Parameter entspricht FP8, zwei Byte FP16, ein halbes Byte INT4. Llama 3.3 70B braucht damit rund 71 GB in FP8 und rund 141 GB in FP16, jeweils vor dem Zwischenspeicher. DeepSeek-R1 mit 671 Milliarden Parametern liegt in FP8 bei rund 671 GB und passt damit in einen Acht-GPU-Knoten, nicht auf eine einzelne Karte.
Welche GPU für welches Modell?
Modelle bis etwa 8 Milliarden Parameter laufen auf einer RTX PRO 4500 Server Edition mit 32 GB oder einer NVIDIA L40S mit 48 GB. Für Modelle bis rund 32 Milliarden Parameter passt eine RTX PRO 6000 Server Edition mit 96 GB, für 70 Milliarden in FP8 eine H200 NVL mit 141 GB. Ab etwa 100 Milliarden Parametern braucht es mehrere Karten in einem Knoten, ab mehreren hundert Milliarden eine HGX-Plattform mit acht GPUs. Der Rechner auf dieser Seite ordnet Ihr Modell konkret zu.
Was ist der KV-Cache und warum ist er wichtig?
Der KV-Cache hält die bereits verarbeiteten Token einer Unterhaltung im Speicher, damit das Modell sie nicht erneut berechnen muss. Er wächst mit der Kontextlänge und mit jeder gleichzeitigen Anfrage. Bei Llama 3.3 70B sind es rund 312 MiB je 1.000 Token und Anfrage: 20 gleichzeitige Unterhaltungen mit 8.000 Token Kontext belegen damit etwa 50 GB zusätzlich - so viel wie eine komplette L40S.
Reicht ein DGX Spark als LLM-Server?
Für Entwicklung und Erprobung ja, für den Mehrbenutzerbetrieb nein. Der DGX Spark hat zwar 128 GB gemeinsamen Speicher und damit mehr als eine H200 NVL, erreicht aber nur 273 GB/s Speicherbandbreite gegenüber 4,8 TB/s bei der H200. Da die Textausgabe eines Sprachmodells fast vollständig von der Bandbreite abhängt, ist der Spark ein hervorragendes Entwicklungsgerät und ein schlechter Produktionsserver.
Was kostet ein LLM-Server?
Bei Nelpx beginnt eine einzelne Serverkarte für kleine Modelle bei 4.400 € netto (RTX PRO 4500 Server Edition, 32 GB); die nächstgrößere Stufe ist eine NVIDIA L40S mit 48 GB ab 9.600 € netto. Eine RTX PRO 6000 Server Edition mit 96 GB kostet 15.200 € netto, eine H200 NVL mit 141 GB ab 26.200 € netto. Ein kompletter Acht-GPU-Server mit RTX-PRO-Karten liegt ab 149.000 € netto, eine HGX-Plattform ab 370.000 € netto. Die laufenden Kosten rechnen Sie auf unserer Seite zu den Gesamtkosten eines GPU-Servers durch.
Welche Software läuft auf einem LLM-Server?
Verbreitet sind vLLM und NVIDIA TensorRT-LLM als Inferenz-Server, dazu NVIDIA NIM als fertig paketierte Variante und Ollama für Einzelplätze. Alle stellen eine zur OpenAI-Schnittstelle kompatible Programmierschnittstelle bereit, sodass bestehende Anwendungen meist nur die Adresse wechseln müssen. Nelpx liefert die Hardware vorbereitet aus; die Auswahl des Inferenz-Servers klären wir im Projektgespräch.
Warum ein eigener LLM-Server statt einer Programmierschnittstelle?
Vor allem wegen der Daten: Auf eigener Hardware verlässt kein Prompt und kein Dokument das Haus, was Betriebsvereinbarungen, Berufsgeheimnisse und Datenschutzprüfungen deutlich vereinfacht. Dazu kommen planbare Kosten ohne Abrechnung je Token und die Freiheit, ein Modell dauerhaft in einer geprüften Version zu betreiben. Dagegen sprechen der einmalige Anschaffungsaufwand und der Betrieb, den jemand übernehmen muss.
Wie viele Nutzer schafft ein LLM-Server?
Eine seriöse Zahl lässt sich ohne Test nicht nennen, weil sie an Modell, Kontextlänge, Antwortlänge und Inferenz-Server hängt. Planbar ist dagegen der Speicher: Jede gleichzeitige Anfrage belegt Zwischenspeicher, und wenn der voll ist, stellt der Server weitere Anfragen in die Warteschlange. Der Rechner auf dieser Seite zeigt genau diesen Zusammenhang - Nelpx nennt bewusst keine Tokens-pro-Sekunde-Zusage.
Was bedeutet Quantisierung für den Speicherbedarf?
Quantisierung speichert die Modellgewichte mit weniger Bit. Von FP16 auf FP8 halbiert sich der Speicherbedarf, von FP16 auf INT4 sinkt er auf ein Viertel. Moderne Modelle mit vielen Experten vertragen das gut, weil der Fehler auf einzelne Experten begrenzt bleibt. Manche Modelle liegen bereits nativ in kleinem Format vor: gpt-oss wird in MXFP4 ausgeliefert und passt deshalb mit 117 Milliarden Parametern auf eine einzelne 80-GB-Karte.
Braucht ein LLM-Server NVLink?
Sobald ein Modell über mehrere GPUs verteilt wird, tauschen die Karten bei jedem Token Zwischenergebnisse aus. Über NVLink läuft das deutlich schneller als über PCIe. Für ein Modell, das auf eine Karte passt, spielt NVLink keine Rolle; für ein auf acht Karten verteiltes Modell ist es der Unterschied zwischen flüssig und zäh. Die H200 NVL lässt sich dafür über steckbare Brücken zu Zweier- oder Vierergruppen koppeln - eine Vierergruppe wirkt wie ein Beschleuniger mit 564 GB. HGX-Plattformen haben NVLink fest auf der Platine.
Wo kann ich einen LLM-Server kaufen?
Nelpx liefert LLM-Server EU-weit, von der einzelnen Beschleunigerkarte bis zur HGX-Plattform mit acht GPUs, als offizieller GIGABYTE-Partner auch direkt über den Herstellerkanal. Sie schicken uns Modell, Kontextlänge und die erwartete Zahl gleichzeitiger Nutzer; wir stellen das passende System zusammen und nennen Preis und Liefertermin.
Schicken Sie uns Ihr Modell, wir legen den Server aus
Modell, Kontextlänge und die erwartete Zahl gleichzeitiger Nutzer genügen. Sie bekommen einen Vorschlag mit Speicherreserve, Preis und Liefertermin - und eine ehrliche Rückmeldung, wenn ein kleineres System reicht.