NVIDIA L40S kaufen — die Universal-GPU für GenAI & Grafik
Eine Karte für KI, Rendering und Video: 48 GB GDDR6, 4. Generation Tensor Cores mit FP8 und bis zu 1.466 TFLOPS. Nelpx GmbH liefert, plant und integriert Ihre L40S im DACH-Raum — luft- oder flüssigekühlt, inklusive Strom-, Kühlungs- und Netzwerkkonzept.
Was ist die NVIDIA L40S?
Die NVIDIA L40S ist eine Universal-Rechenzentrums-GPU auf Basis der Ada-Lovelace-Architektur. Sie kombiniert KI-Beschleunigung, professionelle Grafik und Medien-Verarbeitung auf einer einzigen Karte — und ist damit der Allrounder für Unternehmen, die generative KI, LLM-Inferenz, Rendering und Video auf derselben Infrastruktur betreiben wollen.
Im Zentrum stehen 48 GB GDDR6-Speicher mit ECC und eine Speicherbandbreite von 864 GB/s. Damit lassen sich Modelle im Bereich von rund 40 bis 70 Milliarden Parametern bei moderaten Batch-Größen sinnvoll betreiben — insbesondere FP8-quantisiert. Die 4. Generation der Tensor Cores mit Transformer Engine schaltet während der Berechnung automatisch zwischen FP8 und FP16 um und liefert so bis zu 1.466 TFLOPS FP8 (mit Sparsity).
Anders als reine Trainings-Beschleuniger bringt die L40S zusätzlich 142 RT Cores der 3. Generation und Hardware-Encoder mit. Drei NVENC- und drei NVDEC-Engines mit AV1-Unterstützung machen sie zur idealen Plattform für Rendering, Echtzeit-3D, Video-Transcoding und NVIDIA-Omniverse-Workflows. Diese Doppelrolle aus Compute und Visualisierung unterscheidet sie deutlich von H100/H200, die rein auf KI-Durchsatz ausgelegt sind.
Die L40S kommt als passiv gekühlte Dual-Slot-PCIe-Karte (350 W) und lässt sich damit in gängige Standard-Server einbauen. Sie ist NEBS-Level-3-ready, unterstützt Secure Boot mit Root of Trust sowie NVIDIA vGPU-Software. Hinweis: MIG und NVLink werden nicht unterstützt — Multi-GPU-Skalierung erfolgt über PCIe Gen4. Wo es auf maximale Rack-Dichte ankommt, bieten Server-Hersteller die L40S in flüssigekühlten System-Konfigurationen an.
Die L40S in Zahlen
Alle Werte aus dem offiziellen NVIDIA-L40S-Datenblatt (Ada Lovelace).
Quelle: offizielles NVIDIA-L40S-Datenblatt. FP8/INT8/INT4: 733 TFLOPS dense bzw. 1.466 TFLOPS mit struktureller Sparsity. PCIe Gen4 x16 (64 GB/s bidirektional). Kein MIG, kein NVLink. vGPU-Software wird unterstützt.
L40S im Vergleich
Wo die L40S zwischen der grafikorientierten L40 und der KI-Flaggschiff-GPU H100 steht.
| Merkmal | NVIDIA L40S | NVIDIA L40 | NVIDIA H100 SXM |
|---|---|---|---|
| Architektur | Ada Lovelace | Ada Lovelace | Hopper |
| Speicher | 48 GB GDDR6 ECC | 48 GB GDDR6 ECC | 80 GB HBM3 |
| Speicherbandbreite | 864 GB/s | 864 GB/s | 3,35 TB/s |
| FP8 (sparse) | 1.466 TFLOPS | 1.466 TFLOPS | ~3.958 TFLOPS |
| RT Cores | 142 (3. Gen) | 142 (3. Gen) | — |
| TDP | 350 W | 300 W | 700 W |
| Interconnect | PCIe Gen4 | PCIe Gen4 | NVLink + PCIe Gen5 |
| MIG | Nein | Nein | Ja (bis 7) |
| Schwerpunkt | GenAI + Grafik + Video | Grafik / Visualisierung | Großes KI-Training |
Werte L40S/L40 aus den offiziellen NVIDIA-Datenblättern; H100 zur Einordnung (Hopper, HBM3). Die H100 ist deutlich stärker bei reinem KI-Durchsatz, die L40S punktet bei kombinierten KI-, Grafik- und Video-Workloads sowie bei Anschaffungskosten und Standard-Server-Integration.
Warum die L40S?
Eine GPU für mehrere Workloads
KI-Inferenz, Fine-Tuning kleinerer Modelle, Rendering, Simulation und Video-Encoding laufen auf derselben Karte. Das senkt die Zahl unterschiedlicher GPU-Typen im Rechenzentrum und vereinfacht Beschaffung und Betrieb.
Effiziente LLM-Inferenz
Die 4. Tensor-Core-Generation rechnet FP8 nativ und wählt pro Layer automatisch die Präzision. FP8-quantisierte Modelle laufen bei nahezu unveränderter Qualität mit rund doppeltem Token-Durchsatz gegenüber FP16.
Passt in gängige Server
Als Dual-Slot-PCIe-Gen4-Karte mit 350 W lässt sich die L40S in verbreitete Rack-Server einbauen — ohne exotische Plattform. Das verkürzt Lieferzeiten und reduziert Infrastrukturaufwand.
AV1 in Hardware
Drei NVENC- und drei NVDEC-Engines mit AV1 beschleunigen Streaming, Video-Produktion und Transcoding. In Kombination mit RTX-Raytracing ist die L40S die Plattform für multimodale GenAI- und Omniverse-Pipelines.
Luft- oder flüssigekühlt — was passt zu Ihrem Rechenzentrum?
Die L40S-Karte selbst ist passiv ausgelegt. Entscheidend ist die Kühlung auf System-Ebene — besonders bei dichter Multi-GPU-Bestückung. Wir planen die passende Variante für Ihre Last und Rack-Dichte.
Luftgekühlte Konfiguration
Die passiv ausgelegte Dual-Slot-Karte wird über den Server-Luftstrom gekühlt. Bewährt, kostengünstig und in gängigen Rack-Servern (Dell, HPE, Lenovo, Supermicro) sofort einsetzbar.
- Ideal für 1–4 GPUs pro Knoten
- Standard-Rack-Infrastruktur, keine Wasserkreisläufe
- Schnellste Beschaffung und Inbetriebnahme
- Geringere Einstiegskosten
Flüssigekühlte Server-Konfiguration
Für dicht bestückte Knoten oder thermisch anspruchsvolle Standorte bieten Server-Hersteller Direkt-Flüssigkühlung (Cold-Plate / DLC) auf System-Ebene. Das senkt Lärm, verbessert die Effizienz (PUE) und hält die GPUs dauerhaft im optimalen Temperaturfenster.
- Für maximale GPU-Dichte pro Rack
- Niedrigere Betriebsgeräusche, bessere Wärmeabfuhr
- Optimiert für 24/7-Dauerlast
- Erfordert Wasser-Infrastruktur — planen wir mit
Hinweis zur Faktentreue: Die L40S ist als GPU-Karte ausschließlich passiv/dual-slot spezifiziert (350 W). „Flüssigekühlt“ bezieht sich auf die Kühllösung des Gesamt-Servers, nicht auf eine separate Karten-Variante von NVIDIA.
Wofür die L40S gebaut ist
LLM-Inferenz
FP8-quantisierte Sprachmodelle im 40–70B-Bereich produktiv betreiben — mit hohem Durchsatz pro Watt und günstiger Stueckkosten je Token bei nicht durchgehender Vollauslastung.
Fine-Tuning & kleines Training
Acht L40S in Standard-Servern erreichen bis zu 1,7× der Trainingsleistung eines HGX-A100-8-GPU-Systems — ideal für Anpassung und Entwicklung ohne HBM-Flaggschiff.
Rendering & 3D
RT Cores der 3. Generation und DLSS 3 beschleunigen Produktdesign, Architektur, Engineering und Echtzeit-Visualisierung — bis hin zu virtueller Produktion.
Video & Streaming
Drei NVENC/NVDEC-Engines mit AV1 ermöglichen hochwertiges Transcoding, Broadcast-Streaming und Video-KI — mit deutlich besserer TCO gegenüber CPU-Encoding.
Souveräne & private KI
On-Premise im DACH-Raum, DSGVO-konform betrieben. Sensible Daten bleiben im eigenen Rechenzentrum — Nelpx plant Standort, Strom und Netzwerk.
VDI & Omniverse
Mit NVIDIA vGPU-Software lassen sich GPU-Ressourcen auf mehrere Nutzer aufteilen — für virtuelle Workstations, Omniverse Enterprise und gemischte Multi-User-Umgebungen.
So läuft Ihre Beschaffung
Bedarf klären
Workload, Stueckzahl, Modellgrößen und Zielserver besprechen — wir empfehlen die passende Konfiguration.
Infrastruktur-Check
Strom, Kühlung (Luft oder Flüssig) und Netzwerk am Standort bewerten — inklusive Rack-Dichte.
Angebot & Lieferung
Festpreis-Angebot mit Lieferzeit, dann Beschaffung und Lieferung im DACH-Raum.
Integration & Betrieb
Einbau, Inbetriebnahme, Treiber-/Software-Stack (NVIDIA AI Enterprise) und optionaler Support.
Bis zu 15 % für Forschung & öffentliche Hand
Universitäten, Forschungseinrichtungen, Startups und öffentliche Auftraggeber erhalten Sonderkonditionen auf NVIDIA-L40S-Beschaffungen. Sprechen Sie uns für ein passgenaues Angebot an.
Häufige Fragen zur NVIDIA L40S
Was kostet eine NVIDIA L40S?
Wie wird die L40S gekühlt — Luft oder Flüssigkeit?
Was ist der Unterschied zwischen L40S und L40?
Unterstützt die L40S MIG und NVLink?
Liefert Nelpx die L40S im DACH-Raum?
Fordern Sie Ihr L40S-Angebot an
Ein kurzer Draht statt langem Formular: Schreiben Sie uns Ihren Bedarf — wir melden uns mit Konfiguration, Infrastruktur-Empfehlung und Festpreis.
NVIDIA L40S kaufen — die Universal-GPU für GenAI & Grafik
Eine Karte für KI, Rendering und Video: 48 GB GDDR6, 4. Generation Tensor Cores mit FP8 und bis zu 1.466 TFLOPS. Nelpx GmbH liefert, plant und integriert Ihre L40S im DACH-Raum — luft- oder flüssigekühlt, inklusive Strom-, Kühlungs- und Netzwerkkonzept.
Was ist die NVIDIA L40S?
Die NVIDIA L40S ist eine Universal-Rechenzentrums-GPU auf Basis der Ada-Lovelace-Architektur. Sie kombiniert KI-Beschleunigung, professionelle Grafik und Medien-Verarbeitung auf einer einzigen Karte — und ist damit der Allrounder für Unternehmen, die generative KI, LLM-Inferenz, Rendering und Video auf derselben Infrastruktur betreiben wollen.
Im Zentrum stehen 48 GB GDDR6-Speicher mit ECC und eine Speicherbandbreite von 864 GB/s. Damit lassen sich Modelle im Bereich von rund 40 bis 70 Milliarden Parametern bei moderaten Batch-Größen sinnvoll betreiben — insbesondere FP8-quantisiert. Die 4. Generation der Tensor Cores mit Transformer Engine schaltet während der Berechnung automatisch zwischen FP8 und FP16 um und liefert so bis zu 1.466 TFLOPS FP8 (mit Sparsity).
Anders als reine Trainings-Beschleuniger bringt die L40S zusätzlich 142 RT Cores der 3. Generation und Hardware-Encoder mit. Drei NVENC- und drei NVDEC-Engines mit AV1-Unterstützung machen sie zur idealen Plattform für Rendering, Echtzeit-3D, Video-Transcoding und NVIDIA-Omniverse-Workflows. Diese Doppelrolle aus Compute und Visualisierung unterscheidet sie deutlich von H100/H200, die rein auf KI-Durchsatz ausgelegt sind.
Die L40S kommt als passiv gekühlte Dual-Slot-PCIe-Karte (350 W) und lässt sich damit in gängige Standard-Server einbauen. Sie ist NEBS-Level-3-ready, unterstützt Secure Boot mit Root of Trust sowie NVIDIA vGPU-Software. Hinweis: MIG und NVLink werden nicht unterstützt — Multi-GPU-Skalierung erfolgt über PCIe Gen4. Wo es auf maximale Rack-Dichte ankommt, bieten Server-Hersteller die L40S in flüssigekühlten System-Konfigurationen an.
Die L40S in Zahlen
Alle Werte aus dem offiziellen NVIDIA-L40S-Datenblatt (Ada Lovelace).
Quelle: offizielles NVIDIA-L40S-Datenblatt. FP8/INT8/INT4: 733 TFLOPS dense bzw. 1.466 TFLOPS mit struktureller Sparsity. PCIe Gen4 x16 (64 GB/s bidirektional). Kein MIG, kein NVLink. vGPU-Software wird unterstützt.
L40S im Vergleich
Wo die L40S zwischen der grafikorientierten L40 und der KI-Flaggschiff-GPU H100 steht.
| Merkmal | NVIDIA L40S | NVIDIA L40 | NVIDIA H100 SXM |
|---|---|---|---|
| Architektur | Ada Lovelace | Ada Lovelace | Hopper |
| Speicher | 48 GB GDDR6 ECC | 48 GB GDDR6 ECC | 80 GB HBM3 |
| Speicherbandbreite | 864 GB/s | 864 GB/s | 3,35 TB/s |
| FP8 (sparse) | 1.466 TFLOPS | 1.466 TFLOPS | ~3.958 TFLOPS |
| RT Cores | 142 (3. Gen) | 142 (3. Gen) | — |
| TDP | 350 W | 300 W | 700 W |
| Interconnect | PCIe Gen4 | PCIe Gen4 | NVLink + PCIe Gen5 |
| MIG | Nein | Nein | Ja (bis 7) |
| Schwerpunkt | GenAI + Grafik + Video | Grafik / Visualisierung | Großes KI-Training |
Werte L40S/L40 aus den offiziellen NVIDIA-Datenblättern; H100 zur Einordnung (Hopper, HBM3). Die H100 ist deutlich stärker bei reinem KI-Durchsatz, die L40S punktet bei kombinierten KI-, Grafik- und Video-Workloads sowie bei Anschaffungskosten und Standard-Server-Integration.
Warum die L40S?
Eine GPU für mehrere Workloads
KI-Inferenz, Fine-Tuning kleinerer Modelle, Rendering, Simulation und Video-Encoding laufen auf derselben Karte. Das senkt die Zahl unterschiedlicher GPU-Typen im Rechenzentrum und vereinfacht Beschaffung und Betrieb.
Effiziente LLM-Inferenz
Die 4. Tensor-Core-Generation rechnet FP8 nativ und wählt pro Layer automatisch die Präzision. FP8-quantisierte Modelle laufen bei nahezu unveränderter Qualität mit rund doppeltem Token-Durchsatz gegenüber FP16.
Passt in gängige Server
Als Dual-Slot-PCIe-Gen4-Karte mit 350 W lässt sich die L40S in verbreitete Rack-Server einbauen — ohne exotische Plattform. Das verkürzt Lieferzeiten und reduziert Infrastrukturaufwand.
AV1 in Hardware
Drei NVENC- und drei NVDEC-Engines mit AV1 beschleunigen Streaming, Video-Produktion und Transcoding. In Kombination mit RTX-Raytracing ist die L40S die Plattform für multimodale GenAI- und Omniverse-Pipelines.
Luft- oder flüssigekühlt — was passt zu Ihrem Rechenzentrum?
Die L40S-Karte selbst ist passiv ausgelegt. Entscheidend ist die Kühlung auf System-Ebene — besonders bei dichter Multi-GPU-Bestückung. Wir planen die passende Variante für Ihre Last und Rack-Dichte.
Luftgekühlte Konfiguration
Die passiv ausgelegte Dual-Slot-Karte wird über den Server-Luftstrom gekühlt. Bewährt, kostengünstig und in gängigen Rack-Servern (Dell, HPE, Lenovo, Supermicro) sofort einsetzbar.
- Ideal für 1–4 GPUs pro Knoten
- Standard-Rack-Infrastruktur, keine Wasserkreisläufe
- Schnellste Beschaffung und Inbetriebnahme
- Geringere Einstiegskosten
Flüssigekühlte Server-Konfiguration
Für dicht bestückte Knoten oder thermisch anspruchsvolle Standorte bieten Server-Hersteller Direkt-Flüssigkühlung (Cold-Plate / DLC) auf System-Ebene. Das senkt Lärm, verbessert die Effizienz (PUE) und hält die GPUs dauerhaft im optimalen Temperaturfenster.
- Für maximale GPU-Dichte pro Rack
- Niedrigere Betriebsgeräusche, bessere Wärmeabfuhr
- Optimiert für 24/7-Dauerlast
- Erfordert Wasser-Infrastruktur — planen wir mit
Hinweis zur Faktentreue: Die L40S ist als GPU-Karte ausschließlich passiv/dual-slot spezifiziert (350 W). „Flüssigekühlt“ bezieht sich auf die Kühllösung des Gesamt-Servers, nicht auf eine separate Karten-Variante von NVIDIA.
Wofür die L40S gebaut ist
LLM-Inferenz
FP8-quantisierte Sprachmodelle im 40–70B-Bereich produktiv betreiben — mit hohem Durchsatz pro Watt und günstiger Stueckkosten je Token bei nicht durchgehender Vollauslastung.
Fine-Tuning & kleines Training
Acht L40S in Standard-Servern erreichen bis zu 1,7× der Trainingsleistung eines HGX-A100-8-GPU-Systems — ideal für Anpassung und Entwicklung ohne HBM-Flaggschiff.
Rendering & 3D
RT Cores der 3. Generation und DLSS 3 beschleunigen Produktdesign, Architektur, Engineering und Echtzeit-Visualisierung — bis hin zu virtueller Produktion.
Video & Streaming
Drei NVENC/NVDEC-Engines mit AV1 ermöglichen hochwertiges Transcoding, Broadcast-Streaming und Video-KI — mit deutlich besserer TCO gegenüber CPU-Encoding.
Souveräne & private KI
On-Premise im DACH-Raum, DSGVO-konform betrieben. Sensible Daten bleiben im eigenen Rechenzentrum — Nelpx plant Standort, Strom und Netzwerk.
VDI & Omniverse
Mit NVIDIA vGPU-Software lassen sich GPU-Ressourcen auf mehrere Nutzer aufteilen — für virtuelle Workstations, Omniverse Enterprise und gemischte Multi-User-Umgebungen.
So läuft Ihre Beschaffung
Bedarf klären
Workload, Stueckzahl, Modellgrößen und Zielserver besprechen — wir empfehlen die passende Konfiguration.
Infrastruktur-Check
Strom, Kühlung (Luft oder Flüssig) und Netzwerk am Standort bewerten — inklusive Rack-Dichte.
Angebot & Lieferung
Festpreis-Angebot mit Lieferzeit, dann Beschaffung und Lieferung im DACH-Raum.
Integration & Betrieb
Einbau, Inbetriebnahme, Treiber-/Software-Stack (NVIDIA AI Enterprise) und optionaler Support.
Bis zu 15 % für Forschung & öffentliche Hand
Universitäten, Forschungseinrichtungen, Startups und öffentliche Auftraggeber erhalten Sonderkonditionen auf NVIDIA-L40S-Beschaffungen. Sprechen Sie uns für ein passgenaues Angebot an.
Häufige Fragen zur NVIDIA L40S
Was kostet eine NVIDIA L40S?
Wie wird die L40S gekühlt — Luft oder Flüssigkeit?
Was ist der Unterschied zwischen L40S und L40?
Unterstützt die L40S MIG und NVLink?
Liefert Nelpx die L40S im DACH-Raum?
Fordern Sie Ihr L40S-Angebot an
Ein kurzer Draht statt langem Formular: Schreiben Sie uns Ihren Bedarf — wir melden uns mit Konfiguration, Infrastruktur-Empfehlung und Festpreis.
Kontakt
Ihre Anfrage wird schnellstmöglich bearbeitet.
