Zum Inhalt springen
Auf Lager

NVIDIA L40S kaufen — die Universal-GPU für GenAI & Grafik

Eine Karte für KI, Rendering und Video: 48 GB GDDR6, 4. Generation Tensor Cores mit FP8 und bis zu 1.466 TFLOPS. Nelpx GmbH liefert, plant und integriert Ihre L40S im DACH-Raum — luft- oder flüssigekühlt, inklusive Strom-, Kühlungs- und Netzwerkkonzept.

48 GB
GDDR6 mit ECC
1.466 TFLOPS
FP8 (sparse)
350 W
TDP, PCIe Gen4
NVIDIA L40S GPU - 48 GB GDDR6 Ada-Lovelace-Beschleuniger
Preis Ab 7.600 € zzgl. MwSt., konfigurationsabhängig
Überblick

Was ist die NVIDIA L40S?

Die NVIDIA L40S ist eine Universal-Rechenzentrums-GPU auf Basis der Ada-Lovelace-Architektur. Sie kombiniert KI-Beschleunigung, professionelle Grafik und Medien-Verarbeitung auf einer einzigen Karte — und ist damit der Allrounder für Unternehmen, die generative KI, LLM-Inferenz, Rendering und Video auf derselben Infrastruktur betreiben wollen.

Im Zentrum stehen 48 GB GDDR6-Speicher mit ECC und eine Speicherbandbreite von 864 GB/s. Damit lassen sich Modelle im Bereich von rund 40 bis 70 Milliarden Parametern bei moderaten Batch-Größen sinnvoll betreiben — insbesondere FP8-quantisiert. Die 4. Generation der Tensor Cores mit Transformer Engine schaltet während der Berechnung automatisch zwischen FP8 und FP16 um und liefert so bis zu 1.466 TFLOPS FP8 (mit Sparsity).

Anders als reine Trainings-Beschleuniger bringt die L40S zusätzlich 142 RT Cores der 3. Generation und Hardware-Encoder mit. Drei NVENC- und drei NVDEC-Engines mit AV1-Unterstützung machen sie zur idealen Plattform für Rendering, Echtzeit-3D, Video-Transcoding und NVIDIA-Omniverse-Workflows. Diese Doppelrolle aus Compute und Visualisierung unterscheidet sie deutlich von H100/H200, die rein auf KI-Durchsatz ausgelegt sind.

Die L40S kommt als passiv gekühlte Dual-Slot-PCIe-Karte (350 W) und lässt sich damit in gängige Standard-Server einbauen. Sie ist NEBS-Level-3-ready, unterstützt Secure Boot mit Root of Trust sowie NVIDIA vGPU-Software. Hinweis: MIG und NVLink werden nicht unterstützt — Multi-GPU-Skalierung erfolgt über PCIe Gen4. Wo es auf maximale Rack-Dichte ankommt, bieten Server-Hersteller die L40S in flüssigekühlten System-Konfigurationen an.

Technische Daten

Die L40S in Zahlen

Alle Werte aus dem offiziellen NVIDIA-L40S-Datenblatt (Ada Lovelace).

48 GB
GDDR6 mit ECC
864 GB/s Speicherbandbreite
18.176
CUDA-Cores
Ada-Lovelace-Architektur (AD102)
568
Tensor Cores (4. Gen)
mit Transformer Engine & FP8
142
RT Cores (3. Gen)
209 TFLOPS RT-Leistung
1.466
TFLOPS FP8 (sparse)
733 TFLOPS dense
91,6
TFLOPS FP32
TF32: 183 / 366 (sparse)
350 W
Max. Leistungsaufnahme
Dual-Slot, passiv, 16-Pin
3× / 3×
NVENC / NVDEC
inkl. AV1 Encode & Decode

Quelle: offizielles NVIDIA-L40S-Datenblatt. FP8/INT8/INT4: 733 TFLOPS dense bzw. 1.466 TFLOPS mit struktureller Sparsity. PCIe Gen4 x16 (64 GB/s bidirektional). Kein MIG, kein NVLink. vGPU-Software wird unterstützt.

Einordnung

L40S im Vergleich

Wo die L40S zwischen der grafikorientierten L40 und der KI-Flaggschiff-GPU H100 steht.

Merkmal NVIDIA L40S NVIDIA L40 NVIDIA H100 SXM
ArchitekturAda LovelaceAda LovelaceHopper
Speicher48 GB GDDR6 ECC48 GB GDDR6 ECC80 GB HBM3
Speicherbandbreite864 GB/s864 GB/s3,35 TB/s
FP8 (sparse)1.466 TFLOPS1.466 TFLOPS~3.958 TFLOPS
RT Cores142 (3. Gen)142 (3. Gen)
TDP350 W300 W700 W
InterconnectPCIe Gen4PCIe Gen4NVLink + PCIe Gen5
MIGNeinNeinJa (bis 7)
SchwerpunktGenAI + Grafik + VideoGrafik / VisualisierungGroßes KI-Training

Werte L40S/L40 aus den offiziellen NVIDIA-Datenblättern; H100 zur Einordnung (Hopper, HBM3). Die H100 ist deutlich stärker bei reinem KI-Durchsatz, die L40S punktet bei kombinierten KI-, Grafik- und Video-Workloads sowie bei Anschaffungskosten und Standard-Server-Integration.

Stärken

Warum die L40S?

Vielseitigkeit

Eine GPU für mehrere Workloads

KI-Inferenz, Fine-Tuning kleinerer Modelle, Rendering, Simulation und Video-Encoding laufen auf derselben Karte. Das senkt die Zahl unterschiedlicher GPU-Typen im Rechenzentrum und vereinfacht Beschaffung und Betrieb.

FP8 & Transformer Engine

Effiziente LLM-Inferenz

Die 4. Tensor-Core-Generation rechnet FP8 nativ und wählt pro Layer automatisch die Präzision. FP8-quantisierte Modelle laufen bei nahezu unveränderter Qualität mit rund doppeltem Token-Durchsatz gegenüber FP16.

Standard-Integration

Passt in gängige Server

Als Dual-Slot-PCIe-Gen4-Karte mit 350 W lässt sich die L40S in verbreitete Rack-Server einbauen — ohne exotische Plattform. Das verkürzt Lieferzeiten und reduziert Infrastrukturaufwand.

Media-Engines

AV1 in Hardware

Drei NVENC- und drei NVDEC-Engines mit AV1 beschleunigen Streaming, Video-Produktion und Transcoding. In Kombination mit RTX-Raytracing ist die L40S die Plattform für multimodale GenAI- und Omniverse-Pipelines.

Infrastruktur-Beratung

Luft- oder flüssigekühlt — was passt zu Ihrem Rechenzentrum?

Die L40S-Karte selbst ist passiv ausgelegt. Entscheidend ist die Kühlung auf System-Ebene — besonders bei dichter Multi-GPU-Bestückung. Wir planen die passende Variante für Ihre Last und Rack-Dichte.

Standard

Luftgekühlte Konfiguration

Die passiv ausgelegte Dual-Slot-Karte wird über den Server-Luftstrom gekühlt. Bewährt, kostengünstig und in gängigen Rack-Servern (Dell, HPE, Lenovo, Supermicro) sofort einsetzbar.

  • Ideal für 1–4 GPUs pro Knoten
  • Standard-Rack-Infrastruktur, keine Wasserkreisläufe
  • Schnellste Beschaffung und Inbetriebnahme
  • Geringere Einstiegskosten
Hohe Dichte

Flüssigekühlte Server-Konfiguration

Für dicht bestückte Knoten oder thermisch anspruchsvolle Standorte bieten Server-Hersteller Direkt-Flüssigkühlung (Cold-Plate / DLC) auf System-Ebene. Das senkt Lärm, verbessert die Effizienz (PUE) und hält die GPUs dauerhaft im optimalen Temperaturfenster.

  • Für maximale GPU-Dichte pro Rack
  • Niedrigere Betriebsgeräusche, bessere Wärmeabfuhr
  • Optimiert für 24/7-Dauerlast
  • Erfordert Wasser-Infrastruktur — planen wir mit

Hinweis zur Faktentreue: Die L40S ist als GPU-Karte ausschließlich passiv/dual-slot spezifiziert (350 W). „Flüssigekühlt“ bezieht sich auf die Kühllösung des Gesamt-Servers, nicht auf eine separate Karten-Variante von NVIDIA.

Einsatzgebiete

Wofür die L40S gebaut ist

LLM-Inferenz

FP8-quantisierte Sprachmodelle im 40–70B-Bereich produktiv betreiben — mit hohem Durchsatz pro Watt und günstiger Stueckkosten je Token bei nicht durchgehender Vollauslastung.

Fine-Tuning & kleines Training

Acht L40S in Standard-Servern erreichen bis zu 1,7× der Trainingsleistung eines HGX-A100-8-GPU-Systems — ideal für Anpassung und Entwicklung ohne HBM-Flaggschiff.

Rendering & 3D

RT Cores der 3. Generation und DLSS 3 beschleunigen Produktdesign, Architektur, Engineering und Echtzeit-Visualisierung — bis hin zu virtueller Produktion.

Video & Streaming

Drei NVENC/NVDEC-Engines mit AV1 ermöglichen hochwertiges Transcoding, Broadcast-Streaming und Video-KI — mit deutlich besserer TCO gegenüber CPU-Encoding.

Souveräne & private KI

On-Premise im DACH-Raum, DSGVO-konform betrieben. Sensible Daten bleiben im eigenen Rechenzentrum — Nelpx plant Standort, Strom und Netzwerk.

VDI & Omniverse

Mit NVIDIA vGPU-Software lassen sich GPU-Ressourcen auf mehrere Nutzer aufteilen — für virtuelle Workstations, Omniverse Enterprise und gemischte Multi-User-Umgebungen.

Ablauf

So läuft Ihre Beschaffung

1

Bedarf klären

Workload, Stueckzahl, Modellgrößen und Zielserver besprechen — wir empfehlen die passende Konfiguration.

2

Infrastruktur-Check

Strom, Kühlung (Luft oder Flüssig) und Netzwerk am Standort bewerten — inklusive Rack-Dichte.

3

Angebot & Lieferung

Festpreis-Angebot mit Lieferzeit, dann Beschaffung und Lieferung im DACH-Raum.

4

Integration & Betrieb

Einbau, Inbetriebnahme, Treiber-/Software-Stack (NVIDIA AI Enterprise) und optionaler Support.

Sonderkonditionen

Bis zu 15 % für Forschung & öffentliche Hand

Universitäten, Forschungseinrichtungen, Startups und öffentliche Auftraggeber erhalten Sonderkonditionen auf NVIDIA-L40S-Beschaffungen. Sprechen Sie uns für ein passgenaues Angebot an.

Universitäten Forschungseinrichtungen Startups Öffentliche Hand
Sonderkonditionen prüfen
FAQ

Häufige Fragen zur NVIDIA L40S

Was kostet eine NVIDIA L40S?
Die NVIDIA L40S ist bei Nelpx ab 7.600 € zzgl. MwSt. erhältlich. Der finale Preis hängt von Stueckzahl, Server-Plattform, Support-Level und gewünschter Kühlung (luft- oder flüssigekühlte Konfiguration) ab. Wir erstellen ein individuelles Festpreis-Angebot inklusive Lieferung und Integration im DACH-Raum. Für Universitäten, Forschung, Startups und öffentliche Hand sind bis zu 15 % Sonderkonditionen möglich.
Wie wird die L40S gekühlt — Luft oder Flüssigkeit?
Die L40S-Karte selbst ist eine passiv gekühlte Dual-Slot-PCIe-Karte mit 350 W und wird durch den Luftstrom des Servers gekühlt. In dicht bestückten Multi-GPU-Knoten oder thermisch anspruchsvollen Rechenzentren bieten Server-Hersteller flüssigekühlte Konfigurationen (Cold-Plate / Direct-Liquid-Cooling auf System-Ebene) an. Nelpx plant Strom, Kühlung und Netzwerk als integriertes Gesamtsystem und empfiehlt die passende Variante für Ihre Rack-Dichte.
Was ist der Unterschied zwischen L40S und L40?
Beide basieren auf Ada Lovelace und bieten 48 GB GDDR6 ECC. Die L40S ist stärker auf KI ausgelegt (höhere Tensor-Leistung, bis 1.466 TFLOPS FP8 mit Sparsity) und für GenAI, LLM-Inferenz und Fine-Tuning optimiert, während die L40 stärker auf klassische Grafik- und Visualisierungs-Workloads zielt. Die L40S hat 350 W TDP gegenüber 300 W bei der L40.
Unterstützt die L40S MIG und NVLink?
Nein. Die L40S unterstützt weder Multi-Instance-GPU (MIG) noch NVLink. Multi-GPU-Skalierung erfolgt über PCIe Gen4. Für Mandantentrennung steht NVIDIA vGPU-Software zur Verfügung. Wenn Sie MIG-Partitionierung oder NVLink-gekoppeltes Multi-GPU-Training benötigen, beraten wir Sie ergebnisoffen zu Alternativen wie H100 oder H200.
Liefert Nelpx die L40S im DACH-Raum?
Ja. Nelpx GmbH als IT-Systemhaus liefert, plant und integriert NVIDIA-L40S-GPUs und komplette L40S-Server in Deutschland, Österreich und der Schweiz — inklusive Standortbewertung für Strom und Kühlung, Netzwerkanbindung und Inbetriebnahme. Hinweis: Die L40S unterliegt als Controlled-Produkt US-Exportbestimmungen; für den DACH-Raum ist dies in der Regel unkritisch.

Fordern Sie Ihr L40S-Angebot an

Ein kurzer Draht statt langem Formular: Schreiben Sie uns Ihren Bedarf — wir melden uns mit Konfiguration, Infrastruktur-Empfehlung und Festpreis.

DACHDeutsches IT-Systemhaus
< 24 hAntwort auf Anfragen
End-to-EndLieferung & Integration
Angebot anfragen

Kontakt

Ihre Anfrage wird schnellstmöglich bearbeitet.

Geschützt durch reCAPTCHA, Datenschutzerklärung & Nutzungsbedingungen anwenden.