🧩Architektur einer NVIDIA-GPU
Von außen nach innen: Die GPU besteht aus Clustern, die Cluster aus Streaming Multiprocessors (SMs), die SMs aus vier Verarbeitungsblöcken mit eigenen Warp-Schedulern und Rechenwerken. Klicke dich durch die Ebenen.
🔍Hierarchie: GPU → GPC → TPC → SM
GPU (Beispiel: GH100 / H100)
Der ganze Chip: Graphics Processing Clusters (GPCs), ein gemeinsamer L2-Cache, Speicher-Controller für HBM und die Anschlüsse nach außen (PCIe, NVLink). Der GigaThread-Scheduler verteilt die Blöcke eines Kernels auf freie SMs.
- ▸GH100-Vollausbau: 8 GPCs · 72 TPCs · 144 SMs
- ▸H100 SXM5 (Produkt): 132 SMs aktiv, 50 MB L2
- ▸HBM3 · NVLink 4 · PCIe 5.0
Quelle: NVIDIA H100 Tensor Core GPU Architecture Whitepaper (2022). Tipp: Im Bild ein SM (grün, oben links) anklicken.
⚙️Spezialwerke im SM
🟩 CUDA-Kerne (FP32/INT32)
Skalare Rechenwerke. Ein Warp-Befehl rechnet dieselbe Operation für 32 Threads – das Modell heißt SIMT (Single Instruction, Multiple Threads).
🧮 Tensor Cores
Rechnen D = A·B + C auf ganzen Matrixkacheln pro Befehl. Angesprochen über cuBLAS/cuDNN, CUTLASS, die WMMA-API oder PTX-Befehle wie mma – seit Volta (2017).
💡 RT Cores
Hardware für Raytracing (Schnitt Strahl–Dreieck, Durchlaufen der Hüllkörper-Hierarchie BVH), seit Turing. Für allgemeines CUDA-Rechnen nicht direkt nutzbar, sondern über OptiX, DirectX Raytracing oder Vulkan.
⏳Latenzverbergen: warum so viele Threads?
Jedes Kästchen = ein ausgegebener Befehl (umrandet = Ladebefehl). Rote Striche oben = Takt ohne bereiten Warp (Leerlauf).
Die GPU versteckt Speicherlatenz nicht mit großen Caches, sondern mit Parallelität: Wartet ein Warp auf Daten, rechnet ein anderer. Deshalb ist es wichtig, dass genug Warps gleichzeitig auf dem SM wohnen können – genau das misst die Occupancy.
🏔️Speicherhierarchie
Register
- Sichtbar für
- je Thread
- Größe
- 64 K × 32 Bit = 256 KB je SM
- Latenz
- ≈ 1 Takt Größenordnung
- Hinweis
- schnellster Speicher; max. 255 Register pro Thread
Latenzen sind grobe Größenordnungen und hängen stark von Generation, Takt und Zugriffsmuster ab (vgl. Mikrobenchmark-Studien wie Jia et al., „Dissecting the NVIDIA Volta GPU Architecture via Microbenchmarking“, 2018). Größen: NVIDIA-Whitepaper bzw. CUDA Programming Guide.
🔌Verbindung nach außen: PCIe und NVLink
📅Generationen und Compute Capability
| Architektur | Jahr | Compute Capability | Beispiel | SMs | FP32 je SM | Tensor Cores | Speicher / Verbindung | Neu | Quelle |
|---|---|---|---|---|---|---|---|---|---|
| Pascal | 2016 | 6.0 · 6.1 | Tesla P100 | 56 | 64 (GP100) · 128 (GP10x) | – | HBM2 (P100) |
| [2] [1] |
| Volta | 2017 | 7.0 | Tesla V100 | 80 | 64 | 8 je SM (1. Gen, 640 gesamt) | HBM2, 900 GB/s · NVLink 2: 300 GB/s |
| [3] [1] |
| Turing | 2018 | 7.5 | TU102 (Vollausbau) | 72 | 64 | 8 je SM (2. Gen) | GDDR6 |
| [4] [1] |
| Ampere | 2020 | 8.0 · 8.6 | A100 · RTX 3090 (GA102) | 108 (A100) · 82 (RTX 3090) | 64 (GA100) · 128 (GA102) | 4 je SM (3. Gen) | A100 40 GB: HBM2, 1555 GB/s, 40 MB L2 · NVLink 3: 600 GB/s |
| [5] [6] [1] |
| Ada Lovelace | 2022 | 8.9 | GeForce RTX 4090 | 128 | 128 | 4 je SM (4. Gen, FP8) | GDDR6X, 72 MB L2 |
| [7] [1] |
| Hopper | 2022 | 9.0 | H100 SXM5 | 132 | 128 | 4 je SM (4. Gen) | HBM3, 3,35 TB/s, 50 MB L2 · NVLink 4: 900 GB/s |
| [8] [1] |
| Blackwell | 2024/25 | 10.0 · 12.0 | B200 · GeForce RTX 5090 | 170 (RTX 5090) | 128 | 5. Gen (FP4) | B200: 2 Dies, 208 Mrd. Transistoren, HBM3e 8 TB/s, NVLink 5: 1,8 TB/s · RTX 5090: 32 GB GDDR7, 1792 GB/s |
| [9] [1] |
- [1] NVIDIA: CUDA C++ Programming Guide – Compute Capabilities / Technical Specifications (2025)
- [2] NVIDIA Tesla P100 Whitepaper (Pascal GP100) (2016)
- [3] NVIDIA Tesla V100 GPU Architecture Whitepaper (Volta GV100) (2017)
- [4] NVIDIA Turing GPU Architecture Whitepaper (TU102) (2018)
- [5] NVIDIA A100 Tensor Core GPU Architecture Whitepaper (GA100) (2020)
- [6] NVIDIA Ampere GA102 GPU Architecture Whitepaper (2020)
- [7] NVIDIA Ada GPU Architecture Whitepaper (AD102) (2022)
- [8] NVIDIA H100 Tensor Core GPU Architecture Whitepaper (GH100) (2022)
- [9] NVIDIA Blackwell Architecture Technical Brief / B200- und GeForce-RTX-5090-Datenblatt (2024)