NVIDIA B200 Specs B200 SXM6 HBM3E 192GB Blackwell GPU pour IA (2026) Carte graphique
Spécifications du NVIDIA B200 B200 SXM6 HMB3E 192 Go Blackwell GPU pour l'IA (2026) Carte graphique
Spécifications clés du B200
| Spécification | B200 | H200 (pour référence) | H100 (pour référence) |
|---|---|---|---|
| Architecture | Blackwell (GB200) | Hopper | Hopper |
| Transistors | 208 milliards | 80 milliards | 80 milliards |
| Mémoire | 192 Go HBM3e | 141 Go HBM3e | 80 Go HBM3 |
| Bande passante mémoire | Jusqu'à 8 To/s | 4,8 To/s | 3,35 To/s |
| Tensor Core FP4 | Oui (natif) | Non | Non |
| Tensor Core FP8 | Oui (2e gén.) | Oui | Oui |
| Moteur de transformateur | 2e génération | 1re génération | 1re génération |
| NVLink | 5e gén. (1,8 To/s) | 4e gén. (900 Go/s) | 4e gén. (900 Go/s) |
| TDP | Jusqu'à 1000W | Jusqu'à 700W | Jusqu'à 700W |
| Fabrication | TSMC 4NP | TSMC 4N | TSMC 4N |
Architecture : Ce que Blackwell change
Moteur de transformateur de deuxième génération
La plus grande amélioration pour les charges de travail d'IA est le moteur de transformateur de 2e génération avec prise en charge native du FP4 :
- Précision FP4 — point flottant 4 bits pour l'inférence. Réduit de moitié l'utilisation de la mémoire par rapport au FP8, permettant des modèles plus grands ou des tailles de lot plus élevées sur un seul GPU
- Gestion dynamique de la précision — bascule automatiquement entre FP4, FP8 et FP16 en fonction des besoins de chaque couche
- Débit plus élevé — combiné aux améliorations architecturales, NVIDIA affirme une performance d'inférence jusqu'à 4 fois supérieure à celle du H100
Le FP4 est particulièrement efficace pour l'inférence LLM. Un modèle qui nécessite 80 Go en FP8 sur H100 n'aurait besoin que d'environ 40 Go en FP4 sur B200, laissant plus de 150 Go libres pour le cache KV et le batching.
Mémoire HBM3e de 192 Go
Le saut de mémoire est massif :
| GPU | Mémoire | Bande passante mémoire |
|---|---|---|
| H100 | 80 Go HBM3 | 3,35 To/s |
| H200 | 141 Go HBM3e | 4,8 To/s |
| B200 | 192 Go HBM3e | Jusqu'à 8 To/s |
192 Go signifie :
- Llama 70B en FP16 tient sur un seul GPU (140 Go) avec 52 Go de libre pour le cache KV
- Llama 70B en FP8 ne nécessite qu'environ 70 Go, laissant 122 Go pour des tailles de lot massives
- Llama 405B en FP4 pourrait potentiellement tenir sur 2 B200
- Plusieurs modèles servis simultanément à partir d'un seul GPU
NVLink 5e génération
La bande passante NVLink double, passant de 900 Go/s (H100/H200) à 1,8 To/s par GPU. Pour l'entraînement multi-GPU, cela signifie :
- Synchronisation plus rapide des gradients lors de l'entraînement distribué
- Parallélisme tensoriel plus efficace pour l'inférence de grands modèles
- Meilleure efficacité de mise à l'échelle lors de l'utilisation de 4 à 8 GPU par nœud
GB200 et NVL72
NVIDIA propose également le B200 dans des systèmes préconfigurés à l'échelle du rack :
- GB200 — un module de calcul avec 2 GPU B200 + 1 CPU Grace, connectés via NVLink
- GB200 NVL72 — un rack complet avec 36 CPU Grace et 72 GPU B200 interconnectés via NVLink, offrant 720 pétaFLOPS de calcul FP4
Ceux-ci sont conçus pour l'entraînement et l'inférence à grande échelle au niveau du centre de données.
B200 vs H100 vs H200
Pour l'inférence LLM
| Métrique | B200 | H200 | H100 |
|---|---|---|---|
| Llama 70B (FP8) jetons/sec | ~4x H100* | ~1.9x H100 | 1x (base) |
| Mémoire pour Llama 70B FP8 | 70 Go (122 Go libres) | 70 Go (71 Go libres) | 70 Go (10 Go libres) |
| Mémoire pour Llama 70B FP4 | ~35 Go (157 Go libres) | N/A (pas de FP4) | N/A (pas de FP4) |
| Taille de lot maximale (70B FP8) | Très grande | Modérée | Petite |
*Affirmations publiées par NVIDIA. Les performances réelles varieront selon l'implémentation et la charge de travail.
La combinaison du B200, avec plus de mémoire, une bande passante plus élevée et la prise en charge du FP4, pourrait rendre le service de modèles 70B sur un seul GPU pratique à l'échelle — ce qui est serré sur le H100 et confortable mais pas optimal sur le H200.
Pour l'entraînement
NVIDIA revendique des performances d'entraînement jusqu'à 4 fois supérieures sur les modèles de classe GPT par rapport au H100, principalement grâce à :
- Un débit Tensor Core plus élevé
- Des améliorations de l'entraînement FP8 (Moteur de transformateur de 2e génération)
- Une bande passante NVLink doublée pour une meilleure mise à l'échelle multi-GPU
- Plus de mémoire réduisant le besoin de techniques d'optimisation de la mémoire
Pour l'entraînement de grands modèles, le B200 pourrait réduire le temps (et le coût) d'entraînement de 3 à 4 fois par rapport au H100, en supposant que la pile logicielle utilise pleinement les nouvelles fonctionnalités matérielles.