NVIDIA B200 Specs B200 SXM6 HBM3E 192GB Blackwell GPU pour IA (2026) Carte graphique

NVIDIA B200 Specs B200 SXM6 HBM3E 192GB Blackwell GPU pour IA (2026) Carte graphique

$89,999.00
Passer aux informations sur le produit
NVIDIA B200 Specs B200 SXM6 HBM3E 192GB Blackwell GPU pour IA (2026) Carte graphique

NVIDIA B200 Specs B200 SXM6 HBM3E 192GB Blackwell GPU pour IA (2026) Carte graphique

$89,999.00

Spécifications du NVIDIA B200 B200 SXM6 HMB3E 192 Go Blackwell GPU pour l'IA (2026) Carte graphique

Spécifications clés du B200

Spécification B200 H200 (pour référence) H100 (pour référence)
Architecture Blackwell (GB200) Hopper Hopper
Transistors 208 milliards 80 milliards 80 milliards
Mémoire 192 Go HBM3e 141 Go HBM3e 80 Go HBM3
Bande passante mémoire Jusqu'à 8 To/s 4,8 To/s 3,35 To/s
Tensor Core FP4 Oui (natif) Non Non
Tensor Core FP8 Oui (2e gén.) Oui Oui
Moteur de transformateur 2e génération 1re génération 1re génération
NVLink 5e gén. (1,8 To/s) 4e gén. (900 Go/s) 4e gén. (900 Go/s)
TDP Jusqu'à 1000W Jusqu'à 700W Jusqu'à 700W
Fabrication TSMC 4NP TSMC 4N TSMC 4N

Architecture : Ce que Blackwell change

Moteur de transformateur de deuxième génération

La plus grande amélioration pour les charges de travail d'IA est le moteur de transformateur de 2e génération avec prise en charge native du FP4 :

  • Précision FP4 — point flottant 4 bits pour l'inférence. Réduit de moitié l'utilisation de la mémoire par rapport au FP8, permettant des modèles plus grands ou des tailles de lot plus élevées sur un seul GPU
  • Gestion dynamique de la précision — bascule automatiquement entre FP4, FP8 et FP16 en fonction des besoins de chaque couche
  • Débit plus élevé — combiné aux améliorations architecturales, NVIDIA affirme une performance d'inférence jusqu'à 4 fois supérieure à celle du H100

Le FP4 est particulièrement efficace pour l'inférence LLM. Un modèle qui nécessite 80 Go en FP8 sur H100 n'aurait besoin que d'environ 40 Go en FP4 sur B200, laissant plus de 150 Go libres pour le cache KV et le batching.

Mémoire HBM3e de 192 Go

Le saut de mémoire est massif :

GPU Mémoire Bande passante mémoire
H100 80 Go HBM3 3,35 To/s
H200 141 Go HBM3e 4,8 To/s
B200 192 Go HBM3e Jusqu'à 8 To/s

192 Go signifie :

  • Llama 70B en FP16 tient sur un seul GPU (140 Go) avec 52 Go de libre pour le cache KV
  • Llama 70B en FP8 ne nécessite qu'environ 70 Go, laissant 122 Go pour des tailles de lot massives
  • Llama 405B en FP4 pourrait potentiellement tenir sur 2 B200
  • Plusieurs modèles servis simultanément à partir d'un seul GPU

NVLink 5e génération

La bande passante NVLink double, passant de 900 Go/s (H100/H200) à 1,8 To/s par GPU. Pour l'entraînement multi-GPU, cela signifie :

  • Synchronisation plus rapide des gradients lors de l'entraînement distribué
  • Parallélisme tensoriel plus efficace pour l'inférence de grands modèles
  • Meilleure efficacité de mise à l'échelle lors de l'utilisation de 4 à 8 GPU par nœud

GB200 et NVL72

NVIDIA propose également le B200 dans des systèmes préconfigurés à l'échelle du rack :

  • GB200 — un module de calcul avec 2 GPU B200 + 1 CPU Grace, connectés via NVLink
  • GB200 NVL72 — un rack complet avec 36 CPU Grace et 72 GPU B200 interconnectés via NVLink, offrant 720 pétaFLOPS de calcul FP4

Ceux-ci sont conçus pour l'entraînement et l'inférence à grande échelle au niveau du centre de données.

B200 vs H100 vs H200

Pour l'inférence LLM

Métrique B200 H200 H100
Llama 70B (FP8) jetons/sec ~4x H100* ~1.9x H100 1x (base)
Mémoire pour Llama 70B FP8 70 Go (122 Go libres) 70 Go (71 Go libres) 70 Go (10 Go libres)
Mémoire pour Llama 70B FP4 ~35 Go (157 Go libres) N/A (pas de FP4) N/A (pas de FP4)
Taille de lot maximale (70B FP8) Très grande Modérée Petite

*Affirmations publiées par NVIDIA. Les performances réelles varieront selon l'implémentation et la charge de travail.

La combinaison du B200, avec plus de mémoire, une bande passante plus élevée et la prise en charge du FP4, pourrait rendre le service de modèles 70B sur un seul GPU pratique à l'échelle — ce qui est serré sur le H100 et confortable mais pas optimal sur le H200.

Pour l'entraînement

NVIDIA revendique des performances d'entraînement jusqu'à 4 fois supérieures sur les modèles de classe GPT par rapport au H100, principalement grâce à :

  • Un débit Tensor Core plus élevé
  • Des améliorations de l'entraînement FP8 (Moteur de transformateur de 2e génération)
  • Une bande passante NVLink doublée pour une meilleure mise à l'échelle multi-GPU
  • Plus de mémoire réduisant le besoin de techniques d'optimisation de la mémoire

Pour l'entraînement de grands modèles, le B200 pourrait réduire le temps (et le coût) d'entraînement de 3 à 4 fois par rapport au H100, en supposant que la pile logicielle utilise pleinement les nouvelles fonctionnalités matérielles.

Vous pourriez aussi aimer