Silicon
Vera Rubin : la fin de l'inférence GPU homogène
NVIDIA Vera Rubin n'est pas qu'un GPU plus rapide : l'inférence éclate en trois tiers (prefill GPU, decode LPU, orchestration CPU) coordonnés par Dynamo.
GPU & Silicium
GPU, mémoire HBM, interconnexions NVLink et microarchitecture : ce qui détermine vraiment la performance et le coût du compute IA, du die au datacenter.
19 articles , page 2 sur 2
Silicon
NVIDIA Vera Rubin n'est pas qu'un GPU plus rapide : l'inférence éclate en trois tiers (prefill GPU, decode LPU, orchestration CPU) coordonnés par Dynamo.
Silicon
H100 Hopper face aux Blackwell B200 et B100 : architecture, mémoire HBM3e, NVLink 5 et débit mesuré en inférence LLM. D'où vient le gain, et pour quelles charges il compte.
Silicon
RTX 5090 vs H100 pour faire tourner un LLM en local : 32 Go GDDR7 face à 80 Go HBM3, ce qui tient vraiment en VRAM, et pourquoi ce ne sont pas les mêmes produits.
Silicon
En génération autorégressive à faible batch, la bande passante HBM peut limiter les LLM avant les FLOPS. KV cache, NVLink et dimensionnement expliqués.
Silicon
CUDA vs ROCm en 2026 : le débat n'est plus « est-ce que ROCm marche » mais « quel écart reste-t-il ». Versions, parité framework, vrais verrous, sources.
Silicon
AMD MI355X face à NVIDIA B200 et B300 : mémoire, bande passante, FP4 et le vrai écart, le scale-up NVLink et le logiciel. Comparatif sourcé, mi-2026.
Silicon
FP8, FP6, FP4 : les formats numériques basse précision de l'inférence 2026. Formats à blocs MXFP4 et NVFP4, compromis portée/débit, et ce que le matériel supporte.