Tous les articles (page 4)

Silicon

Vera Rubin : la fin de l'inférence GPU homogène

NVIDIA Vera Rubin n'est pas qu'un GPU plus rapide : l'inférence éclate en trois tiers (prefill GPU, decode LPU, orchestration CPU) coordonnés par Dynamo.

19 min de lecture
  • NVIDIA Rubin
  • Vera CPU
  • HBM4
  • Groq LPU

Coûts

Coût d'inférence LLM : API, GPU cloud ou auto-hébergement ?

Le vrai coût de l'inférence LLM en 2026 : prix des API au token, location de GPU, auto-hébergement. Calculez votre point de bascule, chiffres et sources à l'appui.

11 min de lecture
  • Coût d'inférence
  • GPU cloud
  • API LLM
  • Auto-hébergement

Silicon

RTX 5090 vs H100 : quelle carte pour un LLM en local ?

RTX 5090 vs H100 pour faire tourner un LLM en local : 32 Go GDDR7 face à 80 Go HBM3, ce qui tient vraiment en VRAM, et pourquoi ce ne sont pas les mêmes produits.

8 min de lecture
  • RTX 5090
  • H100
  • LLM local
  • VRAM

Silicon

CUDA vs ROCm en 2026 : l'écart réel en production IA

CUDA vs ROCm en 2026 : le débat n'est plus « est-ce que ROCm marche » mais « quel écart reste-t-il ». Versions, parité framework, vrais verrous, sources.

8 min de lecture
  • CUDA
  • ROCm
  • AMD
  • NVIDIA

Runtimes

vLLM vs llama.cpp vs TensorRT-LLM : quel runtime choisir ?

Trois runtimes d'inférence LLM, trois philosophies : débit serveur, déploiement local, performance verrouillée NVIDIA. Matrice de décision claire pour choisir.

8 min de lecture
  • vLLM
  • llama.cpp
  • TensorRT-LLM
  • Inférence

Runtimes

KV cache : pourquoi votre LLM sature la mémoire

Le KV cache explique pourquoi un LLM consomme autant de VRAM. Définition, calcul de taille concret, PagedAttention, quantification FP8 et prefix caching.

9 min de lecture
  • KV cache
  • PagedAttention
  • Quantification
  • Mémoire