Articles : Silicon

Silicon

BlueField-4 face à Pensando Salina : le DPU entre dans le chemin de l'inférence

BlueField-4 et Pensando Salina ne calculent aucun token. Ils déplacent le réseau, le stockage, la sécurité et certains transferts du KV cache hors du CPU hôte. Voici le chemin de données qui peut libérer le GPU, ou seulement déplacer le goulot.

13 min de lecture
  • BlueField-4
  • Pensando Salina
  • DPU
  • KV cache

Silicon

UALink 2.0 contre NVLink 6 : quand le réseau calcule l'all-reduce

UALink 2.0 standardise le calcul dans le réseau ; NVLink 6 l'intègre dans ses switches. Voici ce que ce mécanisme change, et pourquoi Helios et Vera Rubin restent impossibles à départager.

16 min de lecture
  • UALink 2.0
  • UALoE
  • NVLink 6
  • in-network compute

Silicon

RTX PRO 6000 ou trois RTX 5090 : 96 Go ne font pas une mémoire unique

Une RTX PRO 6000 et trois RTX 5090 totalisent chacune 96 Go de GDDR7. Pour un LLM, cette égalité s'arrête au nombre : pool unique, modèle réparti et répliques indépendantes ne paient pas les mêmes coûts.

13 min de lecture
  • RTX PRO 6000
  • RTX 5090
  • LLM local
  • multi-GPU

Silicon

RTX Spark sous Windows : CUDA est natif, la pile LLM ne l'est pas encore

RTX Spark apporte jusqu'à 128 Go de mémoire unifiée et CUDA natif à Windows on Arm. Au 12 août, le pilote et CUDA 13.4 restent en Developer Preview, TensorRT-RTX est prêt, tandis que PyTorch, llama.cpp et la pile de serving sont encore à qualifier.

13 min de lecture
  • RTX Spark
  • Windows on Arm
  • CUDA 13.4
  • TensorRT-RTX

Silicon

RTX Spark : le cousin Windows du DGX Spark, et le mur des 273 Go/s

Le RTX Spark (N1X) n'est pas un DGX Spark renommé : c'est le SoC Grace-Blackwell sous Windows on Arm, 128 Go de mémoire unifiée. Pourquoi ce sont les ~273 Go/s, et non le « pétaflop », qui décident de ce qu'il sait faire.

19 min de lecture
  • RTX Spark
  • DGX Spark
  • Grace-Blackwell
  • Mémoire unifiée

Silicon

Combien de VRAM pour faire tourner un LLM en local ?

Combien de VRAM faut-il pour un LLM en local ? La règle des ~2 Go par milliard de paramètres, le poids du KV cache, l'effet de la quantification, et ce qui tient vraiment sur votre carte.

8 min de lecture
  • VRAM
  • LLM local
  • Quantification
  • KV cache