Tous les articles

Silicon

BlueField-4 face à Pensando Salina : le DPU entre dans le chemin de l'inférence

BlueField-4 et Pensando Salina ne calculent aucun token. Ils déplacent le réseau, le stockage, la sécurité et certains transferts du KV cache hors du CPU hôte. Voici le chemin de données qui peut libérer le GPU, ou seulement déplacer le goulot.

13 min de lecture
  • BlueField-4
  • Pensando Salina
  • DPU
  • KV cache

Runtimes

MLPerf RAG mesure enfin toute la chaîne, pas encore le service

MLPerf E2E-RAG chronomètre l'ingestion, la recherche, le reranking et quatre rôles LLM dans une boucle multi-hop. Son débit est comparable, mais son scénario offline et sa précision de référence à 35 % bornent le verdict.

16 min de lecture
  • MLPerf
  • RAG
  • MLCommons
  • GPT-OSS

Silicon

UALink 2.0 contre NVLink 6 : quand le réseau calcule l'all-reduce

UALink 2.0 standardise le calcul dans le réseau ; NVLink 6 l'intègre dans ses switches. Voici ce que ce mécanisme change, et pourquoi Helios et Vera Rubin restent impossibles à départager.

16 min de lecture
  • UALink 2.0
  • UALoE
  • NVLink 6
  • in-network compute

Runtimes

DWDP pour les MoE : déplacer les poids plutôt que les tokens

Le parallélisme d'experts déplace les tokens vers les poids. DWDP inverse le trajet, précharge les poids distants et supprime la synchronisation entre rangs. Le pari fonctionne, mais dans un régime étroit.

12 min de lecture
  • DWDP
  • MoE
  • SGLang
  • TensorRT-LLM

Silicon

RTX PRO 6000 ou trois RTX 5090 : 96 Go ne font pas une mémoire unique

Une RTX PRO 6000 et trois RTX 5090 totalisent chacune 96 Go de GDDR7. Pour un LLM, cette égalité s'arrête au nombre : pool unique, modèle réparti et répliques indépendantes ne paient pas les mêmes coûts.

13 min de lecture
  • RTX PRO 6000
  • RTX 5090
  • LLM local
  • multi-GPU

Runtimes

vLLM 0.27 : le KV cache devient pair-à-pair

vLLM 0.27 permet à chaque moteur de servir son KV cache CPU à un autre pair via NIXL, ajoute le filtrage par requête et expose des événements routables. Le cache change d'échelle, mais pas sans coût réseau.

13 min de lecture
  • vLLM 0.27
  • KV cache
  • NIXL
  • Offloading

Silicon

RTX Spark sous Windows : CUDA est natif, la pile LLM ne l'est pas encore

RTX Spark apporte jusqu'à 128 Go de mémoire unifiée et CUDA natif à Windows on Arm. Au 12 août, le pilote et CUDA 13.4 restent en Developer Preview, TensorRT-RTX est prêt, tandis que PyTorch, llama.cpp et la pile de serving sont encore à qualifier.

13 min de lecture
  • RTX Spark
  • Windows on Arm
  • CUDA 13.4
  • TensorRT-RTX

Kernel & Perf

La décision d'une voiture autonome n'a pas de temps réel : qui la porte ?

Un réseau de neurones n'a pas de WCET exploitable pour la certification : le composant central de la conduite automatisée reste une boîte noire probabiliste. L'industrie ne le nie pas : elle déplace la garantie vers une couche qu'elle sait borner.

18 min de lecture
  • temps réel
  • WCET
  • ISO 26262
  • sécurité fonctionnelle

Runtimes

Kimi K3 ouvre 2,8 T de paramètres, pas un modèle local

Kimi K3 active 104 milliards de paramètres sur 2,8 billions, combine KDA et MLA sur un contexte d'un million de tokens, puis demande un nœud de huit B300 ou huit MI355X dans les recettes vLLM. Anatomie de ce que les poids ouverts changent réellement.

12 min de lecture
  • Kimi K3
  • Moonshot AI
  • MoE
  • KDA

Runtimes

Latence contre latence : ce que votre scheduler règle vraiment

Le scheduler d'un moteur d'inférence n'arbitre pas entre débit et latence, mais entre deux latences : le temps jusqu'au premier token et le temps entre les suivants. Trois moteurs majeurs, trois défauts opposés, et rien ne le signale à celui qui déploie.

21 min de lecture
  • Scheduler
  • vLLM
  • SGLang
  • TensorRT-LLM