Articles : Runtimes

Runtimes

MLPerf RAG mesure enfin toute la chaîne, pas encore le service

MLPerf E2E-RAG chronomètre l'ingestion, la recherche, le reranking et quatre rôles LLM dans une boucle multi-hop. Son débit est comparable, mais son scénario offline et sa précision de référence à 35 % bornent le verdict.

16 min de lecture
  • MLPerf
  • RAG
  • MLCommons
  • GPT-OSS

Runtimes

DWDP pour les MoE : déplacer les poids plutôt que les tokens

Le parallélisme d'experts déplace les tokens vers les poids. DWDP inverse le trajet, précharge les poids distants et supprime la synchronisation entre rangs. Le pari fonctionne, mais dans un régime étroit.

12 min de lecture
  • DWDP
  • MoE
  • SGLang
  • TensorRT-LLM

Runtimes

vLLM 0.27 : le KV cache devient pair-à-pair

vLLM 0.27 permet à chaque moteur de servir son KV cache CPU à un autre pair via NIXL, ajoute le filtrage par requête et expose des événements routables. Le cache change d'échelle, mais pas sans coût réseau.

13 min de lecture
  • vLLM 0.27
  • KV cache
  • NIXL
  • Offloading

Runtimes

Kimi K3 ouvre 2,8 T de paramètres, pas un modèle local

Kimi K3 active 104 milliards de paramètres sur 2,8 billions, combine KDA et MLA sur un contexte d'un million de tokens, puis demande un nœud de huit B300 ou huit MI355X dans les recettes vLLM. Anatomie de ce que les poids ouverts changent réellement.

12 min de lecture
  • Kimi K3
  • Moonshot AI
  • MoE
  • KDA

Runtimes

Latence contre latence : ce que votre scheduler règle vraiment

Le scheduler d'un moteur d'inférence n'arbitre pas entre débit et latence, mais entre deux latences : le temps jusqu'au premier token et le temps entre les suivants. Trois moteurs majeurs, trois défauts opposés, et rien ne le signale à celui qui déploie.

21 min de lecture
  • Scheduler
  • vLLM
  • SGLang
  • TensorRT-LLM

Runtimes

MoE : à partir de quel batch le réseau prend-il le dessus ?

Un mixture-of-experts ne supprime pas le coût, il le déplace deux fois : du calcul vers la mémoire, puis de la mémoire vers le réseau. Le second basculement a un seuil, il se calcule, et c'est lui qui décide de votre topologie.

29 min de lecture
  • MoE
  • Parallélisme d'experts
  • all-to-all
  • DeepEP

Runtimes

AMD Infera face à Dynamo et llm-d : le routeur prend le contrôle

AMD lance Infera pour router les requêtes selon le KV cache, séparer prefill et decode, puis déporter le cache hors du GPU. Face à Dynamo et llm-d, la différence se joue moins sur les fonctions promises que sur le périmètre réellement livré.

14 min de lecture
  • AMD Infera
  • NVIDIA Dynamo
  • llm-d
  • KV cache

Runtimes

GGUF, GPTQ, AWQ : anatomie de trois façons de compresser un LLM

GGUF est un format de fichier, GPTQ et AWQ des algorithmes. À 4 bits, chacun attaque autrement le problème des valeurs aberrantes. Anatomie de trois constructions, de la Hessienne de GPTQ aux k-quants de GGUF, et de ce que le choix du format décide pour vous.

21 min de lecture
  • GGUF
  • GPTQ
  • AWQ
  • Quantification

Runtimes

SWE-Bench Pro désavoué : peut-on encore mesurer les agents de codage ?

Le 8 juillet 2026, OpenAI a désavoué SWE-Bench Pro : ~30 % de tâches cassées. C'est le troisième instrument de référence déclaré mort en trois générations. Anatomie d'une crise de métrologie : plafond de bruit, contamination, et un effet harnais qui vaut une génération de modèle.

19 min de lecture
  • Benchmarks
  • SWE-bench
  • Agents de codage
  • Évaluation

Runtimes

Réduire la VRAM et le calcul d'un LLM : la carte des techniques

Quantification, GQA, MLA, fenêtre glissante, MoE, attention sparse, SSM : le zoo des techniques pour alléger un LLM est vaste. Plutôt qu'une liste, une carte rangée par la ressource qu'on attaque : les poids, le KV cache, le calcul par token, le matériel.

11 min de lecture
  • Efficacité
  • KV cache
  • Quantification
  • GQA

Runtimes

SSM et Mamba : le pari de supprimer le KV cache

Gemma borne le KV cache ; les modèles à espace d'états, Mamba et ses hybrides, le suppriment, en remplaçant le cache qui enfle par un état de taille constante. Une mémoire qui ne suit plus le contexte, mais qui bute sur le rappel exact, ce qui a fait des hybrides le format gagnant de 2026.

13 min de lecture
  • SSM
  • Mamba
  • Hybrides
  • KV cache

Runtimes

Gemma : le KV cache qui cesse de suivre le contexte

Gemma 4 tient 256K tokens de contexte sans faire exploser la VRAM, grâce à une idée d'attention héritée de Gemma 3 : n'utiliser l'attention globale qu'une couche sur six, et fenêtrer toutes les autres. Comment ça marche, ce que ça coûte, et pourquoi la perplexité n'en souffre pas.

16 min de lecture
  • Gemma
  • Attention
  • KV cache
  • Contexte long