Tous les articles (page 3)

Runtimes

Réduire la VRAM et le calcul d'un LLM : la carte des techniques

Quantification, GQA, MLA, fenêtre glissante, MoE, attention sparse, SSM : le zoo des techniques pour alléger un LLM est vaste. Plutôt qu'une liste, une carte rangée par la ressource qu'on attaque : les poids, le KV cache, le calcul par token, le matériel.

11 min de lecture
  • Efficacité
  • KV cache
  • Quantification
  • GQA

Runtimes

SSM et Mamba : le pari de supprimer le KV cache

Gemma borne le KV cache ; les modèles à espace d'états, Mamba et ses hybrides, le suppriment, en remplaçant le cache qui enfle par un état de taille constante. Une mémoire qui ne suit plus le contexte, mais qui bute sur le rappel exact, ce qui a fait des hybrides le format gagnant de 2026.

13 min de lecture
  • SSM
  • Mamba
  • Hybrides
  • KV cache

Coûts

GLM-5.2 : le jour où la frontière a changé de mains

Le 12 juin 2026, Washington a coupé l'accès européen aux meilleurs modèles d'Anthropic. Le lendemain, un laboratoire chinois publiait GLM-5.2 sous licence MIT, au niveau de GPT-5.5 et Gemini, et que personne ne peut éteindre à distance. Anatomie d'un basculement, du silicium au coût par tâche.

20 min de lecture
  • GLM-5.2
  • Open-weight
  • Souveraineté
  • MoE

Runtimes

Gemma : le KV cache qui cesse de suivre le contexte

Gemma 4 tient 256K tokens de contexte sans faire exploser la VRAM, grâce à une idée d'attention héritée de Gemma 3 : n'utiliser l'attention globale qu'une couche sur six, et fenêtrer toutes les autres. Comment ça marche, ce que ça coûte, et pourquoi la perplexité n'en souffre pas.

16 min de lecture
  • Gemma
  • Attention
  • KV cache
  • Contexte long

Kernel & Perf

CUDA Tile : programmer le GPU à la tuile, plus au thread

Depuis quinze ans, un kernel GPU performant veut dire orchestrer des milliers de threads à la main. CUDA Tile remonte la programmation d'un cran, la tuile, et confie le reste au compilateur. Mécanique, et ce que ça change vraiment.

12 min de lecture
  • CUDA Tile
  • cuTile
  • Tile IR
  • Kernels GPU

Runtimes

Servir DeepSeek-V4 sans casser l'exactitude

DeepSeek-V4 compresse son attention si fort que le servir mal ne plante pas : ça dégrade l'exactitude en silence. Versions minimales par runtime, le flag qui restaure GSM8K, et comment le vérifier.

12 min de lecture
  • DeepSeek-V4
  • vLLM
  • SGLang
  • TensorRT-LLM

Kernel & Perf

sched_ext : écrire l'ordonnanceur de votre inférence en eBPF

eBPF vous a montré le thread coincé dans la run-queue qui affame le GPU. chrt et cpuset sont des marteaux. sched_ext laisse charger un ordonnanceur CPU sur mesure, en eBPF, sans patch ni redémarrage, taillé pour le prefill et le decode.

11 min de lecture
  • sched_ext
  • eBPF
  • Ordonnancement
  • Noyau Linux

Silicon

RTX Spark : le cousin Windows du DGX Spark, et le mur des 273 Go/s

Le RTX Spark (N1X) n'est pas un DGX Spark renommé : c'est le SoC Grace-Blackwell sous Windows on Arm, 128 Go de mémoire unifiée. Pourquoi ce sont les ~273 Go/s, et non le « pétaflop », qui décident de ce qu'il sait faire.

19 min de lecture
  • RTX Spark
  • DGX Spark
  • Grace-Blackwell
  • Mémoire unifiée

Silicon

Combien de VRAM pour faire tourner un LLM en local ?

Combien de VRAM faut-il pour un LLM en local ? La règle des ~2 Go par milliard de paramètres, le poids du KV cache, l'effet de la quantification, et ce qui tient vraiment sur votre carte.

8 min de lecture
  • VRAM
  • LLM local
  • Quantification
  • KV cache