Articles : Runtimes (page 2)

Runtimes

Servir DeepSeek-V4 sans casser l'exactitude

DeepSeek-V4 compresse son attention si fort que le servir mal ne plante pas : ça dégrade l'exactitude en silence. Versions minimales par runtime, le flag qui restaure GSM8K, et comment le vérifier.

12 min de lecture
  • DeepSeek-V4
  • vLLM
  • SGLang
  • TensorRT-LLM

Runtimes

vLLM vs llama.cpp vs TensorRT-LLM : quel runtime choisir ?

Trois runtimes d'inférence LLM, trois philosophies : débit serveur, déploiement local, performance verrouillée NVIDIA. Matrice de décision claire pour choisir.

8 min de lecture
  • vLLM
  • llama.cpp
  • TensorRT-LLM
  • Inférence

Runtimes

KV cache : pourquoi votre LLM sature la mémoire

Le KV cache explique pourquoi un LLM consomme autant de VRAM. Définition, calcul de taille concret, PagedAttention, quantification FP8 et prefix caching.

9 min de lecture
  • KV cache
  • PagedAttention
  • Quantification
  • Mémoire

Runtimes

llama.cpp expliqué : GGUF, quantification et kernels

Comment llama.cpp fait tenir des modèles de dizaines de milliards de paramètres sur du matériel grand public : format GGUF, quantification et chemin d'un token.

8 min de lecture
  • llama.cpp
  • GGUF
  • Quantification
  • Quantization