Auteur

Christophe Gerardin

Développeur C/C++, réseaux & infrastructure d'inférence

Christophe Gerardin est développeur C/C++ qui travaille les réseaux et l'infrastructure : comment architecturer une plateforme d'inférence, servir des modèles et faire tenir l'ensemble (débit, latence, topologie) à l'échelle.

Son parcours est ancré dans la cybersécurité des systèmes de contrôle industriel (ICS/OT), mais ce n'est pas l'angle qu'il prend sur LeCompute : il y décortique l'infrastructure du compute IA par le réseau et l'architecture de service, là où se jouent réellement la performance et la robustesse d'un déploiement.

  • Réseaux
  • Infrastructure IA
  • Architecture & serving de modèles
  • C / C++
  • Cybersécurité ICS/OT (parcours)

Articles de Christophe 12

Kernel & Perf

La décision d'une voiture autonome n'a pas de temps réel : qui la porte ?

Un réseau de neurones n'a pas de WCET exploitable pour la certification : le composant central de la conduite automatisée reste une boîte noire probabiliste. L'industrie ne le nie pas : elle déplace la garantie vers une couche qu'elle sait borner.

18 min de lecture
  • temps réel
  • WCET
  • ISO 26262
  • sécurité fonctionnelle

Runtimes

Latence contre latence : ce que votre scheduler règle vraiment

Le scheduler d'un moteur d'inférence n'arbitre pas entre débit et latence, mais entre deux latences : le temps jusqu'au premier token et le temps entre les suivants. Trois moteurs majeurs, trois défauts opposés, et rien ne le signale à celui qui déploie.

21 min de lecture
  • Scheduler
  • vLLM
  • SGLang
  • TensorRT-LLM

Runtimes

MoE : à partir de quel batch le réseau prend-il le dessus ?

Un mixture-of-experts ne supprime pas le coût, il le déplace deux fois : du calcul vers la mémoire, puis de la mémoire vers le réseau. Le second basculement a un seuil, il se calcule, et c'est lui qui décide de votre topologie.

29 min de lecture
  • MoE
  • Parallélisme d'experts
  • all-to-all
  • DeepEP

Coûts

Ce qui empêche un modèle de conduite de traverser une frontière

Un modèle de conduite est une fonction de sa distribution de données. Mais le coût du transport n'est pas où on le croit : la perception se recale pour presque rien, le comportement non, et la validation domine tout. Le prix d'entrée sur un marché est une facture de simulation.

23 min de lecture
  • Conduite autonome
  • Validation
  • Simulation
  • UNECE

Runtimes

GGUF, GPTQ, AWQ : anatomie de trois façons de compresser un LLM

GGUF est un format de fichier, GPTQ et AWQ des algorithmes. À 4 bits, chacun attaque autrement le problème des valeurs aberrantes. Anatomie de trois constructions, de la Hessienne de GPTQ aux k-quants de GGUF, et de ce que le choix du format décide pour vous.

21 min de lecture
  • GGUF
  • GPTQ
  • AWQ
  • Quantification

Coûts

Stargate, Spud et abonnements : le levier compute de la remontada d'OpenAI

10 gigawatts « sécurisés avec des années d'avance », 0,3 gigawatt branché à Abilene. Derrière la remontada d'OpenAI dans l'IA de codage, un pari compute qu'il faut lire en trois états : le sécurisé, le construit, le branché. Et une économie d'abonnements que les agents ont fait craquer.

20 min de lecture
  • Stargate
  • OpenAI
  • Compute
  • Datacenter

Runtimes

SWE-Bench Pro désavoué : peut-on encore mesurer les agents de codage ?

Le 8 juillet 2026, OpenAI a désavoué SWE-Bench Pro : ~30 % de tâches cassées. C'est le troisième instrument de référence déclaré mort en trois générations. Anatomie d'une crise de métrologie : plafond de bruit, contamination, et un effet harnais qui vaut une génération de modèle.

19 min de lecture
  • Benchmarks
  • SWE-bench
  • Agents de codage
  • Évaluation

Coûts

GPT-5.6 et la fusion Codex : anatomie de la remontada d'OpenAI

Le 8 juillet 2026, OpenAI désavoue le benchmark de référence du codage agentique. Le 9, il fusionne Codex dans l'app ChatGPT et lance GPT-5.6. Derrière la séquence, une remontada qui se joue moins sur l'intelligence que sur les prix, les forfaits et le harnais.

21 min de lecture
  • GPT-5.6
  • Codex
  • Claude Code
  • OpenAI

Runtimes

Réduire la VRAM et le calcul d'un LLM : la carte des techniques

Quantification, GQA, MLA, fenêtre glissante, MoE, attention sparse, SSM : le zoo des techniques pour alléger un LLM est vaste. Plutôt qu'une liste, une carte rangée par la ressource qu'on attaque : les poids, le KV cache, le calcul par token, le matériel.

11 min de lecture
  • Efficacité
  • KV cache
  • Quantification
  • GQA

Runtimes

SSM et Mamba : le pari de supprimer le KV cache

Gemma borne le KV cache ; les modèles à espace d'états, Mamba et ses hybrides, le suppriment, en remplaçant le cache qui enfle par un état de taille constante. Une mémoire qui ne suit plus le contexte, mais qui bute sur le rappel exact, ce qui a fait des hybrides le format gagnant de 2026.

13 min de lecture
  • SSM
  • Mamba
  • Hybrides
  • KV cache

Coûts

GLM-5.2 : le jour où la frontière a changé de mains

Le 12 juin 2026, Washington a coupé l'accès européen aux meilleurs modèles d'Anthropic. Le lendemain, un laboratoire chinois publiait GLM-5.2 sous licence MIT, au niveau de GPT-5.5 et Gemini, et que personne ne peut éteindre à distance. Anatomie d'un basculement, du silicium au coût par tâche.

20 min de lecture
  • GLM-5.2
  • Open-weight
  • Souveraineté
  • MoE

Runtimes

Gemma : le KV cache qui cesse de suivre le contexte

Gemma 4 tient 256K tokens de contexte sans faire exploser la VRAM, grâce à une idée d'attention héritée de Gemma 3 : n'utiliser l'attention globale qu'une couche sur six, et fenêtrer toutes les autres. Comment ça marche, ce que ça coûte, et pourquoi la perplexité n'en souffre pas.

16 min de lecture
  • Gemma
  • Attention
  • KV cache
  • Contexte long