Tous les articles (page 2)

Runtimes

MoE : à partir de quel batch le réseau prend-il le dessus ?

Un mixture-of-experts ne supprime pas le coût, il le déplace deux fois : du calcul vers la mémoire, puis de la mémoire vers le réseau. Le second basculement a un seuil, il se calcule, et c'est lui qui décide de votre topologie.

29 min de lecture
  • MoE
  • Parallélisme d'experts
  • all-to-all
  • DeepEP

Coûts

Ce qui empêche un modèle de conduite de traverser une frontière

Un modèle de conduite est une fonction de sa distribution de données. Mais le coût du transport n'est pas où on le croit : la perception se recale pour presque rien, le comportement non, et la validation domine tout. Le prix d'entrée sur un marché est une facture de simulation.

23 min de lecture
  • Conduite autonome
  • Validation
  • Simulation
  • UNECE

Runtimes

AMD Infera face à Dynamo et llm-d : le routeur prend le contrôle

AMD lance Infera pour router les requêtes selon le KV cache, séparer prefill et decode, puis déporter le cache hors du GPU. Face à Dynamo et llm-d, la différence se joue moins sur les fonctions promises que sur le périmètre réellement livré.

14 min de lecture
  • AMD Infera
  • NVIDIA Dynamo
  • llm-d
  • KV cache

Runtimes

GGUF, GPTQ, AWQ : anatomie de trois façons de compresser un LLM

GGUF est un format de fichier, GPTQ et AWQ des algorithmes. À 4 bits, chacun attaque autrement le problème des valeurs aberrantes. Anatomie de trois constructions, de la Hessienne de GPTQ aux k-quants de GGUF, et de ce que le choix du format décide pour vous.

21 min de lecture
  • GGUF
  • GPTQ
  • AWQ
  • Quantification

Coûts

Stargate, Spud et abonnements : le levier compute de la remontada d'OpenAI

10 gigawatts « sécurisés avec des années d'avance », 0,3 gigawatt branché à Abilene. Derrière la remontada d'OpenAI dans l'IA de codage, un pari compute qu'il faut lire en trois états : le sécurisé, le construit, le branché. Et une économie d'abonnements que les agents ont fait craquer.

20 min de lecture
  • Stargate
  • OpenAI
  • Compute
  • Datacenter

Runtimes

SWE-Bench Pro désavoué : peut-on encore mesurer les agents de codage ?

Le 8 juillet 2026, OpenAI a désavoué SWE-Bench Pro : ~30 % de tâches cassées. C'est le troisième instrument de référence déclaré mort en trois générations. Anatomie d'une crise de métrologie : plafond de bruit, contamination, et un effet harnais qui vaut une génération de modèle.

19 min de lecture
  • Benchmarks
  • SWE-bench
  • Agents de codage
  • Évaluation

Coûts

GPT-5.6 et la fusion Codex : anatomie de la remontada d'OpenAI

Le 8 juillet 2026, OpenAI désavoue le benchmark de référence du codage agentique. Le 9, il fusionne Codex dans l'app ChatGPT et lance GPT-5.6. Derrière la séquence, une remontada qui se joue moins sur l'intelligence que sur les prix, les forfaits et le harnais.

21 min de lecture
  • GPT-5.6
  • Codex
  • Claude Code
  • OpenAI