Recherche
Rechercher un dossier
Rechercher dans tous les dossiers de LeCompute : silicium, runtimes et edge AI.
54 dossiers disponibles.
- Silicon
BlueField-4 face à Pensando Salina : le DPU entre dans le chemin de l'inférence
BlueField-4 et Pensando Salina ne calculent aucun token. Ils déplacent le réseau, le stockage, la sécurité et certains transferts du KV cache hors du CPU hôte. Voici le chemin de données qui peut libérer le GPU, ou seulement déplacer le goulot.
- Coûts
MLPerf Endpoints : peut-on enfin comparer les fournisseurs d'inférence ?
MLPerf Endpoints mesure un service d'inférence derrière son API, sous plusieurs niveaux de charge. La version 0.7 trace enfin la courbe entre débit, TTFT, TPOT et qualité, mais ne normalise pas encore le coût.
- Runtimes
MLPerf RAG mesure enfin toute la chaîne, pas encore le service
MLPerf E2E-RAG chronomètre l'ingestion, la recherche, le reranking et quatre rôles LLM dans une boucle multi-hop. Son débit est comparable, mais son scénario offline et sa précision de référence à 35 % bornent le verdict.
- Silicon
UALink 2.0 contre NVLink 6 : quand le réseau calcule l'all-reduce
UALink 2.0 standardise le calcul dans le réseau ; NVLink 6 l'intègre dans ses switches. Voici ce que ce mécanisme change, et pourquoi Helios et Vera Rubin restent impossibles à départager.
- Runtimes
DWDP pour les MoE : déplacer les poids plutôt que les tokens
Le parallélisme d'experts déplace les tokens vers les poids. DWDP inverse le trajet, précharge les poids distants et supprime la synchronisation entre rangs. Le pari fonctionne, mais dans un régime étroit.
- Silicon
Mac Studio M3 Ultra limité à 96 Go : ce qui change pour les LLM locaux
Apple vendait le M3 Ultra avec 256 ou 512 Go de mémoire unifiée. Il ne reste que 96 Go. La puce n'a pas ralenti, mais une classe entière de modèles locaux vient de sortir du catalogue.
- Silicon
RTX PRO 6000 ou trois RTX 5090 : 96 Go ne font pas une mémoire unique
Une RTX PRO 6000 et trois RTX 5090 totalisent chacune 96 Go de GDDR7. Pour un LLM, cette égalité s'arrête au nombre : pool unique, modèle réparti et répliques indépendantes ne paient pas les mêmes coûts.
- Runtimes
vLLM 0.27 : le KV cache devient pair-à-pair
vLLM 0.27 permet à chaque moteur de servir son KV cache CPU à un autre pair via NIXL, ajoute le filtrage par requête et expose des événements routables. Le cache change d'échelle, mais pas sans coût réseau.
- Silicon
RTX Spark sous Windows : CUDA est natif, la pile LLM ne l'est pas encore
RTX Spark apporte jusqu'à 128 Go de mémoire unifiée et CUDA natif à Windows on Arm. Au 12 août, le pilote et CUDA 13.4 restent en Developer Preview, TensorRT-RTX est prêt, tandis que PyTorch, llama.cpp et la pile de serving sont encore à qualifier.
- Kernel & Perf
La décision d'une voiture autonome n'a pas de temps réel : qui la porte ?
Un réseau de neurones n'a pas de WCET exploitable pour la certification : le composant central de la conduite automatisée reste une boîte noire probabiliste. L'industrie ne le nie pas : elle déplace la garantie vers une couche qu'elle sait borner.
- Runtimes
Kimi K3 ouvre 2,8 T de paramètres, pas un modèle local
Kimi K3 active 104 milliards de paramètres sur 2,8 billions, combine KDA et MLA sur un contexte d'un million de tokens, puis demande un nœud de huit B300 ou huit MI355X dans les recettes vLLM. Anatomie de ce que les poids ouverts changent réellement.
- Runtimes
Latence contre latence : ce que votre scheduler règle vraiment
Le scheduler d'un moteur d'inférence n'arbitre pas entre débit et latence, mais entre deux latences : le temps jusqu'au premier token et le temps entre les suivants. Trois moteurs majeurs, trois défauts opposés, et rien ne le signale à celui qui déploie.
- Runtimes
MoE : à partir de quel batch le réseau prend-il le dessus ?
Un mixture-of-experts ne supprime pas le coût, il le déplace deux fois : du calcul vers la mémoire, puis de la mémoire vers le réseau. Le second basculement a un seuil, il se calcule, et c'est lui qui décide de votre topologie.
- Coûts
Ce qui empêche un modèle de conduite de traverser une frontière
Un modèle de conduite est une fonction de sa distribution de données. Mais le coût du transport n'est pas où on le croit : la perception se recale pour presque rien, le comportement non, et la validation domine tout. Le prix d'entrée sur un marché est une facture de simulation.
- Runtimes
AMD Infera face à Dynamo et llm-d : le routeur prend le contrôle
AMD lance Infera pour router les requêtes selon le KV cache, séparer prefill et decode, puis déporter le cache hors du GPU. Face à Dynamo et llm-d, la différence se joue moins sur les fonctions promises que sur le périmètre réellement livré.
- Silicon
AMD MI455X contre NVIDIA Rubin : la mémoire suffit-elle à battre NVLink ?
Le MI455X embarque 432 Go de HBM4, contre 288 Go pour Rubin. Mais AMD doit aussi prouver que son tissu UALoE transforme cet avantage de capacité en performances au niveau du rack.
- Edge AI
FastFlowLM rejoint AMD : le NPU Ryzen AI devient crédible pour les LLM locaux
AMD intègre l'équipe FastFlowLM, dont le runtime exécute déjà des LLM sur les NPU XDNA2 des Ryzen AI. Architecture, benchmarks, consommation et limites mémoire.
- Runtimes
GGUF, GPTQ, AWQ : anatomie de trois façons de compresser un LLM
GGUF est un format de fichier, GPTQ et AWQ des algorithmes. À 4 bits, chacun attaque autrement le problème des valeurs aberrantes. Anatomie de trois constructions, de la Hessienne de GPTQ aux k-quants de GGUF, et de ce que le choix du format décide pour vous.
- Coûts
Stargate, Spud et abonnements : le levier compute de la remontada d'OpenAI
10 gigawatts « sécurisés avec des années d'avance », 0,3 gigawatt branché à Abilene. Derrière la remontada d'OpenAI dans l'IA de codage, un pari compute qu'il faut lire en trois états : le sécurisé, le construit, le branché. Et une économie d'abonnements que les agents ont fait craquer.
- Runtimes
SWE-Bench Pro désavoué : peut-on encore mesurer les agents de codage ?
Le 8 juillet 2026, OpenAI a désavoué SWE-Bench Pro : ~30 % de tâches cassées. C'est le troisième instrument de référence déclaré mort en trois générations. Anatomie d'une crise de métrologie : plafond de bruit, contamination, et un effet harnais qui vaut une génération de modèle.
- Coûts
GPT-5.6 et la fusion Codex : anatomie de la remontada d'OpenAI
Le 8 juillet 2026, OpenAI désavoue le benchmark de référence du codage agentique. Le 9, il fusionne Codex dans l'app ChatGPT et lance GPT-5.6. Derrière la séquence, une remontada qui se joue moins sur l'intelligence que sur les prix, les forfaits et le harnais.
- Silicon
DGX Spark vs RTX 5090 : capacité ou vitesse, le choix qui décide de votre LLM local
À prix quasi égal, le DGX Spark et la RTX 5090 répondent à deux questions opposées : loger un très gros modèle, ou servir vite un modèle moyen. Le duel chiffré, mesures et mécanismes à l'appui.
- Silicon
Quel GPU pour un LLM en 2026 : les trois questions à poser avant la fiche technique
Choisir un GPU pour un LLM se joue sur trois questions : combien de mémoire, combien de bande passante, acheter ou louer. La méthode, les verdicts par profil et les prix réels du marché 2026.
- Coûts
Combien coûte un serveur GPU pour LLM : achat, énergie, amortissement
Ce que coûte un serveur GPU pour LLM en 2026 : de la workstation RTX 5090 au nœud 8 GPU, électricité et hébergement compris, et le point où l'achat bat la location.
- Silicon
Puce « sous 1 nm » d'IBM : le nanostack expliqué, sans le marketing
IBM annonce la première puce « sous 1 nanomètre ». Le chiffre est un nom de nœud, pas une dimension. Le vrai saut est ailleurs : empiler les transistors en 3D, et débloquer le SRAM que l'IA réclame.
- Runtimes
Réduire la VRAM et le calcul d'un LLM : la carte des techniques
Quantification, GQA, MLA, fenêtre glissante, MoE, attention sparse, SSM : le zoo des techniques pour alléger un LLM est vaste. Plutôt qu'une liste, une carte rangée par la ressource qu'on attaque : les poids, le KV cache, le calcul par token, le matériel.
- Runtimes
SSM et Mamba : le pari de supprimer le KV cache
Gemma borne le KV cache ; les modèles à espace d'états, Mamba et ses hybrides, le suppriment, en remplaçant le cache qui enfle par un état de taille constante. Une mémoire qui ne suit plus le contexte, mais qui bute sur le rappel exact, ce qui a fait des hybrides le format gagnant de 2026.
- Coûts
GLM-5.2 : le jour où la frontière a changé de mains
Le 12 juin 2026, Washington a coupé l'accès européen aux meilleurs modèles d'Anthropic. Le lendemain, un laboratoire chinois publiait GLM-5.2 sous licence MIT, au niveau de GPT-5.5 et Gemini, et que personne ne peut éteindre à distance. Anatomie d'un basculement, du silicium au coût par tâche.
- Runtimes
Gemma : le KV cache qui cesse de suivre le contexte
Gemma 4 tient 256K tokens de contexte sans faire exploser la VRAM, grâce à une idée d'attention héritée de Gemma 3 : n'utiliser l'attention globale qu'une couche sur six, et fenêtrer toutes les autres. Comment ça marche, ce que ça coûte, et pourquoi la perplexité n'en souffre pas.
- Kernel & Perf
CUDA Tile : programmer le GPU à la tuile, plus au thread
Depuis quinze ans, un kernel GPU performant veut dire orchestrer des milliers de threads à la main. CUDA Tile remonte la programmation d'un cran, la tuile, et confie le reste au compilateur. Mécanique, et ce que ça change vraiment.
- Runtimes
Servir DeepSeek-V4 sans casser l'exactitude
DeepSeek-V4 compresse son attention si fort que le servir mal ne plante pas : ça dégrade l'exactitude en silence. Versions minimales par runtime, le flag qui restaure GSM8K, et comment le vérifier.
- Kernel & Perf
sched_ext : écrire l'ordonnanceur de votre inférence en eBPF
eBPF vous a montré le thread coincé dans la run-queue qui affame le GPU. chrt et cpuset sont des marteaux. sched_ext laisse charger un ordonnanceur CPU sur mesure, en eBPF, sans patch ni redémarrage, taillé pour le prefill et le decode.
- Silicon
TorchTPU, XLA, JAX : comment Google attaque le verrou logiciel de NVIDIA
TorchTPU, PyTorch/XLA, JAX, XLA et vLLM forment une pile dont la clé de voûte est un compilateur. Comment Google s'attaque au seul actif qui retient les développeurs chez NVIDIA : le coût de quitter CUDA.
- Silicon
RTX Spark : le cousin Windows du DGX Spark, et le mur des 273 Go/s
Le RTX Spark (N1X) n'est pas un DGX Spark renommé : c'est le SoC Grace-Blackwell sous Windows on Arm, 128 Go de mémoire unifiée. Pourquoi ce sont les ~273 Go/s, et non le « pétaflop », qui décident de ce qu'il sait faire.
- Silicon
Combien de VRAM pour faire tourner un LLM en local ?
Combien de VRAM faut-il pour un LLM en local ? La règle des ~2 Go par milliard de paramètres, le poids du KV cache, l'effet de la quantification, et ce qui tient vraiment sur votre carte.
- Runtimes
FP4 n'existe pas : il existe des FP4, et chaque runtime choisit son dialecte
NVFP4, MXFP4, W4A4, TurboQuant : le paysage FP4 s'est fragmenté en dialectes. Chaque runtime choisit le sien, et le choix dépend du matériel, du modèle et de la charge.
- Runtimes
La disaggregation prefill/decode sort du papier : état des lieux mai 2026
NVIDIA Dynamo 1.0, SGLang 0.5.12, TensorRT-LLM 1.3, Tenstorrent Blackhole : la disaggregation prefill/decode entre en production. Implémentations, benchmarks et contre-arguments.
- Runtimes
Le KV cache n'est plus un effet de bord : c'est l'objet central du serving en 2026
Le KV cache a cessé d'être un résidu VRAM subi : il possède sa propre quantification (TurboQuant ~3 bits), son protocole de transfert, son stockage hiérarchique (KVBM G1→G4) et son routage dédié. Anatomie de cette mutation.
- Silicon
Vera Rubin : la fin de l'inférence GPU homogène
NVIDIA Vera Rubin n'est pas qu'un GPU plus rapide : l'inférence éclate en trois tiers (prefill GPU, decode LPU, orchestration CPU) coordonnés par Dynamo.
- Coûts
Coût d'inférence LLM : API, GPU cloud ou auto-hébergement ?
Le vrai coût de l'inférence LLM en 2026 : prix des API au token, location de GPU, auto-hébergement. Calculez votre point de bascule, chiffres et sources à l'appui.
- Silicon
H100 vs B200 : analyse microarchitecturale et performance réelle en inférence LLM
H100 Hopper face aux Blackwell B200 et B100 : architecture, mémoire HBM3e, NVLink 5 et débit mesuré en inférence LLM. D'où vient le gain, et pour quelles charges il compte.
- Coûts
GPU cloud en France et en Europe : où louer H100, H200 et Blackwell
Où louer des GPU H100, H200 et Blackwell en France et en Europe en 2026 : Scaleway, OVHcloud, alternatives, prix relevés, souveraineté et pénurie.
- Silicon
RTX 5090 vs H100 : quelle carte pour un LLM en local ?
RTX 5090 vs H100 pour faire tourner un LLM en local : 32 Go GDDR7 face à 80 Go HBM3, ce qui tient vraiment en VRAM, et pourquoi ce ne sont pas les mêmes produits.
- Silicon
HBM et NVLink : pourquoi les LLM sont limités par la mémoire
En génération autorégressive à faible batch, la bande passante HBM peut limiter les LLM avant les FLOPS. KV cache, NVLink et dimensionnement expliqués.
- Silicon
CUDA vs ROCm en 2026 : l'écart réel en production IA
CUDA vs ROCm en 2026 : le débat n'est plus « est-ce que ROCm marche » mais « quel écart reste-t-il ». Versions, parité framework, vrais verrous, sources.
- Edge AI
Jetson Thor, Hailo-10H, Coral : quel accélérateur edge en 2026 ?
Le paysage des accélérateurs edge a basculé : Jetson Thor ouvre un palier Blackwell, le Hailo-10H fait du GenAI, et Google Coral est abandonné. Comparatif 2026.
- Runtimes
vLLM vs llama.cpp vs TensorRT-LLM : quel runtime choisir ?
Trois runtimes d'inférence LLM, trois philosophies : débit serveur, déploiement local, performance verrouillée NVIDIA. Matrice de décision claire pour choisir.
- Runtimes
KV cache : pourquoi votre LLM sature la mémoire
Le KV cache explique pourquoi un LLM consomme autant de VRAM. Définition, calcul de taille concret, PagedAttention, quantification FP8 et prefix caching.
- Kernel & Perf
eBPF et perf : observer une stack d'inférence LLM
Le GPU est à 30 %, pourquoi ? eBPF et perf diagnostiquent le côté hôte d'une stack (ordonnancement, page faults, I/O), là où les abstractions s'arrêtent.
- Runtimes
llama.cpp expliqué : GGUF, quantification et kernels
Comment llama.cpp fait tenir des modèles de dizaines de milliards de paramètres sur du matériel grand public : format GGUF, quantification et chemin d'un token.
- Silicon
AMD MI355X vs NVIDIA B200/B300 : le vrai match en 2026
AMD MI355X face à NVIDIA B200 et B300 : mémoire, bande passante, FP4 et le vrai écart, le scale-up NVLink et le logiciel. Comparatif sourcé, mi-2026.
- Edge AI
Jetson Orin et edge AI : LLM, vision et limites mémoire
Ce qui tourne sur un Jetson Orin hors datacenter : LLM quantifiés, vision temps réel, et les vraies limites, mémoire unifiée, thermique, arbitrage edge/cloud.
- Silicon
FP8, FP6, FP4 : ce que la basse précision change vraiment
FP8, FP6, FP4 : les formats numériques basse précision de l'inférence 2026. Formats à blocs MXFP4 et NVFP4, compromis portée/débit, et ce que le matériel supporte.
- Edge AI
NPU vs GPU à l'edge : quel accélérateur pour l'inférence embarquée
NPU ou GPU embarqué pour l'inférence à l'edge ? Deux philosophies comparées sur l'efficacité énergétique, la flexibilité et le vrai piège : la chaîne de compilation.
Aucun dossier ne correspond à cette recherche. Essayez un autre terme ou parcourez tous les dossiers.