À la une
Threadripper Halo Station vs DGX Station : comment comparer leur mémoire ?
Votre modèle dépasse la mémoire d’un GPU. AMD et NVIDIA proposent deux façons de lui faire de la place, mais leur capacité totale ne suffit pas à choisir.
À la une
Votre modèle dépasse la mémoire d’un GPU. AMD et NVIDIA proposent deux façons de lui faire de la place, mais leur capacité totale ne suffit pas à choisir.
LeCompute décortique l'infrastructure de l'IA : GPU et silicium, mémoire HBM et interconnexions, runtimes d'inférence comme vLLM ou llama.cpp, quantification et edge AI. Des analyses techniques et des benchmarks reproductibles, du silicium au code, sans hype.
Read our articles in EnglishRuntimes
Votre GPU travaille pendant qu’un autre ordinateur reste disponible. NVIDIA PAIR peut lui confier des demandes : voici quand cette répartition fait gagner du temps.
Silicon
Ryzen AI Halo et DGX Spark proposent 128 Go, mais leurs performances changent selon le modèle et le protocole. Mesures constructeur et essais indépendants audités.
Silicon
BlueField-4 et Pensando Salina ne calculent aucun token. Ils déplacent le réseau, le stockage, la sécurité et certains transferts du KV cache hors du CPU hôte. Voici le chemin de données qui peut libérer le GPU, ou seulement déplacer le goulot.
Coûts
MLPerf Endpoints mesure un service d'inférence derrière son API, sous plusieurs niveaux de charge. La version 0.7 trace enfin la courbe entre débit, TTFT, TPOT et qualité, mais ne normalise pas encore le coût.
Runtimes
MLPerf E2E-RAG chronomètre l'ingestion, la recherche, le reranking et quatre rôles LLM dans une boucle multi-hop. Son débit est comparable, mais son scénario offline et sa précision de référence à 35 % bornent le verdict.
Silicon
UALink 2.0 standardise le calcul dans le réseau ; NVLink 6 l'intègre dans ses switches. Voici ce que ce mécanisme change, et pourquoi Helios et Vera Rubin restent impossibles à départager.