Kernel & Perf
eBPF et perf : observer une stack d'inférence LLM
Le GPU est à 30 %, pourquoi ? eBPF et perf diagnostiquent le côté hôte d'une stack (ordonnancement, page faults, I/O), là où les abstractions s'arrêtent.
Dossiers
Tous les articles de LeCompute : silicium, runtimes d'inférence, edge AI, coûts et observabilité système.
54 articles publiés , page 5 sur 5
Kernel & Perf
Le GPU est à 30 %, pourquoi ? eBPF et perf diagnostiquent le côté hôte d'une stack (ordonnancement, page faults, I/O), là où les abstractions s'arrêtent.
Runtimes
Comment llama.cpp fait tenir des modèles de dizaines de milliards de paramètres sur du matériel grand public : format GGUF, quantification et chemin d'un token.
Silicon
AMD MI355X face à NVIDIA B200 et B300 : mémoire, bande passante, FP4 et le vrai écart, le scale-up NVLink et le logiciel. Comparatif sourcé, mi-2026.
Edge AI
Ce qui tourne sur un Jetson Orin hors datacenter : LLM quantifiés, vision temps réel, et les vraies limites, mémoire unifiée, thermique, arbitrage edge/cloud.
Silicon
FP8, FP6, FP4 : les formats numériques basse précision de l'inférence 2026. Formats à blocs MXFP4 et NVFP4, compromis portée/débit, et ce que le matériel supporte.
Edge AI
NPU ou GPU embarqué pour l'inférence à l'edge ? Deux philosophies comparées sur l'efficacité énergétique, la flexibilité et le vrai piège : la chaîne de compilation.