Tous les articles (page 5)

Kernel & Perf

eBPF et perf : observer une stack d'inférence LLM

Le GPU est à 30 %, pourquoi ? eBPF et perf diagnostiquent le côté hôte d'une stack (ordonnancement, page faults, I/O), là où les abstractions s'arrêtent.

10 min de lecture
  • eBPF
  • perf
  • Observabilité
  • Noyau Linux

Runtimes

llama.cpp expliqué : GGUF, quantification et kernels

Comment llama.cpp fait tenir des modèles de dizaines de milliards de paramètres sur du matériel grand public : format GGUF, quantification et chemin d'un token.

8 min de lecture
  • llama.cpp
  • GGUF
  • Quantification
  • Quantization

Silicon

AMD MI355X vs NVIDIA B200/B300 : le vrai match en 2026

AMD MI355X face à NVIDIA B200 et B300 : mémoire, bande passante, FP4 et le vrai écart, le scale-up NVLink et le logiciel. Comparatif sourcé, mi-2026.

6 min de lecture
  • AMD MI355X
  • NVIDIA B200
  • Blackwell
  • CDNA 4

Edge AI

Jetson Orin et edge AI : LLM, vision et limites mémoire

Ce qui tourne sur un Jetson Orin hors datacenter : LLM quantifiés, vision temps réel, et les vraies limites, mémoire unifiée, thermique, arbitrage edge/cloud.

9 min de lecture
  • Jetson Orin
  • Edge AI
  • Embarqué
  • Vision