À la une
AMD Infera face à Dynamo et llm-d : le routeur prend le contrôle
AMD lance Infera pour router les requêtes selon le KV cache, séparer prefill et decode, puis déporter le cache hors du GPU. Face à Dynamo et llm-d, la différence se joue moins sur les fonctions promises que sur le périmètre réellement livré.