De la promesse des 600 milliards de paramètres à 96 Go
En mars 2025, Apple présentait le Mac Studio M3 Ultra comme une machine capable de garder en mémoire un LLM dépassant 600 milliards de paramètres. L’affirmation reposait sur une configuration inhabituelle dans un ordinateur de bureau : jusqu’à 512 Go de mémoire unifiée, accessibles au CPU et au GPU, avec plus de 800 Go/s de bande passante.
En août 2026, la fiche technique Apple raconte un produit différent. Le M3 Ultra est toujours proposé avec 28 ou 32 cœurs CPU, 60 ou 80 cœurs GPU et 819 Go/s de bande passante. La section mémoire ne liste plus que 96 Go. Ars Technica a observé le retrait du 512 Go en mars ; MacRumors a relevé celui du 256 Go en mai. Il ne s’agit ni d’une nouvelle puce ni d’une baisse de fréquence. Apple a retiré des configurations de son catalogue.
| Lancement, mars 2025 | Catalogue, août 2026 | |
|---|---|---|
| Mémoire unifiée | 96, 256 ou 512 Go | 96 Go |
| Bande passante | plus de 800 Go/s | 819 Go/s |
| GPU maximal | 80 cœurs | 80 cœurs |
| Promesse LLM Apple | > 600B en mémoire | non reprise comme capacité configurable |
| Effet technique | très grands modèles résidents | même vitesse, plafond de résidence abaissé |
Cette chronologie prouve le retrait. Elle ne prouve pas à elle seule sa cause. Apple n’a pas publié de note disant : « nous supprimons 256 et 512 Go pour réserver la DRAM à tel usage ». Tim Cook a reconnu une demande supérieure aux prévisions pour les Mac utilisés en IA, une offre contrainte et des coûts mémoire attendus en hausse. La presse a relié ces éléments à la pénurie mondiale de DRAM. C’est une explication documentée, pas une attribution officielle option par option.
Pourquoi 96 Go unifiés valent plus que 96 Go partagés par le PCIe
Sur Apple Silicon, « unifiée » n’est pas un synonyme marketing de RAM système empruntée par le GPU. Le CPU et le GPU adressent le même pool physique. La documentation MLX montre qu’un tableau créé une fois peut être traité par l’un ou l’autre sans copie explicite entre une RAM hôte et une VRAM séparée. Le planificateur insère les dépendances entre flux quand une opération CPU nourrit une opération GPU.
Cette architecture explique pourquoi le Mac Studio 512 Go constituait une catégorie à part. Sur une station CUDA classique, augmenter la RAM du système ne permet pas au GPU de relire 400 Go de poids à sa bande passante locale. Sur le M3 Ultra, la mémoire installée était aussi la mémoire du GPU. Le compromis restait sévère : 819 Go/s sont loin des plusieurs téraoctets par seconde d’un accélérateur HBM, et le calcul d’un modèle dense gigantesque restait lent. Mais la charge existait sur un seul bureau.
Le mot « 96 Go » demande néanmoins une seconde correction. macOS, les applications, les buffers MLX et le KV cache Mémoire des vecteurs clé et valeur déjà calculés pour chaque token traité par un LLM. Évite de recalculer l'attention sur tout l'historique, au prix d'une consommation mémoire qui croît avec le contexte.
Approfondir dans le glossaire
partagent ce pool. MLX expose device_info() pour distinguer la mémoire physique du max_recommended_working_set_size, puis set_wired_limit() pour fixer la quantité maintenue résidente. La limite utile n’est donc pas un pourcentage universel. Elle se mesure sur le système, et elle doit rester strictement sous la mémoire totale.
Ce qui tient encore dans 96 Go
La capacité des poids se calcule d’abord par paramètres × bits / 8, puis se corrige pour les métadonnées de quantification Réduction du nombre de bits codant chaque poids d'un modèle (de 16 bits vers 8, 4, voire moins). Elle divise l'empreinte mémoire d'autant, au prix d'une perte de précision contrôlée, sans changer le nombre de paramètres.
Approfondir dans le glossaire
, le cache et les buffers. Cette formule ne prédit pas la qualité du modèle ni le débit ; elle élimine les configurations physiquement impossibles.
| Classe | Poids estimés | Dans 96 Go ? |
|---|---|---|
| Dense 32B, 4 bits | 18 à 22 Go | oui, marge large |
| Dense 70B, 4 bits | 40 à 45 Go | oui, marge pour le cache |
| Dense 70B, 8 bits | 72 à 80 Go | possible, contexte et système contraints |
| Dense 120B, 4 bits | 68 à 78 Go | limite, à valider sur le fichier réel |
| Dense 405B, 4 bits | environ 220 à 250 Go | non |
| MoE 600B+, 4 bits | plus de 300 Go au total | non, même si peu de paramètres sont actifs |
Le cas des MoE Mixture-of-Experts. Architecture où le réseau est découpé en de nombreux « experts » dont un routeur n'active qu'un petit sous-ensemble par token. Le calcul par token suit le nombre de paramètres actifs ; la mémoire, elle, suit le nombre total, car tous les experts doivent rester résidents en VRAM, prêts à être sollicités. Approfondir dans le glossaire révèle l’erreur la plus coûteuse. Le nombre de paramètres actifs gouverne une partie du calcul par token. Le nombre total gouverne la résidence, car n’importe quel expert doit pouvoir être appelé. Un modèle de 600B dont 30B s’activent à chaque token peut générer comme une charge bien plus petite une fois chargé, mais ses centaines de gigaoctets de poids ne disparaissent pas. Le Mac 512 Go attaquait ce problème par la capacité. Le modèle 96 Go ne le résout pas par sa mémoire unifiée.
À l’autre extrémité, un 32B en 4 bits n’exploite qu’une fraction du pool. Passer de 96 à 512 Go ne lui donnait pas davantage de bande passante. À puce identique, la grande configuration ne devait pas produire plus de tokens par seconde. Elle permettait de charger autre chose à côté.
Les mesures montrent que le contexte mange le bénéfice de la quantification
Le jeu public le plus méthodique que nous ayons trouvé a été exécuté par un contributeur MLX sur un Mac Studio M3 Ultra 512 Go : 276 mesures, cinq modèles, six niveaux de quantification, sept longueurs de contexte, trois essais par cas, batch 1 et médiane publiée. Ce n’est pas un benchmark Apple ni une réplication indépendante. Il est utile parce qu’il expose les données brutes et fait varier un facteur à la fois.
Sur Qwen 32B, le modèle tient largement dans 96 Go. Les résultats décrivent donc le comportement d’une charge encore accessible au catalogue actuel, à condition d’aligner le nombre de cœurs GPU et les versions logicielles.
| Format | Contexte 1K | Contexte 32K | Contexte 128K |
|---|---|---|---|
| F16 | 10,4 tokens/s | 8,5 tokens/s | 5,5 tokens/s |
| Q8 | 18,3 tokens/s | 13,4 tokens/s | 7,1 tokens/s |
| Q4 | 31,2 tokens/s | 19,0 tokens/s | 8,5 tokens/s |
| Q2 | 47,6 tokens/s | 24,1 tokens/s | 9,3 tokens/s |
À 1K, Q2 produit 4,6 fois le débit F16. À 128K, le rapport tombe à 1,7. L’auteur attribue plus de 70 % du trafic mémoire au cache FP16 dans ce régime. Le mécanisme est cohérent : compresser les poids réduit les octets relus pour chaque token, mais le cache grandit avec le contexte et finit par absorber la bande passante économisée. Notre dossier sur le KV cache développe cette bascule.
Le même jeu mesure Llama 405B Q4 entre 2,9 tokens/s à 1K et 2,1 à 64K, avec des temps jusqu’au premier token qui atteignent plusieurs minutes lorsque le prompt grandit. Ces nombres disent deux choses. La configuration 512 Go rendait la charge possible. Elle ne la rendait pas nécessairement interactive. Depuis le retrait, cette expérience ne peut plus être reproduite sur un Mac Studio neuf unique.
L’objection : 512 Go étaient inutiles à presque tout le monde
La meilleure critique de cet article vient du benchmark lui-même. Son auteur conclut que 512 Go sont surdimensionnés pour l’inférence d’un modèle unique courant : un Qwen 32B Q4 occupe de l’ordre de 19 Go dans son protocole. La mémoire supplémentaire ne change ni les 819 Go/s ni le nombre de cœurs. Pour du chat local avec un modèle 7B, 30B ou 70B quantifié, le catalogue à 96 Go conserve l’essentiel de la proposition.
Cette objection est juste. Dire que le Mac Studio est « cassé pour l’IA » serait faux. La machine actuelle conserve une enveloppe rare pour le bureau, un runtime MLX conçu autour de sa mémoire et assez de capacité pour des modèles que les GPU grand public de 32 Go ne chargent pas seuls.
Ce qui disparaît est une option de recherche, pas un usage médian. Les 256 et 512 Go permettaient de comparer des quantifications d’un 405B, d’héberger plusieurs modèles, de conserver des caches volumineux, d’adapter de très grands réseaux ou d’explorer des MoE dont la faible activation masque un grand poids total. Ce sont précisément les charges qui justifiaient le M3 Ultra face à une station CUDA. Réduire la portée de cette perte au motif qu’elle concerne peu d’acheteurs reviendrait à confondre volume de ventes et singularité technique.
Ce que 96 Go changent dans une décision d’achat
Pour 7B à 70B quantifiés, le plafond n’est pas le problème principal. Il faut choisir le nombre de cœurs GPU, mesurer le prefill Phase initiale d'une inférence LLM : les tokens du prompt sont traités en parallèle pour construire l'état du contexte. Cette réutilisation augmente l'intensité arithmétique et peut rendre la phase limitée par le calcul ; le régime exact dépend du modèle, du batch, du contexte et du backend. Approfondir dans le glossaire et le decode Phase de génération autorégressive d'un LLM : un token est produit à la fois en relisant les poids et l'état de contexte utile. À faible batch, ce trafic peut limiter le decode par la bande passante mémoire. Sa part dans le coût total dépend toutefois des longueurs d'entrée et de sortie, du batching et de la réutilisation du cache. Approfondir dans le glossaire , puis dimensionner le contexte. La machine 96 Go peut garder les poids et un cache confortable dans le même pool.
Pour 120B dense, la décision devient un exercice de fichier réel. Une estimation Q4 peut tenir, mais le système, les buffers et une longue fenêtre se disputent la marge. Acheter sur le seul calcul 120 milliards × 4 bits ignore les échelles, les tables et le cache.
Pour 405B dense ou les grands MoE, un seul Mac Studio neuf est éliminé par la capacité. Une ancienne configuration 512 Go, plusieurs Mac reliés ou un serveur GPU redeviennent les catégories pertinentes. Le clustering Thunderbolt ajoute son propre modèle de parallélisme et ne recrée pas la simplicité d’un pool local de 512 Go.
Pour le multi-modèle et le fine-tuning, 96 Go ferment plus tôt le jeu. La mémoire unifiée doit porter en même temps les poids, activations, gradients éventuels, états d’optimiseur et applications. Une charge d’inférence qui tient avec 50 Go peut dépasser 96 Go dès qu’elle devient un entraînement.
Conclusion
Le Mac Studio M3 Ultra n’a pas été rendu lent. Il a été rendu moins singulier. Ses 819 Go/s, son pool CPU-GPU et MLX continuent de former une station locale cohérente pour les modèles qui tiennent sous le nouveau plafond. La disparition des grosses options ne retire aucun token par seconde à un 32B correctement configuré.
Elle retire une capacité plus rare : ouvrir sur un bureau des modèles dont le poids se comptait en centaines de gigaoctets, même lorsque leur vitesse rappelait les limites de la mémoire LPDDR. En 2025, Apple vendait la possibilité d’essayer. En 2026, le catalogue demande de choisir le modèle avant la machine. Pour un acheteur LLM, 96 Go ne sont donc ni insuffisants ni équivalents à 512. Ils déplacent la première question, de « à quelle vitesse ? » vers « est-ce encore résident ? ».
Sources et méthode
Les faits Apple au lancement viennent du communiqué du 5 mars 2025, Apple unveils new Mac Studio, qui annonce 96 à 512 Go, plus de 800 Go/s et la résidence de LLM dépassant 600 milliards de paramètres. La configuration actuelle est relevée sur la fiche technique Mac Studio : 96 Go et 819 Go/s au moment de la publication.
La chronologie des retraits repose sur les observations d’Ars Technica pour le 512 Go et de MacRumors pour le 256 Go. Ces sources rapportent aussi les déclarations de Tim Cook sur la demande, l’offre et les coûts mémoire. Nous ne transformons pas leur interprétation en explication officielle détaillée d’Apple.
Le mécanisme logiciel vient de la documentation MLX sur la mémoire unifiée et sur set_wired_limit. Elle établit l’accès CPU-GPU au même pool et la distinction entre mémoire totale et ensemble de travail recommandé.
Les mesures de performance viennent de la discussion communautaire MLX Systematic inference benchmarks: 5 models × 6 quants × 7 context lengths on M3 Ultra. Le protocole annoncé couvre 276 passages, trois essais par configuration, batch 1 et 256 tokens générés. Nous n’avons pas reproduit ces tests et Apple ne les valide pas. Les chiffres sont donc des mesures tierces, pas des spécifications.
Les tailles de modèles du tableau 2 sont des estimations de résidence issues de paramètres × bits / 8, élargies pour la surcharge de format. Elles excluent un budget fixe de KV cache parce que celui-ci dépend de l’architecture, du batch, de la longueur de contexte et de sa précision. La seule validation d’achat fiable reste la taille du fichier visé, la limite de travail retournée par MLX et un essai avec le contexte cible.