← Retour au fil
Quatre Mac Studio en grappe atteignent 4,8 To/s : Apple et EXO Labs relancent l'IA locale
Coinacademy27 août, 11h · il y a 3j

Quatre Mac Studio en grappe atteignent 4,8 To/s : Apple et EXO Labs relancent l'IA locale

Quatre Mac Studio M5 Ultra valant 43 800 dollars forment, grâce à Thunderbolt 5 et au RDMA, une machine d'inférence unique de 4,8 To/s capable de faire tourner des modèles massifs comme GLM-5.3.

Apple et EXO Labs ont relié quatre Mac Studio M5 Ultra via Thunderbolt 5 pour en faire une machine d'inférence unique : 4,8 To/s de bande passante mémoire cumulée et plus d'un téraoctet de mémoire unifiée partagée. La clé est le RDMA à faible latence : les synchronisations passent d'environ 1 milliseconde à moins de 10 microsecondes, permettant de faire tourner des modèles massifs comme Kimi K3 ou GLM-5.3 à des vitesses proches d'une API. Coût total : environ 43 800 dollars.

Le contexte rend l'arithmétique favorable : la pénurie mondiale de mémoire vive, liée à la réallocation des lignes de production vers la mémoire haute bande passante pour l'IA, ne devrait pas s'améliorer avant 2028. Limites : grappe plafonnée à sept machines, Mac mini M6 incompatible, et surtout aucune mesure de performance indépendante publiée.

Détails

Source
Coinacademy
Publication
27 août à 11h56

Contenu source (brut)

<blockquote class="wp-block-quote is-layout-flow wp-block-quote-is-layout-flow"> <p><strong>Ce qu&rsquo;il faut retenir :</strong></p> <ul class="wp-block-list"> <li>Quatre Mac Studio M5 Ultra reliés en Thunderbolt 5 forment une machine d&rsquo;inférence unique de 4,8 To/s.</li> <li>Le gain vient de la latence, ramenée d&rsquo;environ 1 milliseconde à moins de 10 microsecondes.</li> <li>Les mesures de performance indépendantes ne sont pas encore publiées.</li> </ul> </blockquote> <p><strong>Quatre Mac Studio M5 Ultra reliés par Thunderbolt 5 peuvent désormais fonctionner comme une seule machine d&rsquo;inférence, avec une bande passante mémoire cumulée d&rsquo;environ 4,8 téraoctets par seconde.</strong> EXO Labs a annoncé sur X le résultat d&rsquo;une année de collaboration discrète avec <a class="wpil_keyword_link" href="https://coinacademy.fr/academie/apple-aapl/" target="_blank" rel="noopener" title="Apple" data-wpil-keyword-link="linked" data-wpil-monitor-id="568272">Apple</a> sur le <strong>RDMA à faible latence</strong>, une technique d&rsquo;accès direct à la mémoire d&rsquo;une autre machine sans passer par le système d&rsquo;exploitation.</p> <figure class="wp-block-embed is-type-rich is-provider-x wp-block-embed-x"><div class="wp-block-embed__wrapper"> <blockquote class="twitter-tweet" data-width="550" data-dnt="true"><p lang="en" dir="ltr">exo featured on Apple&#39;s new M5 Ultra Mac Studio and M6 / M5 Pro Mac Mini pages.<br><br>Over the past year, we have worked closely with Apple on low-latency RDMA networking over Thunderbolt 5, enabling clusters of Macs to run massive models like Kimi K3 and GLM-5.3 at API speeds.<br><br>With… <a href="https://t.co/Waww1Dcc8D" target="_blank">pic.twitter.com/Waww1Dcc8D</a></p>&mdash; EXO Labs (@exolabs) <a href="https://x.com/exolabs/status/2092320487019880735?ref_src=twsrc%5Etfw" target="_blank">August 25, 2026</a></blockquote><script async src="https://platform.x.com/widgets.js" charset="utf-8"></script> </div></figure> <h2 class="wp-block-heading" id="h-pourquoi-la-latence-comptait-plus-que-la-bande-passante"><span id="pourquoi-la-latence-comptait-plus-que-la-bande-passante">Pourquoi la latence comptait plus que la bande passante</span></h2> <p>L&rsquo;idée reçue voudrait qu&rsquo;il faille un débit réseau considérable pour répartir un modèle sur plusieurs machines. C&rsquo;est vrai pour l&rsquo;entraînement, beaucoup moins pour l&rsquo;inférence telle que ces grappes la pratiquent.</p> <p>Le calcul mérite d&rsquo;être posé. Le parallélisme de tenseurs découpe le modèle en parts égales entre les appareils. Chaque couche exige deux opérations de synchronisation d&rsquo;environ <strong>10 kilooctets</strong> par appareil. Sur un modèle comme <strong>GLM-5.3</strong> et ses 78 couches, cela représente <strong>156 synchronisations par token</strong>, pour un volume total dérisoire d&rsquo;environ 1,56 mégaoctet.</p> <p>Le problème n&rsquo;était donc pas le volume mais l&rsquo;aller-retour. Avec la pile réseau classique de macOS, chaque synchronisation ajoutait environ <strong>1 milliseconde</strong>, soit 156 millisecondes par token, ce qui plafonnait le débit à <strong>6,41 tokens par seconde</strong>, inutilisable pour un usage interactif. Le RDMA ramène cette latence <strong>sous les 10 microsecondes</strong>, réduisant la surcharge à environ 1,56 milliseconde par token.</p> <p>C&rsquo;est à cette condition que l&rsquo;agrégation de mémoire devient réelle : les quatre machines se comportent alors comme un unique accélérateur doté de plus d&rsquo;un téraoctet de mémoire partagée. Le principe est identique à celui qui justifie l&rsquo;existence de NVLink chez <a class="wpil_keyword_link" href="https://coinacademy.fr/academie/nvidia-nvda/" target="_blank" rel="noopener" title="Nvidia" data-wpil-keyword-link="linked" data-wpil-monitor-id="568275">Nvidia</a>, où l&rsquo;enjeu n&rsquo;est pas de déplacer des gigaoctets mais de gagner des microsecondes sur chaque synchronisation.</p> <p>Le Thunderbolt 5 plafonne à 120 gigabits par seconde en unidirectionnel et 80 en bidirectionnel, des chiffres modestes face aux interconnexions de centre de données, sans que cela pénalise ce type de charge.</p> <h2 class="wp-block-heading" id="h-combien-ca-coute"><span id="combien-ca-coute">Combien ça coûte</span></h2> <p>L&rsquo;addition dressée par Alex Cheema, d&rsquo;EXO Labs, se lit ainsi : quatre Mac Studio M5 Ultra de 256 gigaoctets à <strong>10 799 <a class="wpil_keyword_link" href="https://coinacademy.fr/academie/quest-ce-que-dedollarisation/" target="_blank" rel="noopener" title="dollars" data-wpil-keyword-link="linked" data-wpil-monitor-id="568273">dollars</a></strong> pièce, soit 43 196 dollars, plus environ 600 dollars de câbles, pour un total proche de <strong>43 800 dollars</strong>.</p> <p>La comparaison avec une station de travail équipée de quatre cartes RTX 6000 Ada tourne à l&rsquo;avantage relatif du Mac sur le prix, avec environ 46 000 dollars pour 384 gigaoctets de mémoire <a class="wpil_keyword_link" href="https://coinacademy.fr/tag/videos-podcasts/" target="_blank" rel="noopener" title="vidéo" data-wpil-keyword-link="linked" data-wpil-monitor-id="568274">vidéo</a>, mais une puissance de calcul brute bien supérieure côté Nvidia.</p> <p>L&rsquo;écart se creuse sur la consommation. Quatre Mac Studio tirent <strong>1,92 kilowatt</strong> en pointe, contre plus de 2,4 kilowatts pour les seules cartes graphiques d&rsquo;une configuration comparable, refroidissement non compris. Sur un fonctionnement continu, la différence pèse.</p> <h2 class="wp-block-heading" id="h-le-contexte-de-penurie-de-memoire"><span id="le-contexte-de-penurie-de-memoire">Le contexte de pénurie de mémoire</span></h2> <p>Un facteur extérieur rend cette arithmétique plus favorable qu&rsquo;elle ne l&rsquo;aurait été il y a un an.</p> <p>Les prix de la mémoire vive s&rsquo;envolent. Les analystes d&rsquo;IDC décrivent la réallocation des capacités de production vers la mémoire à haute bande passante comme une crise sans équivalent, sans amélioration attendue avant <strong>2028</strong>. Samsung, SK Hynix et Micron ont réorienté leurs lignes vers ce type de puces destinées aux accélérateurs d&rsquo;IA, dont la fabrication consomme environ trois fois plus de surface de plaquette que la mémoire classique.</p> <p>Dans ce contexte, la mémoire unifiée d&rsquo;Apple, facturée environ 25 dollars le gigaoctet en option, cesse de paraître déraisonnable.</p> <h2 class="wp-block-heading" id="h-la-limite-des-sept-machines"><span id="la-limite-des-sept-machines">La limite des sept machines</span></h2> <p>L&rsquo;architecture bute sur une contrainte physique. Le Mac Studio dispose de six ports Thunderbolt 5, et EXO relie pour l&rsquo;instant chaque machine à toutes les autres. Cette topologie exige N-1 ports par machine, ce qui plafonne la grappe à <strong>sept unités</strong>, avec 21 câbles.</p> <p>L&rsquo;équipe travaille sur des topologies en anneau pour dépasser cette limite, sans que les latences à sauts multiples aient encore été mesurées. Apple s&rsquo;en tient de son côté à une documentation couvrant officiellement jusqu&rsquo;à cinq systèmes, et une communication centrée sur la configuration à quatre nœuds.</p> <p>Une incompatibilité mérite d&rsquo;être signalée aux acheteurs : le Mac mini M6 utilise le Thunderbolt 4 et ne peut donc pas participer à ces grappes. Seuls le Mac mini M5 Pro, à 1 699 dollars, et les Mac Studio y sont éligibles.</p> <h2 class="wp-block-heading" id="h-les-mesures-independantes-manquent-toujours"><span id="les-mesures-independantes-manquent-toujours">Les mesures indépendantes manquent toujours</span></h2> <p>C&rsquo;est la réserve principale à opposer à cette annonce. Les relevés de performance complets ne sont pas publics, EXO Labs indiquant qu&rsquo;ils seront publiés sur local.ai dès que possible.</p> <p>Apple avance de son