Contenu source (brut)
<blockquote class="wp-block-quote is-layout-flow wp-block-quote-is-layout-flow">
<p><strong>Ce qu’il faut retenir :</strong></p>
<ul class="wp-block-list">
<li>Quatre Mac Studio M5 Ultra reliés en Thunderbolt 5 forment une machine d’inférence unique de 4,8 To/s.</li>
<li>Le gain vient de la latence, ramenée d’environ 1 milliseconde à moins de 10 microsecondes.</li>
<li>Les mesures de performance indépendantes ne sont pas encore publiées.</li>
</ul>
</blockquote>
<p><strong>Quatre Mac Studio M5 Ultra reliés par Thunderbolt 5 peuvent désormais fonctionner comme une seule machine d’inférence, avec une bande passante mémoire cumulée d’environ 4,8 téraoctets par seconde.</strong> EXO Labs a annoncé sur X le résultat d’une année de collaboration discrète avec <a class="wpil_keyword_link" href="https://coinacademy.fr/academie/apple-aapl/" target="_blank" rel="noopener" title="Apple" data-wpil-keyword-link="linked" data-wpil-monitor-id="568272">Apple</a> sur le <strong>RDMA à faible latence</strong>, une technique d’accès direct à la mémoire d’une autre machine sans passer par le système d’exploitation.</p>
<figure class="wp-block-embed is-type-rich is-provider-x wp-block-embed-x"><div class="wp-block-embed__wrapper">
<blockquote class="twitter-tweet" data-width="550" data-dnt="true"><p lang="en" dir="ltr">exo featured on Apple's new M5 Ultra Mac Studio and M6 / M5 Pro Mac Mini pages.<br><br>Over the past year, we have worked closely with Apple on low-latency RDMA networking over Thunderbolt 5, enabling clusters of Macs to run massive models like Kimi K3 and GLM-5.3 at API speeds.<br><br>With… <a href="https://t.co/Waww1Dcc8D" target="_blank">pic.twitter.com/Waww1Dcc8D</a></p>— EXO Labs (@exolabs) <a href="https://x.com/exolabs/status/2092320487019880735?ref_src=twsrc%5Etfw" target="_blank">August 25, 2026</a></blockquote><script async src="https://platform.x.com/widgets.js" charset="utf-8"></script>
</div></figure>
<h2 class="wp-block-heading" id="h-pourquoi-la-latence-comptait-plus-que-la-bande-passante"><span id="pourquoi-la-latence-comptait-plus-que-la-bande-passante">Pourquoi la latence comptait plus que la bande passante</span></h2>
<p>L’idée reçue voudrait qu’il faille un débit réseau considérable pour répartir un modèle sur plusieurs machines. C’est vrai pour l’entraînement, beaucoup moins pour l’inférence telle que ces grappes la pratiquent.</p>
<p>Le calcul mérite d’être posé. Le parallélisme de tenseurs découpe le modèle en parts égales entre les appareils. Chaque couche exige deux opérations de synchronisation d’environ <strong>10 kilooctets</strong> par appareil. Sur un modèle comme <strong>GLM-5.3</strong> et ses 78 couches, cela représente <strong>156 synchronisations par token</strong>, pour un volume total dérisoire d’environ 1,56 mégaoctet.</p>
<p>Le problème n’était donc pas le volume mais l’aller-retour. Avec la pile réseau classique de macOS, chaque synchronisation ajoutait environ <strong>1 milliseconde</strong>, soit 156 millisecondes par token, ce qui plafonnait le débit à <strong>6,41 tokens par seconde</strong>, inutilisable pour un usage interactif. Le RDMA ramène cette latence <strong>sous les 10 microsecondes</strong>, réduisant la surcharge à environ 1,56 milliseconde par token.</p>
<p>C’est à cette condition que l’agrégation de mémoire devient réelle : les quatre machines se comportent alors comme un unique accélérateur doté de plus d’un téraoctet de mémoire partagée. Le principe est identique à celui qui justifie l’existence de NVLink chez <a class="wpil_keyword_link" href="https://coinacademy.fr/academie/nvidia-nvda/" target="_blank" rel="noopener" title="Nvidia" data-wpil-keyword-link="linked" data-wpil-monitor-id="568275">Nvidia</a>, où l’enjeu n’est pas de déplacer des gigaoctets mais de gagner des microsecondes sur chaque synchronisation.</p>
<p>Le Thunderbolt 5 plafonne à 120 gigabits par seconde en unidirectionnel et 80 en bidirectionnel, des chiffres modestes face aux interconnexions de centre de données, sans que cela pénalise ce type de charge.</p>
<h2 class="wp-block-heading" id="h-combien-ca-coute"><span id="combien-ca-coute">Combien ça coûte</span></h2>
<p>L’addition dressée par Alex Cheema, d’EXO Labs, se lit ainsi : quatre Mac Studio M5 Ultra de 256 gigaoctets à <strong>10 799 <a class="wpil_keyword_link" href="https://coinacademy.fr/academie/quest-ce-que-dedollarisation/" target="_blank" rel="noopener" title="dollars" data-wpil-keyword-link="linked" data-wpil-monitor-id="568273">dollars</a></strong> pièce, soit 43 196 dollars, plus environ 600 dollars de câbles, pour un total proche de <strong>43 800 dollars</strong>.</p>
<p>La comparaison avec une station de travail équipée de quatre cartes RTX 6000 Ada tourne à l’avantage relatif du Mac sur le prix, avec environ 46 000 dollars pour 384 gigaoctets de mémoire <a class="wpil_keyword_link" href="https://coinacademy.fr/tag/videos-podcasts/" target="_blank" rel="noopener" title="vidéo" data-wpil-keyword-link="linked" data-wpil-monitor-id="568274">vidéo</a>, mais une puissance de calcul brute bien supérieure côté Nvidia.</p>
<p>L’écart se creuse sur la consommation. Quatre Mac Studio tirent <strong>1,92 kilowatt</strong> en pointe, contre plus de 2,4 kilowatts pour les seules cartes graphiques d’une configuration comparable, refroidissement non compris. Sur un fonctionnement continu, la différence pèse.</p>
<h2 class="wp-block-heading" id="h-le-contexte-de-penurie-de-memoire"><span id="le-contexte-de-penurie-de-memoire">Le contexte de pénurie de mémoire</span></h2>
<p>Un facteur extérieur rend cette arithmétique plus favorable qu’elle ne l’aurait été il y a un an.</p>
<p>Les prix de la mémoire vive s’envolent. Les analystes d’IDC décrivent la réallocation des capacités de production vers la mémoire à haute bande passante comme une crise sans équivalent, sans amélioration attendue avant <strong>2028</strong>. Samsung, SK Hynix et Micron ont réorienté leurs lignes vers ce type de puces destinées aux accélérateurs d’IA, dont la fabrication consomme environ trois fois plus de surface de plaquette que la mémoire classique.</p>
<p>Dans ce contexte, la mémoire unifiée d’Apple, facturée environ 25 dollars le gigaoctet en option, cesse de paraître déraisonnable.</p>
<h2 class="wp-block-heading" id="h-la-limite-des-sept-machines"><span id="la-limite-des-sept-machines">La limite des sept machines</span></h2>
<p>L’architecture bute sur une contrainte physique. Le Mac Studio dispose de six ports Thunderbolt 5, et EXO relie pour l’instant chaque machine à toutes les autres. Cette topologie exige N-1 ports par machine, ce qui plafonne la grappe à <strong>sept unités</strong>, avec 21 câbles.</p>
<p>L’équipe travaille sur des topologies en anneau pour dépasser cette limite, sans que les latences à sauts multiples aient encore été mesurées. Apple s’en tient de son côté à une documentation couvrant officiellement jusqu’à cinq systèmes, et une communication centrée sur la configuration à quatre nœuds.</p>
<p>Une incompatibilité mérite d’être signalée aux acheteurs : le Mac mini M6 utilise le Thunderbolt 4 et ne peut donc pas participer à ces grappes. Seuls le Mac mini M5 Pro, à 1 699 dollars, et les Mac Studio y sont éligibles.</p>
<h2 class="wp-block-heading" id="h-les-mesures-independantes-manquent-toujours"><span id="les-mesures-independantes-manquent-toujours">Les mesures indépendantes manquent toujours</span></h2>
<p>C’est la réserve principale à opposer à cette annonce. Les relevés de performance complets ne sont pas publics, EXO Labs indiquant qu’ils seront publiés sur local.ai dès que possible.</p>
<p>Apple avance de son