1,5 ТБ видеопамяти на Mac Studio — RDMA через Thunderbolt 5
Автор: Джефф Гирлинг (Jeff Geerling). Оригинал опубликован 18 декабря 2025 года. Полный перевод для КСОР АйТи. Исходная статья. Повествование от первого лица, оценки и временные указания ниже принадлежат автору и относятся к дате оригинальной публикации. Фотографии и графики — из оригинала.

Apple предоставила мне этот кластер Mac Studio, чтобы я протестировал RDMA через Thunderbolt — новую возможность macOS 26.2. Проще всего попробовать её с помощью Exo 1.0 — инструмента с открытым исходным кодом для объединения компьютеров в кластеры для частного AI. RDMA позволяет всем Mac работать так, словно у них один огромный общий пул оперативной памяти, что ускоряет, например, работу очень больших AI-моделей.
Стопка Mac, которую я тестировал, с 1,5 ТБ объединённой памяти стоит чуть меньше 40 000 долларов. И если вам интересно: нет, я не могу оправдать такие расходы на подобную затею. Apple одолжила Mac Studio для тестирования. Также хочу поблагодарить DeskPi за присланную четырёхстоечную мини-стойку, в которой размещён кластер.
В последний раз я слышал что-то интересное об Apple и HPC — высокопроизводительных вычислениях — ещё в начале 2000-х, когда компания выпускала Xserve.

У Apple было собственное решение для кластеризации под названием Xgrid… которое провалилось. Несколько университетов построили кластеры, но широкого распространения технология так и не получила, а теперь и Xserve остался далёким воспоминанием.
Не знаю, получилось ли это случайно или Apple играет вдолгую, но Mac Studio с M3 Ultra оказался очень удачным вариантом для запуска локальных AI-моделей. А благодаря поддержке RDMA, снижающей задержку доступа к памяти с 300 мкс до менее чем 50 мкс, объединение в кластер теперь повышает производительность, особенно при работе с огромными моделями.
Они также достойно справляются с творческими приложениями и, как минимум, с небольшими научными вычислениями, потребляя при этом менее 250 Вт и работая почти бесшумно.
Два нижних Mac имеют по 512 ГБ объединённой памяти и 32 ядра CPU и стоят по 11 699 долларов. Два верхних, с вдвое меньшим объёмом памяти, — по 8 099 долларов1.
Недёшево.
Но после выхода DGX Spark от Nvidia и систем на AI Max+ 395 от AMD, у которых памяти вчетверо меньше — максимум 128 ГБ, — я решил как следует испытать этот кластер.
Видео
Эта статья — переработанная в текст версия моего последнего видео на YouTube, которое можно посмотреть ниже.
Смотреть видео Джеффа Гирлинга на YouTube
Мини-стойка для Mac
По удивительно удачному совпадению DeskPi прислала новую четырёхстоечную мини-стойку TL1 за день до прибытия этих Mac.

В начале этого года я запустил Project MINI RACK. Идея в том, чтобы получить преимущества оборудования для стоек в формате, который помещается на столе или в углу комнаты.
Пока я не встречал решений для установки Mac Studio в 10-дюймовые стойки, кроме этого корпуса для 3D-печати, поэтому просто поставил компьютеры на несколько 10-дюймовых полок.
Самое раздражающее при установке любых Mac, кроме Pro, в стойку — кнопка питания. У Mac Studio она находится сзади слева, на закруглённой поверхности, поэтому крепления для стойки должны оставлять к ней доступ.
Открытые боковины мини-стойки позволяют просунуть руку и нажать кнопку, но при этом всё равно приходится придерживать Mac Studio, чтобы он не выскользнул вперёд!
Зато приятно, что спереди у Studio есть порты для подключения клавиатуры и монитора:

Что касается питания, я рад, что Apple использует встроенный блок питания. Слишком многие «маленькие» ПК малы лишь потому, что их блок питания вынесен наружу в виде огромного кирпича. Здесь это не так, но приходится иметь дело с кабелями питания Apple, которые не используют C13, — а значит, сложнее подобрать кабели идеальной длины, чтобы уменьшить путаницу проводов.

В сетевых подключениях DGX Spark устроен лучше, чем Apple. У него есть большие прямоугольные порты QSFP, показанные выше. Штекеры держатся надёжнее, но их по-прежнему легко вставлять и вынимать.
У Mac Studio есть Ethernet на 10 Гбит/с, но высокоскоростное соединение — с реальной пропускной способностью примерно 50–60 Гбит/с — обеспечивается Thunderbolt. Даже с дорогими кабелями Apple по 70 долларов за штуку я не уверен, что эта путаница разъёмов долго выдержит эксплуатацию во многих условиях.
Есть решение ThunderLok-A, которое добавляет к каждому кабелю небольшой фиксирующий винт. Но сверлить одолженные Mac Studio и нарезать в них резьбу ради проверки совместимости я не собирался.
Кроме того, насколько я могу судить, коммутаторов Thunderbolt 5 не существует. Поэтому подключить несколько Mac к одному центральному коммутатору нельзя — приходится соединять каждый Mac с каждым, ещё больше запутывая кабели. Сейчас таким образом можно соединить до четырёх Mac, хотя я не думаю, что это обязательно жёсткий предел нынешнего Mac Studio: Apple заявила, что RDMA поддерживают все пять портов TB5.
Но более важный вопрос: нужен ли вам вообще целый кластер Mac Studio? Ведь даже один такой компьютер уже очень мощный и сопоставим с четырьмя DGX Spark или системами AI Max+ 395 в максимальных конфигурациях. А управление кластерами бывает мучительным.
Mac Studio с M3 Ultra: базовые результаты
Чтобы было на что опереться при принятии решения, я провёл базовые тесты и опубликовал все результаты — их гораздо больше, чем приведено здесь, — в своём проекте sbc-reviews.
Я сравню Mac Studio с M3 Ultra с двумя системами:
- Dell Pro Max с GB10 — похож на Nvidia DGX Spark, но с лучшим охлаждением.
- Framework Desktop Mainboard с чипом AMD AI Max+ 395.

Сначала Geekbench. M3 Ultra с процессорными ядрами двухпоколенной давности обходит обе другие системы и в однопоточном, и в многопоточном тестах. В Geekbench 5, который лучше подходит процессорам с большим числом ядер, преимущество ещё заметнее.

Перейдём к вычислениям двойной точности FP64 — моему привычному тесту HPL из top500. M3 Ultra стал первым из протестированных мной компактных настольных компьютеров, преодолевшим отметку 1 Тфлопс FP64. Это почти вдвое больше результата Nvidia GB10, а чип AMD AI Max остался далеко позади.

Энергоэффективность CPU тоже отличная, хотя так было со всеми чипами Apple ещё со времён A-серии. И ещё один связанный с этим показатель: энергопотребление в простое здесь ниже 10 Вт.

Я видел одноплатные компьютеры, потреблявшие в простое больше 10 Вт, что уж говорить об устройстве, которое можно считать персональным суперкомпьютером.
В инференсе AI M3 Ultra выделяется при работе и с маленькими, и с большими моделями:


Разумеется, действительно огромные модели, например DeepSeek R1 или Kimi K2 Thinking, на одном узле двух других систем даже не запустятся.

Но это система за 10 000 долларов. Когда платишь больше, ожидаешь большего.
И всё же задумайтесь: один Mac Studio с M3 Ultra мощнее всего моего кластера Framework Desktop, потребляя при этом вдвое меньше энергии. Я также сравнил его с небольшим двухузловым кластером Dell Pro Max с GB10. И один M3 Ultra всё равно оказался впереди по производительности и энергоэффективности, имея вдвое больше памяти.
Мини-стопка, максимум Mac
А как обстоят дела с кластеризацией и удалённым управлением, когда Mac четыре?
Для меня главным препятствием стала сама macOS. Я автоматизирую на своих Mac всё, что могу. Я поддерживаю самый популярный Ansible-плейбук для управления Mac и могу с определённой уверенностью сказать: управлять кластерами Linux проще.
Сложности есть у любого кластера, но при управлении кластером Mac без дополнительных инструментов вроде MDM возникает множество мелких проблем. Например, знали ли вы, что обновление системы — скажем, до 26.2 — нельзя выполнить через SSH? Нужно нажимать кнопки в интерфейсе.
Вместо подключения KVM к каждому Mac я использовал встроенную в macOS функцию Screen Sharing: подключался к каждому компьютеру и выполнял нужные операции через графический интерфейс.
HPL и llama.cpp
Когда всё было настроено, я протестировал HPL через Ethernet 2,5 Гбит/с, а llama.cpp — через эту же сеть и через Thunderbolt 5.

В HPL один M3 Ultra показал 1,3 Тфлопс. Все четыре вместе — 3,7, то есть ускорение получилось менее чем трёхкратным. Но помните: в двух верхних Studio памяти вдвое меньше, чем в двух нижних, так что примерно трёхкратного ускорения я и ожидал.
Я попытался запустить HPL через Thunderbolt — без RDMA, просто по TCP, — но примерно через минуту оба Mac, настроенные мной в кластер, аварийно завершали работу и перезагружались. Я изучил возможность использовать обёртку Apple MLX для mpirun, но не успел разобраться с ней до публикации статьи.
Затем я сравнил запуск AI-моделей в llama.cpp через Ethernet 2,5 Гбит/с и Thunderbolt 5:

По задержке Thunderbolt определённо выигрывает, даже без RDMA.
Здесь перечислены все результаты моих тестов кластера с llama.cpp. Для краткости я не включил в эту статью множество проведённых тестов.
Включение RDMA
Exo 1.0 вышла сегодня — по крайней мере, так мне сообщили. Её главная возможность — поддержка RDMA для объединения Mac с Thunderbolt 5 в кластеры.

Однако для включения RDMA нужно загрузиться в режим восстановления и выполнить команду:
- Выключите Mac Studio.
- Удерживайте кнопку питания 10 секунд — появится меню загрузки.
- Перейдите в Options («Параметры»), а после появления интерфейса откройте Terminal («Терминал») через меню Utilities («Утилиты»).
- Введите
rdma_ctl enableи нажмите Enter. - Перезагрузите Mac Studio.
После этого я запустил несколько ОГРОМНЫХ моделей, включая Kimi K2 Thinking, которая при размере более 600 ГБ слишком велика для одного Mac.

Я могу запускать такие модели на нескольких Mac и через llama.cpp, и через Exo, но пока только Exo поддерживает RDMA. Сейчас llama.cpp использует метод RPC, распределяющий слои модели между узлами. Это позволяет масштабироваться, но работает неэффективно: при добавлении узлов производительность падает.
Тест Qwen3 235B хорошо это показывает:

Exo, напротив, ускоряется по мере добавления узлов и на полном кластере достигает 32 токенов в секунду. Для вайб-кодинга этого определённо достаточно — если вам такое нравится. Мне не нравится.
Поэтому я перешёл к DeepSeek V3.1 — модели с 671 миллиардом параметров:

Я немного удивился, увидев небольшое ускорение у llama.cpp. Возможно, при работе на двух узлах сетевые накладные расходы не так велики? Не уверен.
Перейдём к самой большой модели, которую я лично когда-либо запускал, — Kimi K2 Thinking:

В этой модели 1 триллион параметров, хотя в каждый момент времени «активны» лишь 32 миллиарда — именно это означает буква A в обозначении A32B.
И всё же мы получаем около 30 токенов в секунду.
Работая с некоторыми из этих огромных моделей, я вижу, что AI может быть полезен, особенно если он работает локально и находится под моим контролем. Но пройдёт ещё немало времени, прежде чем я начну сильно доверять его ответам: я отношусь к ним примерно как к Википедии. Возможно, это хорошая отправная точка, но никогда не позволяйте AI подменять вашу способность мыслить критически!
Впрочем, эта статья не о достоинствах AI, а о кластере Mac Studio, RDMA и Exo.
Они работали отлично… когда работали.
Проблемы со стабильностью
Сначала оговорка: во время тестирования я использовал предварительные версии ПО. Многие ошибки исправлялись прямо в ходе испытаний.
Но было очевидно, что RDMA через Thunderbolt — новая технология. Когда она работает, работает прекрасно. Когда нет… скажем так: я был рад, что настроил Ansible и мог быстро выключить и перезагрузить весь кластер.

Я уже упоминал сбои HPL при запуске через Thunderbolt. Даже если мне удастся наладить его работу, пока я видел только кластеры из четырёх Mac с RDMA — по состоянию на конец 2025 года. Правда, Apple утверждает, что RDMA включена на всех пяти портах Thunderbolt 5. Так что, возможно, удастся добавить больше Mac?
Кроме того, у меня по-прежнему есть определённые сомнения в отношении Exo, поскольку разработчики на какое-то время пропали.
Они остаются верны своим корням в открытом ПО, выпустив Exo 1.0 под лицензией Apache 2.0. Но мне хотелось бы, чтобы им не приходилось скрываться и вести разработку втайне. Вероятно, это побочный эффект тесного сотрудничества с Apple.
Конечно, это их право. Но как человеку, который, возможно, ведёт слишком большую часть разработки открыто, мне не нравится завеса секретности вокруг любого проекта с открытым исходным кодом.
Мне действительно интересно, что будет дальше. Они уже намекнули на использование DGX Spark перед кластером Mac Studio для ускорения обработки промптов… Может быть, заодно вернут поддержку Raspberry Pi? Кто знает.
Открытые вопросы и темы для дальнейшего изучения
Но у меня остались и другие вопросы:
- Где M5 Ultra? Если бы Apple выпустила его, он был бы гораздо быстрее в задачах машинного обучения.
- Может ли Apple возродить Mac Pro и дать мне всю желаемую пропускную способность PCIe для более быстрой кластеризации, без ограничений Thunderbolt?
- Появится ли на Mac SMB Direct? Сетевые файловые ресурсы работали бы так, словно подключены к Mac напрямую. Это было бы замечательно для видеомонтажа и других приложений, чувствительных к задержкам и требующих высокой пропускной способности.
И наконец, что насчёт другого ПО? llama.cpp и другие приложения тоже могли бы ускориться благодаря поддержке RDMA.
Заключение
В отличие от большей части оборудования, связанного с AI, я в целом не против того, что Apple так активно продвигает эту возможность. Когда пузырь AI лопнет, Mac Studio всё равно останутся быстрыми, тихими и мощными рабочими станциями для творческих задач — я сам работаю за M4 Max!
Но в мире Apple не всё так радужно. Помимо того, что управлять кластерами Mac сложнее, Thunderbolt 5 не даёт этим компьютерам раскрыть весь потенциал. QSFP подошёл бы лучше, но сделал бы компьютер менее привлекательным для людей, которым «просто нужен компьютер».
Может быть, в качестве утешительного приза Apple могла бы заменить разъём Ethernet и один-два задних порта Thunderbolt на QSFP? Тогда мы смогли бы использовать сетевые коммутаторы и объединять в кластер больше четырёх таких машин одновременно…
1 В указанных конфигурациях. Apple установила SSD на 8 ТБ в модели с 512 ГБ памяти и на 4 ТБ — в модели с 256 ГБ.
© Jeff Geerling. Оригинал: 1.5 TB of VRAM on Mac Studio — RDMA over Thunderbolt 5, 18 декабря 2025 года. Перевод размещён КСОР АйТи.