Обзор Mac Studio M5 Ultra: идеальный Mac для локальных агентов искусственного интеллекта.

Mac Studio M5 Ultra.
Mac Studio M5 Ultra.

В течение последних нескольких дней я тестировал (на данный момент) топовую модель Mac Studio M5 Ultra с 256 ГБ оперативной памяти.

Перейду сразу к сути: Mac Studio M5 Ultra — это идеальная машина для локальных ИИ‑агентов. Этот компьютер позволяет запускать персональных помощников на базе локальных моделей с высокой производительностью и без дополнительных затрат на облачные сервисы. Если вы скептически относились к тестированию OpenClaw или Hermes Agent с локальными моделями, считая, что они никогда не достигнут уровня интеллекта и скорости облачных моделей, этот Mac изменит ваше мнение.

Начиная с прошлого четверга, я сравнивал этот Mac Studio с его предшественником, M3 Ultra с 512 ГБ оперативной памяти, а также со своим собственным игровым настольным ПК с RTX 5090. Учитывая его размер, цену, тепловые характеристики — не говоря уже о подходе Apple к унифицированной памяти — Mac Studio M5 Ultra коренным образом изменил мое представление о моделях, работающих локально, и о том, что они теперь могут предложить. Конечно, 5090 по‑прежнему имеет преимущество перед M5 Ultra благодаря более высокой пропускной способности памяти. Но, учитывая огромные размеры моей сборки ПК, а также его тепловыделение и шум, я бы предпочел Mac Studio M5 Ultra в любой день. К тому же, это Mac с приятной и неплохой операционной системой, а также с развитой экосистемой приложений. (Поклонники Windows, извините, но программное обеспечение Microsoft никогда не вызовет у меня сочувствия.)

Как я покажу в этой статье, запуск последней модели Qwen3.8-Flash‑Next на Mac Studio с процессором M5 Ultra оказался настолько быстрым и удобным, что я сделал её своей основной моделью как в Open Minis для iOS, так и в Hermes Agent. Да, вы правильно поняли: мои самые часто используемые персональные помощники — даже чаще, чем Siri AI — теперь полностью работают на основе модели, запущенной локально на Mac Studio. Более того, благодаря более быстрому графическому процессору M5 Ultra и большей пропускной способности памяти, эти агенты начинают реагировать быстрее, сохраняют высокую скорость при больших контекстных окнах и могут запускать длинные многоходовые циклы, не замедляясь до черепашьей скорости по мере роста сессии. Поэтому я также использую локальные модели в приложении Codex на своём Mac — либо в качестве основных потоков, либо в качестве субагентов, управляемых GPT-6 Astra — и у меня остались отличные впечатления от этого.

Сейчас мои наиболее часто используемые персональные помощники полностью работают на основе модели, запущенной локально на Mac Studio.

Локальные субагенты работают в Codex на Mac Studio M5 Ultra.
Локальные субагенты работают в Codex на Mac Studio M5 Ultra.

Сразу оговорюсь, что я не профессиональный разработчик ИИ: я не занимаюсь обучением или тонкой настройкой моделей. Я по натуре изобретатель, и уже больше года экспериментирую с локальными моделями ИИ. Этим летом я полностью переключился на использование локального ИИ в крупном проекте, над которым работал, о чем расскажу в следующем разделе.

Цель этой статьи — предоставить вам сочетание двух вещей: цифр и визуализаций, основанных на (многочисленных) тестах, которые я проводил в течение четырех дней, и объяснение моих практических примеров применения локального ИИ в моем рабочем процессе и того, как я выполняю задачи для MacStories.

Давайте начнём.

Почему именно локальный ИИ?

Давайте сначала разберемся с самым очевидным: зачем вообще нужен локальный ИИ, если облачные модели на переднем крае технологий лучше и зачастую быстрее?

Это вполне резонный вопрос. Для запуска этих моделей требуется дорогостоящее оборудование, и к тому времени, как вы окупите свои инвестиции, вы могли бы использовать самую дорогую подписку на Anthropic в течение нескольких лет, при этом сэкономив деньги и получив взамен более высокую производительность.

У разных людей будут разные ответы на этот вопрос. Некоторые могут сказать, что используют локальные модели из‑за конфиденциальности: они предпочитают полагаться на локальный интеллект для обработки конфиденциальных данных и документов, чем загружать что‑либо во внешнее облако. Другие могут утверждать, что это просто круто — и я с этим согласен. Для некоторых это задача, связанная с работой: если вы разработчик ИИ, то имеет смысл иметь отличную локальную среду для обучения собственных адаптеров или тонкой настройки моделей.

Для меня освоение локального ИИ было сопряжено как с чувством " круто, а почему бы и нет? «, так и с соображениями конфиденциальности и стоимости.»

Как я расскажу позже на этой неделе членам Club MacStories, моя исследовательская и писательская работа над обзором iOS и iPadOS 27 этим летом осуществлялась с помощью локального ИИ. Еще в июне я создал внутреннее приложение под названием Desk для организации сотен заметок, сессий, PDF‑документов и фрагментов веб‑страниц, связанных с iOS и iPadOS 27, а также главами обзора. К концу работы проект насчитывал 310 документов. В Desk команда агентов — все на основе DeepSeek V4 Flash, плюс olmOCR для PDF‑файлов — работала круглосуточно в течение 99 дней, выполняя следующие задачи:

  • Расшифровка моих любимых сессий WWDC (с использованием summarizeобработки Plus LLM).

  • Извлечение информации о функциях iOS и iPadOS 27 из фрагментов веб‑страниц, материалов сессий, руководств в формате PDF и моих собственных заметок.

  • Сопоставляйте информацию о характеристиках из разных источников и отслеживайте, какие характеристики относятся к какой главе обзора.

  • Извлечение функций и ошибок из загруженных мной скриншотов.

  • Используйте API Notion для организации всей информации в нескольких базах данных.

Один из вариантов отображения приложения Desk, работающего на базе API Notion и локального ИИ, которое я использовал для обзора iOS 27.
Один из вариантов отображения приложения Desk, работающего на базе API Notion и локального ИИ, которое я использовал для обзора iOS 27.
Локальный ИИ-агент работает в моем пользовательском приложении Desk.
Локальный ИИ‑агент работает в моем пользовательском приложении Desk.

Когда я начал работать с этой системой в начале июня, я быстро понял, что полагаться на API OpenAI или Anthropics для выполнения подобных постоянно работающих фоновых задач будет, мягко говоря, слишком дорого. Поэтому я переключился на локальный ИИ, и результатом стал обзор iOS и iPadOS 27, который вы можете прочитать на MacStories. Всё это было написано мной, старым добрым человеческим способом. Но весь исследовательский процесс, создание глубоких ссылок между заметками и отслеживание новых функций и бета‑версий были выполнены моими агентами, работающими локально на Mac Studio, и обошлися мне всего в 0 долларов.

Если вам это не кажется интересным или недостаточно перспективной концепцией, то эта статья, вероятно, не для вас — и я понимаю. Работа с такими моделями сложна, и я бы никогда не рекомендовал это тому, кто (по праву) просто хочет заплатить 20 долларов за использование Claude Cowork. Подобная система, по определению, является передовой в области рабочих процессов с использованием ИИ на данный момент.

Если же вы относитесь к противоположной категории и считаете подобные вещи интересными… позвольте мне сказать: Mac Studio M5 Ultra — это огромный скачок в производительности по сравнению с локальными моделями на базе MLX, и у меня есть несколько примеров, подтверждающих это.

Прорыв в области оперативной обработки и генерации информации.

Как вы, возможно, видели из анонса и моих первоначальных обзоров, Mac Studio M5 Ultra выглядит идентично модели M3 Ultra, которую он заменяет, но он оснащен совершенно новой архитектурой Apple Silicon, использующей UltraFusion для соединения двух двухкристальных чипов M5 Max в четырехкристальную архитектуру, что является первым подобным решением в экосистеме Apple. Что касается локальных задач ИИ, то здесь есть две области, на которые нам следует обратить внимание (и за которыми я слежу с момента моих обзоров iPad Pro M5 для локального ИИ в прошлом году): графический процессор и пропускная способность памяти.

M5 Ultra оснащен графическим процессором нового поколения с 80 ядрами, каждое из которых имеет нейронный ускоритель, что обеспечивает ему до 4,5 раз большую пиковую вычислительную мощность для ИИ по сравнению с M3 Ultra. Что касается памяти, унифицированная архитектура памяти Apple по‑прежнему достигает максимума в 512 ГБ, как и раньше (хотя эта модель выйдет в конце октября), но ее пропускная способность выросла с 819 ГБ/с до 1,2 ТБ/с, что на 50% выше, чем у M3 Ultra.

Учитывая эти показатели, я начал тестирование M5 Ultra в сравнении с M3 Ultra с 512 ГБ оперативной памяти и моей RTX 5090. Подробнее о тестировании я расскажу ниже, но вкратце: с M5 Ultra вы тратите значительно меньше времени на ожидание, пока модель прочтет ваш запрос и начнет генерировать ответ; а когда она начинает отвечать, текст появляется гораздо быстрее, чем раньше на M3 Ultra. Только эти два улучшения делают машину пригодной для современных агентных циклов, требующих быстрой итерации с моделью и, как следствие, больших контекстных окон.

В моем повседневном опыте работы с агентами на M5 Ultra я сразу заметил улучшения в предварительном заполнении токенов (или скорости обработки запроса) и генерации токенов. При сравнении модели, работающей на M3 Ultra и M5 Ultra, с Open Mini на iOS, M5 Ultra в среднем оказалась примерно на 70% быстрее, чем M3 Ultra, в генерации ответа. Как мы увидим позже, модель, такая как Qwen3.8-Flash‑Next, обрабатывающая 100 токенов в секунду на коротких запросах и при этом генерирующая от 60 до 85 токенов с контекстом от 64 до 256 КБ, — это не шутка, и это обеспечивает такой агентский обмен данными между вами и моделью, который очень удобен в использовании, особенно при вызове инструментов.

В Open Minis для iOS я использую локальную модель в качестве модели по умолчанию. На изображении выше: долгосрочный проект, субагенты и локальная генерация изображений, работающая на основе Qwen-Image-2.1, также запущенной на M5 Ultra.
В Open Minis для iOS я использую локальную модель в качестве модели по умолчанию. На изображении выше: долгосрочный проект, субагенты и локальная генерация изображений, работающая на основе Qwen‑Image-2.1, также запущенной на M5 Ultra.

Однако меня больше впечатлило повышение производительности заполнения токенов. При использовании агентных помощников, таких как Hermes или Codex, модель получает целый блок инструкций, включающий в себя системную подсказку, персонализацию пользователя и память сессии, описания навыков и MCP и многое другое. Некоторые агенты лучше других справляются с сокращением отправляемых инструкций, но, как правило, при использовании современного агента вы не начинаете с пустого контекстного окна. Из‑за этого мне никогда не удавалось стабильно использовать локальные модели с этим новым поколением агентов: они работали, но я долго смотрел на пустой экран и индикатор загрузки, прежде чем модель начинала генерировать ответ. И с каждым оборотом цикла производительность ухудшалась (из‑за большего контекста сессии), и мне приходилось ждать еще некоторое время.

В моих тестах обработка запросов в среднем увеличилась на 150% по сравнению с M3 Ultra — примерно в 2,5 раза по сравнению с моей предыдущей конфигурацией. Уже одно это изменение делает локальные модели надежным выбором в таких приложениях, как Open Minis и Hermes Agent. Когда я прошу Flash‑Next на M5 Ultra получить мои задачи на неделю с помощью RemCTL, мне не нужно ждать, пока агент обработает мой запрос и запрос Open Minis: всего за несколько секунд он приступает к работе, выполняя логические действия, вызовы инструментов и так далее. А когда я работаю над большим проектом, таким как демонстрация воксельного Колизея ниже, модель способна быстро обрабатывать многоходовые циклы, распределять и координировать действия субагентов, и все это со скоростью от 60 до 85 токенов в секунду по мере увеличения длины потока.

Эта интерактивная демонстрация Колизея была полностью создана с помощью Flash-Next, работающего на Mac Studio M5 Ultra, управляемого через Open Minis и его вспомогательную платформу на iOS.
Эта интерактивная демонстрация Колизея была полностью создана с помощью Flash‑Next, работающего на Mac Studio M5 Ultra, управляемого через Open Minis и его вспомогательную платформу на iOS.

Чтобы использовать локальные модели из Mac Studio в Open Mini для iOS, я создал локальный сервер перед API, совместимым с OpenAI и предоставляемым локально oMLX. Он запускается через Tailscale на мой iPhone и работает замечательно.

Я большой сторонник ассистентов, которые могут самостоятельно выполнять задачи в дополнение к ответам на вопросы, но для того, чтобы ими было приятно пользоваться, они должны быть быстрыми. За последние несколько месяцев я протестировал несколько «бутиковых» облачных провайдеров с Open Minis: Inco, который обслуживает Kimi K3 со скоростью более 300 транзакций в секунду; Cerebras с Qwen3.8–27B, достигающей впечатляющих 1800 транзакций в секунду; и такие провайдеры, как Fireworks и Baseten, каждый из которых преодолел барьер в 150 транзакций в секунду. Все эти провайдеры очень удобны в использовании в Open Minis и Hermes, но они дороги (на прошлой неделе я потратил 20 долларов кредитов Inco буквально за 10 минут), и, конечно же, все мои данные куда‑то уходят, когда я их использую. Когда я запускаю Open Minis с Flash‑Next и набором командных строк Apple, которые я создаю, все остается локально, внутри компьютера, который я могу видеть и перезагружать в любое время.

Cadu — это разрабатываемый iOS-клиент для Hermes Agent , работающий в режиме живой голосовой связи с использованием Qwen3-TTS и Qwen3.8-Flash-Next в качестве базовой модели чата, а в качестве сервера используется M5 Ultra.
Cadu — это разрабатываемый iOS‑клиент для Hermes Agent, работающий в режиме живой голосовой связи с использованием Qwen3-TTS и Qwen3.8-Flash‑Next в качестве базовой модели чата, а в качестве сервера используется M5 Ultra.

Самое важное: такая модель, как Flash‑Next, может быть достаточно «маленькой», чтобы работать с более высокими степенями квантизации на 256-гигабайтном M5 Ultra (я могу запускать 5-битные вычисления полностью в оперативной памяти; 6- и 8-битные могут переносить свои таблицы n‑грамм на SSD с помощью этой новой архитектуры ), но при этом достаточно интеллектуальной, чтобы поддерживать длительные потоки и множество вызовов инструментов агента.

Генерация текста на разных квантовых уровнях.
Генерация текста на разных квантовых уровнях.

На мой взгляд, 5-битное квантование в этой версии Ultra — оптимальный баланс между интеллектуальностью, производительностью и потреблением памяти. Но я уже знаю, что если мне когда‑нибудь доведется протестировать M5 Ultra на 512 ГБ, мне будет очень интересно измерить производительность 8-битного квантования без использования SSD‑накопителя.

Я не уделял много времени настройке переноса задач кодирования для своих различных проектов на локальную модель, но провел несколько интересных экспериментов. С такой производительностью, и особенно учитывая возможность одновременного запуска до трех сессий Flash‑Next с субагентами в oMLX с 256 ГБ оперативной памяти (подробнее позже), я теперь могу реально рассматривать возможность передачи более простых задач кодирования локальной модели, а облачные модели будут проверять их работу. Например, мне удалось настроить Qwen3.8-Flash‑Next в Codex, что позволяет использовать локальную модель с Codex. Это означает, что я могу позволить основной модели GPT управлять локальными субагентами, Flash‑Next координировать работу своих субагентов или даже просто использовать модель со своего телефона с помощью Codex Remote на iOS.

Использование локальной модели на M5 Ultra из Codex Remote.
Использование локальной модели на M5 Ultra из Codex Remote.
Обычно я не полагаюсь на генерацию изображений, но для целей этого обзора: чип M5 Ultra является официальным ресурсом Apple; фоновое изображение было сгенерировано локально на M5 Ultra программой Qwen-Image-2.1 за 180 секунд при пиковом использовании оперативной памяти в 78 ГБ.
Обычно я не полагаюсь на генерацию изображений, но для целей этого обзора: чип M5 Ultra является официальным ресурсом Apple; фоновое изображение было сгенерировано локально на M5 Ultra программой Qwen‑Image-2.1 за 180 секунд при пиковом использовании оперативной памяти в 78 ГБ.

Мне любопытно узнать больше на эту тему от реальных разработчиков, которые скоро получат M5 Ultra. Учитывая, что модели с открытыми весами теперь превосходят на потребительском оборудовании то, что считалось «передовым» примерно 10 месяцев назад, и что производительность на M5 Ultra делает возможным программирование с использованием агентов, я думаю, что очень скоро мы увидим несколько захватывающих экспериментов от сообщества MLX.

M5 Ultra против RTX 5090

Как вы увидите из визуализаций, представленных далее в этой статье, NVIDIA RTX 5090 по‑прежнему быстрее, чем Apple M5 Ultra, несмотря на свои «скромные» 32 ГБ видеопамяти, и тому есть две разные причины.

Скорость обработки запросов определяется вычислительными ресурсами: модель считывает весь запрос за одно гигантское матричное умножение, что в точности соответствует задачам, для которых были созданы тензорные ядра NVIDIA. Новые нейронные ускорители Apple (по одному в каждом из 80 ядер GPU M5 Ultra) сокращают разрыв, но не могут его полностью устранить. При запросе на 6000 токенов M5 Ultra считывал данные со скоростью ~1700 токенов в секунду; 5090 показал ошеломляющие ~3000 токенов в секунду с моделью Qwen, которую я тестировал в LM Studio. Генерация токенов, с другой стороны, зависит от пропускной способности: модель записывает по одному токену за раз и извлекает всю модель из памяти для каждого из них, поэтому 1,79 ТБ/с у 5090 против 1,2 ТБ/с у M5 Ultra дают ему стабильное преимущество примерно в 25% при любом размере запроса. Чего у 5090 нет, так это памяти: при объеме 256 КБ она имеет только 8-битный кэш внимания. 32 ГБ видеопамяти — это еще не все.

Однако в этом сравнении есть две проблемы. Во‑первых, хотя 5090 всё ещё немного превосходит M5 Ultra в случае с более компактными моделями, отсутствие единого пула памяти означает, что я ограничен 32 ГБ видеопамяти в графическом процессоре, если хочу запускать модели на невероятно высокой скорости. Как только мне понадобится запустить что‑либо, превышающее 32 ГБ (например, упомянутые выше вычисления с большим количеством квантов Flash‑Next), 5090 придётся переносить слои модели через PCIe в (гораздо более медленную) системную оперативную память, а это неприемлемо.

Для сравнения характеристик между Mac и ПК я протестировал другую модель Qwen.
Для сравнения характеристик между Mac и ПК я протестировал другую модель Qwen.

Во‑вторых, мой игровой ПК огромен по сравнению с Mac Studio, который помещается на моем столе, — а у меня компактная сборка в корпусе Lian‑Li A3. Не говоря уже о том, насколько он шумит и нагревается, когда я запускаю локальные тесты в окнах с высокой контекстной загрузкой: когда я зашел в свой кабинет после запуска нескольких бенчмарков, там было неприятно теплее, чем в остальной части моей квартиры. В отличие от него, «миниатюрный» Mac Studio на моем столе был теплым на ощупь, но при этом заметно тише, чем моя 5090, вентиляторы вращались не так быстро и громко, и, что наиболее важно, он позволял мне запускать более крупные тесты, такие как GLM-5.3-Flash, локально с достойной производительностью благодаря унифицированной памяти Apple Silicon. В повседневном использовании, когда я постоянно запускал Flash‑Next oQ4e, я никогда не слышал вентилятор Studio на своем столе, если только не прикладывал ухо прямо к компьютеру.

Судя по прогрессу, достигнутому Apple за последние годы, я бы не удивился, если бы в ближайшем будущем появилась видеокарта M7 Ultra, которая превзошла бы по пропускной способности памяти 5090. Но это уже тема для отдельного разговора.

Примечание о тестировании

И наконец, прежде чем мы перейдем к цифрам и графикам: как я все тестировал?

Автоматизированные тесты проводились с помощью созданной мной тестовой среды на базе GPT-6 Astra, которая координировала работу нескольких экземпляров Codex на моих Mac Studio M3 Ultra и M5 Ultra, а также на моем ПК с приложением Codex для Windows и Computer Use. На macOS я выбрал oMLX (версия 0.7.0.dev2) в качестве локального бэкенда для моделей MLX и запускал Qwen3.8-Flash‑Next‑oQ4e‑mtp, GLM-5.3-Flash‑MLX‑mixed-4_8bit и Qwen3.8–27B‑oQ4e‑mtp на macOS Golden Gate 27.0 для большинства тестов. На Windows я использовал LM Studio и Qwen3.8–27B‑GGUF с средой выполнения CUDA 12 и с переносом всех 66 слоев на графический процессор для тестов с полной загрузкой GPU, а также отдельные тесты, разделяющие модель между графическим процессором и системной оперативной памятью.

Помимо отдельных экспериментов с собственными субагентами Open Minis, я использовал специальную тестовую среду для измерения количества одновременных запросов и рабочих процессов, включающих модель лида и несколько помощников, при этом oMLX обслуживал модели для Mac, а LM Studio — модель для Windows.

Данные были собраны программой Astra в течение четырех дней, а затем визуализированы программами Claude Fable 5.1 и Opus 5 с использованием готовящейся к выпуску функции Projects от Anthropic, которую я смог протестировать на раннем этапе работы над этим материалом. Интерактивная визуализация была создана с использованием чистого HTML и CSS в стиле MacStories и включает комментарии и аннотации от меня лично.

В ближайшем будущем Клод представит свой проект в рубрике «Проекты».
В ближайшем будущем Клод представит свой проект в рубрике «Проекты».

Моя цель при создании следующих интерактивных виджетов заключалась не только в том, чтобы помочь вам лучше понять цифры, но и в том, чтобы визуализировать, что означают эти статистические данные на практике. Я вполне доволен виджетами, которые приблизительно отражают реальное количество токенов в секунду, поскольку этот показатель часто сложно визуализировать. Надеюсь, эти анимированные графики будут полезнее обычных «статичных», которые вы, вероятно, видели где‑то ещё (они также включены ниже).

Комментарии (2)


  1. achekalin
    23.09.2026 17:25

    Как-то вы свой перевод оборвали на середине. А там еще столько же, и самая мякотка - бенчи, сравнение...


  1. NeoCode2
    23.09.2026 17:25

    874 999 ₽