硬體選購

M5 Ultra 對 M3 Ultra 本地 AI 實測:長提示的等待縮短為四分之一,文字生成快 1.5 倍

2026-09-24 | 約 14 分鐘 | MAQ 技術團隊

YouTube 頻道 NetworkChuck 於 2026 年 9 月 23 日發表影片,比較 Apple 新款 Mac Studio M5 Ultra 與上一代 M3 Ultra 執行本地 AI 的表現。M5 Ultra 由 Apple 借予作者測試,M3 Ultra 為作者自有機器;所有模型都在本機執行,不連線到任何雲端服務。作者同時在 GitHub 公開全部量測資料、測試工具與方法說明,並以 CC BY 4.0 授權釋出。本文依據這份公開資料整理各項數字,說明哪些工作受益最多、哪些幾乎沒有變化,以及對本地 AI 採購的意義。

測試條件

項目M3 UltraM5 Ultra
機器來源作者自有Apple 借測
CPU32 核心(24 效能+8 節能)36 核心(12 超級核心+24 效能)
GPU80 核心80 核心,每個核心內建神經加速器(Neural Accelerator)
記憶體頻寬(Apple 公布)819GB/s1.2TB/s
統一記憶體(本次測試機)512GB256GB
儲存空間8TB8TB
測試時的 macOS26.5.127.0

語言模型以 mlx_lm.server 執行,兩台機器的 mlx-lm(0.31.3)與 MLX(0.32.2)版本一致。測試時關閉提示快取與思考模式、溫度設為 0,每個條件先執行一次暖機再量測五次,取中位數,每次輸出 128 個 token。其餘項目多為單次量測,且通常兩台同時執行。

作者另外揭露兩項差異:兩台機器的 macOS 版本不同;M3 Ultra 在多數測試期間有一個停滯的背景索引程序佔用一顆 CPU 核心。後者只會讓 M3 Ultra 的成績偏慢,因此下文的領先倍數可能略為偏高。影片由 Micro Center 贊助。

一、語言模型:讀取提示與生成答案是兩件事

大型語言模型回答一個問題分為兩個階段。第一階段是讀取提示(prefill),模型一次處理全部輸入,運算以大型矩陣乘法為主,瓶頸在運算能力。第二階段是逐一生成答案(decode),每產生一個 token,密集模型都要把幾乎全部的權重從記憶體再讀取一次,瓶頸在記憶體頻寬。

M5 Ultra 的 GPU 核心數與 M3 Ultra 同為 80 個,差別在每個核心新增的神經加速器,Apple 的說明是大幅加快矩陣乘法。記憶體頻寬則由 819GB/s 提升到 1.2TB/s,約為 1.47 倍。實測結果與這兩項規格變化相符。

32K token 提示,五次量測中位數(數值為 M3 Ultra → M5 Ultra,括號內為 M5 Ultra 的速度倍數):

模型讀取提示生成答案等待第一個字
Qwen3 14B
4-bit,密集
551 → 2,278 tok/s
4.1 倍
31.5 → 55.4 tok/s
1.8 倍
59.0 → 14.3 秒
4.1 倍
Qwen3.8 27B
4-bit,密集
388 → 1,526 tok/s
3.9 倍
27.8 → 42.6 tok/s
1.5 倍
83.6 → 21.3 秒
3.9 倍
Gemma 4 31B
16-bit,密集
294 → 1,217 tok/s
4.1 倍
9.0 → 13.6 tok/s
1.5 倍
110.4 → 26.7 秒
4.1 倍
Qwen3.6 35B-A3B
4-bit,混合專家
2,193 → 6,012 tok/s
2.7 倍
71.5 → 109.1 tok/s
1.5 倍
14.8 → 5.40 秒
2.7 倍
Qwen3.5 122B-A10B
4-bit,混合專家
771 → 2,300 tok/s
3.0 倍
42.3 → 65.3 tok/s
1.5 倍
42.2 → 14.1 秒
3.0 倍

讀取提示的速度在三款密集模型上提升 3.9 至 4.1 倍。生成答案的速度在五款模型中有四款提升 1.5 倍,與記憶體頻寬的 1.47 倍幾乎一致;最小的 14B 模型提升 1.8 倍。以 Qwen3.8 27B 讀取約 32,000 個 token 的文件為例,M3 Ultra 要等待 83.6 秒才出現第一個字,M5 Ultra 為 21.3 秒。作者也說明,這是 GPU 執行語言模型的標準解釋,與全部量測數字相符,但並未實際對晶片進行效能剖析。

提示越長,差距越大

讀取提示速度的提升倍數,依提示長度區分:

模型5124K16K32K
Qwen3 14B2.8 倍4.1 倍4.2 倍4.1 倍
Qwen3.8 27B2.9 倍3.9 倍4.0 倍3.9 倍
Gemma 4 31B2.9 倍4.0 倍4.2 倍4.1 倍
Qwen3.6 35B-A3B1.6 倍2.5 倍2.7 倍2.7 倍
Qwen3.5 122B-A10B2.0 倍2.9 倍3.0 倍3.0 倍

短提示的處理時間多半花在固定開銷,例如建立執行環境與處理網路請求,新硬體可加速的部分有限。影片中的短問題對決,完整回答 M3 Ultra 需時 3.42 秒、M5 Ultra 為 2.10 秒,差距約 1.3 秒。貼入整份文件、程式碼庫或長對話紀錄時,M5 Ultra 的優勢才完全顯現。

混合專家模型的提升幅度較小

密集模型的每個 token 都會經過全部權重;混合專家(MoE)模型則把每個 token 分派給少數「專家」處理,其餘保持閒置。讀取提示時,密集模型提升 3.9 至 4.1 倍,MoE 模型為 2.7 至 3.0 倍。作者推測原因在於 MoE 有一部分時間花在 token 路由與注意力運算,這些並非新硬體最擅長的大型矩陣乘法,但此推測未經剖析驗證。即使如此,Qwen3.6 35B-A3B 仍是兩台機器上速度最快的模型:在 M5 Ultra 上讀取提示每秒逾 6,000 個 token,生成答案每秒 109 個 token。

十萬 token 的超長提示

作者另以 Qwen3.5 122B-A10B 執行一次約 99,000 個 token 的提示:等待第一個字的時間由 221.1 秒縮短為 74.6 秒,生成速度由每秒 31.6 個 token 提升至 51.2 個。提升約為三倍,但 M5 Ultra 仍需等待超過一分鐘才開始回答。大型模型搭配超長提示,在兩台機器上都需要等待。

影片中的現場對決

影片將同一個提示同時送到兩台機器,並排顯示回答過程。拍攝版本中,M5 Ultra 在 21.7 秒後開始回答,M3 Ultra 為 82.8 秒,約為 3.8 倍;生成速度分別為每秒 43.3 與 28.1 個 token。GitHub 記錄的另一次同類對決(提示約 29,000 個 token),等待第一個字的時間為 18.5 秒與 73.8 秒。這些都是單次結果,會隨提示長度與每次執行略有差異,比較時應以上表的五次中位數為準。

二、日常 AI 工作

除了語言模型,作者也測試了自己實際使用的工作。以下除圖片生成為五次中位數外,皆為單次量測。

工作M3 UltraM5 UltraM5 Ultra 倍數
生成一張 1024×1024 圖片(FLUX.2 klein 4B)7.00 秒1.77 秒4.0 倍
生成一張 1024×1024 圖片(Z-Image Turbo)27.9 秒9.25 秒3.0 倍
生成 4 秒含聲音的影片(LTX-2.5,含模型載入)48.4 秒17.8 秒2.7 倍
生成 2 秒含聲音的影片(LTX-2.5,較低解析度,含模型載入)24.3 秒14.0 秒1.7 倍
描述 60 秒影片畫面(Qwen3-VL 32B,含模型載入)61.4 秒23.5 秒2.6 倍
描述 60 秒影片畫面(Qwen3-VL 8B,含模型載入)17.2 秒7.0 秒2.5 倍
轉錄 2 小時 5 分鐘錄音(Whisper large-v3)162.2 秒90.0 秒1.8 倍
轉錄 2 小時 5 分鐘錄音(Whisper large-v3 turbo)57.8 秒27.3 秒2.1 倍
13.8 分鐘 4K 素材轉為 ProRes 422(硬體編碼)91 秒47 秒1.9 倍
同一素材轉為 HEVC(硬體編碼)120 秒90 秒1.3 倍
Laya 決策模型回答 300 題(含模型載入)35.6 秒24.2 秒1.5 倍
Kev-4B 決策模型回答單題(模型已載入)約 0.20 秒約 0.19 秒約 1.0 倍

規律與語言模型一致:工作中矩陣運算的比重越高,M5 Ultra 的提升越大。圖片生成幾乎全為矩陣運算,提升最多;語音轉錄同時包含讀取與生成,落在中間;硬體轉檔與小型模型回答單題,提升最少。

語音轉錄

Whisper 的六種模型大小都經過測試,同一段錄音分為 13.8 分鐘的單段素材與 2 小時 5 分鐘的整日拍攝:

Whisper 模型13.8 分鐘素材2 小時 5 分鐘錄音
large-v319.63 → 11.21 秒(1.75 倍)162.2 → 90.0 秒(1.80 倍)
large-v3 turbo7.21 → 3.05 秒(2.36 倍)57.8 → 27.3 秒(2.12 倍)
medium12.44 → 7.44 秒(1.67 倍)98.7 → 59.8 秒(1.65 倍)
small5.88 → 3.79 秒(1.55 倍)46.8 → 30.9 秒(1.52 倍)
base3.00 → 2.06 秒(1.46 倍)25.6 → 17.6 秒(1.46 倍)
tiny2.45 → 1.66 秒(1.48 倍)18.5 → 12.7 秒(1.45 倍)

large-v3 turbo 在 M5 Ultra 上以 27 秒轉錄完兩小時的錄音,字數與 large-v3 的差距在 1% 以內。作者也記錄了一段測試過程中的問題:以 mlx-whisper 預設設定執行時,Whisper 在長段靜音處陷入重複迴圈,兩台機器輸出的字數與耗時都不一致;固定溫度為 0 之後,仍出現同一段文字重複數千次的情形,最後關閉 condition_on_previous_text 才取得可比較的結果。即使如此,small 與 base 模型在兩小時錄音中仍出現重複片段,作者判斷為模型本身的問題,與硬體無關。在含長段靜音的錄音上使用 Whisper,建議先檢查逐字稿是否有重複內容,再採信耗時數字。

影片生成與影像描述

影片生成使用 LTX-2.5 的社群 MLX 移植版本,作者需先修正四處問題才能執行,並搭配 mlx-lm 尚未正式發布的開發版本,因此這組數字屬於實驗性質,無法直接以正式版軟體重現。

影像描述測試的目的,是評估本地視覺模型能否取代作者目前付費使用的雲端影片分析服務。速度上,Qwen3-VL 32B 在 M5 Ultra 上以 23.5 秒描述完一分鐘的素材;但兩台機器產生的描述都只涵蓋前 29 秒,且動作時間標記彼此不一致。作者的結論是速度已經足夠,輸出內容仍須人工核對後才能取代既有流程。

硬體轉檔:不在 GPU 上執行的工作

硬體影片轉檔由媒體引擎處理,這是晶片上獨立的固定功能電路,並非 GPU 核心。依 Apple 規格,M3 Ultra 與 M5 Ultra 都配備四個 ProRes 編解碼引擎,因此提升幅度明顯低於 AI 工作:HEVC 快 1.3 倍,ProRes 422 快 1.9 倍。兩台機器使用的 ffmpeg 版本不同,且 ProRes 輸出約 62GB、包含磁碟寫入時間,兩項倍數之間的差距不宜過度解讀。

小型決策模型

Laya 與 Kev 屬於不生成文字、只回傳帶機率答案的決策模型,本次透過 PyTorch 的 Metal 後端在 GPU 上執行,是全部測試中唯一未使用 MLX 的項目。40 億參數的 Kev 回答一題短問題時,時間幾乎都花在接收請求與回傳結果等固定開銷,兩台機器都約 0.2 秒;Laya 連續回答 300 題並包含模型載入,快 1.5 倍。這類模型在兩台機器上都已足夠快速,硬體升級帶來的差異不易察覺。

三、只在 M5 Ultra 上執行的三項測試

以下三項僅在 M5 Ultra 上執行,沒有新舊機型的倍數比較,主要用來確認本地模型能否承擔實際工作。

  • AI 代理:以 M5 Ultra 上的 Qwen3.8 27B 作為 Hermes 代理的模型,代理透過工具讀取兩個檔案,並正確回答與內容相關的五個問題,全程 89 秒。代理程式本身在另一台 Mac 上執行,89 秒已包含兩台機器之間的網路傳輸時間。這是單一任務的單次結果,可證明可行,但不足以代表長期可靠度。
  • DaVinci Resolve 剪輯:透過 Resolve 的 MCP 伺服器,由本地模型將一段 13 分 48 秒的原始素材剪成初剪。方法 A 由 27B 模型決定 30 個保留區段並建立時間軸,約 2 分鐘完成,成品 5 分 01 秒;方法 B 由 Kev 逐段判斷 143 個片段、再由 27B 建立時間軸,95 秒完成,成品 5 分 19 秒。作者特別說明,模型需要一份預先撰寫的操作說明才能完成工作;沒有說明時,27B 模型連續呼叫工具 12 次仍未建立時間軸,提供說明後 5 次即完成。以上為排練數據,且未與人工剪輯的版本比較。
  • 長脈絡代理對話:影片中作者也將本地模型接上自己日常使用的 Hermes 代理,脈絡視窗約 13 萬 token。模型載入該代理既有的記憶後,能回答與作者本人相關的問題。作者表示目前不會以它取代主要模型,但可作為處理基本工作的第三層代理。

四、Apple 官方宣稱與實測對照

項目Apple 公布本次實測
語言模型首字時間最高比 M3 Ultra 快 4 倍(14B、4-bit、8K 提示,LM Studio)Qwen3 14B 4-bit:4K、16K、32K 提示分別快 4.1、4.2、4.1 倍(mlx-lm)
文字生成圖片最高比 M3 Ultra 快 4.3 倍(未具名的 12B 模型,MLX)FLUX.2 klein 4B 快 4.0 倍;Z-Image Turbo 快 3.0 倍
記憶體頻寬1.2TB/s,Apple 稱比前代高 50%(相對 819GB/s 約 1.47 倍)語言模型生成速度快 1.5 倍(五款中的四款)
語言模型生成速度未公布約 1.5 倍

Apple 公布的語言模型數據是首字時間,也就是提升約四倍的那一半;逐字輸出答案的那一半,實測提升約 1.5 倍。兩者都是正確的量測,差別在於看的是哪一個階段。作者未測試的官方宣稱包括:CPU 多核心效能最高快 1.3 倍、繪圖效能最高快 1.8 倍、儲存速度最高快 2 倍,以及四台 Mac Studio 組成叢集時推論速度最高為單機的 3 倍。

五、這份實測無法回答的問題

  • 記憶體容量的上限:測試用的 M5 Ultra 為 256GB,M3 Ultra 為 512GB。本次所有模型在兩台機器上都能載入,因此容量並未影響任何數字。以 4-bit 量化估算,模型約需參數量(以十億計)一半的 GB 數,約 6,000 億參數的模型需要約 300GB 權重,可載入 512GB 的 M3 Ultra,無法載入 256GB 的 M5 Ultra。Apple 表示 512GB 的 M5 Ultra 將於 10 月下旬推出。
  • 功耗與能源效率:測試工具內建電表量測流程,但這次並未執行,沒有任何瓦數或每瓦 token 數的數據。
  • 回答品質:語言模型測試只量測速度,並未評估答案品質。
  • 其他:每種機型只有一台、未測試散熱與噪音、未測試 Neural Engine(本次的工作都在 GPU 上執行)、未測試 512GB 的 M5 Ultra 與多機叢集。

六、對本地 AI 採購的意義

這份實測清楚指出 M5 Ultra 的提升集中在哪裡:提示越長、矩陣運算比重越高的工作,受益越多。企業文件問答(RAG)把大量檢索結果放進提示、程式碼助理讀取整個程式碼庫、AI 代理每一步都重新送出不斷增長的對話紀錄,這類工作的等待時間約縮短為四分之一。以短問答為主的對話情境,實際感受到的提升較小,生成速度約為 1.5 倍。

三項規格各自決定一件事:統一記憶體容量決定可以載入哪些模型,記憶體頻寬決定生成答案的速度,GPU 內的神經加速器決定讀取提示的速度。選購時建議依序確認:目標模型在所需量化下的權重大小,加上脈絡長度所需的 KV 快取;典型提示的長度;以及是否需要同時載入多個模型或服務。已使用 M3 Ultra 512GB、且需要執行權重超過 256GB 的模型者,適合等待 512GB 的 M5 Ultra;主要工作是長文件、程式碼或代理流程、且模型可在 256GB 內執行者,M5 Ultra 縮短等待的效果最為明顯。

MAQ 現售 Mac Studio M5 Max 自新台幣 105,900 元起;M5 Ultra(30 核心 CPU、64 核心 GPU、96GB 統一記憶體)自新台幣 199,900 元起;36 核心 CPU、80 核心 GPU 搭配 512GB 統一記憶體的配置自新台幣 626,900 元起,預計 11 月出貨。本次實測使用的是 80 核心 GPU 版本,64 核心 GPU 的配置核心數較少,讀取提示的速度不宜直接套用上表。MAQ 的 Mac Studio 出廠預載 MLX、Ollama 與 llama.cpp,可依目標模型與提示長度建議統一記憶體與 SSD 配置。

延伸閱讀

資料來源:YouTube 頻道 NetworkChuck 影片〈i got one....and it's FAST!!!〉(2026 年 9 月 23 日)。測試數據、方法與限制說明取自 NetworkChuck 於 GitHub 公開之 mac-studio-m5-ultra-local-ai 儲存庫,依 CC BY 4.0 授權引用,經 MAQ 翻譯與整理;語言模型與圖片生成數據為五次量測中位數,其餘為單次量測。Apple 規格、價格與效能宣稱取自 Apple Newsroom〈Apple introduces new Mac Studio with M5 Max and M5 Ultra〉(2026 年 8 月)。M5 Ultra 測試機由 Apple 借予作者,影片由 Micro Center 贊助。台灣售價為 MAQ 網站 2026 年 9 月 24 日標示價格,實際以訂購頁為準。Apple、Mac Studio、Apple Silicon 為 Apple Inc. 商標;DaVinci Resolve 為 Blackmagic Design 商標;文中其他商標均屬各該公司所有。

常見問題

M5 Ultra 執行本地大型語言模型比 M3 Ultra 快多少?

依 NetworkChuck 的實測(mlx-lm、32K token 提示、五次量測中位數),讀取提示的速度在密集模型上快 3.9 至 4.1 倍,混合專家模型快 2.7 至 3.0 倍;生成答案的速度在五款模型中有四款快約 1.5 倍,最小的 14B 模型快 1.8 倍。長提示的首字等待約縮短為四分之一,例如 Qwen3.8 27B 由 83.6 秒縮短為 21.3 秒。

為什麼首字等待快了約 4 倍,生成速度卻只快 1.5 倍?

讀取提示以大型矩陣乘法為主,受惠於 M5 Ultra 每個 GPU 核心新增的神經加速器。逐一生成答案時,每個 token 都要從記憶體讀取模型權重,速度取決於記憶體頻寬;頻寬由 819GB/s 提升至 1.2TB/s,約 1.47 倍,與實測的 1.5 倍相符。

256GB 統一記憶體的 M5 Ultra 可以執行多大的模型?

以 4-bit 量化估算,模型約需參數量(以十億計)一半的 GB 數,另需預留脈絡的 KV 快取與系統使用空間。實測中 122B 的混合專家模型檔案約 65GB,執行時峰值約 70 至 76GB。約 6,000 億參數的模型在 4-bit 下約需 300GB 權重,256GB 無法載入,需要 512GB 版本;Apple 表示 512GB 的 M5 Ultra 於 10 月下旬推出。

語音轉錄、圖片生成等工作也快 4 倍嗎?

不一定。圖片生成幾乎全為矩陣運算,FLUX.2 klein 4B 快 4.0 倍;Whisper 轉錄同時包含讀取與生成,快 1.5 至 2.4 倍;硬體影片轉檔在媒體引擎上執行,只快 1.3 至 1.9 倍;小型決策模型回答單題幾乎沒有差異。

這些測試數據可以查證或自行重現嗎?

可以。作者在 GitHub 公開全部原始數據、測試工具與重現步驟,並以 CC BY 4.0 授權釋出。需注意兩台機器的 macOS 版本不同、M3 Ultra 在測試期間有一個背景程序佔用一顆 CPU 核心,語言模型與圖片生成以外的項目多為單次量測,且這次並未量測功耗。

Mac Studio M5 Ultra:出廠即可執行本地模型

MAQ 供應 Mac Studio M5 Max 與 M5 Ultra,出廠預載 MLX、Ollama 與 llama.cpp,可依目標模型的權重大小與提示長度建議統一記憶體與 SSD 配置。M5 Ultra 新台幣 199,900 元起,512GB 配置接受預訂。