產業動態

四台 Mac Studio 組成地端叢集實測 Kimi K3:同一個前端專案,地端四小時、雲端十五分鐘

2026-09-05 | 約 11 分鐘 | MAQ 技術團隊

2026 年 8 月 31 日,YouTube 頻道 Alex Ziskind(@AZisk)發布影片《I Gave Local AI and the Cloud the Exact Same Job》。影片將四台各配備 512GB 統一記憶體的 Mac Studio 串成一套地端運算叢集,與雲端服務 Abacus AI 的 Supercomputer 執行同一份前端網頁開發任務,各自獨立完成後比較結果。這是該頻道第二輪「地端硬體對雲端服務」測試——第一輪只用單台 512GB Mac Studio,對照組是 Abacus 的 Deep Agent,這次依觀眾意見把地端規模擴大到四機並聯。

一、測試設計:同一份提示詞,兩套系統各自執行

兩邊收到完全相同的提示詞,內容是開發一個名為 Silicon Compute Exchange 的前端網頁專案:採用 TypeScript 與新版前端技術、使用模擬資料、具備深色模式與微互動、符合無障礙規範,並要求代理自行撰寫單元測試並驗證程式可正常運作。地端由本地代理工具 OpenCode 接上四機叢集執行的 Kimi K3;雲端則於 Abacus Supercomputer 上以 Opus 5(high)與 GPT-5.6 Sol 執行。

二、兩套系統的規格對照

比較項目地端:四台 Mac Studio 叢集雲端:Abacus AI Supercomputer
硬體/服務型態四台各 512GB 統一記憶體的 Mac Studio,合計 2TB,以 Thunderbolt 5 網狀連接(六條線材、每台互連)與 RDMA,透過 MLX distributed 執行張量平行運算常駐運作的雲端虛擬機,整合自主代理 Hermes,不需開機等待或容器啟動
可用模型Kimi K3(2.8 兆參數,896 個路由專家),本次啟用全部專家、以 817GB 的量化版本執行單一登入切換一百多款前沿模型,含 GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Kimi K3 等,並有 RouteLLM 依任務自動選模型
建置與付款模式一次性硬體支出,作者陳述當時購入四台合計約 6 萬美元(單台約 1.6 萬美元);同規格的 512GB 配置因記憶體缺貨一度下架,新一代機型的 512GB 版本要到 2026 年 10 月底才恢復供應訂閱制,每月 10 美元起(首月促銷 7 美元)
資料流向提示詞與生成內容留在自有硬體上執行提示詞與生成內容送至 Abacus 的雲端環境執行
本次任務結果首次執行因提示詞篇幅較長、長時間未見輸出;重新執行並靜置後,約 4 小時取得完整可運作的網頁應用約 15 分鐘取得完整可運作、含深色模式與即時篩選動畫的網頁應用

表中硬體採購成本、量化版本細節與完成時間,均為影片作者本人於測試當下的陳述,未經本站覆核或複現,僅供量級參考;硬體市場售價會隨時間與供需變動。

三、速度數據:瓶頸在提示詞處理,不在生成

影片作者實測,Kimi K3 在四機叢集上處理提示詞(prefill)的速度約每秒 238 個 token,生成階段則約每秒 14.7 個 token。這與本站先前評測 Mac Studio 跑本地 LLM 時的結論方向一致:Apple Silicon 的統一記憶體頻寬對生成階段有利,但提示詞處理階段的算力不如 NVIDIA GPU,相關細節見「Mac Studio vs NVIDIA 工作站」一文。以本次任務而言,每秒個位數到十餘 token 的生成速度,加上一份篇幅較長的提示詞,即是四小時完成時間的主要成因。

四、地端與雲端訂閱,差異不只是這次的時間差

把這場測試抽離成一次性的速度比較,容易忽略兩者更根本的不同。以下四項是這次測試同時體現、也是評估地端自建或雲端訂閱時普遍適用的判斷面向。

建置模式。地端硬體是一次性資本支出,取得後所有權歸使用者,往後執行不再產生額外費用;雲端服務是持續性的訂閱支出,隨使用規模、席位數與功能層級累加。

資料流向。地端執行時,提示詞與生成內容不需離開自有硬體;雲端執行則需將資料送至服務供應商的運算環境。這項差異對於資料不能外流的產業與機構,是決定性的考量,與硬體規模大小無關。

模型選擇的彈性。雲端服務如 Abacus AI 的做法是單一登入切換上百款模型,新模型上線當天即可使用,不涉及任何硬體變動;地端執行則受限於當下部署的模型與硬體規格,要換用規模更大的模型,往往意味著添購或擴充硬體。

維運責任。地端叢集的散熱、供電、連線穩定與軟體環境,均由使用者自行維護;雲端服務的底層基礎設施維運則由供應商負責。

這幾項取捨並不會因為地端叢集規模擴大而消失——四台機器能跑滿一個 2.8 兆參數的模型,是這次測試具體證明的能力,但資料是否需要外流、是否有能力自行維運、以及是否需要隨時切換不同前沿模型,仍是各自獨立的決策依據。

資料來源:Alex Ziskind(YouTube 頻道 @AZisk)於 2026 年 8 月 31 日發布之影片《I Gave Local AI and the Cloud the Exact Same Job》;Abacus AI 官方 Supercomputer 說明頁與第三方報導(MindStudio、KDnuggets);Kimi K3 技術報告與本站前篇整理「Kimi K3 釋出 2.8 兆參數權重」;Apple 於 2026 年 8 月 25 日發布之官方新聞稿,以及 MacRumors 對 Mac Studio M5 Ultra 512GB 供貨時程之報導。影片中的硬體採購成本、量化版本體積與效能數據均為作者本人單方陳述,未經本站覆核或複現,僅供量級參考。文中提及之 Abacus AI Supercomputer 為該公司贊助本次影片之產品,本站與 Abacus AI、Moonshot AI、Alex Ziskind 均無合作或對價關係。Mac、Mac Studio、Apple Silicon、Thunderbolt 為 Apple Inc. 之商標;Kimi、Moonshot 為 Moonshot AI 之商標;Claude 為 Anthropic 之商標;Abacus AI 為 Abacus.AI 之商標;NVIDIA 為 NVIDIA Corporation 之商標;其餘商標歸各自所有者所有。

常見問題

Abacus AI 的 Supercomputer 是什麼?

Abacus AI 是一家提供多模型雲端服務的公司,Supercomputer 是其推出的常駐雲端虛擬機產品,開機後持續運作,不需等待冷啟動或容器建置,並內建自主代理 Hermes(具備跨工作階段的持久記憶與自行產生技能的能力)。單一登入即可切換超過一百款前沿模型,並有 RouteLLM 依任務內容自動選模型,另提供桌面版應用程式與 CLI。定價從每月十美元起(首月促銷七美元),若需要 Hermes 等個人代理功能,據 Abacus 官方與第三方報導,另計約每帳號每月二十美元的進階方案。

影片裡的 Kimi K3 是完整、未經剪枝的官方版本嗎?

依影片描述是未剪枝、啟用全部 896 個路由專家,但磁碟佔用僅 817GB,小於官方原生 MXFP4 釋出的 1.56TB,代表使用的是社群自行製作的量化版本,量化方法未於影片中說明。這項數據為影片作者單方陳述,未經第三方覆核或複現,僅供量級參考。Kimi K3 的完整規格、授權條款與各硬體層級實測速度,本站另有專文整理,見「Kimi K3 釋出 2.8 兆參數權重」一文。

先前提到單機跑不動 Kimi K3 完整版,這次為什麼四台 Mac Studio 就跑得動?

因為這是四台機器透過 Thunderbolt 5 網狀連接與 RDMA、以 MLX distributed 執行張量平行運算,將負載分散到合計 2TB 的統一記憶體,並非單機承載。先前文章的結論針對的是單一機箱(含最高規格的多卡 NVIDIA 工作站):即便是四至七卡並聯的頂規平台,系統記憶體上限也僅約 512GB,仍不足以完整載入 1.56TB 的官方權重。四機並聯屬於不同量級的配置;且張量平行運算要求節點數為一、二、四或八的其中之一,三台在架構上不成立,四台是能跑滿完整模型的最小可行組合。

企業如果需要在地端重現這種規模的叢集,MAQ 能提供嗎?

MAQ 的地端 AI 工作站涵蓋 NVIDIA RTX PRO 與 Apple Silicon 兩條產品線,目前上架的最大單機規格為 Mac Studio M5 Ultra,統一記憶體 256GB,適用 200B 級的開放權重模型。多台 Mac 透過 Thunderbolt 網狀連接組成分散式叢集,不是目錄中的現貨品項,可作為客製專案另行報價。對多數企業的實際工作負載而言——內部知識庫問答、文件處理、客服應答、程式輔助——落在數百億至千億參數區間的模型,單機規格即已足夠。

影片提到的每月十美元訂閱費,能直接類推企業導入雲端 AI 的實際成本嗎?

不能直接類推。每月十美元起是 Abacus AI Supercomputer 入門層級的報價,若需要多組帳號、更高並行處理量,或 Hermes 這類個人代理功能,費用會隨方案提高。企業評估雲端方案時,仍須依團隊規模、任務量與所選模型逐項試算實際支出,而非以單一入門價格類推整體導入成本。

單機到位的地端 AI 工作站

MAQ 的地端 AI 工作站涵蓋 NVIDIA RTX PRO 與 Apple Silicon 兩條產品線,鎖定單機即可完整載入的模型規模,目前最高規格為 Mac Studio M5 Ultra 統一記憶體 256GB,適用 200B 級開放權重模型。多台聯機的分散式叢集架構屬客製專案,可另行洽詢規格與報價。