AI 應用

RTX 5090、Mac Studio 或 DGX Spark:個人 AI 電腦的答案不在硬體,而在其上的五層

2026-08-16 | 約 14 分鐘 | MAQ 技術團隊

YouTube 頻道「AI News & Strategy Daily」的主持人 Nate B Jones 在 2026 年 5 月 1 日釋出一支 32 分 35 秒的影片,標題是「RTX 5090, Mac Studio, or DGX Spark? I tried all three.」。標題像三機對決,內容卻是另一回事:三台機器只佔全片約兩分半,其餘三十分鐘在談一個更根本的問題——一台個人 AI 電腦究竟由哪幾層組成,以及其中哪幾層值得自己擁有。本文依原片脈絡逐層整理,並就 2026 年 8 月的現況修正片中已經過時的硬體數字。

這支影片沒有量測數據,重點也不在三台機器

該頻道約 31 萬訂閱,以 AI 產業策略分析為主。這支影片累計逾 18 萬次觀看(2026 年 8 月 16 日查)。全片沒有任何量測數據——沒有每秒 token 數、沒有功耗曲線、沒有跑分對照。片中對三台機器的描述是選型原則,不是實測結果。DGX Spark 的官方實測數字,以及 Mac 與 NVIDIA 在本地 LLM 上的取捨,本站另有兩篇專文可供對照。

影片真正的貢獻在另一處。作者開場即指出一個容易被忽略的轉向:過去十五年,個人電腦的故事其實是電腦逐漸消失的故事——檔案搬進別人的雲端、應用程式變成瀏覽器分頁、作業系統退化為別人基礎設施的啟動器。而代理式 AI 正在把方向扭回來,因為一個有用的代理不只回答問題,它要動手:讀檔案、檢查資料夾、跑測試、改試算表、搜筆記、開瀏覽器、記住上次的決定、失敗後重試。代理愈有用,它就愈往計算最古老的原語靠回去——檔案、行程、權限、記憶、本機狀態與執行。

作者也先立了一道界線:這不是「雲端不好、地端才好」的主張。他明講最好的雲端模型極為有用,而且重要趨勢是它們正在靠近個人電腦而非遠離——Codex、Claude Code 這一整類編碼代理之所以要緊,正是因為雲端模型現在能直接操作眼前這台機器上的儲存庫、終端機與檔案。他的立場是反依賴,不是反雲端

在雲端優先的模式裡,AI 服務擁有記憶,而使用者是去拜訪自己的記憶;在個人運算的模式裡,記憶屬於自己,模型是被請來的客人。

他另外舉了一個歷史對照:個人電腦出現之前,主流是分時制——向別人的大型主機租算力、排隊等候、在素未謀面的操作員所訂的規則裡工作。第一批個人電腦並沒有在原始效能上贏過大型主機,它們贏在把人與機器之間的距離縮到最短。

第一層 硬體:三條路線,以及此刻必須修正的數字

作者把硬體稱為整套堆疊裡最不迷人的一層,也是最多人卡住的一層,因為多數人想要一個通用答案。他的看法是這個問題本身問錯了:地端 AI 同時受記憶體容量、頻寬、加速器支援、軟體成熟度、散熱、電力、噪音,以及每天實際在做什麼所限制。因此該問的不是「哪一台最好」,而是要把哪一個工作負載收回自己手上

影片給出的三條路線如下。

Mac Studio
私密寫作、文件檢索、本地編碼輔助
統一記憶體架構,CPU 與 GPU 共用同一池
安靜、省電,開箱即是一台電腦而非一項工程
強項不在原始張量吞吐
影片形容它「感覺像一台電腦,而不是一個專案」
RTX 5090
代理式編碼、需要吞吐的開發者
32GB GDDR7,記憶體頻寬 1,792 GB/s
CUDA 生態最完整、速度最快
代價是驅動、散熱、電力、切分與維護
兩張卡是 64GB,但不是一個乾淨的 64GB 記憶體池
DGX Spark
想要 CUDA 原生又不想自己組塔式機
GB10 Grace Blackwell 超級晶片
128GB 一致性統一記憶體,頻寬 273 GB/s
附 NVIDIA 官方軟體堆疊
把 NVIDIA 路線包成一台成品,而不是一張零件清單
AMD Strix Halo
影片稱之為「價值面的變數」
正式名 Ryzen AI Max+ 395,128GB 統一記憶體
其中最高 96GB 可切給 GPU 使用
硬體條件吸引人
軟體成熟度仍不及 CUDA,順手程度也不及 Apple Silicon
Mac Studio
私密寫作、文件檢索、本地編碼輔助
統一記憶體架構,CPU 與 GPU 共用同一池
安靜、省電,強項不在原始張量吞吐
影片形容它「感覺像一台電腦,而不是一個專案」
RTX 5090
代理式編碼、需要吞吐的開發者
32GB GDDR7,記憶體頻寬 1,792 GB/s
CUDA 生態最完整,代價是驅動、散熱、電力與維護
兩張卡是 64GB,但不是一個乾淨的 64GB 記憶體池
DGX Spark
想要 CUDA 原生又不想自己組塔式機
GB10 Grace Blackwell 超級晶片
128GB 一致性統一記憶體,頻寬 273 GB/s
把 NVIDIA 路線包成一台成品,而不是一張零件清單
AMD Strix Halo
影片稱之為「價值面的變數」
正式名 Ryzen AI Max+ 395,128GB 統一記憶體
其中最高 96GB 可切給 GPU 使用
軟體成熟度仍不及 CUDA,順手程度也不及 Apple Silicon

三台機器的規格數字取自各廠官方規格頁,查證日 2026 年 8 月 16 日;欄內敘述為影片觀點之整理。

兩張 5090 為何不等於 64GB

影片對這個限制只以一句帶過,成因則相當明確。GeForce RTX 5090 的官方規格頁明列 NVLink 支援為「否」,整個 GeForce 50 系列都沒有 NVLink 介面;更關鍵的是消費級 GeForce 連 GPU 對 GPU 的 PCIe 點對點傳輸都被官方關閉——NVIDIA 官方論壇版主在 2025 年 3 月針對雙 5090 的提問直接回覆「GeForce 系列不支援 GPU 對 GPU 的 P2P」。實務結果是兩張卡等於兩個各自獨立的 32GB 位址空間,跨卡資料交換必須經由主機端中轉。要用滿那 64GB,必須以張量並行把模型權重分片到兩張卡上,且單一層的張量與 KV 快取無法跨卡連續配置。

影片發布後,Mac 這條路線的數字已經改了

影片建議「Mac mini M4 Pro 搭 64GB 是很好的入門點」,並說 Mac Studio 在需要 128GB、256GB 乃至 512GB 統一記憶體時才變得有意思。這些配置在 2026 年 8 月已經買不到了。

依 Apple 官方規格頁(2026 年 8 月 16 日查),Mac Studio 的 M3 Ultra 機種只剩 96GB 單一配置,M4 Max 機種為 36GB 起、最高 64GB;Mac mini 的 M4 Pro 為 24GB 起、最高 48GB,基礎 M4 機種最高 24GB。變動的時序是:512GB 選項於 2026 年 3 月移除,128GB 與 256GB 於 5 月間陸續消失,原因是 AI 需求帶動的全球 DRAM 短缺。同一波供給緊縮也反映在 NVIDIA 身上——DGX Spark 創始版的官方建議售價於 2026 年 2 月 23 日由 3,999 美元調升至 4,699 美元,NVIDIA 在公告中直接寫明「此次價格調整反映全產業的記憶體供給限制」。

換句話說,這半年真正變動的不是誰比較快,而是買得到多少記憶體。影片主張「不要為讀到的最大模型買機器,要為每天實際會執行的工作買」,在容量普遍縮水的此刻反而更站得住腳。他另有一句話值得記下:機器到貨之前就該先有工作等著它做。

兩則影片未提、但寫在同一條時間線上的補充:NVIDIA 桌上型產品線在 DGX Spark 之上還有 DGX Station,採 GB300 Grace Blackwell Ultra,最高 748GB 一致性記憶體,2026 年春季起由 OEM 夥伴接單;AMD 這邊,Strix Halo 的後繼 Gorgon Halo(Ryzen AI Max 400 系列)最高 192GB 統一記憶體、其中最多 160GB 可配給 GPU,排定 2026 年第三季由系統商推出。

第二層 執行環境:決定這台機器是工具還是負擔

影片認為多數人低估了這一層,因為它不像模型名稱那樣引人注意,但它決定的是——地端 AI 究竟感覺像電腦的一部分,還是像一個永遠補不回來的週末。

底層是 llama.cpp。即使從不直接呼叫它,自建堆疊的人幾乎都在受益於它,因為地端模型的通用格式 GGUF 出自同一個 ggml 專案(llama.cpp 的同源底層函式庫,兩者同屬 ggml-org),而 llama.cpp 是它最主要的使用者。影片點名 CPU、Apple Metal、CUDA、Vulkan「還有更多」;llama.cpp 的官方後端表確實更長,另含 SYCL、HIP、MUSA、CANN、OpenCL、WebGPU 等。

再往上,影片給的實務預設是:日常用 Ollama、評估模型用 LM Studio、在 Apple Silicon 上走 MLX、服務化時用 vLLM,確定押注 CUDA 之後再進到更深的 NVIDIA 堆疊。這組建議大方向可用,但有三處需要修正到 2026 年 8 月的現況:

  • LM Studio 是執行模型的桌面應用,不是評測工具。影片稱它為「測試模型與量化的精緻工作台」,並在實務預設裡把它派給「評估」;官方文件的定位則是在本機下載並執行開放模型的桌面應用——內建聊天介面、可接 MCP 工具、可把本機模型以 OpenAI 相容端點對外服務,底層 runtime 為 llama.cpp 與 MLX,並無評測或跑分功能。
  • SGLang 與 vLLM 是同一層級的兩套選擇,不是階梯關係。兩者都是高吞吐服務框架、都提供 OpenAI 相容 API;SGLang 的硬體支援面更廣,涵蓋 NVIDIA、AMD、Intel Xeon、Google TPU 與 Ascend NPU。
  • NVIDIA NeMo 屬於訓練與客製化,不是部署層。官方文件將它定位為建立、客製與微調生成式 AI 模型的框架,訓練完的模型要另接 Riva、NIM 或 TensorRT-LLM 才走到部署。影片把它與 TensorRT-LLM 並列為部署選項,這一格放錯了。

另有一項與影片論旨直接相關、值得留意的變化:Ollama 的模型目錄本身託管在雲端(registry.ollama.ai),拉取後模型才落在本機、之後可離線執行;而 2026 年起,帶 :cloud 後綴的模型是送往 Ollama 自家伺服器執行,不在本機跑。以「擁有底層」為前提選工具時,這個區別必須看清楚。

影片對這一層的總結相當精準:執行環境健康,模型就可以隨時替換;執行環境脆弱,每次換模型都變成一次搬遷工程。

第三層 模型:配一整櫃工具,不是選一個冠軍

影片主張不要圍繞單一模型名稱建置個人 AI 電腦,而要圍繞模型類別:一個負責便宜呼叫的快速小模型、一個較強的地端通用模型、一個編碼模型、一個供記憶層使用的 embedding 模型、一個語音模型、可能還有一個視覺模型,以及一個留給真正困難工作的雲端前沿模型。以編碼為例,合理的組合是小型自動補完模型、理解整個儲存庫的編輯器模型,加上處理架構變更、除錯與遷移的深度推理模型。

他特別點出 embedding 這一格:它便宜、易於快取,而且是隱私的核心。若文件只是為了變成向量就離開了機器,那就錯過了地端 AI 最容易拿到的一項好處。

片中列舉的開放權重家族在 2026 年 8 月仍然成立,惟授權條款一項經常被誤植,實際條款依各家官方文件為:

  • OpenAI gpt-oss-20b 與 gpt-oss-120b:Apache 2.0,2025 年 8 月 5 日發布,混合專家架構,120b 為 1,168 億總參數/每 token 啟動 51 億。
  • Meta Llama 4 Scout 與 Maverick:確為混合專家(Scout 1,090 億總參數/啟動 170 億,Maverick 4,000 億/啟動 170 億),但授權是 Llama 4 Community License,不是 Apache 2.0,內含月活躍使用者逾七億須另行取得授權等條款。
  • Google Gemma 4:2026 年 4 月 2 日發布,且授權已改為 Apache 2.0——不再是 Gemma 1 至 3 那套自訂條款。首發四個尺寸,6 月 3 日再加入 12B 版本,現為五個變體。
  • Qwen3.8:27B 稠密版為 Apache 2.0、原生脈絡 262,144 token;旗艦 Max 版(2.4 兆總參數/啟動 950 億)走自訂授權,兩者條款不同。
  • Mistral:Mistral Large 3、Mistral Small 4 與 Ministral 3 系列皆以 Apache 2.0 釋出。
  • DeepSeek V4:Pro 與 Flash 兩個變體於 2026 年 4 月 24 日以預覽版同步開源,授權為 MIT;Flash 於 7 月 31 日更新,Pro 正式版於 8 月 13 日發布。

影片提到「開源模型還是不如封閉前沿模型」時,對照的是 ChatGPT 5.5;截至本文查證日,ChatGPT 的主力已是 GPT-5.6 家族(Sol、Terra、Luna 三個級距)。模型清單本身會過期,這正是影片的論點——耐久的不是模型清單,是底下那套堆疊。

第四層 記憶:整支影片的真正主張

影片認為這是最多人建置不足的一層,也是把地端 AI 從玩具變成基礎設施的關鍵。理由只有一句:模型是無狀態的,人的生活不是。筆記、文件、逐字稿、郵件、任務、行事曆、程式決策、研究、偏好、長期專案狀態——每一套可用的個人 AI 系統都需要一份存在模型之外的持久記憶,而這份記憶應該屬於使用者本人,不屬於模型供應商。

作者自建了一套名為 Open Brain 的記憶系統,其授權狀態常被誤稱:它是公開原始碼,但不是 OSI 定義下的開源。其授權為 FSL-1.1-MIT(Functional Source License 1.1),禁止用於競品商業服務,並於釋出滿兩週年後自動轉為 MIT。技術上它以 Supabase(即 PostgreSQL)加 pgvector 為底,原文以純文字欄位保存、向量存在同一張表的另一個欄位,另附一個可接 Claude Desktop、ChatGPT、Cursor 等用戶端的 MCP server。

他也給了不必自建的替代路徑:文件量大的人用 Obsidian,把內容留在自己掌控的資料夾裡;純 markdown 加上 Git,是那個無趣但不朽的版本;結構化資料則走 Postgres。判準只有一條——當那個 AI 應用消失時,知識仍然存在。

檢索層的兩個預設值分別是 PostgreSQL 加 pgvector(關聯資料、中繼資料、權限與向量搜尋集中於同一套系統)與 SQLite 加 sqlite-vec(單一檔案、易於備份)。使用後者需注意一項風險:sqlite-vec 官方明寫仍在 v1 之前,SQL 介面與儲存格式可能出現破壞性變更,最新為 2026 年 5 月的預發行版。

影片對這一層最實用的一段是關於管線:好的檢索不是把所有文件切塊後碰運氣。不同種類的資料需要不同的處理方式——PDF 與 markdown 不同,會議逐字稿需要講者與時間戳,程式碼需要理解符號的索引,筆記需要保留連結。原始資料與向量必須分開保存,才能在更好的 embedding 模型出現時重建索引。他的結論是:記憶系統出問題時,多半不是模型的問題,是管線的問題。

至於 MCP,他的提醒相當節制:把 MCP server 擺在資料庫前面,讓各種用戶端都能查詢這份記憶,方向是對的,但不要當成魔法——它仍然需要權限、日誌、密鑰管理與邊界。這一點有官方規格背書:MCP 規格的安全章節明訂「工具代表任意程式碼執行,必須審慎對待」、「主機端在呼叫任何工具前必須取得使用者明確同意」。另需更新一項事實:MCP 已於 2025 年 12 月 9 日由 Anthropic 捐給 Linux Foundation 底下新成立的 Agentic AI Foundation,改為廠商中立治理,現行規格版本為 2026 年 7 月 28 日。

第五層 介面:多個入口,同一套底層

影片對這一層的判斷是:一套很好的執行環境若沒有順手的入口,就是一個用一週就會放棄的設定。地端 AI 不能只活在終端機裡,模型必須出現在工作發生的地方。聊天用 Open WebUI、重度檢索用 AnythingLLM、直接操作模型用 LM Studio;編輯器端 Continue 是明顯的橋樑,因為它可以指向任何 OpenAI 相容端點,Aider 則在終端機編碼上仍然好用;啟動器與命令列這些不起眼的工具反而重要——Raycast、Alfred、shortcuts、shell 指令、選單列小工具、一個 LLM 命令列介面。

他給出的原則是整段最好記的一句:多個入口,底下同一套堆疊。編輯器、筆記軟體、瀏覽器、啟動器、終端機與錄音工具不該各有各的記憶層,它們應該呼叫同一套地端執行環境與同一份記憶。而他也指出為什麼市面產品不會提供這件事:它們的商業模式,正是擁有那個輸入管道底下的記憶。

語音被他認為是遭到低估的一格——過去幾年的雲端語音助理把所有人的期待訓練成失望,但本機語音現在不一樣了:Whisper 負責轉寫,一個本機或混合模型負責意圖理解、清理、摘要與路由。關於 Whisper 有一項限定:它仍是這個生態的參考實作,whisper.cpp 與 faster-whisper 都是同一模型的不同推論實作,但上游 openai/whisper 自 2025 年 6 月起未再發行新版本,並已出現 Voxtral 這類 Apache 2.0 的挑戰者。

第六層 工作流:機器到底每天在做什麼

到這一層,問題從「模型能不能在本機跑」變成「除了模型之外,還掌握了哪些流程」。影片點名四種最先成立的工作流:

  • 個人檢索與記憶。把筆記、草稿、PDF 建成索引。價值不在通用搜尋,而在逐年累積出一份屬於自己的工作史。前沿模型讀過公開網際網路,但沒讀過這幾年的會議紀錄,也不該讀。
  • 私有編碼迴圈。具備儲存庫存取權的本機編碼助理,重構、產生測試、起草都做得到。它未必及得上前沿模型,但足以吸收掉大量日常工作。
  • 會議記錄。本機 Whisper 加本機摘要模型,錄音、轉寫、摘要、抽出決策、建立任務,全程音訊不離開機器,也沒有按小時計費的轉寫帳單。連續一年在每場會議上執行,決策會變成可搜尋的資料,重複出現的對話會累積成一份私有的組織記憶。
  • 長時運行的代理。雲端 API 的計價會讓人心理上不願意跑太多 token;當成本邊界變成電費,長時代理迴圈才划算。作者以 OpenClaw 現象為例——那是一套 MIT 授權的常駐型個人 AI 助理(原名歷經 Warelay、Clawdbot、Moltbot),由 Peter Steinberger 與社群開發,架構主打一個永遠開著的 gateway。需要註明的是:官方文件舉的常駐主機例子是小型 VPS、家用伺服器或 Raspberry Pi 級機器,「拿一台 Mac mini 常駐跑代理」是社群普遍做法,不是官方建議配置。

研究與綜合則被他判定會長期維持混合:地端模型可以檢索、整理、摘要、預備脈絡,真正困難的綜合仍需要前沿模型。

三種買家側寫

影片最後把選型收斂成三個人物。這一段是全片最接近採購建議的部分。

地端優先的知識工作者

寫作、研究、少量編碼、處理機敏文件,但不想把家裡的辦公室變成一間機房。影片建議從 Mac mini M4 Pro 或 Mac Studio M4 Max 起步,軟體用 Ollama、LM Studio、必要時加 MLX,配上本機 embedding、Whisper、Open WebUI、Continue,以及一套 SQLite 或 Obsidian 的簡單檢索組合,同時保留一份前沿模型的訂閱或 API 帳號給困難的工作。

全地端的極大化者

要隱私、要法遵、要主權,核心工作不容許外部相依。這條路指向高記憶體的 Mac Studio、DGX Spark 或條件相當的正規工作站;記憶層走 Postgres 加 pgvector,工具一律擺在 MCP 後面並配上權限與稽核日誌。作者自己的評語是:這不是最便宜的組合,但它是地端主張最乾淨的表達。

地端優先的建置者

開發者或小型團隊,跑代理、測產品,或想壓低雲端推論支出。這類人在意的是 CUDA 吞吐、服務化、評測與可重現性,因此雙張 RTX 5090、工作站級顯卡、DGX Spark 或地端與雲端混合的 GPU 配置都在考慮範圍;服務用 vLLM、原型用 Ollama,部署效率要緊時再上 TensorRT-LLM。影片對這條路的算式很清楚:地端推論不必取代每一次雲端呼叫才有價值,它只需要吸收掉足夠多重複、私密、高頻的工作。

影片的結論:這是一套路由系統,不是純度測試

作者把整支影片收束在一句話上——個人 AI 電腦不是一場純度測試,它是一套路由系統。有些工作留在本機,因為它私密、便宜、重複、且脈絡沉重;有些工作送往雲端,因為它罕見、困難、價值高、需要前沿能力。差別在於由誰決定路由

他也把「省錢」降為次要理由:成本節省可能是真的,但長期建立這套堆疊的更深理由不是成本,而是知識的複利。每一個專案、筆記、會議、決策、修正、偏好與流程都能成為一份自己擁有的記憶;模型可能每幾個月換一次,記憶則每年變好一點。至於記憶本身,他給了兩項並存的要求:要能累積,也要能稽核——系統應該能從工作中學習,而使用者應該能檢視它存了什麼、刪掉錯的、追溯某項事實的來源,並在更好的 embedding 出現時重建索引。

權限是他最後的提醒,而且舉例極為具體:寫作代理不需要 shell 權限,編碼代理不需要看銀行對帳單,會議摘要工具不需要刪除檔案的權限。代理愈有用,可攻擊面就愈大,因此擴充性必須配上邊界。

把前沿模型當成專家聘用,讓它做最擅長的那件事,而不是把記憶、檔案系統、工作流引擎與作業層都租給它。

MAQ 觀點

影片提到的軟體——Ollama、LM Studio、MLX、vLLM、Open Brain、OpenClaw、Obsidian——沒有一項是 MAQ 的產品,這一整套堆疊也不需要向任何人採購才能開始。真正需要採購的只有最底下那一層,而那一層此刻的限制條件很明確:記憶體。

MAQ 型錄與影片三條路線的對應關係如下。Mac 這條路,站上供應 Mac mini(M4 與 M4 Pro)與 Mac Studio(M4 Max 64GB、M3 Ultra 96GB)。GB10 這條路,DGX Spark 與同晶片的 ASUS Ascent GX10 都在架上,兩者同為 128GB 統一記憶體,差別在儲存容量、品牌與價格。CUDA 這條路,MAQ 的答案是 RTX PRO Blackwell 系列而非 GeForce RTX 5090——單卡的顯示記憶體自 RTX PRO 4000 的 24GB 到 RTX PRO 6000 的 96GB,每一級都是一整塊連續的記憶體,正好避開前文那個「兩張卡不是一個記憶池」的限制。

至於該對到哪一格,判準與影片一致:先確定要收回本機的是哪一個工作負載,再回推目標模型量化後的記憶體需求與並行人數。這層對照完整整理在 AI 硬體選購指南

延伸閱讀:NVIDIA DGX Spark 自主式 AI 代理實測解析(含官方實測數字)、Mac Studio vs NVIDIA 工作站:跑本地 LLM 哪個划算跑 Llama 3.3 70B/gpt-oss-120b 要買幾張卡

資料來源:影片為 Nate B Jones 於 YouTube 頻道「AI News & Strategy Daily」發布之「RTX 5090, Mac Studio, or DGX Spark? I tried all three.」(2026 年 5 月 1 日,片長 32 分 35 秒,https://www.youtube.com/watch?v=iUSdS-6uwr4 )。影片內容之整理依據該片官方自動字幕全文,引號內文字為中譯,語意以原文為準;影片觀點歸屬原作者,本文之補正與判斷由 MAQ 編輯負責。修正與補充所依據之一手來源,均於 2026 年 8 月 16 日查證:NVIDIA 官方 DGX Spark、DGX Station 與 GeForce RTX 5090 規格頁、NVIDIA Developer Forums 之 2026 年 2 月 23 日調價公告與 GeForce P2P 官方答覆、NVIDIA TensorRT-LLM 與 NeMo 官方文件;Apple 官方 Mac Studio 與 Mac mini 規格頁,記憶體選項移除之時序參考 MacRumors 與 9to5Mac 報導;AMD 官方部落格與 Variable Graphics Memory 說明,Gorgon Halo 規格參考 ServeTheHome 報導;ggml 專案之 GGUF 規格文件與 llama.cpp、Ollama、LM Studio、vLLM、SGLang、MLX、pgvector、sqlite-vec、whisper.cpp 官方文件;Model Context Protocol 官方規格與 2025 年 12 月 9 日之治理移轉公告;OpenAI、Meta、Google、阿里巴巴、Mistral、DeepSeek 之官方模型卡與授權文件;Open Brain(GitHub NateBJones-Projects/OB1)與 OpenClaw(GitHub openclaw/openclaw)之官方授權與說明文件。凡未能取得一手證據者一律未寫入,包含 DGX Station 之售價與 Mac 新世代機種之上市時程傳聞。硬體規格、授權條款與定價依時間變動,實際規格請以各廠商官方最新公告為準;導入前應以自身工作負載實測。本文非受任何公司委託或贊助,亦未收受對價;MAQ 為 AI 硬體系統整合商,所銷售之工作站包含文中提及廠商之硬體產品,讀者於閱讀本文之產品觀察時宜一併考量。NVIDIA、CUDA、Blackwell、Grace、DGX、GeForce、RTX、NVLink、TensorRT、NeMo 為 NVIDIA Corporation 之商標;Apple、Mac、Mac mini、Mac Studio、Apple Silicon、MLX 為 Apple Inc. 之商標;AMD、Ryzen、Radeon 為 Advanced Micro Devices, Inc. 之商標;OpenAI、ChatGPT 為 OpenAI 之商標;Claude、Anthropic 為 Anthropic PBC 之商標;Meta、Llama 為 Meta Platforms, Inc. 之商標;Google、Gemma 為 Google LLC 之商標;Qwen、通義千問為阿里巴巴集團之商標;Mistral 為 Mistral AI 之商標;DeepSeek 為杭州深度求索之商標;ASUS、Ascent 為華碩電腦之商標;其餘商標歸各自所有者所有。

常見問題

這支影片真的實測了三台機器嗎?

沒有量測數據。全片 32 分 35 秒沒有出現每秒 token 數、功耗曲線或跑分對照,三台機器的段落約兩分半,內容是選型原則而非實測結果。片中對三者的描述分別是:Mac Studio 的強項在統一記憶體、低噪音與能源效率,而非原始張量吞吐;RTX 5090 的回報是速度與生態支援,代價是驅動、散熱、電力與維護;DGX Spark 則是把 NVIDIA 路線包裝成一台成品而非一張零件清單。想看 DGX Spark 的官方實測數字,可讀本站另一篇拆解。

影片說 Mac Studio 可以配到 512GB 統一記憶體,現在還買得到嗎?

買不到。依 Apple 官方規格頁(2026 年 8 月 16 日查),Mac Studio 的 M3 Ultra 機種只剩 96GB 單一配置、M4 Max 機種為 36GB 起最高 64GB;Mac mini 的 M4 Pro 為 24GB 起最高 48GB。變動時序是 512GB 於 2026 年 3 月移除、128GB 與 256GB 於 5 月間陸續消失,原因為 AI 需求帶動的全球 DRAM 短缺。同一波緊縮也反映在 NVIDIA:DGX Spark 創始版建議售價於 2026 年 2 月 23 日由 3,999 美元調升至 4,699 美元,官方公告明寫「反映全產業的記憶體供給限制」。引用該片的硬體數字時,須一併確認當下的實際可購配置。

兩張 RTX 5090 是不是就等於 64GB 可用記憶體?

不是。NVIDIA 官方規格頁明列 RTX 5090 的 NVLink 支援為「否」,整個 GeForce 50 系列都沒有 NVLink 介面;此外消費級 GeForce 連 GPU 對 GPU 的 PCIe 點對點傳輸都被官方關閉,NVIDIA 官方論壇版主於 2025 年 3 月針對雙 5090 的提問已明確答覆不支援。實務上兩張卡是兩個各自獨立的 32GB 位址空間,跨卡交換須經主機端中轉,要用滿 64GB 必須以張量並行把權重分片,且單一層的張量與 KV 快取無法跨卡連續配置。若需要單一連續的大容量記憶體,路線是專業級單卡或統一記憶體架構的機器。

影片說的 Open Brain 是開源軟體嗎?

是公開原始碼,但不是 OSI 定義下的開源。官方儲存庫為 GitHub 上的 NateBJones-Projects/OB1,授權為 FSL-1.1-MIT(Functional Source License 1.1),禁止用於競品商業服務,並於釋出滿兩週年後自動轉為 MIT。技術架構以 Supabase(PostgreSQL)加 pgvector 為底,原文以純文字欄位保存、向量存於同一張表的另一欄位,另附可接 Claude Desktop、ChatGPT、Cursor 等用戶端的 MCP server。影片提到的替代路徑同樣可行:文件為主用 Obsidian,純 markdown 加 Git 是最耐久的版本,結構化資料走 Postgres。

影片對軟體堆疊的建議,有哪幾處需要更新?

三處定位需要修正。其一,影片把 LM Studio 稱為測試模型與量化的工作台,官方文件的定位則是在本機下載並執行開放模型的桌面應用,可接 MCP 工具、可用 OpenAI 相容端點對外服務,底層 runtime 為 llama.cpp 與 MLX,並無評測或跑分功能。其二,SGLang 與 vLLM 是同一層級的兩套高吞吐服務框架,不是階梯關係,SGLang 的硬體支援涵蓋 NVIDIA、AMD、Intel Xeon、Google TPU 與 Ascend NPU。其三,NVIDIA NeMo 屬於訓練與客製化框架,不是部署層,訓練後須另接 Riva、NIM 或 TensorRT-LLM。另有兩項事實需同步更新:MCP 已於 2025 年 12 月 9 日由 Anthropic 捐給 Linux Foundation 底下的 Agentic AI Foundation,改為廠商中立治理;Ollama 自 2026 年起提供帶 cloud 後綴的模型,該類模型送往 Ollama 自家伺服器執行,不在本機運行。

一般企業要照著這支影片做,第一步該從哪裡開始?

影片給的順序是先決定工作負載,再決定機器——原話是機器到貨之前就該先有工作等著它做。可先盤點哪一類工作最適合收回本機:多半是私密、重複、脈絡沉重且量大的那一類,例如內部文件檢索、會議轉寫與摘要、私有程式庫的編碼輔助。確定之後再回推兩個數字:目標模型量化後的記憶體需求,以及同時使用的人數。這兩個數字決定的是顯示記憶體與系統記憶體的級距,而不是顯示卡型號。至於雲端,影片的立場是反依賴而非反雲端,困難、罕見、高價值的工作仍應交給前沿模型。

把工作負載對回機器規格

MAQ 的 AI 硬體選購指南依用途分列中型 LLM 推論、70B 至 120B 推論、LoRA 與 QLoRA 微調、影像生成與 AI Agent 工作流,各自對應建議的顯示記憶體、系統記憶體與 CPU,並直接連到可線上估價的機型。GB10 迷你機與顯卡型工作站兩條路線同頁對照。