NVIDIA 於官方技術部落格發表針對 DGX Spark 的實測分析,主題為自主式 AI 代理(autonomous AI agents)的執行與擴充。該文提供了完整的效能數據,並同時載明了幾項限制。對正在評估地端 AI 主機的企業而言,這些數字比規格表更具參考價值——前提是要看懂它在量什麼。

閱讀前須先建立一項認知:本文所引效能表中的「提示處理吞吐」與「token 生成吞吐」是兩個不同階段的指標,數值相差約兩個數量級。前者是模型讀入長脈絡的速度,後者才是實際產出文字的速度。若只看前者,將對這台機器的產出能力產生嚴重高估。以下每張表均完整呈現兩者。
一、這台機器的設計目的:讓代理常駐於本機
自主式 AI 代理與一般問答應用不同。它需要長時間執行任務、同時維持多個通訊管道與背景子程序,並且必須記得整段脈絡。這類工作負載對硬體的要求集中在三處:足夠的記憶體容納長脈絡、足夠的並行能力同時執行多個子代理、以及能夠持續運行而不依賴雲端。
DGX Spark 單機配置 128GB 統一記憶體。依 NVIDIA 的觀察,自主代理實務上常使用 30K 至 120K token 的脈絡,處理複雜請求時部分可達 250K token。由於運算完全在本機完成,代理得以常駐運行,資料無須送往外部服務。
二、單機推論實測
測試條件為 128K token 輸入、1K token 回應、批次大小 1。各模型的量化方式與推論引擎不同,已逐列標註——這三列並非同條件的橫向比較。
| 模型(量化/推論引擎) | 端到端耗時 | 提示處理耗時 | 提示處理吞吐 | token 生成吞吐 |
|---|---|---|---|---|
| Nemotron 3 Super 120B(NVFP4/TensorRT LLM) | 99 秒 | 44 秒 | 2,855 tokens/秒 | 18 tokens/秒 |
| Qwen3 Coder Next 80B(FP8/vLLM) | 89 秒 | 54 秒 | 2,390 tokens/秒 | 28.95 tokens/秒 |
| Qwen3.5 35B A3B(FP8/vLLM) | 73 秒 | 41 秒 | 3,080 tokens/秒 | 35.75 tokens/秒 |
兩欄吞吐量的落差是採購評估的關鍵。提示處理吞吐達數千 tokens/秒,反映的是讀入長脈絡的速度;實際產出文字則為每秒 18 至 36 個 token,且模型愈大愈慢。就代理工作流而言,前者決定啟動延遲,後者決定完成一段輸出所需的時間。
關於 120B 模型如何放進 128GB
Nemotron 3 Super 標示為 120B 參數,實際運行採 NVFP4 四位元量化,權重佔用約 60GB,128GB 統一記憶體因此得以承載。若以 BF16 全精度載入則約需 240GB,該機器放不下。
該模型同時為混合專家(MoE)架構、活躍參數約 12B——這一點影響的是每個 token 的運算量,而非記憶體佔用;推論時 120B 參數仍須全部常駐記憶體。表中的 Qwen3.5 35B A3B 同樣是 MoE,活躍參數約 3B。
評估其他模型時,記憶體需求應以總參數乘以量化位元數估算,活躍參數則用於推估運算速度,兩者不可混為一談。
並行任務的表現
測試條件為 Qwen3 Coder Next FP8 於 vLLM、32K 輸入、1K 回應:
| 同時任務數 | 端到端耗時 | 首個 token 中位延遲 | 提示處理吞吐 | token 生成吞吐 |
|---|---|---|---|---|
| 1 | 35 秒 | 9 秒 | 3,261 tokens/秒 | 38 tokens/秒 |
| 2 | 54 秒 | 12 秒 | 5,363 tokens/秒 | 47 tokens/秒 |
| 4 | 91 秒 | 15 秒 | 9,616 tokens/秒 | 53 tokens/秒 |
由 1 個任務增至 4 個任務,提示處理吞吐提升約 2.9 倍,但 token 生成吞吐僅由 38 提升至 53 tokens/秒,約 1.4 倍;單一任務的端到端耗時則由 35 秒增為 91 秒,約 2.6 倍。
換言之,並行處理主要提升的是讀入脈絡的總量,實際產出速度的增幅有限。平均分攤到每個任務,生成速度由 38 tokens/秒降至約 13 tokens/秒。若代理工作流屬於背景批次執行,此一取捨通常可以接受;若要求即時互動回應,則應以較低的並行數規劃。
三、多節點叢集
DGX Spark 支援以 ConnectX-7 網路卡搭配 RoCE 200GbE 互連。依 NVIDIA 2026 年 6 月的多節點更新文,實體拓樸包含兩節點直連、三節點環狀,以及經 QSFP 交換器的二至四節點配置:
- 兩節點:256GB 統一記憶體,可支援約 400B 參數規模的推論
- 四節點:512GB 統一記憶體,可運行大型 MoE 模型與多代理管線
- 單節點的微調能力可達 120B 規模
微調與強化學習的擴充接近線性
| 節點數 | 微調吞吐(Nanochat) | 相對單節點 | 強化學習(Isaac Lab) |
|---|---|---|---|
| 1 | 約 18,400 tokens/秒 | 1.0× | 630 FPS |
| 2 | 約 35,900 tokens/秒 | 約 2.0× | 1,241 FPS |
| 4 | 約 74,600 tokens/秒 | 約 4.0× | 2,520 FPS |
這類工作負載的節點間通訊需求較低,因此擴充效率接近線性。多節點的效益在此最為明顯。
推論擴充:兩個階段表現不同
以 Llama 3.3 70B 在 32K 輸入條件下的張量平行測試:
| 配置 | 首個 token 延遲(TTFT) | 每 token 輸出時間(TPOT) |
|---|---|---|
| 單節點(TP1) | 33,415 毫秒 | 269 毫秒 |
| 兩節點(TP2) | 21,384 毫秒 | 133 毫秒 |
| 四節點(TP4) | 15,552 毫秒 | 72 毫秒 |
節點數由 1 增至 4 時,首個 token 延遲改善約 2.1 倍,低於節點數的 4 倍;每 token 輸出時間則改善約 3.7 倍,接近線性。差異在於兩個階段的通訊特性:提示處理需在節點間頻繁且細粒度地同步,通訊開銷隨節點增加而顯著;token 逐一生成則相對規律。NVIDIA 於文中載明,當工作負載需要節點之間頻繁且細粒度的通訊時,擴充效率會低於線性。
實務意義為:多節點對長提示的首次回應幫助有限,對長篇輸出的生成速度則有明顯效益。
四、必須理解的規格差距:記憶體頻寬
| 項目 | DGX Spark | B200(資料中心級) |
|---|---|---|
| 記憶體頻寬 | 273 GB/s(LPDDR5X) | 約 8 TB/s(HBM3e) |
| 串流多處理器 | 48 組 @ 2.14 GHz | 148 組 @ 約 1.0 GHz |
記憶體頻寬相差約 29 倍。這正是前述 token 生成速度落在每秒數十個 token 的原因——生成階段的瓶頸在記憶體頻寬,而非運算能力。
這項數字直接說明了 DGX Spark 的定位:它是用於開發、驗證與本機常駐代理的機器,而非用於取代資料中心的推論服務叢集。NVIDIA 在文中提出的實際工作流亦為「在 DGX Spark 上開發、再部署至雲端」的跨架構模式。
五、軟體堆疊與版本更新
NVIDIA 提及的軟體組合包括:推論引擎 TensorRT LLM、vLLM、SGLang;代理執行環境 NemoClaw(整合套件)、OpenClaw(代理框架)、OpenShell(沙箱化執行環境,提供存取控制與操作護欄);模型為 NVIDIA Nemotron 系列開放模型;強化學習使用 Isaac Lab;核心開發與最佳化則有 Tile IR、cuTile Python DSL、TileGym 與 Nsight Compute。
其中 OpenShell 的沙箱化執行環境值得重視。自主代理會實際執行指令與存取檔案,將其限制在具備存取控制與稽核能力的環境中運行,於地端部署屬必要考量。
數據時效性:本文效能數字引自 NVIDIA 2026 年 3 月的文章。NVIDIA 已於 2026 年 6 月 1 日發布更新,其中提及 vLLM 搭配 NVFP4 量化檢查點與 MTP 最佳化,對 Qwen3.6-35B 可較先前取得最高約 2.6 倍的推論吞吐提升。軟體版本對實測結果影響顯著,評估時請以當前版本自行實測為準。
六、對台灣企業採購的實務意義
綜合上述數據,適合的情境相當明確:
- 代理需要常駐運行:長時間執行、多通道通訊的工作流,適合放在本機而非按用量計費的雲端服務。
- 資料不宜離開公司:涉及財務、客戶、成本或人事的代理工作流,運算完全在本機完成。
- 開發與驗證階段:在本機完成模型選型、提示工程與工作流驗證,再視需要部署至雲端。
- 桌邊部署:機身約同迷你主機,無須機房、無須專用電源與散熱規劃。
不適合的情境同樣明確:需要為大量外部使用者提供高並行、低延遲產出的推論服務。依前述數據,四個並行任務下平均每任務的生成速度約為 13 tokens/秒,該用途應評估資料中心級的方案。
若尚在判斷所需模型規模與對應規格,可先參考 AI 硬體選購指南 的模型對照表;企業級地端知識平台的完整方案則見 MAQ Alishan。
資料來源:NVIDIA 官方技術部落格「Scaling Autonomous AI Agents and Workloads with NVIDIA DGX Spark」(作者 Allen Bourgoyne,2026 年 3 月 16 日,https://developer.nvidia.com/blog/scaling-autonomous-ai-agents-and-workloads-with-nvidia-dgx-spark/),以及「Run Local AI Agents with Faster Models and Multi-Node Clustering on NVIDIA DGX Spark」(作者 Maitri Taneja,2026 年 6 月 1 日)。單機推論、並行、張量平行、微調與強化學習數據,以及記憶體頻寬與串流多處理器規格引自前者;多節點拓樸、兩節點 400B、四節點 512GB 與 vLLM 約 2.6 倍提升引自後者。各表之量化方式與推論引擎均依原文逐列標註,比較時請確認條件一致。文章封面圖片取自 NVIDIA 技術部落格。本文為 MAQ 依公開資料所作之整理與說明,非委託研究,與 NVIDIA 無合作或對價關係。效能數據依測試條件、模型版本、量化方式與軟體版本而異,實際表現請以自身工作負載實測為準。NVIDIA、DGX、DGX Spark、Grace Blackwell、Nemotron、Isaac Lab、ConnectX 為 NVIDIA Corporation 之商標;Qwen、Llama 等名稱為各自所有者之商標。MAQ 機型規格與報價請以官網最新內容為準。