AI 應用

NVIDIA DGX Spark 自主式 AI 代理實測解析:兩種吞吐量的差別,以及它不適合做什麼

2026-07-22 | 約 10 分鐘 | MAQ 技術團隊

NVIDIA 於官方技術部落格發表針對 DGX Spark 的實測分析,主題為自主式 AI 代理(autonomous AI agents)的執行與擴充。該文提供了完整的效能數據,並同時載明了幾項限制。對正在評估地端 AI 主機的企業而言,這些數字比規格表更具參考價值——前提是要看懂它在量什麼。

四台堆疊的 NVIDIA DGX Spark 節點

閱讀前須先建立一項認知:本文所引效能表中的「提示處理吞吐」與「token 生成吞吐」是兩個不同階段的指標,數值相差約兩個數量級。前者是模型讀入長脈絡的速度,後者才是實際產出文字的速度。若只看前者,將對這台機器的產出能力產生嚴重高估。以下每張表均完整呈現兩者。

一、這台機器的設計目的:讓代理常駐於本機

自主式 AI 代理與一般問答應用不同。它需要長時間執行任務、同時維持多個通訊管道與背景子程序,並且必須記得整段脈絡。這類工作負載對硬體的要求集中在三處:足夠的記憶體容納長脈絡、足夠的並行能力同時執行多個子代理、以及能夠持續運行而不依賴雲端。

DGX Spark 單機配置 128GB 統一記憶體。依 NVIDIA 的觀察,自主代理實務上常使用 30K 至 120K token 的脈絡,處理複雜請求時部分可達 250K token。由於運算完全在本機完成,代理得以常駐運行,資料無須送往外部服務。

二、單機推論實測

測試條件為 128K token 輸入、1K token 回應、批次大小 1。各模型的量化方式與推論引擎不同,已逐列標註——這三列並非同條件的橫向比較。

模型(量化/推論引擎)端到端耗時提示處理耗時提示處理吞吐token 生成吞吐
Nemotron 3 Super 120B(NVFP4/TensorRT LLM)99 秒44 秒2,855 tokens/秒18 tokens/秒
Qwen3 Coder Next 80B(FP8/vLLM)89 秒54 秒2,390 tokens/秒28.95 tokens/秒
Qwen3.5 35B A3B(FP8/vLLM)73 秒41 秒3,080 tokens/秒35.75 tokens/秒

兩欄吞吐量的落差是採購評估的關鍵。提示處理吞吐達數千 tokens/秒,反映的是讀入長脈絡的速度;實際產出文字則為每秒 18 至 36 個 token,且模型愈大愈慢。就代理工作流而言,前者決定啟動延遲,後者決定完成一段輸出所需的時間。

關於 120B 模型如何放進 128GB

Nemotron 3 Super 標示為 120B 參數,實際運行採 NVFP4 四位元量化,權重佔用約 60GB,128GB 統一記憶體因此得以承載。若以 BF16 全精度載入則約需 240GB,該機器放不下。

該模型同時為混合專家(MoE)架構、活躍參數約 12B——這一點影響的是每個 token 的運算量,而非記憶體佔用;推論時 120B 參數仍須全部常駐記憶體。表中的 Qwen3.5 35B A3B 同樣是 MoE,活躍參數約 3B。

評估其他模型時,記憶體需求應以總參數乘以量化位元數估算,活躍參數則用於推估運算速度,兩者不可混為一談。

並行任務的表現

測試條件為 Qwen3 Coder Next FP8 於 vLLM、32K 輸入、1K 回應:

同時任務數端到端耗時首個 token 中位延遲提示處理吞吐token 生成吞吐
135 秒9 秒3,261 tokens/秒38 tokens/秒
254 秒12 秒5,363 tokens/秒47 tokens/秒
491 秒15 秒9,616 tokens/秒53 tokens/秒

由 1 個任務增至 4 個任務,提示處理吞吐提升約 2.9 倍,但 token 生成吞吐僅由 38 提升至 53 tokens/秒,約 1.4 倍;單一任務的端到端耗時則由 35 秒增為 91 秒,約 2.6 倍。

換言之,並行處理主要提升的是讀入脈絡的總量,實際產出速度的增幅有限。平均分攤到每個任務,生成速度由 38 tokens/秒降至約 13 tokens/秒。若代理工作流屬於背景批次執行,此一取捨通常可以接受;若要求即時互動回應,則應以較低的並行數規劃。

三、多節點叢集

DGX Spark 支援以 ConnectX-7 網路卡搭配 RoCE 200GbE 互連。依 NVIDIA 2026 年 6 月的多節點更新文,實體拓樸包含兩節點直連、三節點環狀,以及經 QSFP 交換器的二至四節點配置:

  • 兩節點:256GB 統一記憶體,可支援約 400B 參數規模的推論
  • 四節點:512GB 統一記憶體,可運行大型 MoE 模型與多代理管線
  • 單節點的微調能力可達 120B 規模

微調與強化學習的擴充接近線性

節點數微調吞吐(Nanochat)相對單節點強化學習(Isaac Lab)
1約 18,400 tokens/秒1.0×630 FPS
2約 35,900 tokens/秒約 2.0×1,241 FPS
4約 74,600 tokens/秒約 4.0×2,520 FPS

這類工作負載的節點間通訊需求較低,因此擴充效率接近線性。多節點的效益在此最為明顯。

推論擴充:兩個階段表現不同

以 Llama 3.3 70B 在 32K 輸入條件下的張量平行測試:

配置首個 token 延遲(TTFT)每 token 輸出時間(TPOT)
單節點(TP1)33,415 毫秒269 毫秒
兩節點(TP2)21,384 毫秒133 毫秒
四節點(TP4)15,552 毫秒72 毫秒

節點數由 1 增至 4 時,首個 token 延遲改善約 2.1 倍,低於節點數的 4 倍;每 token 輸出時間則改善約 3.7 倍,接近線性。差異在於兩個階段的通訊特性:提示處理需在節點間頻繁且細粒度地同步,通訊開銷隨節點增加而顯著;token 逐一生成則相對規律。NVIDIA 於文中載明,當工作負載需要節點之間頻繁且細粒度的通訊時,擴充效率會低於線性

實務意義為:多節點對長提示的首次回應幫助有限,對長篇輸出的生成速度則有明顯效益。

四、必須理解的規格差距:記憶體頻寬

項目DGX SparkB200(資料中心級)
記憶體頻寬273 GB/s(LPDDR5X)約 8 TB/s(HBM3e)
串流多處理器48 組 @ 2.14 GHz148 組 @ 約 1.0 GHz

記憶體頻寬相差約 29 倍。這正是前述 token 生成速度落在每秒數十個 token 的原因——生成階段的瓶頸在記憶體頻寬,而非運算能力。

這項數字直接說明了 DGX Spark 的定位:它是用於開發、驗證與本機常駐代理的機器,而非用於取代資料中心的推論服務叢集。NVIDIA 在文中提出的實際工作流亦為「在 DGX Spark 上開發、再部署至雲端」的跨架構模式。

五、軟體堆疊與版本更新

NVIDIA 提及的軟體組合包括:推論引擎 TensorRT LLM、vLLM、SGLang;代理執行環境 NemoClaw(整合套件)、OpenClaw(代理框架)、OpenShell(沙箱化執行環境,提供存取控制與操作護欄);模型為 NVIDIA Nemotron 系列開放模型;強化學習使用 Isaac Lab;核心開發與最佳化則有 Tile IR、cuTile Python DSL、TileGym 與 Nsight Compute。

其中 OpenShell 的沙箱化執行環境值得重視。自主代理會實際執行指令與存取檔案,將其限制在具備存取控制與稽核能力的環境中運行,於地端部署屬必要考量。

數據時效性:本文效能數字引自 NVIDIA 2026 年 3 月的文章。NVIDIA 已於 2026 年 6 月 1 日發布更新,其中提及 vLLM 搭配 NVFP4 量化檢查點與 MTP 最佳化,對 Qwen3.6-35B 可較先前取得最高約 2.6 倍的推論吞吐提升。軟體版本對實測結果影響顯著,評估時請以當前版本自行實測為準。

六、對台灣企業採購的實務意義

綜合上述數據,適合的情境相當明確:

  • 代理需要常駐運行:長時間執行、多通道通訊的工作流,適合放在本機而非按用量計費的雲端服務。
  • 資料不宜離開公司:涉及財務、客戶、成本或人事的代理工作流,運算完全在本機完成。
  • 開發與驗證階段:在本機完成模型選型、提示工程與工作流驗證,再視需要部署至雲端。
  • 桌邊部署:機身約同迷你主機,無須機房、無須專用電源與散熱規劃。

不適合的情境同樣明確:需要為大量外部使用者提供高並行、低延遲產出的推論服務。依前述數據,四個並行任務下平均每任務的生成速度約為 13 tokens/秒,該用途應評估資料中心級的方案。

若尚在判斷所需模型規模與對應規格,可先參考 AI 硬體選購指南 的模型對照表;企業級地端知識平台的完整方案則見 MAQ Alishan

資料來源:NVIDIA 官方技術部落格「Scaling Autonomous AI Agents and Workloads with NVIDIA DGX Spark」(作者 Allen Bourgoyne,2026 年 3 月 16 日,https://developer.nvidia.com/blog/scaling-autonomous-ai-agents-and-workloads-with-nvidia-dgx-spark/),以及「Run Local AI Agents with Faster Models and Multi-Node Clustering on NVIDIA DGX Spark」(作者 Maitri Taneja,2026 年 6 月 1 日)。單機推論、並行、張量平行、微調與強化學習數據,以及記憶體頻寬與串流多處理器規格引自前者;多節點拓樸、兩節點 400B、四節點 512GB 與 vLLM 約 2.6 倍提升引自後者。各表之量化方式與推論引擎均依原文逐列標註,比較時請確認條件一致。文章封面圖片取自 NVIDIA 技術部落格。本文為 MAQ 依公開資料所作之整理與說明,非委託研究,與 NVIDIA 無合作或對價關係。效能數據依測試條件、模型版本、量化方式與軟體版本而異,實際表現請以自身工作負載實測為準。NVIDIA、DGX、DGX Spark、Grace Blackwell、Nemotron、Isaac Lab、ConnectX 為 NVIDIA Corporation 之商標;Qwen、Llama 等名稱為各自所有者之商標。MAQ 機型規格與報價請以官網最新內容為準。

常見問題

DGX Spark 實際產出文字的速度有多快?

依 NVIDIA 於 128K token 輸入、1K token 回應、批次大小 1 條件下的測試:Nemotron 3 Super 120B(NVFP4/TensorRT LLM)為每秒 18 個 token;Qwen3 Coder Next 80B(FP8/vLLM)為每秒 28.95 個;Qwen3.5 35B A3B(FP8/vLLM)為每秒 35.75 個。須特別區分的是,同一張表中另有「提示處理吞吐」欄位,數值為每秒 2,390 至 3,080 個 token,該欄反映的是讀入長脈絡的速度而非產出速度,兩者相差約兩個數量級。

為什麼 120B 的模型可以放進 128GB 記憶體?

關鍵在量化精度。NVIDIA 測試中的 Nemotron 3 Super 採 NVFP4 四位元量化,權重佔用約 60GB;若以 BF16 全精度載入則約需 240GB,該機器無法承載。該模型另為混合專家(MoE)架構、活躍參數約 12B,但這一點影響的是每個 token 的運算量,而非記憶體佔用——推論時 120B 參數仍須全部常駐記憶體。評估其他模型時,記憶體需求應以總參數乘以量化位元數估算,活躍參數則用於推估運算速度。

同時執行多個代理任務時效能如何?

依 NVIDIA 於 Qwen3 Coder Next FP8、32K 輸入、1K 回應條件下的測試:單一任務端到端 35 秒、首個 token 中位延遲 9 秒、提示處理吞吐 3,261、生成吞吐 38 tokens/秒;四個任務則為 91 秒、15 秒、9,616、53 tokens/秒。由 1 增至 4 個任務,提示處理吞吐提升約 2.9 倍,但生成吞吐僅提升約 1.4 倍,端到端耗時增為約 2.6 倍。平均分攤到每個任務,生成速度由 38 降至約 13 tokens/秒。並行處理主要提升的是讀入脈絡的總量,實際產出速度增幅有限。

多節點叢集能提升多少?

視工作負載而定。微調與強化學習的節點間通訊需求較低,擴充接近線性:微調吞吐由單節點約 18,400 提升至四節點約 74,600 tokens/秒(約 4 倍),強化學習由 630 提升至 2,520 FPS。推論則須分兩階段看——以 Llama 3.3 70B 測試,節點數由 1 增至 4 時,首個 token 延遲改善約 2.1 倍,每 token 輸出時間則改善約 3.7 倍。記憶體方面,兩節點 256GB 可支援約 400B 參數規模的推論,四節點 512GB 可運行大型 MoE 模型與多代理管線。

DGX Spark 可以取代雲端推論服務嗎?

就多數情境而言不建議如此定位。NVIDIA 列出的規格顯示,DGX Spark 記憶體頻寬為 273 GB/s(LPDDR5X),資料中心級的 B200 則約為 8 TB/s(HBM3e),相差約 29 倍——這正是 token 生成速度落在每秒數十個 token 的原因,生成階段的瓶頸在記憶體頻寬而非運算能力。NVIDIA 提出的實際工作流亦為「在 DGX Spark 上開發、再部署至雲端」的跨架構模式。適合的用途是本機開發驗證、代理常駐運行與機密資料不外送。

這些數據是最新的嗎?

本文效能數字引自 NVIDIA 2026 年 3 月 16 日的文章。NVIDIA 已於同年 6 月 1 日發布更新,其中提及 vLLM 搭配 NVFP4 量化檢查點與 MTP 最佳化,對 Qwen3.6-35B 可較先前取得最高約 2.6 倍的推論吞吐提升。軟體版本對實測結果影響顯著,實際評估時應以當前版本自行測試為準。

需要搭配哪些軟體?

NVIDIA 提及的組合包括推論引擎 TensorRT LLM、vLLM 與 SGLang;代理執行環境 NemoClaw(整合套件)、OpenClaw(代理框架)與 OpenShell(沙箱化執行環境,提供存取控制與操作護欄);模型為 NVIDIA Nemotron 系列開放模型;強化學習使用 Isaac Lab。其中 OpenShell 的沙箱化環境值得重視——自主代理會實際執行指令與存取檔案,將其限制在具存取控制與稽核能力的環境中運行,於地端部署屬必要考量。

MAQ 的 DGX Spark 價格與供應狀況?

NT$199,900 起,現貨供應。配置為 GB10 Grace Blackwell 超級晶片、20 核心 ARM Cortex-X925 與 A725 CPU、128GB 統一記憶體、4TB NVMe SSD,網路為 200GbE 加 10GbE、Wi-Fi 7 與 USB4 40G。出廠前可由 MAQ 完成開發環境安裝,交機時即為可用狀態。建議採購前先確認用途是否與本文所述之適用情境相符。

NVIDIA DGX Spark,MAQ 現貨供應

MAQ 提供 NVIDIA DGX Spark AI 迷你電腦,搭載 GB10 Grace Blackwell 超級晶片、20 核心 ARM Cortex-X925 與 A725 CPU、128GB 統一記憶體與 4TB NVMe SSD,網路為 200GbE 加 10GbE、Wi-Fi 7 與 USB4 40G,NT$199,900 起、現貨供應。建議採購前先確認用途:本機適合本機開發、代理常駐與機密資料不外送的情境;若需求為對外提供高並行、低延遲產出的推論服務,我們會建議評估其他方案。