硬體選購

RTX 5090 與 RTX 5070 Ti 本地 LLM 實測:32GB 可承載 26B 模型的線上客服,16GB 適合 8B 級單步驟任務

2026-09-25 | 約 11 分鐘 | MAQ 技術團隊

MAQ 官網的「AI 諮詢」線上客服,是在本地執行的大型語言模型:客人詢問機型、預算與規格時,模型會呼叫查詢機型、計算配置價格、產生報價單等工具,再依工具回傳的資料回答。為了評估消費級顯示卡能否承擔這類工作,MAQ 在 2026 年 9 月以 RTX 5090 與 RTX 5070 Ti 兩台測試機,量測讀取提示與生成答案的速度、多人同時使用時的表現,並以真實客服情境檢驗模型能否正確完成工作。本文整理全部數字與測試方法。

RTX 5090 與 RTX 5070 Ti 本地 LLM 單人速度比較圖

測試條件

項目RTX 5090 測試機RTX 5070 Ti 測試機
顯示卡RTX 5090 32GB(功耗上限 600W)RTX 5070 Ti 16GB(功耗上限 300W)
處理器/系統記憶體4 vCPU/15GBIntel Core i5-11500(4 vCPU)/23GB
推論引擎ollama 0.32.14ollama 0.34.2
測試模型gemma4 26B MoE(Q4_K_M,模型檔 17GB)gemma4 e4b(8B,Q4_K_M,9.6GB);gpt-oss 20B(MXFP4,13GB)
共同設定脈絡長度 65,536 token、Flash Attention、關閉思考模式(gpt-oss 無法關閉,設為 low)

gemma4 26B MoE 是 MAQ 線上客服目前使用的模型。它的模型檔有 17GB,放不進 RTX 5070 Ti 的 16GB 顯示記憶體,因此 RTX 5070 Ti 改測兩顆放得下的模型:8B 級的 gemma4 e4b,以及 20B 級的 gpt-oss 20B。兩台測試機的 ollama 版本不同,比較數字時請留意這項差異。

一、單人速度:讀取提示與生成答案

語言模型回答問題分兩個階段:先一次讀完整段提示(prefill),再逐一生成答案(decode)。前者決定客人送出問題後多久看到第一個字,後者決定答案出現的速度。每個提示長度量測兩次取中位數,提示前加上唯一字串,避免命中快取。

RTX 5090/gemma4 26B MoE

提示長度讀取提示生成答案首字時間
1,533 token10,710 tok/s219 tok/s0.49 秒
3,048 token12,448 tok/s225 tok/s0.64 秒
5,941 token13,948 tok/s230 tok/s0.83 秒
12,024 token14,262 tok/s233 tok/s1.27 秒
23,823 token13,583 tok/s224 tok/s2.26 秒

RTX 5070 Ti/gemma4 e4b(8B)

提示長度讀取提示生成答案首字時間
1,545 token8,383 tok/s161 tok/s0.21 秒
3,043 token9,180 tok/s159 tok/s0.37 秒
5,984 token9,315 tok/s156 tok/s0.70 秒
11,921 token9,046 tok/s151 tok/s1.41 秒
23,813 token8,085 tok/s143 tok/s3.13 秒

RTX 5070 Ti/gpt-oss 20B(首字時間包含模型的思考時間)

提示長度讀取提示生成答案首字時間
1,836 token5,440 tok/s112 tok/s0.52 秒
3,556 token6,067 tok/s111 tok/s0.78 秒
7,057 token6,041 tok/s109 tok/s1.40 秒
13,910 token5,917 tok/s65 tok/s5.09 秒
28,010 token5,604 tok/s103 tok/s5.77 秒

RTX 5090 跑 26B MoE 模型,生成速度穩定在每秒 220 至 235 個 token,幾乎不受提示長度影響;兩萬多 token 的長提示,第一個字在 2.3 秒內出現。RTX 5070 Ti 跑 8B 模型全部放在顯示記憶體內,含 64K 脈絡只使用 6.5GB,生成速度約每秒 150 個 token。gpt-oss 20B 在 64K 脈絡下總需求約 13.5GB,顯示卡只容納得下 11.5GB,其餘約 2GB 落到 CPU 執行,生成速度降至每秒約 110 個 token,長提示時更低。

二、多人同時使用

線上客服會有多位訪客同時詢問。測試模擬真實客服:每個請求共用約 3,000 token 的系統提示,再加上各自不同的問題,輸出上限 300 token,同時送出 1 至 16 個請求。ollama 的並行槽數(同時處理的請求數)另行調整比較,每種設定重啟後先暖機一輪,採用第二輪結果。

RTX 5090/gemma4 26B MoE,並行槽數 2

同時人數首字時間(中位/最慢)完成時間(中位/最慢)總吞吐
10.40/0.40 秒1.69/1.69 秒177 tok/s
20.58/0.68 秒2.27/2.28 秒263 tok/s
41.84/2.91 秒3.51/4.57 秒263 tok/s
85.70/8.71 秒7.40/10.36 秒221 tok/s
169.94/17.41 秒11.75/18.90 秒244 tok/s

RTX 5070 Ti/gemma4 e4b,並行槽數 4

同時人數首字時間(中位/最慢)完成時間(中位/最慢)總吞吐
10.08/0.08 秒1.98/1.98 秒152 tok/s
20.05/0.05 秒2.18/2.18 秒275 tok/s
40.15/0.15 秒3.13/3.14 秒383 tok/s
81.89/3.54 秒4.31/6.37 秒357 tok/s
164.68/10.16 秒7.13/13.86 秒324 tok/s
  • RTX 5090:並行槽數維持 2。總吞吐在 2 人時即達約每秒 260 個 token,超過的請求排隊等候,首字時間隨人數拉長,但 16 人同時送出仍全部完成。改為並行槽數 4 時,8 至 16 人的最慢完成時間約縮短 25%(16 人最慢 14.4 秒),但 4 人時每人生成速度降至約每秒 120 個 token,反而較慢。
  • RTX 5090:並行槽數 8 不可用。在 64K 脈絡下,模型與快取共佔 30.7GB,只剩約 2GB。16 人同時送出時推論程序因顯示記憶體不足而中止,當下全部請求失敗,模型重新載入後才恢復。
  • RTX 5070 Ti:小模型適合較多並行槽數。並行槽數 4 只使用 8.7GB 顯示記憶體,4 人同時使用時總吞吐達每秒 383 個 token。表中極短的首字時間,是因為共用的系統提示命中快取;兩台測試機的 ollama 版本不同,快取行為的差異未另行區分。

三、小模型能否勝任客服

速度只是條件之一。客服需要依序呼叫多個工具並判斷結果,例如先查機型、再查可選配置、最後計算價格。MAQ 以 12 個真實客服情境,走官網 AI 諮詢的實際程式,比較 RTX 5070 Ti 上的 gemma4 e4b 與目前線上使用的 gemma4 26B。對照組的 26B 在 MAQ 內部一台 AMD Radeon AI PRO R9700 32GB 主機上執行。其中產生報價單的情境受測試環境限制無法判定,不計入。

情境類型gemma4 e4b(RTX 5070 Ti)gemma4 26B(R9700)
單步驟:保固與備機、轉接真人、依規格報價、換顯示卡算價、查詢特定顯示卡的機型、簡體中文提問、無關閒聊(8 題)8 題全部正確8 題全部正確
預算三萬以內的遊戲主機未查詢遊戲機型,回覆與需求無關正確,說明最低價機型並附連結
Mac Studio 256GB 追問升級 CPU 後的總價追問時工具呼叫次數超過上限,未能回答正確查詢選配並算出總價
50 人文件問答、預算 50 萬列出四台含超出預算的機型,重點不清推薦兩台並說明理由
12 情境總耗時約 49 秒約 83 秒

8B 模型在一步就能完成的問題上表現正確,而且速度較快;需要連續查詢與判斷的問題,則出現答非所問或無法完成。同一顆 26B 模型換到不同顯示卡,工具呼叫的結果一致,差別只在速度:前台 8 題工具測試中,RTX 5090 為 30.4 秒,R9700 為 41.4 秒,兩者都 8 題全對。

四、選購判讀

  • 模型大小決定能力,顯示記憶體決定能放多大的模型。要讓 AI 處理需要多步驟判斷的工作,例如客服、報價與知識問答,26B 級模型明顯較可靠;這個等級搭配 64K 脈絡,需要 32GB 級的顯示記憶體。
  • 16GB 適合 8B 級模型與單步驟任務。例如常見問題回覆、分類與轉接。20B 級模型在 16GB 上已有部分落到 CPU,速度與穩定性都打折。
  • 同時在線人數取決於總吞吐。以 RTX 5090 跑 26B MoE、每輪對話約 400 至 600 個輸出 token 估算,約 15 至 20 人同時在線時回覆仍順暢,約 30 人為上限;這是依實測吞吐換算的估計值,並非實際量測。
  • 系統記憶體也要留足。RTX 5090 測試機只有 15GB 系統記憶體,放不下 17GB 的模型檔快取,每次重啟都要從磁碟重新載入,約需 67 至 82 秒。建議系統記憶體不小於模型檔大小。

MAQ 的 AI 工作站中,AI-Medium 採用 AMD Radeon AI PRO R9700 32GB,即本文對照組使用的顯示卡,可在本機執行 26B 級模型;RTX 5070 Ti 16GB 則用於剪輯、CAD 與入門 AI 工作站。可依預計使用的模型、同時在線人數與提示長度,協助評估合適的配置。

延伸閱讀

資料說明:本文數據為 MAQ 於 2026 年 9 月 24 至 25 日自行測試。兩台測試機皆為 4 vCPU 等級的主機,ollama 版本不同(RTX 5090 為 0.32.14、RTX 5070 Ti 為 0.34.2),多人同時與客服情境測試為單次量測,同設定重跑的差異約 ±10%。客服情境使用 MAQ 官網 AI 諮詢的實際程式與題目,結果會隨提示內容與工具版本調整而變動。同時在線人數為依實測吞吐換算的估計值。NVIDIA、GeForce RTX 為 NVIDIA Corporation 商標;AMD、Radeon 為 Advanced Micro Devices, Inc. 商標;Gemma 為 Google LLC 商標;文中其他商標均屬各該公司所有。

常見問題

RTX 5090 跑 gemma4 26B MoE 有多快?

MAQ 實測在 ollama 0.32.14、Q4_K_M 量化、64K 脈絡下,單人生成速度約每秒 220 至 235 個 token,讀取提示約每秒 1.1 萬至 1.4 萬個 token;約 3,000 token 的提示,首字時間 0.64 秒,兩萬多 token 的提示則為 2.3 秒。

RTX 5070 Ti 16GB 可以跑多大的模型?

8B 級模型可完整放入顯示記憶體,例如 gemma4 e4b 含 64K 脈絡只使用 6.5GB,生成速度約每秒 150 個 token。20B 級的 gpt-oss 20B 在 64K 脈絡下約有 2GB 落到 CPU,生成速度降至每秒約 110 個 token;26B 模型檔 17GB,放不進 16GB。

一張 RTX 5090 可以同時服務多少人?

以 gemma4 26B MoE、並行槽數 2 實測,總吞吐約每秒 260 個 token,4 人同時送出時最慢 4.6 秒完成,16 人同時送出最慢 18.9 秒且全部成功。依此換算,線上客服約 15 至 20 人同時在線時回覆仍順暢,約 30 人為上限;此為估計值。

8B 小模型可以當線上客服嗎?

適合單步驟的問題,例如常見問題回覆、轉接真人與單一規格查詢;在 MAQ 的 12 個客服情境中,這類題目全部正確。需要連續查詢與判斷的問題,例如依預算推薦並追問升級價格,8B 模型出現答非所問或無法完成,26B 模型則全部正確。

本地 AI 客服與知識問答主機

MAQ 的 AI 工作站可在本機執行 26B 級語言模型,資料不必送往雲端。提供預計使用的模型、同時在線人數與提示長度,由 MAQ 協助評估顯示卡與記憶體配置。