產業動態

Kimi K3 釋出 2.8 兆參數權重:原生 MXFP4 已無壓縮餘裕,頂規工作站實測每秒 0.41 個 token

2026-07-29 | 約 12 分鐘 | MAQ 技術團隊

2026 年 7 月 27 日,中國 Moonshot AI(月之暗面)在 Hugging Face 釋出 Kimi K3 的完整權重,總參數 2.8 兆,是目前公開下載的最大模型。權重可以自由取得,這件事屬實;但「取得權重」與「在自己的機器上執行」之間,隔著一段比多數報導所描述更遠的距離。本文以官方技術報告、授權原文與社群實測數據,說明這段距離的實際尺寸。

地端執行開放權重模型的軟體堆疊

一、規格與架構

Kimi K3 於 2026 年 7 月 16 日發表,API 與 Kimi app 同步上線;權重則延後 11 天,於 7 月 27 日連同技術報告一併公開。官方僅釋出單一 checkpoint,沒有 Base、Instruct、mini 或 Air 等任何變體——這與 K2 世代同時提供 Base 與 Instruct 兩版的作法不同。

項目Kimi K3對照:Kimi K2
總參數2.8 兆(技術報告精確值 2.78T)1.04 兆
每 token 啟動參數1,040 億326 億
層數與注意力組成93 層=69 層 KDA + 24 層 Gated MLA61 層,純 MLA
專家配置896 個路由專家,每 token 選 16 個,另有 2 個共享專家384 個,選 8 個,1 個共享
脈絡長度1,048,576 token(訓練階段即為 1M)128K
視覺編碼器MoonViT-V2,4.01 億參數,原生訓練
權重精度MXFP4 權重/MXFP8 啟動值

架構上有三項改動值得注意。其一是 KDA(Kimi Delta Attention),一種混合線性注意力機制,以三比一的比例與 Gated MLA 交錯配置;其二是採用 NoPE,不使用顯式位置嵌入,位置資訊由 KDA 的遞迴衰減隱含編碼,因此可直接外推至 1M 脈絡而無須 RoPE 重新縮放;其三是 Stable LatentMoE,路由專家在潛在空間運作。官方稱這套組合相對 K2 帶來約 2.5 倍的整體擴展效率提升——即每單位算力所換得的能力,而非單純堆疊參數。

視覺部分為原生多模態:MoonViT-V2 自零訓練,非以既有視覺模型初始化,語言與視覺自訓練起始即聯合最佳化,而非後掛轉接層。

二、跑分:官方自評與第三方量測的落差

官方在技術報告摘要中明確自承:整體效能仍落後最強的封閉模型,具體點名 Claude Fable 5 與 GPT-5.6 Sol,但勝過評測套組中其他開放權重與封閉模型。以下為官方公布數據,測試條件為 reasoning effort 設定至最高、temperature 1.0。

評測項目Kimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8
GPQA Diamond93.592.694.191.0
Terminal-Bench 2.188.388.088.884.6
FrontierSWE81.286.671.366.7
SWE-Marathon(長時程)42.035.039.040.0
DeepSWE67.570.073.059.0
MCPMark-Verified(工具呼叫)94.587.492.976.4
HLE-Full(無工具)43.553.344.549.8
CritPt(物理推理)23.428.632.320.9

第三方量測結果與官方自評方向一致,但數字較低。Artificial Analysis 的 Intelligence Index v4.1 給出 57.1,在 580 個模型中排名第 4,落後 Claude Fable 5(59.9)與 GPT-5.6 Sol(58.9),領先 Claude Opus 4.8(55.7)與 GLM-5.2(51.1)——在開放權重模型中排名第一。Vals AI 以統一的 Terminus 2 harness 重跑 Terminal-Bench 2.1,K3 得 80.90%,低於官方自評的 88.3。

評測方法本身存在公開爭議。ProgramBench 的作者 Ofir Press 公開質疑 Moonshot 的計分方式:該評測建議的指標為「完全實作完成的程式百分比」,而 Kimi 採用的是「所有程式實作完成度的平均」,Press 表示這種取法「可能造成誤導」。此外,官方 benchmark 表混用三種不同的 agent harness(Kimi Code、Claude Code、Codex),跨項目比較時需留意此一變因。

兩項容易被跑分掩蓋的落差

第一項是能力分布極不平均。K3 在第三方的 WebDev Arena 群眾盲測中以 1,678 Elo 排名第一,是首個登上該榜首位的開放權重模型;但在一般文字對話的 Text Arena 上僅 1,486 Elo,於 200 個模型中排第 8。前端程式生成極強,一般對話則屬中上。

第二項是「結果對」不等於「過程乾淨」。官方自評的 Agent Behavior Bench 專門評估工具使用行為、執行效率與紀律,K3 在此項僅 65.0,明顯落後 GPT-5.6 Sol 的 76.4 與 Fable 5 的 75.5。視覺方面亦有相同落差:單張圖像理解的 OmniDocBench 為 91.1 居首,但評估代理執行任務時能否正確運用畫面資訊的 Agentic Vision Bench 僅 78.3,落後三款對照模型。

vLLM 官方部署文件亦記載一項實務問題:「我們偶爾看到 K3 產出其自身解析器未預期的工具呼叫格式,導致 tool_calls 回傳為空。」文件建議正式環境的代理必須加上結構驗證與重試機制。對評估以 K3 建置自動化流程的團隊,這是需要先行設計的環節。

三、關鍵前提:官方釋出的權重,本身就是量化版

這是本文最需要說清楚的一點,也是多數報導未提及的技術前提。

一般談論大型模型的地端部署,慣常的算法是:先取全精度體積,再乘以量化的壓縮比。以 2.8 兆參數計算,BF16 全精度約 5.6 TB,量化至 4-bit 後約 1.4 TB——聽起來仍有大幅壓縮的空間。

但 Kimi K3 官方釋出的權重,本身就已經是 4-bit。技術報告載明,其 MoE 專家權重採 MXFP4、啟動值採 MXFP8,且自 SFT 階段起即進行量化感知訓練(QAT),而非事後量化。設定檔中的 quantization_config 明確標示格式為 mxfp4-pack-quantized、位元數 4、群組大小 32。注意力投影、共享專家、路由器、輸出層與視覺編碼器則排除在量化之外,保留高精度。

因此 Hugging Face 上顯示的 1.56 TB、96 個 safetensors 分片,就是壓縮後的體積,不是壓縮前。官方沒有發行 BF16 全精度版本,也未說明是否有此計畫。這代表一般預期的「量化紅利」在下載之前就已經被使用掉了——社群若要再往下壓,換得的不是空間,而是品質。

社群量化版的實際大小可以印證這一點:unsloth 的 GGUF 版本中,UD-IQ1_S 為 649 GB、UD-Q2_K_XL 為 861 GB、UD-Q4_K_XL 為 1.51 TB。另一組由 AtomicChat 製作的量化版把體積壓到 555 GB(IQ1_S,約 1.60 bpw),但該版本明言必須使用其自行維護的 llama.cpp 分支,「主線 llama.cpp 會拒絕這些檔案」。

四、地端部署的實際門檻

官方模型卡列出的推論引擎只有三種:vLLM、SGLang 與 TokenSpeed,全部屬資料中心級。官方部署建議為「具備 64 顆以上加速器的超節點配置」。vLLM 作為首日支援夥伴,在其部落格中給出目前最明確的最低硬體陳述:「至少需要一台 8× B300(或 GB300 NVL72)節點;16× B200 亦受支援。」

以下整理各種硬體層級的實測生成速度。資料中心配置為官方數據,工作站與單機配置則來自社群回報。

執行環境模型版本生成速度資料性質
GB300 NVL72(vLLM,開推測解碼)官方 MXFP4 完整版331–370 token/秒vLLM 官方實測
GB300 NVL72(vLLM,未開推測解碼)官方 MXFP4 完整版111–118 token/秒vLLM 官方實測
8× B200(llama.cpp,佔用約 956 GB VRAM)完整版16.6 token/秒社群回報,單一來源
M3 Ultra Mac Studio 512GBREAP80 剪枝版(350 GB)5.54 token/秒社群回報,非完整模型
GPU 放注意力層+CPU RAM 放專家IQ1_S(527 GiB)4.9 token/秒社群回報,單一來源
64 核 Threadripper + 768 GB DDR5Q4 部分自磁碟讀取0.90–1.05 token/秒社群回報,單一來源
2× RTX PRO 6000 96GB + 512 GB DDR5 + NVMe RAID自 Gen5 NVMe 以 mmap 讀取0.41 token/秒社群回報,單一來源、未經複現

最後一列是與本站讀者最相關的配置:兩張 RTX PRO 6000 Blackwell 96GB、Threadripper PRO 平台、512 GB DDR5 記憶體、NVMe RAID——以工作站而言已屬頂規。實測結果為每秒 0.41 個 token,換算約每兩秒半產出一個字。該數據為單一使用者回報且未經複現,但與另一筆「純堆疊系統記憶體約每秒 1 個 token」的回報方向一致。

三個常見的誤解

誤解一:Ollama 已經支援,所以可以本機跑。Ollama 提供的是 kimi-k3:cloud 這個雲端標籤,並無可本機下載的版本,且需 Pro 或 Max 訂閱並額外消耗用量額度。LM Studio 提供的 Kimi K3 同樣是託管於美國伺服器的雲端存取,非本機執行。兩者都容易被轉述成「消費級工具已可本機執行 K3」。

誤解二:llama.cpp 可以跑,所以門檻沒那麼高。llama.cpp 主線至今尚未支援 K3,相關的 PR 於權重釋出當日開啟,查證時仍為未合併狀態。Unsloth 的官方教學明白要求使用者切換到該未合併分支自行編譯。該 PR 另註明跨層殘差僅支援 CPU 與 CUDA 後端,Metal 與 Vulkan 不支援——這對 Mac 與 AMD 平台的使用者是硬性阻礙。

誤解三:有人在 Mac Studio 上跑起來了。該案例使用的是經 REAP 專家剪枝的版本,每層 896 個專家只保留 179 個,砍掉約八成。其模型卡自承這是「激進的剪枝」,相對完整 K3 有「顯著的品質退化」。對台灣使用者特別需要留意的是:退化最明顯的部分正是中文輸出,實測出現重複迴圈,程式碼補全的結構則相對完整。

五、授權:不是 Modified MIT

多家中英文媒體報導 Kimi K3「以 Modified MIT 授權開源」。經核對授權原文,此說法有誤。K3 的授權文件正式名稱為「Kimi K3 License」,開頭為「Copyright (c) 2026 Moonshot AI」,全文未出現 MIT 字樣,Hugging Face 上標記為 license:other,並非 OSI 認證的開源授權。Modified MIT 是 Kimi K2 世代的條款,K3 已更換為自訂授權。

該授權允許商業使用,包含使用、修改、散布與販售,但設有兩道門檻:

條款觸發條件義務
第 2 條經營 Model-as-a-Service 業務,且與關係企業合計營收於任何連續 12 個月內超過 2,000 萬美元商業使用前須另與 Moonshot AI 簽訂授權協議
第 3 條產品月活躍使用者超過 1 億,或月營收超過 2,000 萬美元須於使用者介面顯著位置標示「Kimi K3」
第 4 條內部使用(不將模型、其輸出或底層能力提供予第三方),或透過官方產品/認證推論夥伴存取豁免第 2、3 條

對絕大多數企業而言,這些門檻不會被觸發:內部導入、部署於自有機房、供內部員工使用,均落在第 4 條的豁免範圍。需要留意的是對外提供 API 服務的業者。授權另載明所有輸出以現狀提供、不附任何擔保。

六、台灣企業的合規與資安現況

此處僅陳述查得的官方文件事實。

行政院於 2025 年 2 月 3 日公告公務機關全面禁用 DeepSeek,範圍涵蓋中央及地方機關、公立學校、公營事業與行政法人,禁止形式包含雲端服務、應用程式與本機下載,法源為 2019 年訂定的「各機關對危害國家資通安全產品限制使用原則」。該公告僅點名 DeepSeek,未提及 Kimi 或月之暗面。國家安全局於 2025 年 11 月 17 日公布的中國 AI 模型資安檢測報告,測試對象為 DeepSeek、豆包、文心一言、通義千問與元寶等五款,名單中同樣不含 Kimi。截至 2026 年 7 月底,全球查無任何政府機關明文禁用 Kimi 的公告。

惟前述「限制使用原則」明訂公務用資通訊產品不得使用大陸廠牌,其適用範圍逐字涵蓋軟體、硬體與服務。該原則規範對象為各機關,未涵蓋民間企業。公部門與其供應鏈在評估時,應以該原則的通則規定為準,而非以是否被個別點名為準。

資料落地方面,Kimi 官方 API 平台的隱私政策載明資料儲存於新加坡的伺服器,服務由 MOONSHOT AI PTE. LTD.(新加坡法人)提供與控制。同一份政策亦表示使用者內容會用於模型最佳化,保存期限為「提供服務所必要之期間」,未給出固定期程,亦未明確說明 API 的輸入輸出是否排除於訓練用途之外。自行部署開放權重可移除資料經過對方伺服器的問題,但無法移除授權條款的適用性,亦無法移除模型權重本身內建的傾向。

英國 AI Security Institute 與美國 CAISI 於 2026 年 7 月 23 日發布聯合資安評估,結論可分兩面看:K3 在 41 項端到端任務中達成任意程式碼執行的次數為 0,最強前沿模型平均為 20;在 32 步驟的模擬企業網路攻擊中平均推進至第 17 步,最強美國模型平均為 28.5 步。攻擊能力低於前沿模型。但同一份評估亦明確指出:「Kimi K3 的防護機制未能阻止它嘗試開發攻擊程式碼或執行攻擊性網路作業。」

另有一項政治爭議需標明其性質。2026 年 7 月 22 日,白宮科技政策辦公室主任 Michael Kratsios 公開指控月之暗面以大規模蒸餾美國模型開發 K3;同日財政部長 Scott Bessent 表示制裁與實體清單指定「將被納入選項」。月之暗面否認該指控。截至查證時點,美方未提出技術證據,亦未有任何制裁實際實施。

七、對地端 AI 硬體採購的實際意義

把上述事實收攏為採購決策,可得三項結論。

其一,K3 不是工作站級的部署目標。其官方最低配置為單台 8× B300 節點,這是資料中心規格。以本站可交付的最高規格為例,四至七卡並聯的 WRX90 平台合計顯示記憶體最高約 672 GB,系統記憶體最高 512 GB——即便如此,仍不足以將 1.56 TB 的官方權重完整載入,而必須依賴磁碟讀取,速度即落入前述每秒個位數以下的區間。這不是配置選擇的問題,是數量級的差距。

其二,模型規模與可用性並非同一件事。對多數企業的實際工作負載——內部知識庫問答、文件處理、程式輔助、代理流程——目前可在單機執行且具備生產品質的開放權重模型,落在 200 億至 1,200 億參數這個區間。以 gpt-oss-120b 為例,其權重約 60 GB,單張 96 GB 顯示卡即可完整承載並保留脈絡空間,無須跨卡拆分,延遲與部署複雜度都遠低於任何需要多節點的方案。

目標單機可行性對應配置
200 億級推論(gpt-oss-20b)可行,單卡 32GB 有餘裕AI-Medium 級,約 15 萬
270 至 320 億級高品質推論可行,單卡 32GBAI-Medium-Gemma 級,約 23 萬
700 億級推論(4-bit)可行,單卡 72GBAI-High 級,約 69 萬
1,200 億級 MoE(gpt-oss-120b)可行,單卡 96GB 免拆分AI-Highend 級,約 141 萬
2.8 兆級(Kimi K3 完整版)單機不可行需資料中心級節點

其三,若確實需要 K3 的能力,API 是目前唯一務實的路徑,但需先計算 token 成本。官方定價為輸入快取未命中每百萬 token 3 美元、快取命中 0.30 美元、輸出 15 美元,全 1M 脈絡採單一費率。需要注意的是 K3 的思考模式永遠開啟且無法關閉,輸出量因此偏高——Artificial Analysis 完成一輪 Intelligence Index 評測即用掉 1.3 億輸出 token,中位數為 9,900 萬,其評語為「智慧水準名列前茅,但特別昂貴,同時明顯偏慢且極為冗長」。社群亦有使用者回報訂閱制額度消耗遠快於預期。評估時應以實際工作負載試算,而非以單價比較。

結語

Kimi K3 是一次實質的技術進展:2.8 兆參數的開放權重、原生 1M 脈絡、原生多模態,並在工具呼叫與長時程軟體工程等項目上取得領先閉源旗艦的成績。開放權重的意義也確實存在——它讓能力的擴散不再完全取決於少數封閉服務的政策。

但對評估地端 AI 的企業而言,需要區分兩個問題:「這個模型是否開放」與「這個模型是否適合放進我的機房」,答案並不相同。K3 的答案是前者為是、後者為否。真正能落到自有機房、且具備生產品質的模型,目前仍在百億至千億參數的區間;而這個區間的能力,對絕大多數企業實際會遇到的工作負載而言,已經足夠。

資料來源:Kimi K3 技術報告(arXiv 2607.24653,2026 年 7 月 27 日)與 Hugging Face 官方模型卡、config.json 及 LICENSE 原文;Moonshot AI 官方部落格與 platform.kimi.ai 文件;vLLM 官方部署部落格與 recipe;Artificial Analysis、Vals AI 與 WebDev Arena 之第三方評測;英國 AI Security Institute 與美國 CAISI 於 2026 年 7 月 23 日發布之聯合資安評估;行政院 2025 年 2 月 3 日公告與「各機關對危害國家資通安全產品限制使用原則」;國家安全局 2025 年 11 月 17 日中國 AI 模型資安檢測報告。授權條款、參數規格與定價均以官方原始文件逐字核對;本文標示為「社群回報」之實測速度數據,均取自 llama.cpp 相關 PR 與討論串之個別使用者貼文,為單一來源且未經複現,僅供量級參考,不應視為效能保證。白宮官員之蒸餾指控與月之暗面之否認,均依媒體報導引用,雙方皆未提出可供查核之技術證據。本文引號內之英文陳述均為中譯,語意以原文為準。本文非受任何公司委託或贊助,亦未收受對價;MAQ 為 AI 硬體系統整合商,所銷售之工作站包含文中提及廠商之硬體產品,讀者於閱讀本文之產業觀察時宜一併考量。模型效能數據依測試條件與版本而異,實際表現請以官方最新公告及自身工作負載實測為準。Kimi、Moonshot 為 Moonshot AI 之商標;NVIDIA、CUDA、Blackwell 為 NVIDIA Corporation 之商標;Claude 為 Anthropic 之商標;AMD、Radeon 為 Advanced Micro Devices, Inc. 之商標;Gemma 為 Google LLC 之商標;Llama 為 Meta Platforms, Inc. 之商標;Qwen 為阿里巴巴集團之商標;其餘商標歸各自所有者所有。

常見問題

Kimi K3 開放權重了,我可以在自己的工作站上執行嗎?

完整版不行。官方釋出的權重為 1.56 TB、96 個 safetensors 分片,官方部署建議為具備 64 顆以上加速器的超節點;vLLM 給出的最低配置是一台 8× B300 節點或 GB300 NVL72,16× B200 亦受支援。社群回報在兩張 RTX PRO 6000 96GB 搭配 512 GB 系統記憶體與 NVMe RAID 的頂規工作站上,以磁碟讀取方式執行僅得每秒 0.41 個 token。該數據為單一來源且未經複現,但與另一筆「純堆疊系統記憶體約每秒 1 個 token」的回報方向一致。

把 Kimi K3 量化到更小,是不是就跑得動了?

壓縮空間已經在下載之前被使用掉了。與多數模型不同,Kimi K3 官方釋出的權重本身即為 4-bit——MoE 專家權重採 MXFP4、啟動值採 MXFP8,且自 SFT 階段起即進行量化感知訓練,而非事後量化。因此 1.56 TB 是壓縮後的體積,不是壓縮前。社群最小的量化版本仍需 555 GB,且需自行編譯特定的 llama.cpp 分支;另有經專家剪枝八成、體積 350 GB 的版本可載入 512 GB 的 Mac Studio,但其模型卡自承有顯著品質退化,且退化最明顯的部分正是中文輸出。

Kimi K3 是以 Modified MIT 授權開源的嗎?

不是。經核對授權原文,K3 採用的是自訂的「Kimi K3 License」,開頭為 Copyright (c) 2026 Moonshot AI,全文未出現 MIT 字樣,Hugging Face 標記為 license:other,並非 OSI 認證的開源授權。Modified MIT 是 Kimi K2 世代的條款。該授權允許商用,但設有兩道門檻:經營 Model-as-a-Service 且連續 12 個月合計營收超過 2,000 萬美元者須另簽協議;月活躍使用者超過 1 億或月營收超過 2,000 萬美元的產品須於介面顯著標示「Kimi K3」。純內部使用不受此限。

台灣的企業或政府機關可以使用 Kimi 嗎?

行政院 2025 年 2 月 3 日公告公務機關全面禁用 DeepSeek,國家安全局 2025 年 11 月的中國 AI 模型資安檢測報告測試對象為 DeepSeek、豆包、文心一言、通義千問與元寶等五款——兩份文件均未點名 Kimi 或月之暗面,截至 2026 年 7 月底全球亦無政府明文禁用 Kimi 的公告。惟公告所依據的「各機關對危害國家資通安全產品限制使用原則」明訂公務用資通訊產品不得使用大陸廠牌,範圍涵蓋軟體、硬體與服務。公部門與其供應鏈應以該通則為準,而非以是否被個別點名為準;該原則規範對象為各機關,未涵蓋民間企業。

如果不跑 Kimi K3,企業地端 AI 應該選什麼規模的模型?

目前可在單機執行且具備生產品質的開放權重模型,落在 200 億至 1,200 億參數區間。200 億級的 gpt-oss-20b 量化後約 16 GB,單張 32 GB 顯示卡即有餘裕;700 億級的 Llama 3.3 在 4-bit 下約 43 GB,單張 72 GB 卡可執行並保留脈絡空間;1,200 億級的 gpt-oss-120b 為 MoE 架構,權重約 60 GB,單張 96 GB 卡即可完整承載而無須跨卡拆分。對內部知識庫問答、文件處理、程式輔助與代理流程等多數企業實際工作負載,這個區間的能力已經足夠,且部署複雜度與延遲都遠低於任何需要多節點的方案。

單機可執行的地端 AI 工作站

MAQ 提供從入門到企業級的地端 AI 工作站,預載開放權重模型環境,開機即可執行 gpt-oss、Gemma、Llama、Qwen 等模型。選型的關鍵並非顯示卡型號,而是目標模型量化後的記憶體需求與並行人數。