2026 年 7 月 27 日,中國 Moonshot AI(月之暗面)在 Hugging Face 釋出 Kimi K3 的完整權重,總參數 2.8 兆,是目前公開下載的最大模型。權重可以自由取得,這件事屬實;但「取得權重」與「在自己的機器上執行」之間,隔著一段比多數報導所描述更遠的距離。本文以官方技術報告、授權原文與社群實測數據,說明這段距離的實際尺寸。

一、規格與架構
Kimi K3 於 2026 年 7 月 16 日發表,API 與 Kimi app 同步上線;權重則延後 11 天,於 7 月 27 日連同技術報告一併公開。官方僅釋出單一 checkpoint,沒有 Base、Instruct、mini 或 Air 等任何變體——這與 K2 世代同時提供 Base 與 Instruct 兩版的作法不同。
| 項目 | Kimi K3 | 對照:Kimi K2 |
|---|---|---|
| 總參數 | 2.8 兆(技術報告精確值 2.78T) | 1.04 兆 |
| 每 token 啟動參數 | 1,040 億 | 326 億 |
| 層數與注意力組成 | 93 層=69 層 KDA + 24 層 Gated MLA | 61 層,純 MLA |
| 專家配置 | 896 個路由專家,每 token 選 16 個,另有 2 個共享專家 | 384 個,選 8 個,1 個共享 |
| 脈絡長度 | 1,048,576 token(訓練階段即為 1M) | 128K |
| 視覺編碼器 | MoonViT-V2,4.01 億參數,原生訓練 | — |
| 權重精度 | MXFP4 權重/MXFP8 啟動值 | — |
架構上有三項改動值得注意。其一是 KDA(Kimi Delta Attention),一種混合線性注意力機制,以三比一的比例與 Gated MLA 交錯配置;其二是採用 NoPE,不使用顯式位置嵌入,位置資訊由 KDA 的遞迴衰減隱含編碼,因此可直接外推至 1M 脈絡而無須 RoPE 重新縮放;其三是 Stable LatentMoE,路由專家在潛在空間運作。官方稱這套組合相對 K2 帶來約 2.5 倍的整體擴展效率提升——即每單位算力所換得的能力,而非單純堆疊參數。
視覺部分為原生多模態:MoonViT-V2 自零訓練,非以既有視覺模型初始化,語言與視覺自訓練起始即聯合最佳化,而非後掛轉接層。
二、跑分:官方自評與第三方量測的落差
官方在技術報告摘要中明確自承:整體效能仍落後最強的封閉模型,具體點名 Claude Fable 5 與 GPT-5.6 Sol,但勝過評測套組中其他開放權重與封閉模型。以下為官方公布數據,測試條件為 reasoning effort 設定至最高、temperature 1.0。
| 評測項目 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| GPQA Diamond | 93.5 | 92.6 | 94.1 | 91.0 |
| Terminal-Bench 2.1 | 88.3 | 88.0 | 88.8 | 84.6 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 |
| SWE-Marathon(長時程) | 42.0 | 35.0 | 39.0 | 40.0 |
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 |
| MCPMark-Verified(工具呼叫) | 94.5 | 87.4 | 92.9 | 76.4 |
| HLE-Full(無工具) | 43.5 | 53.3 | 44.5 | 49.8 |
| CritPt(物理推理) | 23.4 | 28.6 | 32.3 | 20.9 |
第三方量測結果與官方自評方向一致,但數字較低。Artificial Analysis 的 Intelligence Index v4.1 給出 57.1,在 580 個模型中排名第 4,落後 Claude Fable 5(59.9)與 GPT-5.6 Sol(58.9),領先 Claude Opus 4.8(55.7)與 GLM-5.2(51.1)——在開放權重模型中排名第一。Vals AI 以統一的 Terminus 2 harness 重跑 Terminal-Bench 2.1,K3 得 80.90%,低於官方自評的 88.3。
評測方法本身存在公開爭議。ProgramBench 的作者 Ofir Press 公開質疑 Moonshot 的計分方式:該評測建議的指標為「完全實作完成的程式百分比」,而 Kimi 採用的是「所有程式實作完成度的平均」,Press 表示這種取法「可能造成誤導」。此外,官方 benchmark 表混用三種不同的 agent harness(Kimi Code、Claude Code、Codex),跨項目比較時需留意此一變因。
兩項容易被跑分掩蓋的落差
第一項是能力分布極不平均。K3 在第三方的 WebDev Arena 群眾盲測中以 1,678 Elo 排名第一,是首個登上該榜首位的開放權重模型;但在一般文字對話的 Text Arena 上僅 1,486 Elo,於 200 個模型中排第 8。前端程式生成極強,一般對話則屬中上。
第二項是「結果對」不等於「過程乾淨」。官方自評的 Agent Behavior Bench 專門評估工具使用行為、執行效率與紀律,K3 在此項僅 65.0,明顯落後 GPT-5.6 Sol 的 76.4 與 Fable 5 的 75.5。視覺方面亦有相同落差:單張圖像理解的 OmniDocBench 為 91.1 居首,但評估代理執行任務時能否正確運用畫面資訊的 Agentic Vision Bench 僅 78.3,落後三款對照模型。
vLLM 官方部署文件亦記載一項實務問題:「我們偶爾看到 K3 產出其自身解析器未預期的工具呼叫格式,導致 tool_calls 回傳為空。」文件建議正式環境的代理必須加上結構驗證與重試機制。對評估以 K3 建置自動化流程的團隊,這是需要先行設計的環節。
三、關鍵前提:官方釋出的權重,本身就是量化版
這是本文最需要說清楚的一點,也是多數報導未提及的技術前提。
一般談論大型模型的地端部署,慣常的算法是:先取全精度體積,再乘以量化的壓縮比。以 2.8 兆參數計算,BF16 全精度約 5.6 TB,量化至 4-bit 後約 1.4 TB——聽起來仍有大幅壓縮的空間。
但 Kimi K3 官方釋出的權重,本身就已經是 4-bit。技術報告載明,其 MoE 專家權重採 MXFP4、啟動值採 MXFP8,且自 SFT 階段起即進行量化感知訓練(QAT),而非事後量化。設定檔中的 quantization_config 明確標示格式為 mxfp4-pack-quantized、位元數 4、群組大小 32。注意力投影、共享專家、路由器、輸出層與視覺編碼器則排除在量化之外,保留高精度。
因此 Hugging Face 上顯示的 1.56 TB、96 個 safetensors 分片,就是壓縮後的體積,不是壓縮前。官方沒有發行 BF16 全精度版本,也未說明是否有此計畫。這代表一般預期的「量化紅利」在下載之前就已經被使用掉了——社群若要再往下壓,換得的不是空間,而是品質。
社群量化版的實際大小可以印證這一點:unsloth 的 GGUF 版本中,UD-IQ1_S 為 649 GB、UD-Q2_K_XL 為 861 GB、UD-Q4_K_XL 為 1.51 TB。另一組由 AtomicChat 製作的量化版把體積壓到 555 GB(IQ1_S,約 1.60 bpw),但該版本明言必須使用其自行維護的 llama.cpp 分支,「主線 llama.cpp 會拒絕這些檔案」。
四、地端部署的實際門檻
官方模型卡列出的推論引擎只有三種:vLLM、SGLang 與 TokenSpeed,全部屬資料中心級。官方部署建議為「具備 64 顆以上加速器的超節點配置」。vLLM 作為首日支援夥伴,在其部落格中給出目前最明確的最低硬體陳述:「至少需要一台 8× B300(或 GB300 NVL72)節點;16× B200 亦受支援。」
以下整理各種硬體層級的實測生成速度。資料中心配置為官方數據,工作站與單機配置則來自社群回報。
| 執行環境 | 模型版本 | 生成速度 | 資料性質 |
|---|---|---|---|
| GB300 NVL72(vLLM,開推測解碼) | 官方 MXFP4 完整版 | 331–370 token/秒 | vLLM 官方實測 |
| GB300 NVL72(vLLM,未開推測解碼) | 官方 MXFP4 完整版 | 111–118 token/秒 | vLLM 官方實測 |
| 8× B200(llama.cpp,佔用約 956 GB VRAM) | 完整版 | 16.6 token/秒 | 社群回報,單一來源 |
| M3 Ultra Mac Studio 512GB | REAP80 剪枝版(350 GB) | 5.54 token/秒 | 社群回報,非完整模型 |
| GPU 放注意力層+CPU RAM 放專家 | IQ1_S(527 GiB) | 4.9 token/秒 | 社群回報,單一來源 |
| 64 核 Threadripper + 768 GB DDR5 | Q4 部分自磁碟讀取 | 0.90–1.05 token/秒 | 社群回報,單一來源 |
| 2× RTX PRO 6000 96GB + 512 GB DDR5 + NVMe RAID | 自 Gen5 NVMe 以 mmap 讀取 | 0.41 token/秒 | 社群回報,單一來源、未經複現 |
最後一列是與本站讀者最相關的配置:兩張 RTX PRO 6000 Blackwell 96GB、Threadripper PRO 平台、512 GB DDR5 記憶體、NVMe RAID——以工作站而言已屬頂規。實測結果為每秒 0.41 個 token,換算約每兩秒半產出一個字。該數據為單一使用者回報且未經複現,但與另一筆「純堆疊系統記憶體約每秒 1 個 token」的回報方向一致。
三個常見的誤解
誤解一:Ollama 已經支援,所以可以本機跑。Ollama 提供的是 kimi-k3:cloud 這個雲端標籤,並無可本機下載的版本,且需 Pro 或 Max 訂閱並額外消耗用量額度。LM Studio 提供的 Kimi K3 同樣是託管於美國伺服器的雲端存取,非本機執行。兩者都容易被轉述成「消費級工具已可本機執行 K3」。
誤解二:llama.cpp 可以跑,所以門檻沒那麼高。llama.cpp 主線至今尚未支援 K3,相關的 PR 於權重釋出當日開啟,查證時仍為未合併狀態。Unsloth 的官方教學明白要求使用者切換到該未合併分支自行編譯。該 PR 另註明跨層殘差僅支援 CPU 與 CUDA 後端,Metal 與 Vulkan 不支援——這對 Mac 與 AMD 平台的使用者是硬性阻礙。
誤解三:有人在 Mac Studio 上跑起來了。該案例使用的是經 REAP 專家剪枝的版本,每層 896 個專家只保留 179 個,砍掉約八成。其模型卡自承這是「激進的剪枝」,相對完整 K3 有「顯著的品質退化」。對台灣使用者特別需要留意的是:退化最明顯的部分正是中文輸出,實測出現重複迴圈,程式碼補全的結構則相對完整。
五、授權:不是 Modified MIT
多家中英文媒體報導 Kimi K3「以 Modified MIT 授權開源」。經核對授權原文,此說法有誤。K3 的授權文件正式名稱為「Kimi K3 License」,開頭為「Copyright (c) 2026 Moonshot AI」,全文未出現 MIT 字樣,Hugging Face 上標記為 license:other,並非 OSI 認證的開源授權。Modified MIT 是 Kimi K2 世代的條款,K3 已更換為自訂授權。
該授權允許商業使用,包含使用、修改、散布與販售,但設有兩道門檻:
| 條款 | 觸發條件 | 義務 |
|---|---|---|
| 第 2 條 | 經營 Model-as-a-Service 業務,且與關係企業合計營收於任何連續 12 個月內超過 2,000 萬美元 | 商業使用前須另與 Moonshot AI 簽訂授權協議 |
| 第 3 條 | 產品月活躍使用者超過 1 億,或月營收超過 2,000 萬美元 | 須於使用者介面顯著位置標示「Kimi K3」 |
| 第 4 條 | 內部使用(不將模型、其輸出或底層能力提供予第三方),或透過官方產品/認證推論夥伴存取 | 豁免第 2、3 條 |
對絕大多數企業而言,這些門檻不會被觸發:內部導入、部署於自有機房、供內部員工使用,均落在第 4 條的豁免範圍。需要留意的是對外提供 API 服務的業者。授權另載明所有輸出以現狀提供、不附任何擔保。
六、台灣企業的合規與資安現況
此處僅陳述查得的官方文件事實。
行政院於 2025 年 2 月 3 日公告公務機關全面禁用 DeepSeek,範圍涵蓋中央及地方機關、公立學校、公營事業與行政法人,禁止形式包含雲端服務、應用程式與本機下載,法源為 2019 年訂定的「各機關對危害國家資通安全產品限制使用原則」。該公告僅點名 DeepSeek,未提及 Kimi 或月之暗面。國家安全局於 2025 年 11 月 17 日公布的中國 AI 模型資安檢測報告,測試對象為 DeepSeek、豆包、文心一言、通義千問與元寶等五款,名單中同樣不含 Kimi。截至 2026 年 7 月底,全球查無任何政府機關明文禁用 Kimi 的公告。
惟前述「限制使用原則」明訂公務用資通訊產品不得使用大陸廠牌,其適用範圍逐字涵蓋軟體、硬體與服務。該原則規範對象為各機關,未涵蓋民間企業。公部門與其供應鏈在評估時,應以該原則的通則規定為準,而非以是否被個別點名為準。
資料落地方面,Kimi 官方 API 平台的隱私政策載明資料儲存於新加坡的伺服器,服務由 MOONSHOT AI PTE. LTD.(新加坡法人)提供與控制。同一份政策亦表示使用者內容會用於模型最佳化,保存期限為「提供服務所必要之期間」,未給出固定期程,亦未明確說明 API 的輸入輸出是否排除於訓練用途之外。自行部署開放權重可移除資料經過對方伺服器的問題,但無法移除授權條款的適用性,亦無法移除模型權重本身內建的傾向。
英國 AI Security Institute 與美國 CAISI 於 2026 年 7 月 23 日發布聯合資安評估,結論可分兩面看:K3 在 41 項端到端任務中達成任意程式碼執行的次數為 0,最強前沿模型平均為 20;在 32 步驟的模擬企業網路攻擊中平均推進至第 17 步,最強美國模型平均為 28.5 步。攻擊能力低於前沿模型。但同一份評估亦明確指出:「Kimi K3 的防護機制未能阻止它嘗試開發攻擊程式碼或執行攻擊性網路作業。」
另有一項政治爭議需標明其性質。2026 年 7 月 22 日,白宮科技政策辦公室主任 Michael Kratsios 公開指控月之暗面以大規模蒸餾美國模型開發 K3;同日財政部長 Scott Bessent 表示制裁與實體清單指定「將被納入選項」。月之暗面否認該指控。截至查證時點,美方未提出技術證據,亦未有任何制裁實際實施。
七、對地端 AI 硬體採購的實際意義
把上述事實收攏為採購決策,可得三項結論。
其一,K3 不是工作站級的部署目標。其官方最低配置為單台 8× B300 節點,這是資料中心規格。以本站可交付的最高規格為例,四至七卡並聯的 WRX90 平台合計顯示記憶體最高約 672 GB,系統記憶體最高 512 GB——即便如此,仍不足以將 1.56 TB 的官方權重完整載入,而必須依賴磁碟讀取,速度即落入前述每秒個位數以下的區間。這不是配置選擇的問題,是數量級的差距。
其二,模型規模與可用性並非同一件事。對多數企業的實際工作負載——內部知識庫問答、文件處理、程式輔助、代理流程——目前可在單機執行且具備生產品質的開放權重模型,落在 200 億至 1,200 億參數這個區間。以 gpt-oss-120b 為例,其權重約 60 GB,單張 96 GB 顯示卡即可完整承載並保留脈絡空間,無須跨卡拆分,延遲與部署複雜度都遠低於任何需要多節點的方案。
| 目標 | 單機可行性 | 對應配置 |
|---|---|---|
| 200 億級推論(gpt-oss-20b) | 可行,單卡 32GB 有餘裕 | AI-Medium 級,約 15 萬 |
| 270 至 320 億級高品質推論 | 可行,單卡 32GB | AI-Medium-Gemma 級,約 23 萬 |
| 700 億級推論(4-bit) | 可行,單卡 72GB | AI-High 級,約 69 萬 |
| 1,200 億級 MoE(gpt-oss-120b) | 可行,單卡 96GB 免拆分 | AI-Highend 級,約 141 萬 |
| 2.8 兆級(Kimi K3 完整版) | 單機不可行 | 需資料中心級節點 |
其三,若確實需要 K3 的能力,API 是目前唯一務實的路徑,但需先計算 token 成本。官方定價為輸入快取未命中每百萬 token 3 美元、快取命中 0.30 美元、輸出 15 美元,全 1M 脈絡採單一費率。需要注意的是 K3 的思考模式永遠開啟且無法關閉,輸出量因此偏高——Artificial Analysis 完成一輪 Intelligence Index 評測即用掉 1.3 億輸出 token,中位數為 9,900 萬,其評語為「智慧水準名列前茅,但特別昂貴,同時明顯偏慢且極為冗長」。社群亦有使用者回報訂閱制額度消耗遠快於預期。評估時應以實際工作負載試算,而非以單價比較。
結語
Kimi K3 是一次實質的技術進展:2.8 兆參數的開放權重、原生 1M 脈絡、原生多模態,並在工具呼叫與長時程軟體工程等項目上取得領先閉源旗艦的成績。開放權重的意義也確實存在——它讓能力的擴散不再完全取決於少數封閉服務的政策。
但對評估地端 AI 的企業而言,需要區分兩個問題:「這個模型是否開放」與「這個模型是否適合放進我的機房」,答案並不相同。K3 的答案是前者為是、後者為否。真正能落到自有機房、且具備生產品質的模型,目前仍在百億至千億參數的區間;而這個區間的能力,對絕大多數企業實際會遇到的工作負載而言,已經足夠。
資料來源:Kimi K3 技術報告(arXiv 2607.24653,2026 年 7 月 27 日)與 Hugging Face 官方模型卡、config.json 及 LICENSE 原文;Moonshot AI 官方部落格與 platform.kimi.ai 文件;vLLM 官方部署部落格與 recipe;Artificial Analysis、Vals AI 與 WebDev Arena 之第三方評測;英國 AI Security Institute 與美國 CAISI 於 2026 年 7 月 23 日發布之聯合資安評估;行政院 2025 年 2 月 3 日公告與「各機關對危害國家資通安全產品限制使用原則」;國家安全局 2025 年 11 月 17 日中國 AI 模型資安檢測報告。授權條款、參數規格與定價均以官方原始文件逐字核對;本文標示為「社群回報」之實測速度數據,均取自 llama.cpp 相關 PR 與討論串之個別使用者貼文,為單一來源且未經複現,僅供量級參考,不應視為效能保證。白宮官員之蒸餾指控與月之暗面之否認,均依媒體報導引用,雙方皆未提出可供查核之技術證據。本文引號內之英文陳述均為中譯,語意以原文為準。本文非受任何公司委託或贊助,亦未收受對價;MAQ 為 AI 硬體系統整合商,所銷售之工作站包含文中提及廠商之硬體產品,讀者於閱讀本文之產業觀察時宜一併考量。模型效能數據依測試條件與版本而異,實際表現請以官方最新公告及自身工作負載實測為準。Kimi、Moonshot 為 Moonshot AI 之商標;NVIDIA、CUDA、Blackwell 為 NVIDIA Corporation 之商標;Claude 為 Anthropic 之商標;AMD、Radeon 為 Advanced Micro Devices, Inc. 之商標;Gemma 為 Google LLC 之商標;Llama 為 Meta Platforms, Inc. 之商標;Qwen 為阿里巴巴集團之商標;其餘商標歸各自所有者所有。