產業動態

AI 兩週大事 7/27–8/10:記憶體緊到 2027、Meta 開源 30B 上得了 24GB 顯卡,三家雲端同時在調價

2026-08-10 | 約 14 分鐘 | MAQ 技術團隊

2026 年 7 月 27 日至 8 月 10 日這兩週,AI 產業有三件事同時在走:記憶體缺貨被機構明確定調為延續到 2027 年;三個可商用的開放權重模型釋出,而且都標明了單機硬體門檻;雲端 API 的價格則同時出現大幅調降與調漲預告。以下逐條整理,每則標明來源等級與必要的限定。

立場揭露:本文由 MAQ 編輯整理。MAQ 銷售地端 AI 工作站與 AI 伺服器,因此涉及「自建與雲端」的段落存在利益關聯。處理方式是:所有數字標明來源與查證日期;凡對本公司產品不利的事實——例如雲端 API 大幅降價、多數旗艦模型單機跑不動——一律照寫。本文不作為採購依據,請以自身工作負載實測為準。

地端執行開放權重模型的軟體堆疊

三條主線

一、記憶體是這兩週所有硬體新聞的共同分母。TrendForce 於 8 月 4 日明寫「DRAM 供給將維持緊張直到 2027 年」,並指出 NVIDIA 已「決定」把次世代 Vera Rubin Superchip 的 SOCAMM 容量減半。8 月 10 日另一份報告指出,記憶體占 iPhone 物料成本的比重已從一年前約 10% 升至 2026 年第三季的約 34%。

二、可自架的甜蜜點明確落在 30 億到 300 億參數。這兩週釋出的三個開放權重模型都給了硬體門檻,而且都在單機範圍內。相對地,旗艦級模型全數證明了單機跑不動——這一點與本站上一篇談 Kimi K3 的結論一致。

三、雲端 API 同時在降價與漲價。OpenAI 調降兩個級距、DeepSeek 預告大幅調漲、Anthropic 的 Sonnet 5 導入價將於 9 月 1 日到期。這把自建的理由從「比較便宜」推向「成本可預測、資料落地、法遵」——降價的那一半,本站沒有立場迴避。

一、開放權重:這兩週真正能自己跑的是哪幾個

8 月 10 日 · Meta 以 Apache 2.0 釋出 Muse Glimmer 30B

參數為 296 億的稠密模型,另含 18 億參數的視覺編碼器,支援影像輸入、不支援音訊,脈絡長度逾 131,072 token,知識截止於 2026 年 1 月 4 日。授權為 Apache 2.0,可商用、可再散布。

官方量化版 model card 列出兩個級距:K-Quant-Dynamic 對應 32GB 顯示記憶體、準確率衰退 0.2%;K-Quant-17GB 對應 24GB、衰退 1.0%。

三個必要的限定。其一,24GB 與 32GB 是 model card 標示的目標硬體記憶體級距,不是權重檔大小——全精度權重官方說法為逾 55GB。其二,0.2% 與 1.0% 是 Meta 自行量測,取 15 個常見基準的準確率平均,無第三方獨立驗證。其三,執行路徑要看清楚:24GB 顯卡走 llama.cpp 或 LM Studio 可跑,Meta 官方 card 自附 RTX 5090 實測為每秒 74.9 至 233.4 token;但截至 8 月 10 日,Ollama 僅提供 Apple Silicon 的 MLX 版本,NVIDIA 與 AMD 官方寫的是「近期推出」。

8 月 4 日 · Mistral 釋出 Shieldstral 1.0,30 億參數的多模態內容審核模型

Apache 2.0 授權,單一模型同時處理純文字、純圖片與圖文混合,支援 12 種語言。官方稱單張 16GB 顯示卡即可運行。

設計上最實用的一點是「政策即文字」:審核規則以自然語言在推論當下寫成問題傳入,不需要重新訓練。對做電商、社群或客服的公司,這代表內容審核可以收回自有 AI 伺服器,而不必逐筆送雲端 API。

限定:官方說的是「單張 16GB GPU」,未指定廠牌;16GB 指 BF16 全精度,官方未拆解影像模態的額外記憶體開銷,也未說明測試時的脈絡長度。文字安全六項基準平均 F1 為 84.9%,這個數字是與一個 200 億參數模型並列同分,不是勝出,且部分子項略輸;多模態部分則明顯領先。所有基準皆由 Mistral 自行代跑,含對照組。

7 月 31 日 · DeepSeek 釋出 MIT 授權的 V4-Flash-0731

授權為 MIT,權重未設取用限制,脈絡長度 1,048,576 token。改版來自重做後訓練而非改架構。官方公布的跑分與 4 月版本相比大幅提升,例如 DeepSWE 由 7.3 升至 54.4、Terminal Bench 2.1 由 61.8 升至 82.7。

參數量有一處來源不一致,引用時要一併交代:本體 2,840 億、啟動 130 億,這組數字不在官方 model card 上,而是 LM Studio 官方部落格與多家企業版 Hugging Face 頁面一致記載;Hugging Face 權重庫本身計數為 3,040 億,含推測解碼模組。

硬體門檻比多數報導寫的高:官方 vLLM 部署範例是四張 GB300 的單一節點。社群量化版方面,LM Studio 官方建議至少 156GB 系統記憶體才適合 2-bit 級距,而該級距下可用的脈絡長度遠低於 1M。

8 月 3 日 · MiniMax H3 權重上架,授權排除美歐英韓,台灣不在排除清單

影片生成模型。授權條款排除美國、歐盟、英國與南韓,台灣不在排除清單內。社群量化組合的權重約 39.5 GiB,落在 48GB 級機器範圍。

兩個限定:開源權重上限為 768p,2K 模組未開源;39.5 GiB 是檔案體積推算,並無實測的顯示記憶體峰值——實際峰值受 KV 快取、脈絡長度與 offload 策略影響。另外,網路上流傳的排名主張未能在官方說明中查得,本文不引用。

8 月 3 日 · 阿里推出 Qwen3.8-Max,但開放權重尚未兌現

Qwen3.8-Max 為 2.4 兆總參數的混合專家模型,脈絡 1M,API 定價每百萬 token 輸入 2 美元、輸出 6 美元。官方文件同時提供 Anthropic 相容端點,這對已經接了 Claude 工具鏈、想測試替代方案的團隊是可行的路徑。

阿里承諾於「下週」釋出 Qwen3.8 的開放權重。截至 2026 年 8 月 10 日,官方 Hugging Face 組織尚未上架任何 Qwen3.8 權重庫;已出現的同名第三方庫全部是空的佔位,連權重檔都沒有。承諾週才剛開始,稱其「跳票」並不正確;但在官方庫出現之前,也不宜為了跑 Qwen3.8 而下單特定顯卡——官方連該模型是稠密還是混合專家都尚未說明。

二、雲端定價:同時在降,也在漲

7 月 30 日 · OpenAI 調降 GPT-5.6 兩個級距

Luna 降 80% 至每百萬 token 輸入 0.20 美元、輸出 1.20 美元;Terra 降 20% 至 2 美元與 12 美元。降 80% 的基準是 Luna 自己的發表時定價,不是相對其他型號。Sol 維持 5 美元與 30 美元不變,所以這不是全線調降。

估算成本時有一個容易踩的陷阱:超過 272K token 的長脈絡請求採不同費率,Luna 為 0.40 與 1.80 美元,開啟 Fast mode 再乘二。用招牌價估長文件工作負載會嚴重低估。

這一則對本站不利,但必須照寫:在 Luna 的價位下,高量、低複雜度的批次工作——文件分析、客服分類、例行程式實作——自建很難算得贏。

8 月 6 日前後 · DeepSeek 官方定價頁掛出漲價預告

官方 API 文件定價頁以註腳形式掛出:計劃近期整體上調定價,預計漲幅較大,具體方案以正式通知為準。英文版用詞為 significant increase expected。

未公布幅度,也未公布生效日;截至查證時點現行單價未變。本文不對漲幅做任何推估——官方沒給數字。這則的意義不在幅度,而在於:把成本綁在別人的定價策略上,本身就是一個風險敞口,而這次是供應商自己掛出來的。

Anthropic:Claude Sonnet 5 的導入價 8 月 31 日到期

依 Anthropic 官方定價文件,Sonnet 5 目前每百萬 token 輸入 2 美元、輸出 10 美元屬導入價,2026 年 9 月 1 日起為 3 美元與 15 美元,同樣工作量帳單增加五成。批次處理價亦由 1 與 5 美元調整為 1.5 與 7.5 美元。

兩個可立即動用的緩衝:提示快取命中價為基礎輸入價的十分之一,批次處理輸入輸出各打五折,兩者可疊加。另外務必以自家真實中文語料重新試算——官方文件載明 Claude 4.7 之後的模型改用新分詞器,同樣文字約多產生 30% token。

三、記憶體與硬體:緊到 2027 年

8 月 4 日 · TrendForce:DRAM 供給緊張延續整個 2027 年

該機構同時指出,NVIDIA 自 2026 年第三季起,已將 Rubin Ultra 的高頻寬記憶體配置評估範圍,從原本的 12-Hi HBM4e 擴大到 8-Hi HBM4e、12-Hi HBM4 與 8-Hi HBM4 三種替代方案。

這是評估中、最終規格未定的狀態,不可寫成 NVIDIA 已下修或已確認降規。同一份報告中唯一屬於已定案的是:NVIDIA 已決定把次世代 Vera Rubin Superchip 的 SOCAMM 容量減半,理由是 LPDDR5X 供給緊張延續至 2027 年。TrendForce 自家英文標題的語氣比內文強,本文以內文為準。

連 NVIDIA 都在為搶不到記憶體而評估降規,代表這不是短期現象。

8 月 10 日 · TrendForce:記憶體占 iPhone 物料成本比重升至約 34%

256GB 版 iPhone 18 Pro 的物料成本較 2025 年前代高約 38%;記憶體占物料成本比重從一年前約 10% 升至 2026 年第三季約 34%,並預期 2027 年上半年超過 40%。記憶體價格自 2025 年初以來上漲五至七倍。

限定:38% 僅適用該一款 256GB 機型與前代的對比,不可簡化為「iPhone 18 Pro 成本漲 38%」;全部為 TrendForce 估算,Apple 從未公布成本結構。

這組數字的價值在於把抽象的漲價翻成任何人都懂的比例。AI 工作站的記憶體配置動輒 128GB 至 512GB,受影響的倍數遠高於一支手機。

7 月 31 日 · 供應鏈傳出 AMD 通知板卡廠調漲,AMD 未證實

傳聞內容為 Radeon 顯示晶片與記憶體套件報價自 8 月起調漲至少一成。AMD 官方未證實,外電多為同源複述。本文僅記錄此一傳聞的存在,不引用任何具體幅度、廠商名稱或型號——那些細節只出現在單一低階來源。

四、Agent 治理:執行環境地端化,不等於模型地端化

8 月 6 日 · Anthropic 開放 Claude Code 自架執行環境公測

Team 與 Enterprise 方案可把 agent 的執行階段跑在自有主機上。留在自有設備的是儲存庫檢出、建置產物、憑證,以及 session 建立或修改的檔案;對話本身——包含提示、回應與工具結果——仍會送往 Anthropic 進行模型推論。連線全為由內對外,官方明寫不會反向連入企業網路。

要跟客戶講清楚的五件事:這是執行環境地端化,不是模型地端化,解決不了「資料完全不出境」的合規要求;推論固定走原廠 API,不能改道其他雲端平台或自家閘道;啟用零資料保留的組織不能使用;目前是公測而非正式版;計費不變,仍消耗既有用量,不是把費用換成硬體成本。

若要估算所需台數,有一個常見誤解要修正:一台執行器一次只服務一位使用者——認領第一個 session 時即鎖定該帳號。官方明寫最小機隊規模等於預期同時活躍的使用者數,不是併發 session 數。

另外,這兩週有三份一手事故報告指向同一個根因:環境隔離不足,而非模型失控。做 agent 的團隊,網路出口白名單、憑證最小權限與行為監控應當視為基礎建設,不是加值選項。

五、選型錨點

把這兩週有一手證據的模型,對應到機器級距。每一格的限定都必須一起讀——這張表最容易被誤用的地方,就是把「目標硬體記憶體」當成「模型檔案大小」。

單張 16GB
入門級
Shieldstral 1.0(30 億參數,多模態內容審核)
Apache 2.0,12 種語言,政策以自然語言傳入
BF16 全精度;官方未指定顯卡廠牌;未拆解影像模態的額外開銷
單張 24GB
MAQ AI-Eco 級,約 15 萬
Muse Glimmer 30B / K-Quant-17GB
Apache 2.0,多模態,脈絡逾 131,072 token
衰退 1.0% 為 Meta 自測、15 項基準平均;走 llama.cpp 或 LM Studio,Ollama 當下僅 Apple Silicon
單張 32GB
MAQ AI-Medium 級,約 15 萬
Muse Glimmer 30B / K-Quant-Dynamic
同上,量化衰退較小
衰退 0.2%,同為 Meta 自測;全精度權重官方說法為逾 55GB
48GB 級
影片生成用途
MiniMax H3(社群量化組合約 39.5 GiB)
授權排除美歐英韓,台灣不在排除清單
僅 768p,2K 模組未開源;體積為檔案推算,無實測顯示記憶體峰值
156GB 以上
多卡或大記憶體平台
DeepSeek-V4-Flash-0731(MIT 授權)
本體 2,840 億/啟動 130 億,脈絡上限 1M
2-bit 級距,LM Studio 官方建議至少 156GB 系統記憶體;該級距可用脈絡遠低於 1M
不建議規劃
單機不可行
Kimi K3、Qwen3.8-Max
前者權重逾 600GB,後者權重未釋出
官方部署配置為資料中心節點等級;Qwen3.8 官方庫尚未上架

機器級距為模型官方標示的目標硬體記憶體,非權重檔大小,亦非實際執行峰值。MAQ 機型價格為概數,精確報價以線上估價為準。所有跑分若無特別註明,均為模型廠商自行量測。

六、對台灣中小企業的建議

記憶體與顯示記憶體一次配足,不要規劃明年再升級。依據不是廠商說詞:緊供延續到 2027 年、記憶體占物料成本比重升至三分之一、兩年漲五至七倍。同一台機器只是配置年份不同,價差可能就是好幾萬。報價單應註明有效期與調價條款,前置期建議抓八至十二週以上。

高量、低複雜度的批次工作先不要自建。在目前的雲端價位下自建很難算得贏。地端的理由應該改成資料落地、法遵、延遲與成本可預測,而不是單純比價。

用雲端 API 的,現在就把 9 月 1 日那筆帳算出來。Sonnet 5 調價後同樣工作量帳單增加五成。提示快取與批次處理可疊加使用,另需以自家中文語料重新試算 token 數。

做 AI agent 的,把環境隔離當基礎建設。出口白名單、憑證最小權限、行為監控。這兩週的三份事故報告,根因都在此。

七、這幾則跟多數讀者無關

為了節省時間,以下這些在其他媒體被大幅報導、但對台灣中小企業的採購決策沒有影響的項目,本文不展開:中國 AI 晶片廠商的財報與上市(產品不對外銷台,生態與相容性都是問題);Intel 的增資與先進封裝擴產(2028 年才到位);各國超大型資料中心的興建案;Qualcomm 進軍資料中心(2028 年才商用送樣,未來兩年不會有第三家可選,選型第一考量仍是 CUDA 相容性);歐盟 AI 法規的施行細則(服務未觸及歐盟使用者則不需處理)。

資料來源與查證方式:本文涵蓋 2026 年 7 月 27 日至 8 月 10 日。素材以六個主題線平行蒐集共 82 則,排序後就 12 則頭條逐條回原始來源查證。主要一手來源包括:Meta AI Research 部落格與 Hugging Face 官方模型卡(Muse Glimmer);Mistral 官方公告與技術報告 arXiv:2607.25857(Shieldstral);DeepSeek 官方 Hugging Face 模型卡與 API 文件定價頁;MiniMax 官方權重庫;阿里雲官方文件與 Hugging Face 組織頁;OpenAI 官方定價與更新紀錄;Anthropic 官方定價文件與自架執行環境說明文件;TrendForce 2026 年 8 月 4 日與 8 月 10 日新聞稿。Claude Sonnet 5 之定價與生效日由編輯直接讀取 Anthropic 官方定價頁面逐字核對。凡標示為廠商自測之跑分,其對照組分數多數亦由同一廠商代跑,本文已於各處註明;廠商自評與第三方獨立驗證存在落差的前例確實存在,讀者引用時宜留意。AMD 調漲一節為供應鏈傳聞,AMD 官方未證實,本文不引用任何具體幅度或廠商名稱。凡查證階段未能取得一手證據者一律未寫入,包括部分排名主張、未經證實的量化體積數字,以及來源相互矛盾的定價異動說法。模型版本、授權條款與服務定價依時間變動,實際規格請以各廠商官方最新公告為準;本文所列硬體門檻均為官方標示之目標記憶體級距,非實際執行峰值,導入前應以自身工作負載實測。本文非受任何公司委託或贊助,亦未收受對價;MAQ 為 AI 硬體系統整合商,銷售之工作站包含文中提及廠商之硬體產品,於本題具有商業利益,讀者宜一併考量。Meta、Llama 為 Meta Platforms, Inc. 之商標;Mistral 為 Mistral AI 之商標;DeepSeek 為杭州深度求索之商標;MiniMax 為上海稀宇科技之商標;Qwen、通義千問為阿里巴巴集團之商標;OpenAI、ChatGPT 為 OpenAI 之商標;Claude、Anthropic 為 Anthropic PBC 之商標;NVIDIA、CUDA、Rubin 為 NVIDIA Corporation 之商標;AMD、Radeon 為 Advanced Micro Devices, Inc. 之商標;Apple、iPhone 為 Apple Inc. 之商標;其餘商標歸各自所有者所有。

常見問題

這兩週釋出的開放權重模型,哪些是單機真的跑得動的?

有三個。Mistral 的 Shieldstral 1.0 為 30 億參數多模態內容審核模型,官方稱單張 16GB 顯示卡即可運行(BF16 全精度,官方未指定廠牌)。Meta 的 Muse Glimmer 30B 官方量化版標示兩個級距:24GB 對應準確率衰退 1.0%、32GB 對應 0.2%(皆為 Meta 自測,取 15 項基準平均)。MiniMax H3 影片模型的社群量化組合約 39.5 GiB,落在 48GB 級,但開源權重上限為 768p。DeepSeek V4-Flash-0731 雖為 MIT 授權,官方部署範例是四張 GB300 的節點,2-bit 級距需至少 156GB 系統記憶體,已超出一般工作站範圍。

Meta 說 24GB 可以跑,是指 24GB 的檔案嗎?

不是。24GB 與 32GB 是模型卡標示的目標硬體記憶體級距,不是權重檔案大小——Meta 官方說明全精度權重逾 55GB。這是規格對照最容易誤讀的一格:目標硬體記憶體、權重檔案體積、實際執行峰值三者都不相同,執行峰值還會受 KV 快取、脈絡長度與 offload 策略影響。另需注意執行路徑:24GB 顯卡走 llama.cpp 或 LM Studio 可行,但截至 2026 年 8 月 10 日,Ollama 僅提供 Apple Silicon 的 MLX 版本,NVIDIA 與 AMD 版官方寫「近期推出」。

雲端 API 到底是變便宜還是變貴?

同時發生。OpenAI 於 7 月 30 日調降 GPT-5.6 兩個級距,Luna 降 80% 至每百萬 token 輸入 0.20 美元、輸出 1.20 美元,Terra 降 20%,但 Sol 維持 5 與 30 美元不變,並非全線調降;且超過 272K token 的長脈絡請求採不同費率,用招牌價估長文件會嚴重低估。另一方面,DeepSeek 於官方定價頁掛出漲價預告,明言預計漲幅較大,但未公布幅度與生效日;Anthropic 的 Claude Sonnet 5 導入價 2 與 10 美元於 2026 年 8 月 31 日到期,9 月 1 日起為 3 與 15 美元。

Qwen3.8 已經開源了嗎?

截至 2026 年 8 月 10 日尚未。阿里於 8 月 3 日推出 Qwen3.8-Max(2.4 兆總參數混合專家、脈絡 1M、API 每百萬 token 輸入 2 美元輸出 6 美元),並承諾於下週釋出開放權重,但官方 Hugging Face 組織目前沒有任何 Qwen3.8 權重庫,已出現的同名第三方庫都是空的佔位、連權重檔都沒有。承諾週剛開始,稱其跳票並不正確,但在官方庫出現前不宜為了跑該模型下單特定顯卡——官方連該模型是稠密還是混合專家都尚未說明。

Claude Code 可以完全在自己的機器上跑了嗎?

不能。Anthropic 於 8 月 6 日開放的是執行環境自架公測,不是模型地端化。留在自有設備的是儲存庫檢出、建置產物、憑證與 session 產生的檔案;對話本身包含提示、回應與工具結果,仍會送往原廠進行模型推論,因此解決不了資料完全不出境的合規要求。其他限制:推論固定走原廠 API 不能改道;啟用零資料保留的組織不能使用;目前為公測;計費不變仍消耗既有用量。估算台數時要注意一台執行器一次只服務一位使用者,最小規模等於預期同時活躍的使用者數,不是併發 session 數。

把推論放進自有 AI 伺服器的硬體方案

MAQ 提供從入門到企業級的地端 AI 工作站與 AI 伺服器,預載開放權重模型環境。若受規範資料必須留在內部、或需要成本可預測,選型關鍵是目標模型量化後的記憶體需求與並行人數。若工作負載不涉受規範資料且用量不高,雲端加企業控制項通常更合理,MAQ 會據實說明。