九月下旬的 AI 消息密度很高,值得單獨看的有三件:一個新品類「決策模型」在三天內出現三個名字(Jev、Laya、Kev),Anthropic 發表 Claude Opus 5.5,Meta 推出個人 AI 代理 Muse。三件事的共同線索,是「AI 應該在哪裡執行」這個問題有了新的答案。本文先講決策模型,因為它對本地硬體的影響最直接。
一、決策模型是什麼
大型語言模型的輸出是文字,但生產環境裡大量的 AI 呼叫其實不需要文字,只需要一個標籤:這張工單該派給誰、這個潛在客戶值幾分、這段內容是否違規、這個請求該交給哪個代理。決策模型(decision model,業界也稱 System 1 model)只回答這類結構化問題,回傳選項、等級或是否,並附上校正過的機率,不做自迴歸生成。結果是延遲以毫秒計、成本比 LLM 低一到兩個數量級。
這個品類在 9 月 15 日到 18 日之間密集登場,三個名字分別代表三種取用方式。
二、Jev:閉源 API,ChatGPT 共同創作者創辦
- 推出:2026 年 9 月 15 日,TypeSafe AI。創辦人 Diogo Almeida 曾任職 OpenAI、是 ChatGPT 的共同創作者之一,共同創辦人為 Erik Gafni 與 Sasha Sheng。
- 形式:閉源,僅提供 API。未公開技術論文與權重。
- 定價:每百萬輸入 token 0.042 美元,輸出免費;最低儲值 5 美元。
- 延遲:官方區間 70 至 500 毫秒,社群實測典型約 150 毫秒。
- 技術:非自迴歸架構,以「強化學習校正決策」訓練,輸出校正機率與信心分數。官方宣稱針對特定任務較 LLM 快 20 到 200 倍、便宜 40 到 400 倍。
- 社群用法:工單分類與路由、潛在客戶評分、安全標記、代理路由、論文分類、人資配對、廣告素材挑選。
三、Laya:Apache 2.0 開源,自架不計費
- 推出:2026 年 9 月 18 日,Convai Innovations,創辦人 Nandakishor Mukkunnoth;原始研究為 2025 年 3 月的 arXiv 論文。
- 授權:Apache 2.0,權重放在 Hugging Face,
pip install laya即可安裝。 - 模型:三個檢查點——laya(ModernBERT-large 骨幹,4.21 億參數,512 token)、laya-multilingual(mmBERT-base,3.22 億參數,支援百餘種語言,上下文可至 8k)、laya-typed-decisions(4.21 億參數,1024 token)。
- 延遲:單張 GPU 上單題中位數 32.8 毫秒;十題批次 72.3 毫秒,平均每題 7.2 毫秒。
- 與 Jev 的比較(Laya 官方數據):typed-decisions 準確率 0.766 對 0.727;校正誤差 0.081 對 0.246;每 token 成本 0 對 0.042 美元。這些數字出自 Laya 一方,Jev 未公開對應的技術資料可供交叉驗證。
第三方評測的結論比官方數字保守:Laya 在任務與訓練分布相符、或經微調後占優;Jev 開箱即用、在選項數量多的題目與校正表現上占優。要資料隱私、極低延遲與可微調,選 Laya;要零維運、選項超過二十個,選 Jev。
四、Kev 與 laya-mlx:三天內長出的本地生態
Kev 由 Jared Palmer 發布,形式是本機伺服器:以 jaredpalmer/kev-4b 模型啟動一個決策服務,不需要 API 金鑰、沒有雲端費用,定位為「通用本地評估」。
laya-mlx 是社群將 Laya 轉為 Apple Silicon 原生 MLX 格式的專案(作者 mizorewww):FP16 檢查點 843MB,不需安裝 PyTorch 或 Transformers;在 M3 Max 上,英文短題端到端中位數 13.4 毫秒、多語言版 7.4 毫秒;與上游 PyTorch 版本在 63 組決策分布中的最大機率差為 0.0054。專案三天內在 GitHub 取得逾 5,190 顆星,並於 9 月 22 日被整合進 Compound Engineering 的決策引擎,與 Kev 並列為本地供應器。
五、三者對照
| Jev | Laya | Kev | |
|---|---|---|---|
| 推出 | 9 月 15 日,TypeSafe AI | 9 月 18 日,Convai Innovations | Jared Palmer |
| 形式 | 閉源 API | Apache 2.0 開源 | 本機伺服器(kev-4b) |
| 執行位置 | 雲端 | 自架 GPU;Apple Silicon 有 laya-mlx | 本機 |
| 延遲 | 約 150 毫秒 | 32.8 毫秒;M3 Max 上 7 至 14 毫秒 | 視本機硬體 |
| 成本 | 每百萬輸入 token 0.042 美元 | 自架,不計費 | 自架,不計費 |
六、Claude Opus 5.5:更低價格追平旗艦
Anthropic 於 9 月 22 日發表 Claude Opus 5.5,是 5.5 世代的第一個模型。官方頁的數字:
- 定價:每百萬輸入 token 4 美元(Opus 5 為 5 美元)、輸出 20 美元(Opus 5 為 25 美元)、快取讀取 0.20 美元(Opus 5 為 0.50 美元)。典型工作負載成本較 Opus 5 低四成。
- 速度:輸出速度較 Opus 5 快三成以上。
- 基準:Terminal-Bench 4.0 66.4%(Opus 5 為 52.3%)、FrontierCode v1.1 54.4%(48.0%)、GDPval-AA v2.1 1846 Elo(1708)。官方稱多數工作與旗艦 Fable 5.1 相當,部分基準略低。
- 可用性:Claude Platform(模型代號 claude-opus-5-5)、AWS、Google Cloud、Microsoft Azure。發布前由 Frontier Design 與 METR 進行外部評估。Sonnet 5.5 與 Haiku 5.5 預告數週內推出。
七、Meta Muse:代理進了雲端虛擬機
Meta 於 9 月 8 日發表個人 AI 代理 Muse,代替使用者寄信、訂旅程、填表單、談價與結帳,關閉 App 後仍持續工作;在 Muse Secure VM 雲端虛擬機上執行、由 Muse Spark 模型驅動,免費層之外有每月 20 美元與 100 美元兩個方案,並預告年底前推出使用者自持金鑰的加密虛擬機。MAQ 上週已有專文整理:Meta 推出個人 AI 代理 Muse。
八、MAQ 的觀點:AI 在哪裡執行,這週有了更清楚的分工
把三件事放在一起看,分工變得清楚:
- 判斷類任務走本地小模型。4 億參數的 Laya 在一張入門 GPU 上單題三十餘毫秒,在 Apple Silicon 上十幾毫秒,而且不計費、資料不出門。分類、路由、評分、內容審核這些每天發生數千到數百萬次的判斷,沒有理由再逐次呼叫雲端 LLM。
- 生成與推理類任務走 API 或本地大模型。Opus 5.5 把旗艦級能力的價格再往下拉,適合寫作、程式與長推理;資料敏感的企業則以本地 LLM 主機承接。
- 消費者代理走雲端服務。Muse 這類產品面向個人,企業內部的代理流程仍以本地執行為宜。
對應到 MAQ 現售機型:Mac mini AI Agent 版(M6、24GB 統一記憶體、512GB SSD,新台幣 43,900 元)可直接以 laya-mlx 承接決策任務;AI Agent 工作站(AMD 版 33,000 元、Intel 版 36,800 元)適合作為代理流程與決策服務的常駐主機;需要同時執行本地 LLM 與批次決策時,AI-Eco(RTX PRO 4000 24GB,108,700 元)以上機型可一併承載。三者皆出廠預載本地模型環境,售後提供遠端連線服務。
資料來源:Laya 官方頁(laya.convaiinnovations.com);AI Supremacy〈The most Viral new AI model isn't an LLM at all〉(2026 年 9 月);DEV Community〈Jev vs Laya: The Same AI Idea, One Closed and One Open〉;GitHub mizorewww/laya-mlx 與 mastepanoski/ce-ai PR #409;Anthropic〈Introducing Claude Opus 5.5〉(2026 年 9 月 22 日);Meta 官方公告與 TechCrunch(2026 年 9 月 8 日)。Laya 與 Jev 的比較數據出自 Laya 一方,Jev 未公開技術資料;各項價格與延遲以各廠商公告為準。MAQ 機型價格為本文更新當時官網現價,以線上估價系統即時價格為準。Claude 為 Anthropic PBC 商標;Meta、Muse 為 Meta Platforms, Inc. 商標;Apple、Mac mini 為 Apple Inc. 商標;文中商標均屬各該公司所有。