產業動態

本週 AI 三件事:Jev、Laya、Kev 開啟「決策模型」新品類,Claude Opus 5.5 以更低價格追平旗艦,Meta Muse 把代理放進雲端虛擬機

2026-09-23 | 約 10 分鐘 | MAQ 技術團隊

九月下旬的 AI 消息密度很高,值得單獨看的有三件:一個新品類「決策模型」在三天內出現三個名字(Jev、Laya、Kev),Anthropic 發表 Claude Opus 5.5,Meta 推出個人 AI 代理 Muse。三件事的共同線索,是「AI 應該在哪裡執行」這個問題有了新的答案。本文先講決策模型,因為它對本地硬體的影響最直接。

一、決策模型是什麼

大型語言模型的輸出是文字,但生產環境裡大量的 AI 呼叫其實不需要文字,只需要一個標籤:這張工單該派給誰、這個潛在客戶值幾分、這段內容是否違規、這個請求該交給哪個代理。決策模型(decision model,業界也稱 System 1 model)只回答這類結構化問題,回傳選項、等級或是否,並附上校正過的機率,不做自迴歸生成。結果是延遲以毫秒計、成本比 LLM 低一到兩個數量級。

這個品類在 9 月 15 日到 18 日之間密集登場,三個名字分別代表三種取用方式。

二、Jev:閉源 API,ChatGPT 共同創作者創辦

  • 推出:2026 年 9 月 15 日,TypeSafe AI。創辦人 Diogo Almeida 曾任職 OpenAI、是 ChatGPT 的共同創作者之一,共同創辦人為 Erik Gafni 與 Sasha Sheng。
  • 形式:閉源,僅提供 API。未公開技術論文與權重。
  • 定價:每百萬輸入 token 0.042 美元,輸出免費;最低儲值 5 美元。
  • 延遲:官方區間 70 至 500 毫秒,社群實測典型約 150 毫秒。
  • 技術:非自迴歸架構,以「強化學習校正決策」訓練,輸出校正機率與信心分數。官方宣稱針對特定任務較 LLM 快 20 到 200 倍、便宜 40 到 400 倍。
  • 社群用法:工單分類與路由、潛在客戶評分、安全標記、代理路由、論文分類、人資配對、廣告素材挑選。

三、Laya:Apache 2.0 開源,自架不計費

  • 推出:2026 年 9 月 18 日,Convai Innovations,創辦人 Nandakishor Mukkunnoth;原始研究為 2025 年 3 月的 arXiv 論文。
  • 授權:Apache 2.0,權重放在 Hugging Face,pip install laya 即可安裝。
  • 模型:三個檢查點——laya(ModernBERT-large 骨幹,4.21 億參數,512 token)、laya-multilingual(mmBERT-base,3.22 億參數,支援百餘種語言,上下文可至 8k)、laya-typed-decisions(4.21 億參數,1024 token)。
  • 延遲:單張 GPU 上單題中位數 32.8 毫秒;十題批次 72.3 毫秒,平均每題 7.2 毫秒。
  • 與 Jev 的比較(Laya 官方數據):typed-decisions 準確率 0.766 對 0.727;校正誤差 0.081 對 0.246;每 token 成本 0 對 0.042 美元。這些數字出自 Laya 一方,Jev 未公開對應的技術資料可供交叉驗證。

第三方評測的結論比官方數字保守:Laya 在任務與訓練分布相符、或經微調後占優;Jev 開箱即用、在選項數量多的題目與校正表現上占優。要資料隱私、極低延遲與可微調,選 Laya;要零維運、選項超過二十個,選 Jev。

四、Kev 與 laya-mlx:三天內長出的本地生態

Kev 由 Jared Palmer 發布,形式是本機伺服器:以 jaredpalmer/kev-4b 模型啟動一個決策服務,不需要 API 金鑰、沒有雲端費用,定位為「通用本地評估」。

laya-mlx 是社群將 Laya 轉為 Apple Silicon 原生 MLX 格式的專案(作者 mizorewww):FP16 檢查點 843MB,不需安裝 PyTorch 或 Transformers;在 M3 Max 上,英文短題端到端中位數 13.4 毫秒、多語言版 7.4 毫秒;與上游 PyTorch 版本在 63 組決策分布中的最大機率差為 0.0054。專案三天內在 GitHub 取得逾 5,190 顆星,並於 9 月 22 日被整合進 Compound Engineering 的決策引擎,與 Kev 並列為本地供應器。

五、三者對照

JevLayaKev
推出9 月 15 日,TypeSafe AI9 月 18 日,Convai InnovationsJared Palmer
形式閉源 APIApache 2.0 開源本機伺服器(kev-4b)
執行位置雲端自架 GPU;Apple Silicon 有 laya-mlx本機
延遲約 150 毫秒32.8 毫秒;M3 Max 上 7 至 14 毫秒視本機硬體
成本每百萬輸入 token 0.042 美元自架,不計費自架,不計費

六、Claude Opus 5.5:更低價格追平旗艦

Anthropic 於 9 月 22 日發表 Claude Opus 5.5,是 5.5 世代的第一個模型。官方頁的數字:

  • 定價:每百萬輸入 token 4 美元(Opus 5 為 5 美元)、輸出 20 美元(Opus 5 為 25 美元)、快取讀取 0.20 美元(Opus 5 為 0.50 美元)。典型工作負載成本較 Opus 5 低四成。
  • 速度:輸出速度較 Opus 5 快三成以上。
  • 基準:Terminal-Bench 4.0 66.4%(Opus 5 為 52.3%)、FrontierCode v1.1 54.4%(48.0%)、GDPval-AA v2.1 1846 Elo(1708)。官方稱多數工作與旗艦 Fable 5.1 相當,部分基準略低。
  • 可用性:Claude Platform(模型代號 claude-opus-5-5)、AWS、Google Cloud、Microsoft Azure。發布前由 Frontier Design 與 METR 進行外部評估。Sonnet 5.5 與 Haiku 5.5 預告數週內推出。

七、Meta Muse:代理進了雲端虛擬機

Meta 於 9 月 8 日發表個人 AI 代理 Muse,代替使用者寄信、訂旅程、填表單、談價與結帳,關閉 App 後仍持續工作;在 Muse Secure VM 雲端虛擬機上執行、由 Muse Spark 模型驅動,免費層之外有每月 20 美元與 100 美元兩個方案,並預告年底前推出使用者自持金鑰的加密虛擬機。MAQ 上週已有專文整理:Meta 推出個人 AI 代理 Muse

八、MAQ 的觀點:AI 在哪裡執行,這週有了更清楚的分工

把三件事放在一起看,分工變得清楚:

  • 判斷類任務走本地小模型。4 億參數的 Laya 在一張入門 GPU 上單題三十餘毫秒,在 Apple Silicon 上十幾毫秒,而且不計費、資料不出門。分類、路由、評分、內容審核這些每天發生數千到數百萬次的判斷,沒有理由再逐次呼叫雲端 LLM。
  • 生成與推理類任務走 API 或本地大模型。Opus 5.5 把旗艦級能力的價格再往下拉,適合寫作、程式與長推理;資料敏感的企業則以本地 LLM 主機承接。
  • 消費者代理走雲端服務。Muse 這類產品面向個人,企業內部的代理流程仍以本地執行為宜。

對應到 MAQ 現售機型:Mac mini AI Agent 版(M6、24GB 統一記憶體、512GB SSD,新台幣 43,900 元)可直接以 laya-mlx 承接決策任務;AI Agent 工作站(AMD 版 33,000 元、Intel 版 36,800 元)適合作為代理流程與決策服務的常駐主機;需要同時執行本地 LLM 與批次決策時,AI-Eco(RTX PRO 4000 24GB,108,700 元)以上機型可一併承載。三者皆出廠預載本地模型環境,售後提供遠端連線服務。

資料來源:Laya 官方頁(laya.convaiinnovations.com);AI Supremacy〈The most Viral new AI model isn't an LLM at all〉(2026 年 9 月);DEV Community〈Jev vs Laya: The Same AI Idea, One Closed and One Open〉;GitHub mizorewww/laya-mlx 與 mastepanoski/ce-ai PR #409;Anthropic〈Introducing Claude Opus 5.5〉(2026 年 9 月 22 日);Meta 官方公告與 TechCrunch(2026 年 9 月 8 日)。Laya 與 Jev 的比較數據出自 Laya 一方,Jev 未公開技術資料;各項價格與延遲以各廠商公告為準。MAQ 機型價格為本文更新當時官網現價,以線上估價系統即時價格為準。Claude 為 Anthropic PBC 商標;Meta、Muse 為 Meta Platforms, Inc. 商標;Apple、Mac mini 為 Apple Inc. 商標;文中商標均屬各該公司所有。

常見問題

什麼是決策模型(decision model)?和大型語言模型有何不同?

決策模型只回答結構化問題:從選項中挑一個、在等級量表上評分、或回答是與否,並附上校正過的機率,不生成文字。用途是分類、路由、評分與安全檢查這類生產流程中的判斷節點。因為不做自迴歸生成,延遲以毫秒計、成本遠低於大型語言模型;需要撰寫或推理長文時仍要用 LLM。

Jev、Laya、Kev 三者差在哪?

Jev 由 TypeSafe AI 於 9 月 15 日推出,閉源、走 API,每百萬輸入 token 0.042 美元、輸出免費,延遲約 150 毫秒。Laya 由 Convai Innovations 於 9 月 18 日以 Apache 2.0 開源,4.21 億參數(另有 3.22 億參數的多語言版),單張 GPU 單題 32.8 毫秒,自架不計費。Kev 由 Jared Palmer 發布,以 kev-4b 模型在本機啟動伺服器,不需 API 金鑰。

Laya 能在 Mac 上跑嗎?

可以。社群專案 laya-mlx 將 Laya 轉為 Apple Silicon 原生的 MLX 格式,檢查點 843MB,在 M3 Max 上英文短題中位數 13.4 毫秒、多語言版 7.4 毫秒,不需安裝 PyTorch。該專案三天內在 GitHub 取得逾五千顆星。

Claude Opus 5.5 的價格與定位?

Anthropic 於 9 月 22 日發表,每百萬輸入 token 4 美元、輸出 20 美元、快取讀取 0.20 美元,官方稱典型工作負載比 Opus 5 便宜四成、輸出快三成以上,多數工作表現與旗艦 Fable 5.1 相當。提供於 Claude Platform 與 AWS、Google Cloud、Microsoft Azure,模型代號 claude-opus-5-5,Sonnet 5.5 與 Haiku 5.5 預告數週內推出。

決策模型只要一張入門卡或一台 Mac mini:MAQ AI Agent 工作站

Laya 這類 4 億參數的決策模型在單張 GPU 上單題三十餘毫秒,在 Apple Silicon 上十幾毫秒。MAQ 供應可在自家網路內執行分類、路由與代理流程的 AI Agent 工作站與 Mac mini AI Agent 版,出廠預載本地模型環境。提供預計的判斷任務與每秒請求量,由 MAQ 協助配置。