Google 在 2026 年 10 月 1 日發表新一代前沿模型 Gemini 4 Argon。Argon 專為「需要長時間維持深度推理的複雜工作流程」打造,主打三個領域:實際的軟體工程、法律與金融等企業知識工作,以及網路安全防禦。輸出上限從前一代的 6.4 萬個 token 提高到 100 萬個 token,Google 表示這是業界最高。以下依 Google DeepMind 資深副總裁暨 Google 首席 AI 架構師 Koray Kavukcuoglu 發表的官方文章整理重點。
分階段開放:先給資安防禦專家
Argon 沒有一次全面開放。第一階段透過 Google 的 Fairwind 計畫,開放給一批受信任的網路安全防禦專家;Google 也表示已配合美國政府的自願性計畫,在正式發布前先開放給相關單位評估。下一階段將開放給付費 API 客戶與 Google AI Ultra 訂閱者,之後才會擴及更多開發者、企業與一般消費者。官方文章未說明各地區的開放時程。
| 優惠價 | 每百萬輸入 token 2 美元、每百萬輸出 token 10 美元;快取輸入 token 比一般輸入便宜 95%。 |
| 優惠期結束後 | 每百萬輸入 token 4 美元、每百萬輸出 token 20 美元。 |
| 輸出上限 | 100 萬個 token(前一代為 6.4 萬個 token),單次推演可產生數十萬個 token。 |
Google 內部已經在用
Google 表示,數千名員工已在內部工作中使用 Argon,並在專業程式撰寫、深度研究與寫作品質上給予正面評價。官方舉了三個實例:
- 量子演算法最佳化:Argon 協助研究團隊處理拖慢整體運算的「效能瓶頸」,在一個實際案例中,只花幾分鐘就交出比現有公開文獻好 40% 的結果(以量子位元 × 邏輯閘的時空資源衡量)。
- 資料中心記憶體效率:一組 Argon 代理程式分析 Google 資料中心的效能數據,自主找出並套用記憶體最佳化方案。全面部署後已釋放超過 300 TiB 記憶體,預估整體可節省約 500 TiB 至 1 PiB。
- C/C++ 遷移到 Rust:Argon 代理程式正在把 Google 內部的 C/C++ 程式碼庫遷移到 Rust,規模從 re2、libgav1 等核心函式庫的數萬行,到 Fuchsia Zircon 核心的 80 多萬行;改寫結果在上線前都會經過自動與人工稽核、模擬測試與審查。以影片解碼器 libgav1 為例,Argon 接手既有的 Rust 移植版本,替換掉 3.2 萬行 SIMD 程式碼,最後的解碼器具備記憶體安全、輸出畫面與原版完全相同,速度比原本的 Rust 版本快 2.7 倍,接近高度最佳化的 C++ 版本。
基準測試成績
| 軟體工程 | DeepSWE v1.1(真實世界長期軟體工程任務) | 77.9%,業界新紀錄 |
| 企業知識 | Vals 指數(金融、程式開發、法律、稅務) | 第一名 |
| Vals Finance Agent v2(多步驟金融研究)、Harvey's Legal Agent Benchmark(法律研究與草擬) | 表現領先 | |
| Zapier AutomationBench(企業業務全端執行) | 51.3%,第一名 | |
| 長影片理解 | LVBench | 91.7%,業界最高 |
| 資安修補 | CWE-bench v1(修補安全漏洞) | 68%,並列第一 |
| 防提示注入 | Gray Swan 間接提示注入(IPI) | 防禦力領先業界 |
除了文字與程式,Argon 也能做專業的圖表分析、辨識長影片中的關鍵細節,並根據一連串文件的內容採取行動。
網路安全防禦
Google 把 Argon 訓練成具備高度網路防禦能力的模型,能自主尋找、驗證並修補關鍵軟體漏洞。針對受信任的防禦專家與 Google 內部團隊,Google 將提供不設網路安全防護限制的 Argon 版本。
- Wiz「Scan for Good」計畫:這項計畫免費為關鍵公共基礎設施尋找並修補高風險漏洞。早期示範中,Argon 在全球醫院使用的醫療保健軟體裡,發現一個會洩露敏感個人資料的關鍵漏洞,而這是其他前沿模型先前沒有找到的。
- 漏洞識別:在 Google 內部的漏洞基準測試中,Argon 揭露了涵蓋 20 種程式語言的複雜程式碼庫中的各類安全風險;在 Wiz 不提供原始碼的黑箱滲透測試中,Argon 在攻擊面探測、漏洞識別與產生概念驗證(PoC)上,都優於 Google 先前的 3.8 Flash Cyber 模型。
正式推出前的四項安全防護
- 防止濫用:依《前沿安全架構》(Frontier Safety Framework)設計,主動拒絕網路攻擊與化學、生物、放射性、核能(CBRN)相關的有害請求,同時允許合法的軍民兩用科學研究;並改良監控模型內部狀態的技術,防護機制已經過內外部紅隊壓力測試。
- 防禦提示注入:Google 表示 Argon 是目前對「間接提示注入攻擊」防禦力最強的模型。
- 監控未對齊行為:即時監控 Argon 的思維鏈與行動,必要時直接中止;監控結果刻意不回饋到訓練中,避免模型學會規避監控。Google 也呼籲業界保持模型推理過程的透明度。
- 強化沙盒:高風險的訓練或評估開始前,先將沙盒環境隔離並封鎖,並承諾與合作夥伴分享代理程式安全的最佳實務。
MAQ 的觀察
- 前沿模型開始「先評估、再開放」。Argon 先給資安防禦專家,再給付費 API 與 Ultra 訂閱者,並在發布前開放政府單位評估。這和本週 Google 等公司簽署的〈白宮超級智慧協議〉強調的內部管控與外部稽核方向一致;最強的 AI(SI)模型,短期內會以分階段、有條件的方式開放。
- 長任務讓 token 成本變成預算項目。100 萬 token 的輸出上限,代表單一任務可能產生數十萬個輸出 token。以優惠期後每百萬輸出 token 20 美元計算,一次產出 50 萬 token 的任務,光輸出就約 10 美元。企業導入代理式工作流程前,宜先估算每月任務量與 token 用量。
- 雲端前沿模型與地端執行環境並用。Argon 的內部案例,都是代理程式在大型程式碼庫與系統數據上長時間作業。需要存取內部程式碼、測試環境與機密資料的工作,企業通常會在自己的主機上建置執行與測試環境,搭配本地模型處理不能離開公司的資料,再視任務需要呼叫雲端前沿模型。
資料來源:Google 台灣官方部落格〈Gemini 4 Argon:邁向先進智慧的下一個時代〉(Koray Kavukcuoglu,2026 年 10 月 1 日),含文末價格註腳;2026 年 10 月 2 日查詢。主視覺圖片來源:Google。Gemini、Google 為 Google LLC 的商標,其他產品名稱為各所有者之商標。