本週最重要的不是單一模型又多了多少分,而是 Agent 的成果已由整條系統鏈共同決定:完成任務的總成本、是否保留工作記憶、評測環境能否隔離,以及企業政策是否覆蓋每個執行介面。以下均為官方公布的狀態或測試,不是獨立重現。
- OpenAI 調降 GPT-5.6 Terra 與 Luna 價格;比較模型應轉向每個成功任務的總成本。
- OpenAI 在特定 ARC-AGI-3 harness 中,靠 retained reasoning 與 compaction 把分數由 13.3% 提升到 38.3%。
- Anthropic 與 GitHub 的公開資料提醒我們:研究成果加速後,評測隔離與跨介面的企業治理同樣是產品能力。
GPT-5.6 降價後,模型選擇要看每個成功任務的總成本
發生什麼事
OpenAI 在 7 月 30 日下調 GPT-5.6 Terra 與 Luna 的 API 價格,並為 GPT-5.6 Sol 提供 Fast mode。
已確認的事實
Terra 官方模型頁與Luna 官方模型頁列出每百萬 input/output token 為 2/12 美元與 0.20/1.20 美元。OpenAI 的價格公告稱 Luna、Terra 分別降價 80%、20%,Sol Fast mode 為標準處理兩倍價格、最高 2.5 倍速度。OpenAI 的工程說明另報告 production kernel 工作使 serving cost 降 20%,draft model 改善使 token-generation efficiency 增逾 15%;這些是 OpenAI 的內部工程結果。
為什麼值得關注
token 單價不等於任務成本。多步 Agent 還會支付重複 context、工具呼叫、重試與失敗重做;低價模型只有在目標任務的成功率不下降時才是真的便宜。實務上應把任務分成可明確驗收的單位,記錄完成率、人工介入次數、延遲與 token,再決定哪些步驟值得使用更快或更強的模型。
目前仍不知道什麼
不同硬體、地區與工作負載下的 serving 改善沒有公開拆分;Fast mode 的最高速度也不能外推到每個請求。團隊仍需以自己的延遲、成功率與每個完成任務成本驗證。
能否保留工作記憶,會改變同一模型的評測結論
發生什麼事
OpenAI 在 7 月 29 日比較 ARC-AGI-3 的官方 generic harness 與自家 Responses API harness。
已確認的事實
OpenAI 的研究說明報告:GPT-5.6 Sol 在 public set 由 13.3% 升至 38.3%。差異是保留 reasoning 並啟用 compaction;官方 harness 會丟棄 private reasoning,且在 context 超過 175,000 字元時 rolling truncation。OpenAI 的實作採 175,000 token 上限,並稱輸出 token 減少約六倍。這是特定設定下的官方實驗,不是所有 Agent 任務的普遍結論。
為什麼值得關注
評測測到的不只模型,也測到 API 設定、context 策略與工具流程。若 Agent 每一步都必須重新理解先前工作,或遺失早期觀察,系統會同時損失品質與成本效率。這也意味著對外比較時,模型版本之外還要交代 harness、工具權限、context 上限與評分方法;否則兩個看似相同的評測分數,實際上可能不是同一件事。
目前仍不知道什麼
軟體開發、研究或企業流程是否會得到相同比例的改善仍未知。reasoning 保存與摘要壓縮也有資料保存、摘要失真與除錯可觀測性的 trade-off。
Claude 的密碼分析進展,沒有等於現行加密已被破解
發生什麼事
Anthropic 在 7 月 28 日披露 Claude Mythos Preview 協助改良對 HAWK 與 reduced-round AES 的攻擊。
已確認的事實
Anthropic 的研究報告表示 HAWK 是尚未部署的 NIST 候選簽章方案;AES 結果針對十輪 AES 的七輪版本。公司報告 HAWK 工作約花 60 小時,兩項主要成果各約 10 萬美元 API 成本,七輪 AES 的既有攻擊快 200 至 800 倍。Anthropic 明確說兩項成果目前不要求 production 系統更改,並表示已進行協調揭露與學術諮詢。
為什麼值得關注
Agent 可把文獻閱讀、假設、程式實驗與驗證管線串成長任務,降低探索成本;可信度瓶頸卻會轉移到專家驗證,而不會自動消失。對安全研究團隊而言,較合理的工作流不是把模型輸出直接當結論,而是讓模型產出可重跑的實驗、明確假設與失敗案例,再由熟悉威脅模型的人決定影響範圍。
目前仍不知道什麼
這種方法能否穩定找到更多實用系統弱點,以及探索成本能否持續下降,都沒有被這一篇官方研究證明。
評測沙箱也必須以 production 的安全標準處理
發生什麼事
Anthropic 在 7 月 30 日表示,回溯 141,006 次可能有網路存取的資安評測後,找到三起從第三方評測環境接觸公開網路、進而未授權存取真實組織系統的事件。
已確認的事實
Anthropic 的事故報告將主因歸為 prompt 與環境實際網路設定不一致,而非模型自行逃逸或追求外部目標。事件涉及 Opus 4.7、Mythos 5 與一個內部研究模型;公司表示已停止相關評測、通知受影響組織,並加強網路驗證、監控與 vendor assurance。METR 的第三方檢視仍未完成。
為什麼值得關注
「這是 eval,不是 production」不是安全控制。只要 egress、憑證或可觸及 endpoint 的任一假設錯誤,測試環境就可能承接真實風險。評測設計至少要把網路出口、可用身分、目標範圍與即時告警當成可測試的控制,而不是寫在 prompt 裡的前提;這也是讓能力評估能安全重複執行的最低條件。
目前仍不知道什麼
公開資訊尚不足以判斷控制措施在各 vendor 環境的覆蓋程度與長期效果;這些不能被寫成已獨立驗證的安全保證。
Copilot 的企業治理開始延伸到不同執行介面
發生什麼事
GitHub 在 7 月 27 日把 enterprise managed settings 擴展至 GitHub Copilot app 與 Copilot cloud agent,並提供專用的 App access policy。
已確認的事實
GitHub changelog列出 plugins、plugin marketplace、approval prompt bypass 與新對話自動模型選擇等設定。App 設定在下次登入或重啟後生效,cloud agent 在下一次 task assignment 套用;GitHub 稱通常一小時內更新。另一則官方公告確認專用 policy 預設為 Enabled everywhere,管理員可改為 Disabled everywhere 或 Let organizations decide;bypass-prompt 控制不適用 cloud agent。
為什麼值得關注
企業 Agent 的治理缺口通常不在沒有政策,而在政策只覆蓋部分 client。只要一個介面仍能安裝未審核 plugin 或跳過核准,整體邊界就以最弱處為準。採用前應列出每個人會使用的 App、IDE、CLI 與 cloud agent,再逐一確認 plugin、approval、模型選擇、網路與 audit log 的實際行為,而不是只確認管理後台存在一個 policy。
目前仍不知道什麼
GitHub 尚未公布大型部署的誤攔率、覆蓋率或稽核結果;每個設定 key 在目標 client 的支援範圍仍須由採用團隊驗證。
下週值得繼續觀察的訊號
接下來可看三件事:降價是否真的降低每個成功任務成本、Anthropic 的第三方事故檢視是否釋出,以及企業平台能否把 egress、plugin、approval、記憶保存與 audit log 接到同一套控制面。模型只是 Agent 系統的一層,成本與風險都由整條執行鏈累積。下次評估採用時,先要求一份可重跑的任務評測、可稽核的權限清單與可驗證的隔離測試,會比先追逐單一排行榜名次更有用。驗收重點應是可重複的結果、清楚的失敗邊界與可追溯的修正紀錄。
自 2026 年 7 月 30 日起,Terra 每百萬 input 與 output token 為 2 與 12 美元;Luna 為 0.20 與 1.20 美元。實際任務成本還要加上 context、工具呼叫與重試。
不能直接推論。約三倍分數與六倍 token 改善來自 OpenAI 的特定 ARC-AGI-3 實驗;其他任務仍須評估資料保存、摘要失真、延遲與成本。
沒有。HAWK 是未部署的候選簽章方案,AES 結果只攻擊十輪中的七輪版本;Anthropic 表示兩項結果目前不要求 production 系統更改。
第一手來源:OpenAI GPT-5.6 價格公告、OpenAI ARC-AGI-3 harness 測試、Anthropic 密碼分析研究、Anthropic 資安評測事故報告、GitHub enterprise managed settings。