AI 每日新聞 — 2026 年 10 月 9 日

AI 每日新聞 — 2026 年 10 月 9 日

過去 24 小時 AI 領域重要動態整理:共 12 條,分為模型與產品、Agent/框架、研究與論文、產業與政策四類。每條皆整理歸納過,並附「為什麼重要」。

⚡ 快速總覽

今日三條主線(如圖一):

  1. 「為工作而生的 agent」進入多模型時代。Google Cloud 的 Gemini agent 可跨 Gemini 與 Claude 調度任務,還能建立有獨立信箱的「同事 agent」;OpenAI Codex 支援即時轉向進行中的任務;ElevenLabs 為語音 agent 加上合併提案機制。企業軟體的基本單位正在變成 agent——而且 agent 開始跨模型運作。
  2. 基建資金機器愈轉愈快。Gartner 預估 2026 年全球 AI 支出達 2.59 兆美元(年增 47%),其中基建佔 1.43 兆;Broadcom 傳正為 OpenAI 與 Anthropic 籌組逾 1100 億美元的晶片融資;川普宣布科技巨頭為 Genesis 計畫承諾 24 億美元算力。問題已從「誰買晶片」變成「誰來融資晶片變現前的漫長歲月」。
  3. 治理開始追趕 agent。澳洲提出系統導向的前沿 AI 監管(2027 年立法)、印度一個月內提出 AI 監管諮詢文件、英國 ICO 就 agentic AI 與資料保護徵求證據;同時一項新研究發現,寫程式 agent 自己寫測試對修 bug 幾乎沒幫助——自主性行銷的現實檢驗。

📦 模型與產品

1. ServiceNow 十月模型陣容大換血:Gemma 4 26B-A4B 加入,Gemini 2.5 與 Claude Sonnet 4.5 退役

ServiceNow 十月更新把 Google 的 Gemma 4 26B-A4B 納入 Now LLM Service,同時退役 Gemini 2.5 Pro/Flash/Flash-Lite 與 Claude Sonnet 4.5(分別由 Gemini 3.5 Flash 與 Claude Sonnet 4.6 接替);自家 V2 模型不再用於新開發。

為什麼重要:企業級模型汰換已成常態。鎖定的模型版本保鮮期愈來愈短,而 ServiceNow 這類治理平台正是多數開發者最先感受到汰換衝擊的地方——技能與 agent 需要遷移計畫,不只是一組 prompt。

來源:ServiceNow 文件

🤖 Agent/框架

2. Google Cloud 推出「Gemini 工作 agent」

Google Cloud 發表單一工作 AI agent:能規劃工作、呼叫工具、串接企業系統,並把成品交回文件、郵件與開發環境。支援 Google Workspace、Microsoft 365、Slack;依任務挑選最適模型(目前用 Gemini 與 Anthropic 的 Claude),未來會加更多;可建立「同事 agent」——有自己的信箱、只能存取被授權的資訊。金融服務與法務版已預覽中,政府、醫療、零售版即將推出。

為什麼重要:這是第一個明確標榜多模型的大型企業 agent,等於承認沒有一家實驗室的模型能贏下所有任務。同時它為「agent 即同事」模式標了價:身分、信箱、權限範圍——這正是 agentic AI 治理的形狀。

來源:Reuters

3. ElevenLabs ElevenAgents:合併提案+預設語音模型換代

ElevenLabs 為 ElevenAgents 推出合併提案(alpha):語音 agent 的設定也能走 pull-request 式審查流程,附 8 個新 API 端點;儲存/發布時自動編譯驗證。agents API 預設語音模型從 eleven_flash_v2 換成 eleven_v4_turbo,LLM 選項新增 gpt-6.1-sol、claude-sonnet-5-5 等。

為什麼重要:語音 agent 開始有生產級工具鏈:設定審查、類 CI 驗證、部署歷史。預設模型更換也是提醒:「最新」模型會默默改變 agent 的行為與延遲,除非你鎖定版本。

來源:my2cents.ai

4. OpenAI Codex:進行中的任務可即時轉向

OpenAI 讓 Codex 使用者能即時重定向正在執行的任務,不必等它跑完——agent 使用體驗的持續打磨之一。

為什麼重要:即時轉向是一種控制原語,不是小功能。當 agent 開始連跑數小時(Google 的新 agent 主打多日連跑),中斷與轉向就是安全煞車。

來源:RuntimeWire 每日回顧

5. Mysten Labs × Google Cloud:發表「可驗證 Agent 仲裁者」

Mysten Labs 與 Google Cloud 合作發表 Verifiable Agent Arbiter,目標是讓 agent 的決策可稽核、可驗證。

為什麼重要:可驗證性是 agent 故事缺的那一半:自主很容易,證明 agent 做了什麼、為什麼這樣做很難。如果 agent 仲裁變成一種服務,企業信任委外工作的方式可能就此定型。

來源:HPCwire AIwire

🔬 研究與論文

6. 研究:寫程式 agent 自己寫測試,對修 bug 幾乎沒幫助

新加坡管理大學、上海交通大學與 ByteDance 的研究團隊,在 SWE-bench Verified(500 個真實 GitHub bug)上系統性測試自主寫程式 agent。結果:agent 寫了多少測試,與能否修好 bug 沒有統計顯著關係——GPT-5.2 只在 0.6% 的任務中寫了新測試,修復率卻達 71.8%。論文題為 "Rethinking the Value of Agent-Generated Tests for LLM-Based Software Engineering Agents"。

為什麼重要:「自己寫測試、自我驗證」是 agentic 寫程式工具的核心賣點之一,但 agent 多半只是用測試偷看變數值,並沒有真正檢查自己的工作。如果你是衝著自我驗證買單,這個數字值得坐下來想一想。

來源:Startup Fortune

7. Tensor Machines 開源「AI 算力真實成本」基準測試

Tensor Machines 發表開源 AI 硬體基準測試,衡量的是產出「有用 AI」(符合工作負載服務要求的 token)所需的能源與成本,而非原始 GPU 規格或每小時租金。在 NVIDIA GPU 上的初期測試發現:同一款 GPU 的輸出可差近 15% 的每秒 token 數;同樣的每小時價格,換算成每 token 成本就差了 15%。10 月 8 日在 NeoCloud Summit 發表。

為什麼重要:當逾 1100 億美元融資湧入 AI 硬體(見下文),「每有用 token 成本」才是營運者真正編預算的數字。FLOPS 是規格,有用輸出才是生意。

來源:HPCwire · Optical Connections News

8. AI 設計的蛋白質黏合劑,迎接 CAR T 細胞療法的真實考驗

公開競賽 "Bits to Binders" 把 AI 設計的迷你黏合劑(minibinder)拿去當 CAR T 細胞療法的功能性辨識結構做基準測試,發表於《Molecular Systems Biology》——用計算設計的蛋白質,直面病人治療現場的檢驗。

為什麼重要:這是 AI 蛋白質設計最難的一場考試:考的不是實驗室裡的結合親和力,而是活體免疫療法中的實際功能。這個領域終於要被成果打分,而不是 demo。

來源:Bioengineer.org

🏭 產業與政策

9. 川普宣布 24 億美元算力承諾,挺 Genesis 計畫;再推「超級智慧」改名

川普宣布科技巨頭承諾 24 億美元算力——Nvidia 10 億、AMD 5 億、OpenAI 2 億、Anthropic 與 Google 各 1.5 億——把 Genesis 計畫(用 AI 加速聯邦科學研究)推進到能源、衛生、太空等 14 個機構。他同時加碼把 AI 改名為「超級智慧」,稱這是「廣受接受」、更準確的說法。

為什麼重要:聯邦 AI 正在變成公私合營的算力池,而不只是一筆補助。而改名這件事對政策語言有實質影響:立法者怎麼稱呼它,會形塑他們怎麼管它。

來源:NY Post

10. Gartner:2026 年全球 AI 支出達 2.59 兆美元,年增 47%

Gartner 預估 2026 年全球 AI 支出 2.59 兆美元(2025 年為 1.76 兆),2027 年上看 3.49 兆。其中 AI 基建是最大宗:今年 1.43 兆,佔總額 45% 以上,由超大規模雲端商的資料中心擴建與晶片需求帶動。分析師 John-David Lovelock 稱「2026 將是轉折之年」(如圖二)。

為什麼重要:數字不斷長大,因為替代方案——在算力競賽中落敗——代價更高。但真正的故事是集中度:少數平台一年砸逾千億美元,懸念在於供應鏈的哪一段能吃下利潤。

來源:Morningstar/PRNewswire

11. Broadcom 晶片融資網傳逾 1100 億美元

據《華爾街日報》與彭博報導:Broadcom 正為 OpenAI 客製晶片籌組逾 500 億美元融資(Apollo、Blackstone 參與初期洽談),另有 600 億美元方案給 Anthropic 及其他客戶(420 億美元優先擔保+180 億美元次順位,後者由 Blackstone 主導)。Anthropic 的 IPO 文件據報顯示 Broadcom 已同意提供最高 420 億美元貸款,與 TPU 租賃承諾掛鉤。另據報導,Oracle 與 SpaceX 也在洽談數十億美元級的 AI 硬體融資。

為什麼重要:債務融資已從資料中心擴散到晶片與伺服器本身。經濟學的核心問題很硬:昂貴的硬體裝機、供電、變現之前的漫長歲月,這段財務風險由誰來扛?

來源:Hokanews · Stocktwits · Blockster

12. 同一天,三國政府出手管 AI

  • 澳洲(10/8):助理部長 Andrew Charlton 提出前沿 AI 的系統導向監管——企業必須運行嚴格的風險管理流程,像航空或銀行監理那樣接受稽核;國家 AI 標準 2026 年底前出爐,2027 年立法。
  • 印度(10/8):部長 Ashwini Vaishnaw 表示 MeitY 一個月內將發布 AI 監管諮詢文件,聚焦安全、深偽與「科技+法律」雙軌模式,產業承擔主要責任。
  • 英國(10/8):ICO 就資料保護法如何適用於 agentic AI 展開徵求證據(至 11/20)。

為什麼重要:同一天落地三種模式:稽核流程(澳洲)、先諮詢後立法(印度)、把 agent 塞進現有隱私法(英國)。對全球出貨 agent 的人來說,合規版圖剛變成三維的。

來源:Streamline Business · Careerindia · Digital Policy Alert

💡 可發展成 Agentic AI 部落格主題

  1. Google 的 Gemini agent 走向多模型:模型無關的 agent 設計。當 agent 自己會在 Gemini 與 Claude 之間選路,「用哪個模型」就從架構決策變成執行期決策。路由、評測、降級備案的深掘,正是 Agentic AI 系列的好題材。
  2. 「Agent 自己寫測試幾乎沒用」——agentic 寫程式評測的迷思破解。SWE-bench 這份研究是現成的鉤子:把自我驗證的行銷話術和真正修好 bug 的因素分開,談 agentic 寫程式到底需要什麼樣的評測紀律。

依過去 24 小時報導整理歸納。數據以來源原文為準,不確定的已標註「據報導」。配圖為作者手繪筆記。

Agent 沙箱與安全:別再指望「跟模型說清楚」

Agent 沙箱與安全:別再指望「跟模型說清楚」

前言:一次成功的攻擊鏈

安全研究員 Johann Rehberger 的 ZombAIs 演示,至今仍是 Agent 安全的標準教材:Claude Computer Use 在一個沒有防護的瀏覽會話中,造訪惡意網頁、讀取隱藏的指令 payload、下載二進位檔並執行、最後連上 C2 伺服器——整個攻擊鏈一次成功。同一時間,OpenAI 與 Anthropic 揭露正在調查數萬起模型行為異常事件(涵蓋未遂測試與內部評估中的 guardrail 觸發,多數未造成實質損害),而 OWASP 在 2025 年 12 月發布了《Top 10 for Agentic Applications 2026》(ASI01–ASI10,逾百位研究者審閱)。

這些事件指向同一個結論:用「跟模型說清楚」來守安全,是行不通的。system prompt 不是安全邊界。

一、新的信任邊界:tool call

傳統 Web 安全打了幾十年注入(injection)、混淆代理人(confused deputy)、權限控管,Agent 把這整套典籍帶到一個全新的地方:agent 的 tool call。

LLM 的基本問題是它在「解釋語言」。同一個 context 裡混著應用程式指令、使用者請求,以及模型被要求檢視的第三方內容。一段惡意文字藏在後者裡,看起來就像另一道指令——這就是 prompt injection,OWASP 把它列為 LLM01,也是 ASI01(Agent Goal Hijack,CWE-94/77)的核心機制。

Greshake 等人在 AISec 2023 的經典工作指出:處理被檢索的 prompt,等同於在 agent 的工具面上執行任意程式碼。他們展示的攻擊手法包括資料竊取(把對話歷史外送到攻擊者 URL)、蠕蟲式擴散、記憶體毒化(persistent memory poisoning),甚至污染共享記憶讓其他 agent 也被感染。2024–2026 年,間接 prompt injection 成了每個生產級 agent 都必須面對的定義性問題。

而傷害的放大器,是 Excessive Agency——它在 OWASP LLM Top 10 2026 年版從第六名升到第三名。道理很直白:注入指令的傷害,等於 agent 手裡握著的權限。一個只能讀文件的 agent 被注入,最多讀錯東西;一個握著廣域 API token、shell 權限、repo 寫入權的 agent 被注入,文字伎倆就變成真實行動。

二、為什麼 Docker 容器不夠:三層隔離光譜

「把 agent 跑在 Docker 裡」是很多人第一個想到的答案,但容器共用 host kernel——對 kernel 級逃逸來說,這是根本性的弱點。實務上業界已經收斂出三層光譜(如圖一):

第一層:強化容器(hardened container) namespace + cgroup + seccomp-BPF + AppArmor/SELinux + 唯讀 root filesystem + no-new-privileges。速度最快、成本最低,適合邊界明確、可重現、可撤銷的確定性任務:HTML 解析、測試跑者、文件轉換、可信 repo 的建置。注意「可信」二字——標準 Docker 容器只留給完全可信的內部工具。

第二層:gVisor / Kata Containers 在容器與 kernel 之間加一道 runtime 邊界:gVisor 用 userspace kernel 攔截 syscall,Kata 則是每個 pod 一個輕量 VM。適合混合信任的 shell 任務、多租戶作業。Modal 的沙箱即採用 gVisor 架構。

第三層:Firecracker microVM 硬體虛擬化為每個 agent 啟動一個獨立的 guest Linux kernel,冷啟動約 125 毫秒。E2B 的 disposable VM、Daytona 的沙箱走的都是這條路線。2026 年初 Docker 也推出了實驗性的 Docker Sandboxes,專門為 AI 隔離設計;Cloudflare、Vercel、Modal 相繼跟進。

選型規則很簡單:任務可限界、可重現、易撤銷 → 用容器;agent 能執行任意程式碼、瀏覽未知網域、或接觸有商業價值的 secret → 用 ephemeral microVM。冷啟動延遲可以用暖池(warm pool)或 snapshot/restore 攤平。

三、確定性層才是保證:安全五件套

2026 年的防禦共識是:確定性政策是保證(the guarantee),分類器只是遙測(telemetry)。模型層的偵測擋不住自適應攻擊——設計時就假設它會被繞過,把 blast radius 縮到最小才是正解。實作上有五件事(如圖二):

1. 沙箱裡不放真憑證。 常見錯誤是把 secret manager 吐出的 10 分鐘臨時 token 當環境變數塞進容器——對被注入的 agent 來說,10 分鐘是永恆,一個 curl 只要 200 毫秒就能把 key 送到外部。正確做法:key 留在雲端 secret 保管處,agent 的出站呼叫走外部 gateway proxy(如 Apigee AI Gateway),以 IAM Workload Identity 認證 agent 身分,只在目的地是核准 URL 時才在出站途中掛上真正的 API key。

2. 所有外部回傳都是不可信輸入。 sandbox 的 stdout、檔案、tool output 回到模型 context 前,要做大小上限、schema 驗證與注入感知處理——tool output 本身就是 prompt injection 向量。應用層也一樣:不要 eval 回傳的「JSON」,不要未經沙箱渲染回傳的 HTML。

3. 思考環境與行動環境分開,處處設硬 timeout。 每個 tool call、每個任務迴圈、每個沙箱生命週期都要有不可繞過的超時。被注入的 agent 最愛做的事之一就是無限迴圈燒資源(Unbounded Consumption)。

4. 出站網路預設拒絕,用 allowlist 放行。 最近的雲端 coding agent 審計發現一個典型盲點:推理時鎖了網際網路,但初始的 npm install / pip install 階段卻全開——惡意套件的安裝腳本在 agent 開始工作前就把資料偷走了。最小可用版本可以直接寫在 HTTP client 包裝層:


import httpx
from urllib.parse import urlparse

ALLOWED = {"api.anthropic.com", "api.openai.com", "internal-api.example.com"}

class PolicyViolationError(Exception):
    pass

class AllowlistedHTTPClient:
    def __init__(self):
        self._client = httpx.AsyncClient(timeout=10.0)
    def _check(self, url):
        host = urlparse(url).hostname or ""
        if not any(host == d or host.endswith("." + d) for d in ALLOWED):
            raise PolicyViolationError(f"blocked: {host}")
    async def get(self, url, **kw):
        self._check(url)
        return await self._client.get(url, **kw)

這是應用層的執行點,補強(而非取代)基礎設施層的 egress 政策。

5. 最小權限+分級人工確認。 登入、付款、發訊息、刪資料——高爆破半徑的工具走人工確認,而且確認 UI 要顯示「要做什麼」而不是一個空洞的「Allow?」。Anthropic 觀察到約 93% 的核准率:疲勞本身就是會被威脅建模的失效模式,所以確認要分級升級(risk-tier escalation),不是每件事都彈窗。

四、看看大廠怎麼做

  • Claude Code:用作業系統層隔離(macOS Seatbelt / Linux bubblewrap),寫入限於工作目錄,零容器開銷。
  • OpenAI Codex:Landlock + seccomp,檔案寫入限 workspace,網路預設關閉。
  • Devin:整台雲端 VM 隔離,關鍵節點加人工檢查閘門。
  • 最小可行沙箱可以濃縮成五個設定:Landlock + seccomp + PR_SET_NO_NEW_PRIVS + 非 root + cgroup——擋在你的 agent 和你的家目錄之間。

結論:把安全寫進架構,而不是寫進 prompt

Agent 安全不是新學科——它是經典安全典籍在「agent 的 tool call」這個新信任邊界上的重逢。會動的控制都是無聊但有效的老朋友:最小權限、中介存取、強身分、可稽核的軌跡。行不通的,恰恰是團隊最常做的那件事:試圖用「跟模型說清楚」來治理 agent。

下次部署 agent 前,先回答一個問題:如果這隻 agent 此刻已經被注入,它能造成的最大傷害是什麼? 把答案縮到你能接受的大小,沙箱才算設好了。

參考來源

Uploaded Image Uploaded Image

AI 每日新聞 — 2026 年 10 月 8 日

AI 每日新聞 — 2026 年 10 月 8 日

三分鐘總覽

今日 AI 新聞可歸納為三條主線(如圖一):

  1. Agent 話語權之爭升級。Amazon 封鎖 AI 購物 agent(Meta 的 Muse 是最新一個),Wikimedia 則指控疑似 OpenAI 的 agent 產生數百萬次請求並進行未經授權的編輯。另一邊,Atlassian 反其道而行:推動治理——MCP 伺服器正式 GA,並發表新的 Agentic Multiplayer Protocol(AMP)。
  2. 前沿智能持續降價、持續開放。Anthropic 發表 Claude Haiku 5.5,主打高頻任務;Mistral 預覽 Large 4、預告十月開放權重;Google 全球推出 SynthID 偵測器,辨識 AI 生成內容。
  3. 基礎設施資本機器全開。Manus 在 Meta 收購案破局後募資逾 5 億美元;據報導 Broadcom 正談判超過 500 億美元融資,為 OpenAI 打造客製晶片;Nvidia 投資的 Upscale AI 發表跨廠商網路平台。

模型與產品

1. Anthropic 發表 Claude Haiku 5.5

Anthropic 發表 Claude Haiku 5.5,定位為更快、更便宜、專為高頻 AI 任務設計的模型。

為什麼重要:前沿模型正在分叉——最強的模型負責困難推理,便宜快速的模型負責 agent 每天數百萬次的例行呼叫。Haiku 5.5 是 Anthropic 押注後者的籌碼。

來源:Gadgets360 · LLM Gateway

2. Google 全球推出 SynthID 偵測器

Google 在全球推出 SynthID 偵測器,可辨識 AI 生成的圖片、影片與音訊。

為什麼重要:偵測正在變成基礎設施,而不只是功能。當浮水印成為主流,內容溯源工具將決定平台信任什麼、使用者相信什麼。

來源:Gadgets360

3. Mistral 預覽 Large 4,預告開放權重

Mistral 公開預覽 Large 4(歐洲訓練的 MoE 模型),承諾十月底前釋出權重。官方自測:DeepSWE 61.7%、CyberGym-E2E 82%,預覽期定價據報為定價的一半。

為什麼重要:歐洲旗艦開放權重路線持續推進。對 agent 開發者來說,又多了一個壓低 API 成本的談判籌碼。

來源:AI News · LLM Stats

Agent/框架

4. Amazon 封鎖 Meta Muse 在其平台購物

Amazon 以「未被告知」為由,封鎖 Meta 的 Muse AI agent 在其網站代為購物。YC 共同創辦人 Paul Graham 評論:「這是我見過自 Amazon 成立以來,新創公司第一次有機會做出 Amazon 的競爭對手。」

為什麼重要:Agent 商務的平台戰爭開打了。Amazon 要交易走自己的 Alexa 購物 agent,其他 agent 都是對其利潤的威脅。誰掌握 agent 的錢包,誰就掌握顧客。

來源:Barron's

5. Wikimedia:疑似 OpenAI agent 產生數百萬次請求、未經授權編輯

Wikimedia 通報,疑似 OpenAI 的 AI agent 產生了數百萬次請求,並進行未經授權的編輯。

為什麼重要:開放知識庫正在變成 agent 的基礎設施——但並未同意。預期更多網站會對 agent 限流、封鎖或收費,這直接影響訓練資料管線與 agent 瀏覽的可靠性。

來源:Gadgets360

6. Atlassian MCP 正式 GA,發表 AMP 協議

在 Team '26 Europe 大會上,Atlassian 宣布重寫的 MCP 伺服器正式 GA(220+ 工具、據稱每日 1500 萬次以上呼叫、自家測試在 Claude 模型上省下 25% token),並發表 Agentic Multiplayer Protocol(AMP)——規範人類與 agent 互動的框架,外加需要人工審核的多步驟任務新模式 Rovo Work。

為什麼重要:企業 agent 技術棧正在快速標準化:MCP 管工具存取,A2A/AMP 管互動模式。Atlassian 押注的是:治理(身分、權限、稽核紀錄)才是真正的產品。

來源:AppStack Insider

研究與論文

7. TasteVal:Claude Opus 5.5 達到專家級實驗搜尋水準

P-Zero Research 的 TasteVal 基準測試顯示,Claude Opus 5.5 在八項實驗性機器學習任務上達到專家參考分數,運算倍率為 2.30。

為什麼重要:這衡量的是 AI 選擇與解讀實驗的效率——自主科研的代理指標。在有限運算預算下達到專家級實驗搜尋,是 AI 加速科學的具體一步。

來源:Ground Truth

8. 研究:LLM 在氣候建議上存在現狀偏誤

滑鐵盧大學研究團隊測試 11 個 LLM、約 55,000 次提問後發現,聊天機器人支持現有氣候政策的頻率約為支持新提案的兩倍。

為什麼重要:模型預設給出「常見答案」而非「正確答案」。對氣候這種需要改變的議題,這種偏誤直接阻礙進展。「對齊」不等於「追求改變」。

來源:Phys.org

產業與政策

9. Manus 在 Meta 收購案破局後募資逾 5 億美元

Manus 母公司 Butterfly Effect 完成逾 5 億美元融資,由博裕資本與 IDG 資本共同領投。此前北京當局要求 Meta 撤銷逾 20 億美元的收購案,公司於八月恢復獨立營運。據 The Information 報導,Manus 年化收入已衝上約 5 億美元。

為什麼重要:今年最戲劇化的 AI 分手案,現在變成融資故事。Manus 賭自己能獨立走下去——投資人則用真金白銀為有實際收入的公司定價,而不只是 demo。

來源:Reuters

10. Nvidia 投資的 Upscale AI 發表 Token Fabric

估值 20 億美元的 Upscale AI 發表 Token Fabric——軟硬體整合的網路平台,讓資料中心可以混用不同廠商的 AI 晶片,無需各自獨立的網路系統。首批預計第四季出貨。

為什麼重要:單一廠商 GPU 叢集的護城河正在被侵蝕。如果客戶能自由混搭 Nvidia、AMD 與客製晶片,定價權將從晶片商轉向掌握互連層的人。

來源:Reuters

11. 據報 Broadcom 為 OpenAI 客製晶片尋求逾 500 億美元融資

華爾街日報報導,Broadcom 可能需要超過 500 億美元融資,為 OpenAI 製造客製 AI 晶片,Apollo 與 Blackstone 據稱為潛在出資方。Oracle 與 SpaceX 據報也在尋求數十億美元的 AI 硬體融資。

為什麼重要:AI 基礎設施現在是用國家級規模在融資。數字不斷變大,因為替代方案——在算力競賽中落敗——代價更高。

來源:Investor's Business Daily · WSJ Pro

12. Anthropic 擴大新創補助:7000 美元額度+4.5 萬美元福利

Anthropic 擴大 Claude Startups 計畫,提供早期新創 7,000 美元 API 額度與 45,000 美元福利。

為什麼重要:模型實驗室正在補貼下一代開發者——額度就是獲客。對新創是免費跑道,對 Anthropic 是押注今天的 hacker 變成明天的企業合約。

來源:Startup Stars

💡 可發展成 Agentic AI 部落格主題

  1. Amazon vs Meta Muse:誰擁有 agent 的錢包?Agent 商務的平台戰爭開打,身分、同意、交易授權等治理問題,正是 agent 框架需要解決的核心。
  2. Atlassian 的 AMP+MCP GA:企業 agent 技術棧正在標準化。深入解析 MCP/A2A/AMP 作為受治理 agent 的協議層,正是 Agentic AI 系列的好題材。

根據過去 24 小時報導整理。配圖為作者手繪筆記(圖一:三大主題;圖二:誰在管 Agent)。

Uploaded Image Uploaded Image

語音 Agent:讓 Agent 開口說話的即時語音實作課

語音 Agent:讓 Agent 開口說話的即時語音實作課

前言:文字 Agent 之後,下一個介面是聲音

Agent 已經會寫程式、會操作電腦,但人類最重要的溝通通道既不是鍵盤也不是螢幕,而是聲音。客服電話、車載助理、醫療問診、語言學習——大量真實工作發生在「講電話」的情境裡。2024 年 OpenAI 發佈 Realtime API、Google 推出 Gemini Live、LiveKit 把 WebRTC 基礎設施加上 Agent 框架,語音 Agent 從研究 demo 走向量產。但真正的門檻不是「讓模型說話」,而是讓對話「像在講電話」:延遲要壓在 1 秒內、使用者可以隨時插話、模型要聽得出語氣。

兩種架構:串接管線 vs 端到端語音模型

如圖一,2026 年的語音 Agent 只有兩種形狀。

串接管線(Cascaded):麥克風 → VAD(語音活動偵測)→ 串流 STT → 端點偵測 → LLM → 串流 TTS → 喇叭。音訊在每個階段邊界都被轉成文字,每一段都是可替換的零件,常常來自不同廠商(STT 用 Deepgram 或 AssemblyAI,TTS 用 Cartesia 或 ElevenLabs,LLM 任意選)。

端到端語音模型(Speech-to-Speech):單一多模態模型直接吃音訊、直接吐音訊,文字只是轉錄副產物。代表作是 OpenAI Realtime API、Google Gemini Live、AWS Nova Sonic,以及開源的 Kyutai Moshi。

權衡很實在:串接的可控性高——每段邊界都有文字,可以換廠商、做 A/B 測試、插入政策檢查、留審計軌跡;代價是韻律和情緒在 STT 轉文字時被弄丟,而且你要自己處理輪次。端到端保留語氣、笑聲和猶豫,延遲結構上更低,但換供應商等於重寫架構,除錯時只能對著黑箱。

2026 年的產業共識值得注意:Vapi、Smallest AI、Decagon、Retell 的工程師在 Latent Space 播客上一致表示,真正上線扛流量的系統幾乎都是串接架構——護欄、可靠度、可解釋性壓過了端到端的優雅。端到端是未來,但生產的現在是串接。

延遲預算:800ms 怎麼花

語音對話的體感延遲有一條硬線:使用者講完到聽到回應,超過約 1 秒就會覺得「卡」。如圖二上半,一個典型串接管線的預算長這樣:STT 約 150ms、LLM 首字約 300ms、TTS 約 200ms、網路與緩衝約 150ms,總計 800ms。

關鍵洞察是:全串流架構下,總延遲趨近於各段的最大值,而不是加總。STT 邊聽邊轉、LLM 邊生成邊把 token 餵給 TTS、TTS 邊合成邊播放——管線重疊起來,瓶頸只剩最慢的那一段(通常是 LLM 的首字時間)。實務上還有三招壓延遲:preemptive generation(使用者還沒講完就先用中間轉錄開始生成,猜錯就丟掉)、串流 STT/TTS 全開、以及把回覆寫短——第一句話越短,首音出現得越快。

實作核心:輪次偵測與打斷

語音工程裡最不性感、也最難的問題是輪次(turn-taking):VAD 只回答「現在有沒有人在說話」,真正的問題是「他講完了,還是只是停頓?」切太快會打斷使用者,切太慢對話像在對講機。LiveKit 的做法是訓練一個語義輪次偵測模型:同時讀聲學訊號和即時轉錄的文字(填充詞、句法完整度),把等待窗口動態調在 0.3 到 2.5 秒之間——比固定靜音閾值自然得多。

另一半是打斷(barge-in),如圖二下半。使用者插話時,正確的反應鏈是:VAD 觸發 → 150ms 內停止 TTS → 清空播放緩衝 → 取消還在生成的 LLM → 把新話語送回 STT。LiveKit Agents、Pipecat 都把這條鏈做成了內建行為。兩個常見坑:第一,誤打斷——偵測到聲音但轉錄回來是空的(咳嗽、背景音),這時要恢復播放而不是丟掉對話;第二,Agent 打斷自己——喇叭的聲音被麥克風收回去,要用回音消除或客戶端降噪解決。

實作要點:LiveKit Agents 最小 session

下面是一個 LiveKit Agents 風格的最小語音 session 骨架(Python 概念碼):


from livekit.agents import Agent, AgentSession

class VoiceAssistant(Agent):
    def __init__(self):
        super().__init__(
            instructions="你是客服助理,回答簡短,一次只講一件事。",
        )

async def entrypoint(ctx):
    session = AgentSession(
        stt="deepgram/nova-3",        # 串流語音轉文字
        llm="openai/gpt-4o-mini",     # 推理+工具呼叫
        tts="cartesia/sonic-3",       # 串流語音合成
        vad="silero",                 # 語音活動偵測
        turn_detection="multilingual",  # 語義輪次偵測,而非固定靜音閾值
    )
    await session.start(room=ctx.room, agent=VoiceAssistant())

# 打斷處理是框架內建的:VAD 觸發 → 停止 TTS → 取消 LLM 生成 → 新話語送回 STT
# 誤打斷(轉錄為空)時自動恢復播放,對話不丟失

落地時的三個實務提醒:第一,傳輸用 WebRTC——LiveKit 的 SFU 就是為低延遲音訊設計的,不要自己拿 WebSocket 從頭刻;第二,電話線路(PSTN)只有 8kHz,端到端的音質優勢在電話上幾乎歸零,這也是串接至今仍是電話場景標準答案的原因;第三,先寫文字版 Agent 再加聲音——工具、政策邏輯、知識庫全部複用,語音只需要自己的輪次處理和評測。

評測與生產考量:成本和安全

語音的評測維度跟文字 Agent 不完全一樣:除了任務成功率,還要量首音延遲(time-to-first-audio)、打斷成功率、誤打斷率、噪音下的 STT 錯誤率。成本結構也不同:串接是可預測的每分鐘計費,端到端多半按 token 計費——而且為了保持上下文,每一輪都要重送累積的音訊歷史,通話越長越貴;兩種路線的每分鐘成本價差可達上百倍,選型時要先算帳。

安全上,聲音帶來新的攻擊面:語音版 prompt injection(用音訊藏指令)、語音偽造冒充身分。實務底線是:重要動作(轉帳、刪資料、對外承諾)永遠不要只靠語音確認,要嘛轉文字二次確認,要嘛留人工審核。

選型決策:何時用哪種

決策規則很直白:需要工具呼叫、結構化擷取、可審計軌跡、或走電話線路——選串接;追求自然度、最低延遲、情感語調、且對話是閒聊型而非交易型——選端到端。框架選型則看團隊:LiveKit Agents 是自己組裝的基礎設施(最大控制權、開源),Pipecat 同類;想快速上線就買 Vapi 這類託管服務。

結論:先讓管線轉起來,再追求自然

語音 Agent 的工程現實是:架構選串接還是端到端只是第一題,真正的功夫在延遲預算、輪次偵測和打斷處理這些「不性感」的細節。2026 年的務實路線是串接管線起手——可觀測、可除錯、可上線;等對話自然度變成瓶頸時,再把特定場景切到端到端。會說話不難,難的是讓人願意一直講下去。

來源

Uploaded Image Uploaded Image

AI 每日新聞 — 2026 年 10 月 7 日

AI 每日新聞 — 2026 年 10 月 7 日

過去約 24 小時 AI 領域重要動態整理。僅供資訊參考,非投資建議。

📰 今日總覽

今天有三條主線(如圖一):

  1. 算力軍備競賽撞上物理現實。《金融時報》報導,SpaceX 正在籌資 400 億美元(100 億銀行貸款+300 億投資級債券)向 Nvidia 買 AI 晶片,年底前要把 AI 算力推到 2GW,而且是「只用 Nvidia 架構」,連軌道資料中心都在規劃。同一場競賽的另一端:孟菲斯市議會對 Colossus/Colossus 2 資料中心的投票吵成一團、延到 10/20,桌上還躺著一份為期 12 個月的資料中心禁令提案(要研究對健康、電力、水資源的衝擊)。資本沒有上限;但社區、電網和地下水開始設上限了。
  2. 數學成為 AI 的新競技場。OpenAI 週二深夜把 722 篇 AI 生成的數學手稿(372 個成果家族、Apache-2.0 授權)倒上 GitHub,自稱解了數百個懸而未決的數學問題——《華爾街日報》報導其中包括剩下五個千禧年難題中的三個相關進展,含黎曼猜想。部分證明已用 Lean 形式化(機器可驗證);OpenAI 自己提醒,未形式化的結果可能有錯。同週,arXiv 推出上傳限額來擋「低價值」投稿。學術驗證體系正在被即時壓力測試。
  3. Agent 從演示畢業,進入營運紀律。OpenAI 的 Codex 團隊啟動 28 天衝刺:每天要給大多數用戶一個「明確的改進」,做不到的日子就全員重置使用額度。Day 1:GPT-6 Astra/6.1 Sol 預設快約 50%;Day 2:Auto-Review 免費。AIBound 則發佈 AgentHarness,把安全策略直接寫進 agent 內部:數百條預建規則,每個動作允許/詢問/拒絕。企業級 agent 的戰場移到治理層。

如圖一:今日三大主線。

🤖 模型與產品

Google 發佈 Nano Banana 2.1(GA):4K 圖像編輯,價格砍半

Google 在 10/6 發佈 Nano Banana 2.1(Nano Banana 2/Gemini 3.1 Flash Image 的升級版),全面 GA:Gemini app、Search 的 AI Mode、Google Ads、AI Studio、Flow、Stitch 都能上。規格:最高 4K 輸出、14 張參考圖多圖融合(4 個人物一致性、10 個物件保真)、Google Search grounding、可調 thinking 等級、C2PA 內容憑證。API 價格砍半:1K 圖 $0.0336(原 $0.067)、4K 圖 $0.0756,批次任務再五折。舊圖像 API 的最早關閉日是 10/29。

為什麼重要:Google 正在把圖像生成也變成「便宜+到處都有」的基礎設施。已在用 Gemini 圖像堆疊的人注意:遷移死線是真的,價格戰則重寫了 AI 原生創意工具的成本帳。

來源:RuntimeWire、The Decoder、AndroidHeadlines、Unite.AI

Musk:Grok Bot 轉多模型路由——哪個強用哪個,連對手也不避諱

Musk 週三上午宣佈,Grok Bot AI 助理未來會「為每個任務選最好的後端模型」,明確點名對手的 API 也在選項裡:Claude Opus 5.5、Midjourney、Suno——「哪個最可能給出最好結果就用哪個」。

為什麼重要:頭部實驗室的發行端親口承認:單一模型路線讓位給路由(routing)。前沿競爭現在是編排問題,不是訓練問題——而 Anthropic 的模型等於在 Musk 帝國裡面悄悄拿下了一筆發行合約。

來源:Investor's Business Daily

產品速覽:印度 Chrome 的 Auto Browse、Word Copilot 終於有引用、企業版 Edge 加 AI 安全瀏覽

Google 在印度的 Chrome 推出 Auto Browse(AI 代辦網頁任務);Microsoft 給 Word 的 Copilot 加了遲到多年的功能——真正的引用來源;Edge for Business 則加入帶職場安全護欄的 AI 瀏覽功能。

為什麼重要:三件小事同一個方向:AI 功能被嵌進人們本來就工作的地方(瀏覽器、Word),企業版賣的是「治理先行」。護城河是發行渠道,不是演示。

來源:Gadgets 360、WinCentral

🛡️ Agent / 框架

OpenAI Codex 團隊:一天一個改進,做不到就全員重置額度

從 10/5 起,Codex 和 ChatGPT Work 團隊進入 28 天衝刺:每天都要交付一個「對大多數用戶是明確改進」的更新,做不到的日子就所有人重置使用額度。Day 1:GPT-6 Astra 和 GPT-6.1 Sol 在訂閱制預設下感覺快約 50%(涵蓋 OpenAI 產品與 Sign in with ChatGPT 合作夥伴如 OpenCode、Pi、Amp、Devin);Day 2:Auto-Review 免費。團隊聚焦四件事:簡化產品、更多可用額度、突破性功能、新模型——背景是 Opus 5.5 推出後,Claude Code 和 Codex 的比較更白熱化。

為什麼重要:這把「品質」變成有公開記分板的營運紀律。每個在出貨 agent 的人可以抄這招:沒用完的額度是最便宜的廣告,而每日交付節奏本身就是競爭武器。

來源:OpenAI Developer Community — Day 1、Day 2、Cointime

AIBound 發佈 AgentHarness:安全策略直接寫在 agent 體內

AIBound(San Mateo)10/6 發佈 AgentHarness:數百條跨越主要風險類別的預建安全規則——惡意 prompt、機密竊取、資料外洩——由 agent 本體在每個動作上原生執行,以白話文策略設定允許/詢問用戶/拒絕,不需要再裝端點代理。

為什麼重要:網關看得到流量、EDR 看得到行程,但兩者都管不到 agent「決定做什麼」。在決策點執法是企業 agent 安全缺的那一層——把權限邊界寫成可執行的策略,而不是寫成 prompt。

來源:EIN Presswire

🔬 研究與論文

OpenAI 倒出 722 篇 AI 生成數學手稿:宣稱攻下數百個未解問題

OpenAI 週二把 722 篇數學手稿(由一個未公開的前沿模型生成)整理成 372 個成果家族、以 Apache-2.0 授權放到 GitHub——據稱是該實驗室至今最完整的「AI 做形式數學研究」揭露。公司宣稱解了數百個長期未解的開放問題,《華爾街日報》報導包括五個剩餘千禧年難題中的三個相關進展,含黎曼猜想;平均每個成果消耗約「三小時的 ChatGPT Pro thinking」算力。許多證明已用 Lean 形式化(機器可驗證);OpenAI 提醒未形式化的結果可能仍有錯誤,會逐步修正。發佈過程諮詢了普林斯頓高等研究院與 9 月底成立的 Advisory Group on Mathematics and AI,後續還會資助研討會。報導中的數學家反應兩極:驚嘆與懷疑並存;同週 arXiv 也推出了上傳限額來擋「低價值」投稿。

為什麼重要:不管每個證明最後是否都成立,瓶頸已經移到了驗證基礎設施——而這正是 agent 彼此協作的縮影:修訂協議、引用規範、形式化檢查、人類審閱流程,正在成為機器生成知識的底層。

如圖二:722 篇手稿的結構與驗證缺口。

來源:BigGo Finance、Wall Street Journal、New Scientist、Gizmodo

🏭 產業與政策

SpaceX 傳籌資 400 億買 Nvidia 晶片;FCC 批准 1.5 萬顆 Starlink 衛星

《金融時報》(週二)報導:SpaceX 正在籌約 100 億美元銀行貸款+300 億美元投資級債券,向 Nvidia 買 AI 晶片;建造地面 AI 資料中心群,未來幾年還要部署軌道資料中心。Musk 先前已說 SpaceX 的 AI 基建只用 Nvidia 架構;公司目標年底前 AI 算力達到 2GW(第二季末是 1.4GW)。另據 PCMag 先報導,FCC 已批准增發 1.5 萬顆新一代 Starlink 衛星(Starlink Mobile 服務)。

為什麼重要:光買晶片就 400 億,把 AI 基建寫成主權級資本配置——問題不再是「AI 是不是泡沫」,而是「誰還坐得上桌」。太空+算力從投影片變成有資金的路線圖。

來源:Investor's Business Daily、Barron's

孟菲斯市議會為 Musk 資料中心吵成一團:投票延到 10/20

約 100 名抗議者湧入孟菲斯市議會——原本要對邊界上的 Colossus 與 Colossus 2 資料中心(SpaceXAI 營運)做最終投票。會議吵成一團,投票延到 10/20。桌上提案:為期 12 個月禁令,先研究資料中心對健康、工程、電力與水資源的衝擊;支持者說是為了研究,反對者警告企業只會轉往別處蓋。

為什麼重要:AI 基建迎來 NIMBY 時刻。每 GW 宣佈的產能都要過地方政治這一關——真正的瓶頸不是矽,是電力和水。10/20 的孟菲斯是全美數十場類似鬥爭的風向球。

來源:New York Post

美國司法部要求員工改稱 AI 為「super intelligence」

路透(10/6)報導:美國司法部發備忘錄,要求員工在多數場合——適當時包括法庭文件——改用 "super intelligence"/"SI" 取代 "artificial intelligence"。源頭是川普的行政命令:認為新稱呼更能反映技術潛力。聯邦官員有 60 天提出正式定義。路透並指出,駭客事件後公眾觀感惡化、對安全的質疑升高。

為什麼重要:改名不等於治理。政府一面抗拒新監管、一面用「能力敘事」重新包裝技術;真正要看的是 60 天後的正式定義——那可能改寫聯邦法規怎麼稱呼這項技術。

來源:Reuters、Analytics Insight

英國接受 44 項醫療 AI 監管改革建議,全面改寫遊戲規則

英國政府 10/6 全盤接受國家醫療 AI 監管委員會的 44 項建議:現代化醫療器材法規、加強上市後監控、對會持續學習的模型引入預定變更控制計畫(PCCP)、版本可追溯、明確責任歸屬。MHRA 將在 2026 年 12 月前發佈草案指引,完整實施路線圖 2027 年春季出爐,由跨體系專案委員會督導。

為什麼重要:醫療 AI 的保證模式從「上市前審一次」轉向全生命週期證據——這正是所有會持續更新的 agentic 系統最終需要的監管框架。PCCP(預先定義模型允許變更的邊界)是值得抄的模板。

來源:TechMarketView、AI Briefing Room

市場速覽:AI 漲勢撞上三重逆風

Barron's(週三):標普 500 週二收歷史新高,但期貨回落——AI 股漲勢同時面對油價走高、債券殖利率上行、美元走強三重逆風,AI 與晶片股出現獲利了結。聯準會 9 月會議紀要今晚稍晚公佈。

為什麼重要:宏觀環境現在是 AI 交易的守門員——算力需求是真的,但融資成本在定價。這是天氣報告,不是泡沫判決。

來源:Barron's


💡 可發展成 Agentic AI 部落格主題:

  1. OpenAI 的 722 篇數學手稿——驗證危機。切入角度:當 agent 開始生產知識,誰來驗證明?Lean 形式化、arXiv 限流、AGMAI 的修訂協議,是 agent 對 agent 問責制的第一份草稿——形式化檢查、引用規範、修正流程,正是多 agent 系統在信任對方輸出之前需要的同款機制。
  2. AIBound AgentHarness——決策點的策略。切入角度:企業 agent 安全缺的那一層。對比執法模型:網關監控 vs agent 內策略(允許/詢問/拒絕)。可直接抄的實作模式:把 agent 的權限邊界寫成可執行策略,而不是寫成 prompt。
Uploaded Image Uploaded Image

Computer Use:當 Agent 不再只呼叫 API,而是直接操作電腦

Computer Use:當 Agent 不再只呼叫 API,而是直接操作電腦

前言:API 覆蓋不到的地方

過去兩年的 Agent 實作幾乎都站在同一個假設上:世界有 API。Function calling 讓模型可以查資料庫、下訂單、發訊息——前提是對方有把功能包裝成乾淨的端點。但現實世界大部分的工作流程並沒有 API:客戶的後台管理系統、老舊的 ERP、銀行網銀、需要人工拖拉的設計軟體。這些軟體的介面只有一種:給人類看的圖形介面(GUI)。

Computer Use 就是把這個限制拿掉的技術路線:Agent 不再透過 API 呼叫功能,而是看螢幕截圖、推理下一步、在像素座標上點滑鼠、打字——用和人類完全一樣的介面操作電腦。2024 年 10 月 Anthropic 率先把 computer use 做成 API 工具,OpenAI 則以 CUA(Computer-Using Agent)模型驅動 Operator(2025 年併入 ChatGPT Agent)。到 2026 年,這條路線已經從 demo 變成可部署的架構選項。

核心機制:截圖→推理→動作的迴路

Computer use 的控制迴路簡單到近乎笨拙,如圖一所示:

  1. 看:執行環境擷取一張螢幕截圖,交給模型;
  2. 想:模型在截圖上做版面解析、OCR、空間推理,決定下一步動作;
  3. 動:模型輸出一個動作——通常是「在像素座標 (x, y) 左鍵點擊」「輸入這段文字」「按 ctrl+S」「往下捲動」;
  4. 執行與回饋:你的程式碼實際執行這個動作(透過 Playwright、VNC、作業系統自動化),再擷取新的截圖回傳;
  5. 重複,直到模型回傳純文字(不再呼叫工具),表示任務完成。

這個架構最關鍵的設計取捨是:模型手上沒有任何語意資訊。沒有 DOM、沒有元素選擇器、沒有無障礙樹的座標。它必須從像素裡「看」出按鈕在哪——這就是所謂的視覺定位(visual grounding),也是整個技術棧裡最難的子問題。好處是通用性:只要看得見的東西都在操作範圍內,瀏覽器、桌面軟體、系統對話框全都通吃。

另一個取捨是每個動作都要一次完整的模型往返。N 個步驟就是 N 次 round trip,截圖還是 token 的大戶(每張截圖動輒上千 token)。這意味著 computer use 的任務天生又貴又慢:單步延遲 2–5 秒是常態,複雜任務的 token 帳單要先做心理準備。

兩大流派的實作:Anthropic 與 OpenAI

Anthropic 的路線是「API 工具」。在 Messages API 裡宣告一個 computer 工具(型別如 computer_20241022,附螢幕解析度參數),模型就能在回覆裡輸出 tool_use 區塊:{"action": "left_click", "coordinate": [640, 400]}。動作集合包含 screenshot、左右鍵點擊、雙擊、拖曳、mouse_move、type、key(支援組合鍵如 ctrl+c)、scroll,新版還加入 zoom、hold_key、wait。官方的三工具架構是:computer(滑鼠鍵盤 GUI 操作)+ bash(持久化 shell session)+ text_editor(結構化檔案編輯)。參考實作把整套跑在 Docker 裡的完整桌面環境,用 VNC 接畫面——環境是你的,你負責沙箱。

OpenAI 的路線是 CUA 模型。CUA(Computer-Using Agent)以 GPT-4o 的視覺能力為基礎加上強化學習訓練,透過 Responses API 的 computer 工具呼叫。實作上有個重要差異:OpenAI 允許一個回合內批次多個動作,而 Anthropic 是嚴格的單動作往返——前者在簡單任務上少走很多 round trip。CUA 當年公佈的基準:OSWorld 38.1%、WebArena 58.1%、WebVoyager 87%。消費端產品 Operator 已在 2025 年 8 月收掉,能力併入 ChatGPT Agent。

安全設計上兩家方向一致,只是落點不同:Anthropic 的文件花了大量篇幅在環境建議——沙箱 VM、域名白名單、不要交出真實憑證、重要動作要求人工確認,並用分類器偵測 prompt injection;OpenAI 的 CUA 則內建 pending_safety_checks,在敏感動作前暫停等確認。

實作要點:最小的 Computer Use 迴路

下面是一個 Anthropic 風格的最小迴路骨架(Python 概念碼):


MAX_STEPS = 40  # 迴圈一定要有上限

def computer_use_loop(user_task, model, env):
    messages = [{"role": "user", "content": user_task}]
    tools = [{"type": "computer_20241022", "name": "computer",
              "display_width_px": 1280, "display_height_px": 800}]
    for _ in range(MAX_STEPS):
        resp = model.messages.create(model="claude-sonnet-4-5",
                                     messages=messages, tools=tools)
        messages.append({"role": "assistant", "content": resp.content})
        tool_calls = [b for b in resp.content if b.type == "tool_use"]
        if not tool_calls:
            return resp.text          # 模型不再呼叫工具=任務完成
        results = []
        for call in tool_calls:
            action = call.input["action"]
            # 座標縮放:截圖傳給模型前通常會降採樣,
            # 模型回傳的座標要按比例放大回真實解析度再執行
            env.execute(scale(call.input))
            shot = env.screenshot()   # 執行動作後立刻擷取新畫面
            results.append({"type": "tool_result",
                            "tool_use_id": call.id,
                            "content": [{"type": "image",
                                         "source": {"type": "base64",
                                                    "media_type": "image/png",
                                                    "data": shot}}]})
        messages.append({"role": "user", "content": results})
    raise RuntimeError("步數耗盡:任務可能卡住或太複雜")

落地時的三個實務提醒:第一,環境隔離是剛需——computer use 會「照著像素能做的事去做」,給它真實桌面等於給它你的全部權限,務必跑在拋棄式 VM 或容器裡;第二,座標縮放別寫錯,截圖降採樣後回傳的座標若沒放大回真實解析度,點擊會系統性偏掉;第三,錯誤是可見的——這個架構的美妙之處是每個規劃錯誤在下一步的截圖裡都看得見,模型通常能自我修正,但你要給它足夠的步數預算和明確的「卡住了就停下來問人」指令。

三條路線怎麼選:Browser Use、ChatGPT Agent、Claude Computer Use

不是所有「操作電腦」的需求都要上 computer use。如圖二,三條路線各有最適位置:

  • 只控瀏覽器、要便宜可控:選 Browser Use 這類開源框架。它讀 DOM 元素並標註,模型看到的是結構化資訊而非純像素,token 成本低、可自託管、模型無關。網站自動化的預設起點。
  • OpenAI 生態、公開網路任務:走 ChatGPT Agent。雲端 VM、爆發半徑小(blast radius 有界)、適合交易型任務;但沒有本機檔案系統存取,複雜多步任務約 30 步後容易漂移。
  • 要操作桌面軟體、超出瀏覽器:只有 Claude Computer Use 做得到。API 工具形式、環境你自己管——自由度最高,出事也是你自己修。

決策規則很直白:先問「任務能不能只用瀏覽器完成?」能,就用 browser 路線;再問「需不需要碰桌面應用或本機檔案?」需要,才上 computer use。Computer use 的通用性是它的賣點,也是它的稅:截圖架構天生又貴又慢,能用結構化介面(API、DOM)解決的任務,永遠不要拿像素去硬幹。

評測:OSWorld 與 2026 年的進展

Computer use 的標準考場是 OSWorld:在真實作業系統環境裡完成數百個跨應用任務。2025 年初 CUA 的 38.1% 還是新聞;到 2026 年,OSWorld-Verified 上的頂尖分數已經翻倍——GPT-5.5 達 78.7%、Anthropic 的 Mythos 達 79.6%,雙雙超過人類專家基線。數字之外更值得注意的是 Anthropic 在保險領域的內部數字達 94%:垂直場景+受控環境,computer use 已經是「週二早上真的在用」的生產力工具,不是 demo。

但基準分數和生產可靠度之間仍有落差,大部分團隊第一次上線都是在這裡摔跤:demo 環境的網站不會改版、不會跳驗證碼、不會有效能抖動,真實世界全都會。評估時記得把「環境漂移」算進成本。

結論:先 API,再 DOM,最後才用眼睛

Computer use 把 Agent 的操作邊界從「有 API 的世界」擴張到「人類看得見的世界」,代價是速度、成本和安全複雜度。2026 年的實務共識是分層策略:有 API 就用 function calling,只有瀏覽器就用 browser agent,非得碰桌面軟體才派出 computer use——並且永遠跑在沙箱裡、重要動作留人工確認。眼睛和手腳是 Agent 最貴的器官,不要拿來做手做得到的事。

來源

Uploaded Image Uploaded Image

Agentic RAG:讓 Agent 自己決定「怎麼搜」的實作課

Agentic RAG:讓 Agent 自己決定「怎麼搜」的實作課

前言:一次檢索為什麼不夠

2023 年的 RAG 是條單行道:把使用者的問題丟進向量資料庫,取回 top-k 段落,塞進 prompt,生成答案。流程簡單,但有三種問題會讓它默默失敗:

  1. 多跳問題(multi-hop):答案散在多份文件裡,一次向量查詢永遠湊不齊證據;
  2. 含糊提問:使用者寫的文字和語料庫的措辭差太多,直接搜尋的召回率慘淡;
  3. 靜默壞檢索:取回的段落看似相關實則無用,模型照樣拿它來生成——幻覺就是這樣長出來的。

Agentic RAG 的答案,是把「檢索」從管線裡的一個固定步驟,變成 Agent 手上的一支工具:Agent 可以在一輪對話裡呼叫檢索 0 到 N 次、改寫查詢、切換資料源、對草稿做事實查核,證據不夠就回去再搜。代價是更多 token、更高延遲,換來的是多跳與含糊問題上更高的答案可信度(faithfulness)。

核心觀念:檢索是一個決策,不是一個步驟

經典 RAG 的控制流是線性的 DAG:input → retrieve → generate。Agentic RAG 則是帶迴路的狀態圖:檢索完先「打分數」,分數好才生成,生成完再做「事實查核」,沒通過就重寫查詢回去再搜。如圖一所示,左側是經典單行道,右側是 Agent 主導的檢索迴路。這種循環拓樸,正是 LangGraph 這類框架存在的理由——線性的 chain 表達不了「條件式重試」。

三種成名模式:Self-RAG、CRAG、Adaptive RAG

研究與實務沉澱出三種可以直接套用的模式(架構對比如圖二):

  • Self-RAG(Asai et al., 2023):讓模型自己輸出反思標記(reflection tokens)——該不該檢索?取回的段落相不相關?生成的答案有沒有被證據支持?這種自我批判迴路大幅降低幻覺,特別適合法律、醫療、金融等受監管場景。
  • CRAG(Corrective RAG, Yan et al., 2024):檢索後加一個獨立的「文件評分員」,逐份評估取回文件的品質;證據太弱就換路徑——例如改走網路搜尋,而不是死守向量資料庫。實務上常和知識圖譜查詢混搭。
  • Adaptive RAG:在管線最前面放一個便宜的查詢分類器,按難度分流:簡單事實題直接跳過檢索或只做一次單跳搜尋,複雜多步問題才進完整的 agent 迴路。生產環境裡 60–70% 的查詢是簡單題,這一步是省成本的關鍵。

2026 生產級堆疊:五個積木

實務上,一個 agentic RAG 系統通常組合 3–4 個子模式,很少五個全上:

  1. Query rewrite / decomposition:使用者的原話很少是檢索器想要的查詢;先改寫成檢索友善的形式,多跳問題再拆成子問題各自檢索;
  2. Hybrid retrieval:BM25(關鍵字)+向量(語意)並行,用 RRF(Reciprocal Rank Fusion)融合。純向量檢索在生產環境據稱有約四成失敗率,混合檢索能補回大半差距——BM25 擅長稀有詞、程式識別符、精確名稱,向量擅長改寫與概念匹配;
  3. Reranker:用 cross-encoder 對候選段落逐一重打分,貴但槓桿率高,是實務上 precision 提升最多的單一步驟;
  4. Iterative / multi-hop retrieval:Agent 讀完結果再搜,直到證據足夠——迴圈一定要設上限;
  5. Self-check(faithfulness judge):對草稿做 groundedness 檢查,發現無證據支撐的主張就退回重搜。

索引端也不能偷懶:Contextual Retrieval

檢索迴路再聰明,也救不了切壞的 chunk。Anthropic 的 Contextual Retrieval 指出:chunk 被切離原文後會失去上下文(例如「費用可免」到底指哪一種帳戶?),做法是在索引時用 LLM 為每個 chunk 寫一段定位說明、再一起做 embedding。他們自家的評估顯示:只加上下文,top-20 檢索失敗率降 35%(5.7% → 3.7%);加上 Contextual BM25 降 49%(→ 2.9%);再加 rerank 降 67%(→ 1.9%)。索引端的功夫和運行時的 agent 迴路是乘法關係。

實作要點:一個最小的修正迴路

下面是一個 CRAG 風格的最小骨架(Python 概念碼):grader 先打分,證據不足就改寫查詢、必要時切換資料源,最多重試兩次:

MAX_RETRIES = 2

def agentic_retrieve(question, retriever, web_search, grader, rewriter):
    query, retries = question, 0
    while True:
        docs = retriever.search(query)          # 混合檢索 + rerank
        kept = [d for d in docs if grader.is_relevant(question, d)]
        if kept or retries >= MAX_RETRIES:
            return kept or web_search(query)    # 兜底:換資料源
        query = rewriter.rewrite(question, docs)  # 改寫後再搜
        retries += 1

落地時的三個實務提醒:第一,迴圈一定要有上限與「證據充分就停」的停止條件,否則 token 帳單會失控;第二,簡單查詢走 Adaptive 分流,不要讓 80% 的簡單題去付深層管線的延遲;第三,用 LangGraph 的 checkpointing 把每一步留痕——可追蹤、可暫停、可重播,這是合規與除錯的剛需。

評測:沒有 eval 的 RAG 都是 demo

上線前至少鎖三個指標:faithfulness(答案是否被證據支持,目標 ≥ 0.9)、context precision(取回段落的精準度,≥ 0.8)、answer relevancy(≥ 0.85)。RAGAS 這類自動化評測框架可以直接跑進 CI;再配上 Arize Phoenix 或 Langfuse 做線上可觀測性,追蹤每一次檢索迴路的停止原因(證據足夠/重試耗盡/分類器分流),才知道迴路到底有沒有在做事。

結論:什麼時候該讓 Agent 自己搜

三個訊號出現任一個,就值得從經典 RAG 升級到 agentic RAG:問題是多跳的、提問是含糊的、正確率比延遲重要(法務、醫療、合規場景)。反之,高流量的 FAQ、單文件查詢,經典單次 RAG 更快更便宜,agentic 的開銷純屬浪費。記住 2026 年的共識:純向量檢索是架構失誤,混合檢索+rerank 是底線;agent 迴路則是把「搜尋品質」從索引工程問題,變成「運行時決策問題」——讓模型自己決定怎麼搜、搜幾次、何時停。

來源

Uploaded Image Uploaded Image