Computer Use:當 Agent 不再只呼叫 API,而是直接操作電腦

Computer Use:當 Agent 不再只呼叫 API,而是直接操作電腦

前言:API 覆蓋不到的地方

過去兩年的 Agent 實作幾乎都站在同一個假設上:世界有 API。Function calling 讓模型可以查資料庫、下訂單、發訊息——前提是對方有把功能包裝成乾淨的端點。但現實世界大部分的工作流程並沒有 API:客戶的後台管理系統、老舊的 ERP、銀行網銀、需要人工拖拉的設計軟體。這些軟體的介面只有一種:給人類看的圖形介面(GUI)。

Computer Use 就是把這個限制拿掉的技術路線:Agent 不再透過 API 呼叫功能,而是看螢幕截圖、推理下一步、在像素座標上點滑鼠、打字——用和人類完全一樣的介面操作電腦。2024 年 10 月 Anthropic 率先把 computer use 做成 API 工具,OpenAI 則以 CUA(Computer-Using Agent)模型驅動 Operator(2025 年併入 ChatGPT Agent)。到 2026 年,這條路線已經從 demo 變成可部署的架構選項。

核心機制:截圖→推理→動作的迴路

Computer use 的控制迴路簡單到近乎笨拙,如圖一所示:

  1. 看:執行環境擷取一張螢幕截圖,交給模型;
  2. 想:模型在截圖上做版面解析、OCR、空間推理,決定下一步動作;
  3. 動:模型輸出一個動作——通常是「在像素座標 (x, y) 左鍵點擊」「輸入這段文字」「按 ctrl+S」「往下捲動」;
  4. 執行與回饋:你的程式碼實際執行這個動作(透過 Playwright、VNC、作業系統自動化),再擷取新的截圖回傳;
  5. 重複,直到模型回傳純文字(不再呼叫工具),表示任務完成。

這個架構最關鍵的設計取捨是:模型手上沒有任何語意資訊。沒有 DOM、沒有元素選擇器、沒有無障礙樹的座標。它必須從像素裡「看」出按鈕在哪——這就是所謂的視覺定位(visual grounding),也是整個技術棧裡最難的子問題。好處是通用性:只要看得見的東西都在操作範圍內,瀏覽器、桌面軟體、系統對話框全都通吃。

另一個取捨是每個動作都要一次完整的模型往返。N 個步驟就是 N 次 round trip,截圖還是 token 的大戶(每張截圖動輒上千 token)。這意味著 computer use 的任務天生又貴又慢:單步延遲 2–5 秒是常態,複雜任務的 token 帳單要先做心理準備。

兩大流派的實作:Anthropic 與 OpenAI

Anthropic 的路線是「API 工具」。在 Messages API 裡宣告一個 computer 工具(型別如 computer_20241022,附螢幕解析度參數),模型就能在回覆裡輸出 tool_use 區塊:{"action": "left_click", "coordinate": [640, 400]}。動作集合包含 screenshot、左右鍵點擊、雙擊、拖曳、mouse_move、type、key(支援組合鍵如 ctrl+c)、scroll,新版還加入 zoom、hold_key、wait。官方的三工具架構是:computer(滑鼠鍵盤 GUI 操作)+ bash(持久化 shell session)+ text_editor(結構化檔案編輯)。參考實作把整套跑在 Docker 裡的完整桌面環境,用 VNC 接畫面——環境是你的,你負責沙箱。

OpenAI 的路線是 CUA 模型。CUA(Computer-Using Agent)以 GPT-4o 的視覺能力為基礎加上強化學習訓練,透過 Responses API 的 computer 工具呼叫。實作上有個重要差異:OpenAI 允許一個回合內批次多個動作,而 Anthropic 是嚴格的單動作往返——前者在簡單任務上少走很多 round trip。CUA 當年公佈的基準:OSWorld 38.1%、WebArena 58.1%、WebVoyager 87%。消費端產品 Operator 已在 2025 年 8 月收掉,能力併入 ChatGPT Agent。

安全設計上兩家方向一致,只是落點不同:Anthropic 的文件花了大量篇幅在環境建議——沙箱 VM、域名白名單、不要交出真實憑證、重要動作要求人工確認,並用分類器偵測 prompt injection;OpenAI 的 CUA 則內建 pending_safety_checks,在敏感動作前暫停等確認。

實作要點:最小的 Computer Use 迴路

下面是一個 Anthropic 風格的最小迴路骨架(Python 概念碼):


MAX_STEPS = 40  # 迴圈一定要有上限

def computer_use_loop(user_task, model, env):
    messages = [{"role": "user", "content": user_task}]
    tools = [{"type": "computer_20241022", "name": "computer",
              "display_width_px": 1280, "display_height_px": 800}]
    for _ in range(MAX_STEPS):
        resp = model.messages.create(model="claude-sonnet-4-5",
                                     messages=messages, tools=tools)
        messages.append({"role": "assistant", "content": resp.content})
        tool_calls = [b for b in resp.content if b.type == "tool_use"]
        if not tool_calls:
            return resp.text          # 模型不再呼叫工具=任務完成
        results = []
        for call in tool_calls:
            action = call.input["action"]
            # 座標縮放:截圖傳給模型前通常會降採樣,
            # 模型回傳的座標要按比例放大回真實解析度再執行
            env.execute(scale(call.input))
            shot = env.screenshot()   # 執行動作後立刻擷取新畫面
            results.append({"type": "tool_result",
                            "tool_use_id": call.id,
                            "content": [{"type": "image",
                                         "source": {"type": "base64",
                                                    "media_type": "image/png",
                                                    "data": shot}}]})
        messages.append({"role": "user", "content": results})
    raise RuntimeError("步數耗盡:任務可能卡住或太複雜")

落地時的三個實務提醒:第一,環境隔離是剛需——computer use 會「照著像素能做的事去做」,給它真實桌面等於給它你的全部權限,務必跑在拋棄式 VM 或容器裡;第二,座標縮放別寫錯,截圖降採樣後回傳的座標若沒放大回真實解析度,點擊會系統性偏掉;第三,錯誤是可見的——這個架構的美妙之處是每個規劃錯誤在下一步的截圖裡都看得見,模型通常能自我修正,但你要給它足夠的步數預算和明確的「卡住了就停下來問人」指令。

三條路線怎麼選:Browser Use、ChatGPT Agent、Claude Computer Use

不是所有「操作電腦」的需求都要上 computer use。如圖二,三條路線各有最適位置:

  • 只控瀏覽器、要便宜可控:選 Browser Use 這類開源框架。它讀 DOM 元素並標註,模型看到的是結構化資訊而非純像素,token 成本低、可自託管、模型無關。網站自動化的預設起點。
  • OpenAI 生態、公開網路任務:走 ChatGPT Agent。雲端 VM、爆發半徑小(blast radius 有界)、適合交易型任務;但沒有本機檔案系統存取,複雜多步任務約 30 步後容易漂移。
  • 要操作桌面軟體、超出瀏覽器:只有 Claude Computer Use 做得到。API 工具形式、環境你自己管——自由度最高,出事也是你自己修。

決策規則很直白:先問「任務能不能只用瀏覽器完成?」能,就用 browser 路線;再問「需不需要碰桌面應用或本機檔案?」需要,才上 computer use。Computer use 的通用性是它的賣點,也是它的稅:截圖架構天生又貴又慢,能用結構化介面(API、DOM)解決的任務,永遠不要拿像素去硬幹。

評測:OSWorld 與 2026 年的進展

Computer use 的標準考場是 OSWorld:在真實作業系統環境裡完成數百個跨應用任務。2025 年初 CUA 的 38.1% 還是新聞;到 2026 年,OSWorld-Verified 上的頂尖分數已經翻倍——GPT-5.5 達 78.7%、Anthropic 的 Mythos 達 79.6%,雙雙超過人類專家基線。數字之外更值得注意的是 Anthropic 在保險領域的內部數字達 94%:垂直場景+受控環境,computer use 已經是「週二早上真的在用」的生產力工具,不是 demo。

但基準分數和生產可靠度之間仍有落差,大部分團隊第一次上線都是在這裡摔跤:demo 環境的網站不會改版、不會跳驗證碼、不會有效能抖動,真實世界全都會。評估時記得把「環境漂移」算進成本。

結論:先 API,再 DOM,最後才用眼睛

Computer use 把 Agent 的操作邊界從「有 API 的世界」擴張到「人類看得見的世界」,代價是速度、成本和安全複雜度。2026 年的實務共識是分層策略:有 API 就用 function calling,只有瀏覽器就用 browser agent,非得碰桌面軟體才派出 computer use——並且永遠跑在沙箱裡、重要動作留人工確認。眼睛和手腳是 Agent 最貴的器官,不要拿來做手做得到的事。

來源

Uploaded Image Uploaded Image

沒有留言:

張貼留言