Computer Use:當 Agent 不再只呼叫 API,而是直接操作電腦
前言:API 覆蓋不到的地方
過去兩年的 Agent 實作幾乎都站在同一個假設上:世界有 API。Function calling 讓模型可以查資料庫、下訂單、發訊息——前提是對方有把功能包裝成乾淨的端點。但現實世界大部分的工作流程並沒有 API:客戶的後台管理系統、老舊的 ERP、銀行網銀、需要人工拖拉的設計軟體。這些軟體的介面只有一種:給人類看的圖形介面(GUI)。
Computer Use 就是把這個限制拿掉的技術路線:Agent 不再透過 API 呼叫功能,而是看螢幕截圖、推理下一步、在像素座標上點滑鼠、打字——用和人類完全一樣的介面操作電腦。2024 年 10 月 Anthropic 率先把 computer use 做成 API 工具,OpenAI 則以 CUA(Computer-Using Agent)模型驅動 Operator(2025 年併入 ChatGPT Agent)。到 2026 年,這條路線已經從 demo 變成可部署的架構選項。
核心機制:截圖→推理→動作的迴路
Computer use 的控制迴路簡單到近乎笨拙,如圖一所示:
- 看:執行環境擷取一張螢幕截圖,交給模型;
- 想:模型在截圖上做版面解析、OCR、空間推理,決定下一步動作;
- 動:模型輸出一個動作——通常是「在像素座標 (x, y) 左鍵點擊」「輸入這段文字」「按 ctrl+S」「往下捲動」;
- 執行與回饋:你的程式碼實際執行這個動作(透過 Playwright、VNC、作業系統自動化),再擷取新的截圖回傳;
- 重複,直到模型回傳純文字(不再呼叫工具),表示任務完成。
這個架構最關鍵的設計取捨是:模型手上沒有任何語意資訊。沒有 DOM、沒有元素選擇器、沒有無障礙樹的座標。它必須從像素裡「看」出按鈕在哪——這就是所謂的視覺定位(visual grounding),也是整個技術棧裡最難的子問題。好處是通用性:只要看得見的東西都在操作範圍內,瀏覽器、桌面軟體、系統對話框全都通吃。
另一個取捨是每個動作都要一次完整的模型往返。N 個步驟就是 N 次 round trip,截圖還是 token 的大戶(每張截圖動輒上千 token)。這意味著 computer use 的任務天生又貴又慢:單步延遲 2–5 秒是常態,複雜任務的 token 帳單要先做心理準備。
兩大流派的實作:Anthropic 與 OpenAI
Anthropic 的路線是「API 工具」。在 Messages API 裡宣告一個 computer 工具(型別如 computer_20241022,附螢幕解析度參數),模型就能在回覆裡輸出 tool_use 區塊:{"action": "left_click", "coordinate": [640, 400]}。動作集合包含 screenshot、左右鍵點擊、雙擊、拖曳、mouse_move、type、key(支援組合鍵如 ctrl+c)、scroll,新版還加入 zoom、hold_key、wait。官方的三工具架構是:computer(滑鼠鍵盤 GUI 操作)+ bash(持久化 shell session)+ text_editor(結構化檔案編輯)。參考實作把整套跑在 Docker 裡的完整桌面環境,用 VNC 接畫面——環境是你的,你負責沙箱。
OpenAI 的路線是 CUA 模型。CUA(Computer-Using Agent)以 GPT-4o 的視覺能力為基礎加上強化學習訓練,透過 Responses API 的 computer 工具呼叫。實作上有個重要差異:OpenAI 允許一個回合內批次多個動作,而 Anthropic 是嚴格的單動作往返——前者在簡單任務上少走很多 round trip。CUA 當年公佈的基準:OSWorld 38.1%、WebArena 58.1%、WebVoyager 87%。消費端產品 Operator 已在 2025 年 8 月收掉,能力併入 ChatGPT Agent。
安全設計上兩家方向一致,只是落點不同:Anthropic 的文件花了大量篇幅在環境建議——沙箱 VM、域名白名單、不要交出真實憑證、重要動作要求人工確認,並用分類器偵測 prompt injection;OpenAI 的 CUA 則內建 pending_safety_checks,在敏感動作前暫停等確認。
實作要點:最小的 Computer Use 迴路
下面是一個 Anthropic 風格的最小迴路骨架(Python 概念碼):
MAX_STEPS = 40 # 迴圈一定要有上限
def computer_use_loop(user_task, model, env):
messages = [{"role": "user", "content": user_task}]
tools = [{"type": "computer_20241022", "name": "computer",
"display_width_px": 1280, "display_height_px": 800}]
for _ in range(MAX_STEPS):
resp = model.messages.create(model="claude-sonnet-4-5",
messages=messages, tools=tools)
messages.append({"role": "assistant", "content": resp.content})
tool_calls = [b for b in resp.content if b.type == "tool_use"]
if not tool_calls:
return resp.text # 模型不再呼叫工具=任務完成
results = []
for call in tool_calls:
action = call.input["action"]
# 座標縮放:截圖傳給模型前通常會降採樣,
# 模型回傳的座標要按比例放大回真實解析度再執行
env.execute(scale(call.input))
shot = env.screenshot() # 執行動作後立刻擷取新畫面
results.append({"type": "tool_result",
"tool_use_id": call.id,
"content": [{"type": "image",
"source": {"type": "base64",
"media_type": "image/png",
"data": shot}}]})
messages.append({"role": "user", "content": results})
raise RuntimeError("步數耗盡:任務可能卡住或太複雜")
落地時的三個實務提醒:第一,環境隔離是剛需——computer use 會「照著像素能做的事去做」,給它真實桌面等於給它你的全部權限,務必跑在拋棄式 VM 或容器裡;第二,座標縮放別寫錯,截圖降採樣後回傳的座標若沒放大回真實解析度,點擊會系統性偏掉;第三,錯誤是可見的——這個架構的美妙之處是每個規劃錯誤在下一步的截圖裡都看得見,模型通常能自我修正,但你要給它足夠的步數預算和明確的「卡住了就停下來問人」指令。
三條路線怎麼選:Browser Use、ChatGPT Agent、Claude Computer Use
不是所有「操作電腦」的需求都要上 computer use。如圖二,三條路線各有最適位置:
- 只控瀏覽器、要便宜可控:選 Browser Use 這類開源框架。它讀 DOM 元素並標註,模型看到的是結構化資訊而非純像素,token 成本低、可自託管、模型無關。網站自動化的預設起點。
- OpenAI 生態、公開網路任務:走 ChatGPT Agent。雲端 VM、爆發半徑小(blast radius 有界)、適合交易型任務;但沒有本機檔案系統存取,複雜多步任務約 30 步後容易漂移。
- 要操作桌面軟體、超出瀏覽器:只有 Claude Computer Use 做得到。API 工具形式、環境你自己管——自由度最高,出事也是你自己修。
決策規則很直白:先問「任務能不能只用瀏覽器完成?」能,就用 browser 路線;再問「需不需要碰桌面應用或本機檔案?」需要,才上 computer use。Computer use 的通用性是它的賣點,也是它的稅:截圖架構天生又貴又慢,能用結構化介面(API、DOM)解決的任務,永遠不要拿像素去硬幹。
評測:OSWorld 與 2026 年的進展
Computer use 的標準考場是 OSWorld:在真實作業系統環境裡完成數百個跨應用任務。2025 年初 CUA 的 38.1% 還是新聞;到 2026 年,OSWorld-Verified 上的頂尖分數已經翻倍——GPT-5.5 達 78.7%、Anthropic 的 Mythos 達 79.6%,雙雙超過人類專家基線。數字之外更值得注意的是 Anthropic 在保險領域的內部數字達 94%:垂直場景+受控環境,computer use 已經是「週二早上真的在用」的生產力工具,不是 demo。
但基準分數和生產可靠度之間仍有落差,大部分團隊第一次上線都是在這裡摔跤:demo 環境的網站不會改版、不會跳驗證碼、不會有效能抖動,真實世界全都會。評估時記得把「環境漂移」算進成本。
結論:先 API,再 DOM,最後才用眼睛
Computer use 把 Agent 的操作邊界從「有 API 的世界」擴張到「人類看得見的世界」,代價是速度、成本和安全複雜度。2026 年的實務共識是分層策略:有 API 就用 function calling,只有瀏覽器就用 browser agent,非得碰桌面軟體才派出 computer use——並且永遠跑在沙箱裡、重要動作留人工確認。眼睛和手腳是 Agent 最貴的器官,不要拿來做手做得到的事。
來源
- Anthropic, Computer Use 官方文件 — https://docs.anthropic.com/en/docs/agents-and-tools/computer-use
- OpenAI CUA vs Anthropic Computer Use 實作對比 — https://github.com/quriosity-agent/articles/blob/HEAD/2026-03-09/openai-cua-computer-use-agent-en.md
- Particula, Claude Computer Use vs OpenAI Operator vs Browser Use (2026) — https://particula.tech/blog/browser-use-vs-operator-vs-claude-computer-use-web-agents
- Feder-cr, OpenAI Operator vs Claude Computer Use 評測筆記 — https://github.com/feder-cr/invisible_playwright_mcp/blob/HEAD/docs/openai-operator-vs-claude-computer-use.md
- Vibecodingconsultant, OpenAI Computer Use vs Claude Dispatch 2026 架構對決 — https://vibecodingconsultant.com/blog/openai-computer-use-vs-claude-dispatch/
- AI System Design Guide, Computer Use Agents — https://github.com/ombharatiya/ai-system-design-guide/blob/HEAD/17-tool-use-and-computer-agents/04-computer-use-agents.md
沒有留言:
張貼留言