一个能读懂你正在看的网页、自主规划、点击、填表、导航、提取数据的 AI agent。它第一次同时拥有「眼睛」和「手」——因为只有浏览器能看见并操作整个互联网。
人醒着的大部分时间在网页里,不是桌面、不是终端。住在浏览器 = 驻扎在最大的渠道里。
终端 agent 是瞎的。浏览器有 DOM 和可访问性树——agent 第一次能「看见」并「操作」全世界的网页。
扩展直接驱动你的标签页,银行、后台、任何你已登录的网站都能操作——云端浏览器做不到这一点。
每一轮:把页面压成一段纯文本快照,交给模型,模型只返回一个动作 JSON,执行,再重拍快照——直到任务完成(≤ 25 步,可中断)。
动作契约:
{"type":"click","ref":"@e1"}
{"type":"fill","ref":"@e2","value":"hello"}
{"type":"navigate","url":"https://..."}
{"type":"done","result":"总结…"}
大多数浏览器 agent 依赖截图 + 多模态模型,贵且慢。本项目的页面表示是纯文本可访问性快照——模型只需读文字就能定位元素、执行操作。这意味着它能在 纯文本模型(如 deepseek-v4-flash)上跑,也预留了 vision toggle 等将来接视觉模型。
git clone https://github.com/gewenbo888/browser-agentchrome://extensions → 打开右上角「开发者模式」browser-agent/extensioncd web-harness && npm i && npm run dev(首次自动 playwright install chromium)http://localhost:3001需要本地模型代理 http://127.0.0.1:15721 运行中(Anthropic Messages 兼容)。