Browser Agent
安装
next-gen harness · lives in the browser

下一代 harness 不是 TUI,
住在浏览器里

一个能读懂你正在看的网页、自主规划、点击、填表、导航、提取数据的 AI agent。它第一次同时拥有「眼睛」和「手」——因为只有浏览器能看见并操作整个互联网。

Chrome 扩展本地 Playwright harness自主多步任务纯文本 a11y 快照无需视觉模型

为什么是浏览器

人类时间最大的去处

人醒着的大部分时间在网页里,不是桌面、不是终端。住在浏览器 = 驻扎在最大的渠道里。

唯一看得见工作现场

终端 agent 是瞎的。浏览器有 DOM 和可访问性树——agent 第一次能「看见」并「操作」全世界的网页。

复用你的真实登录态

扩展直接驱动你的标签页,银行、后台、任何你已登录的网站都能操作——云端浏览器做不到这一点。

工作原理 · 快照 → 动作循环

每一轮:把页面压成一段纯文本快照,交给模型,模型只返回一个动作 JSON,执行,再重拍快照——直到任务完成(≤ 25 步,可中断)。

01快照DOM → 可交互元素列表 + 主文本,每个元素带稳定 ref
02决策模型看快照 + 目标 + 历史,返回一个动作 JSON
03执行点击 / 填写 / 选择 / 滚动 / 导航 / 提取
04观察重拍快照,记录结果,进入下一轮或 done

动作契约:

{"type":"click","ref":"@e1"}
{"type":"fill","ref":"@e2","value":"hello"}
{"type":"navigate","url":"https://..."}
{"type":"done","result":"总结…"}

差异化:不需要视觉模型

大多数浏览器 agent 依赖截图 + 多模态模型,贵且慢。本项目的页面表示是纯文本可访问性快照——模型只需读文字就能定位元素、执行操作。这意味着它能在 纯文本模型(如 deepseek-v4-flash)上跑,也预留了 vision toggle 等将来接视觉模型。

安装

Chrome 扩展(旗舰)

  1. git clone https://github.com/gewenbo888/browser-agent
  2. 打开 chrome://extensions → 打开右上角「开发者模式」
  3. 「加载已解压的扩展程序」→ 选择 browser-agent/extension
  4. 点工具栏图标打开侧边栏,输入任务开始

本地网页 harness

  1. cd web-harness && npm i && npm run dev(首次自动 playwright install chromium
  2. 打开 http://localhost:3001

需要本地模型代理 http://127.0.0.1:15721 运行中(Anthropic Messages 兼容)。