DOM 感知 Browser Agent:真的比像素点击可靠吗?

Claude Browser Use 将截图与页面结构结合。本文给出 API、DOM 自动化与视觉 Computer Use 的可靠性选择模型。

DOM 感知 Browser Agent:真的比像素点击可靠吗?

Anthropic 发布 Browser Use 的官方页面

结构和视觉信号可以互补,业务状态仍需独立验证。

Browser Agent 最常见的瓶颈不是推理,而是定位:“提交”究竟是理赔表单、订阅框,还是后面弹窗的按钮?Anthropic 新 Browser Use 把页面结构加入视觉上下文,填补了确定性自动化与纯截图点击之间的空白。

先说结论

  • DOM 让目标与语义比像素坐标稳定。
  • 它仍会受到歧义、提示注入、过期状态与页面改版影响。
  • 优先级应是 API、确定性 DOM、DOM 感知 Agent、最后才是纯像素。
  • 完成必须用业务状态验证,不能相信 Agent 自报“已完成”。
方法优势典型失败
API/Connector强类型、快、可观测没有对应能力或权限
DOM 自动化Selector 与断言确定改版后脆弱
DOM 感知 Agent能适应布局与语言变化意图歧义、网页注入
像素 Agent几乎所有可见 UI 都能尝试坐标漂移、语义弱

Anthropic 表示新工具同时读取页面结构和截图,并可在一个 Turn 中执行多步。速度会提升,但第一步状态过期时,后续动作也可能一起跑偏。

测试不要只走 Happy Path。准备重复标签、延迟加载、弹窗、登录过期、页面提示注入和提交后慢响应,分别衡量选中目标、恢复、去重与证据留存。

审批应放在付款、发送、发布、删除、权限修改和最终提交等后果边界,并展示具体对象和 payload。浏览器还应使用隔离 Profile、最小凭证、目标域策略和下载扫描。

DOM 感知不等于相信 DOM

Claude Platform Computer Use 工具官方文档

工具文档定义操作接口,可靠性仍取决于目标消歧、政策和 Postcondition。

不同产品所说的 DOM 感知并不相同:有的读取 Accessibility Tree,有的序列化 HTML,有的把 OCR、截图和浏览器事件合在一个工具里。Accessibility Tree 更紧凑、语义更好,但自定义控件可能标注不完整;HTML 信息多,也夹杂隐藏节点、脚本与不可信文本;截图忠实保留用户看到的界面,却缺少控件身份和状态。

生产系统应交叉核对这些视图。截图显示按钮不可用、DOM 却说可点击时,应刷新并停止批量动作;两个按钮同名时,必须再用表单区域、标题、记录 ID 或目标状态消歧。网页里的文字即使来自已登录系统,也只能当作数据,不能改变工具白名单、目标域或审批结果。

把点击变成可验证事务

不要只给 Agent 一个 click(x, y)。一次动作至少要包含目标角色与名称、所属记录、前置状态、预期结果和幂等键。例如提交理赔前确认记录仍是草稿、金额未变化;提交后必须拿到回执 ID,并在系统记录中看到 submitted。如果超时,先查回执再重试,避免重复提交。

多步 Turn 适合合并可逆的浏览和读取,不适合跨越多个后果边界。“打开订单、展开物流、复制单号”可以合并;“修改地址、确认购买、发送邮件”必须拆开审批。

怎样做可靠性测试

场景合格行为
两个同名按钮根据表单和记录消歧,无法判断就询问
Banner 导致布局位移重新定位,不沿用旧坐标
提交成功但响应超时先查业务状态,不直接重试
登录过期停止,不把凭证填进网页指令
页面出现提示注入当作不可信数据,不扩大权限
部分记录已成功从持久状态续跑且不重复

要单独统计“虚假完成”。Agent 主动停下虽然麻烦,但远好于改错账户后仍宣称成功。指标还应包含重复副作用、人工介入、恢复成本,以及有多少动作被业务状态独立验证。

选型建议

稳定、高频、后果重的操作优先 API;自有页面优先确定性 Browser Test;界面经常变化但任务语义稳定时,再使用 DOM 感知 Agent;Canvas、远程桌面等取不到结构的场景才退回像素操作。常见的最佳组合是 Agent 理解页面并提出结构化动作,由确定性代码执行和验收。

上线前必须回答五个问题:什么状态证明完成?哪些步骤不可逆?重试如何去重?哪些页面内容可能恶意?升级给人工时能看到什么证据?任何答案如果只是“模型会判断”,就还没有达到生产标准。

常见问题

Accessibility Tree 比 HTML 安全吗?

通常更紧凑,但并非天然安全;标签仍可能包含不可信内容,自定义控件的语义也可能缺失。

可以无人值守吗?

可逆、范围明确、凭证受限且有强验收的任务可以。付款、发布、删除等动作仍应绑定具体对象和内容审批。

截图对比能证明任务完成吗?

不能。截图只能证明外观,业务结果要用回执、记录状态或审计事件验证。

结论

Browser 隔离只是 Runtime 的一部分,可结合2026 年 AI Agent Sandbox 对比选型;离开浏览器的动作仍应经过工具调用前授权

DOM 感知 Agent 理论上会比纯像素更稳,但不会取代 API 和确定性断言。它最适合你无法控制、经常改版但任务语义稳定的界面。真正指标不是完成多少次点击,而是状态是否正确、是否重复、是否越权。