跳转到内容

Fara1.5:浏览器 Agent 的关键不只是会点按钮

进阶

来源:Microsoft Research · 发布于 2026-05-21最近复核于 2026-08-30

浏览器 Agent 的难点不是识别一个按钮,而是连续多步后仍知道目标、在缺信息时会问、在不可逆动作前会停。Fara1.5 最值得学习的是闭环:观察—思考—单步行动,加上能审计正确性、效率和用户授权的数据生产线。

只用公开网页轨迹训练,会避开登录、发邮件、提交表单等真实任务;直接在真实账号上采集又有隐私与不可逆风险。长任务还会积累截图和历史,既昂贵又容易让模型丢掉当前页面。一个“能点”的模型如果不会澄清用户信息,也不能安全代理用户。

Fara1.5 有 4B、9B、27B 三种尺寸。每一步读取完整文字历史和最近三张浏览器截图,输出思考与一个原子动作;搜索、记忆事实、询问用户等 meta-action 支撑长任务。训练轨迹来自 FaraGen1.5:环境负责真实开放网页与六类合成站点,强 solver 生成候选轨迹,verifier 按正确性、效率、用户交互三道门筛选。遇到缺少个人信息、任务歧义或未授权的不可逆动作,合格轨迹必须先询问。

原文报告 Fara1.5-9B 在 Online-Mind2Web 为 63.4%、WebVoyager 为 86.6%,均为自动评测且三次运行平均;本文没有独立复现这些数值。

先把网页自动化拆成状态机,而不是一句“帮我办完”。每一步保存:当前截图、目标、已确认事实、下一原子动作、是否触及授权门。把最终结果和过程分开验收:页面到了不等于提交成功,提交成功也不等于没有多改数据。练习时优先使用本地假网页和假身份。

对会写入外部状态的动作,保存执行前后的可比较证据,例如购物车条目、表单字段或数据库快照。允许用户随时停止,并把“返回成功页面”和“服务端状态真的改变”分开记录。页面刷新后的视觉相似不能替代结果校验。

失败也要保留最后一个可信状态,方便人工接管。

做一个只有三页的本地静态站:商品列表、购物车、确认页,加入一个名称相近的干扰按钮。准备五个任务,其中两个缺收货信息,一个要求最终提交。让 Agent 逐步输出动作日志;在确认页前必须停下询问。人工按“目标完成、冗余动作、是否越权”打勾。这个实验验证控制流,不代表复现 Fara1.5 的模型能力或公开基准。

成功证据: 五个任务都有截图或状态快照与动作日志;缺信息的任务会先询问,最终提交前会停下,干扰按钮不会造成未授权状态变化。

停止线: 流程需要真实账号、支付、外部消息或不可逆提交,或者无法取得动作前后的状态证据时,停止自动操作并改用本地假页面。

  • 截图理解强不等于端到端可靠,错误会沿多步累积。
  • 合成环境不是“假数据所以无用”;它的价值是安全生成可校验状态变化,但仍需检查迁移到真实网页的差距。
  • sandbox 不能替代授权。隔离保护机器,用户确认保护现实后果。

Microsoft 将其称为 research preview,并提示 prompt injection、诈骗和误操作等风险。7 月 22 日页面追加了权重按 MIT 许可公开的信息;发布时间仍是 5 月 21 日。教程只概括页面公开机制,不为真实账号自动操作背书。

本文是原创中文实践解读,不是逐句译文。英文原文见 Microsoft Research 官方文章。