← 返回全部项目v0.1 框架版 · 实测进行中

Browser Agent 评测实验室

12 探针任务 × 统一评分卡 × 失败归因五分类的评测方法论

探针任务矩阵评分卡角色分离协议污染检测
我的角色
发起人与执行者
周期
2026.09
规模
9 篇文档 · 2 个实验记录
Browser Agent 评测实验室 · 演示截图采集中
12 个
探针任务
L1/L2/L3
难度分级
5 分类
失败归因
2 个已记录
实验
一个系统性评测 Browser Use Agent 能力边界的开源实验项目:从任务设计、评分者与执行者角色分离,到实验污染检测与降级处理,把「评测」本身当成工程来做。

§把评测做成工程

12 个只读探针任务按 L1 单页查找 / L2 多步交互 / L3 跨站聚合分级;每例实验记录执行者与评分者的隔离协议、异常与局限;首例实验因发现污染被主动降级为冒烟——诚实的负结果也是产出。

§接下来

Sprint 1: 12 任务横测补全Sprint 2: benchmark 化 + 排行榜

导览路线 · 下一站

归一 · AI 日程助手

从竞品矩阵到可点击原型:一份 91KB PRD 的产品定义全程

→