← 返回全部项目v0.1 框架版 · 实测进行中
Research
Browser Agent 评测实验室
12 探针任务 × 统一评分卡 × 失败归因五分类的评测方法论
探针任务矩阵评分卡角色分离协议污染检测
- 我的角色
- 发起人与执行者
- 周期
- 2026.09
- 规模
- 9 篇文档 · 2 个实验记录
Browser Agent 评测实验室 · 演示截图采集中
12 个
探针任务
L1/L2/L3
难度分级
5 分类
失败归因
2 个已记录
实验
一个系统性评测 Browser Use Agent 能力边界的开源实验项目:从任务设计、评分者与执行者角色分离,到实验污染检测与降级处理,把「评测」本身当成工程来做。
§把评测做成工程
12 个只读探针任务按 L1 单页查找 / L2 多步交互 / L3 跨站聚合分级;每例实验记录执行者与评分者的隔离协议、异常与局限;首例实验因发现污染被主动降级为冒烟——诚实的负结果也是产出。
§接下来
Sprint 1: 12 任务横测补全Sprint 2: benchmark 化 + 排行榜