跳转至

AndroidWorld 评估报告与失败分析(T3A Agent)

本书对 T3A Agent(t3a_claude4_sonnet)在 AndroidWorld 基准上一次完整运行的评估报告与失败案例分析笔记,是实验 6-10「AndroidWorld 的评估和改进」的阅读材料。

返回第 6 章目录 · 📖 读本章正文

这是什么 / 不是什么

  • 这是:一次真实 AndroidWorld 评估运行的原始轨迹 + 报告解读 + 失败根因分析(阅读材料,无可运行代码)。
  • 这不是:AndroidWorld 基准本身。基准代码见同章的 android_world/(下划线命名,需自行 git clone 的外部仓库)。本目录采用连字符命名 android-world/,正是为了与基准仓库区分。

运行元信息(见 t3a.md 末尾):Agent 为 t3a_claude4_sonnet,运行于 2025-07-02,覆盖 AndroidWorld 全部 116 个任务,总体成功率 88%,成功任务平均 13.45 步。

文件说明

文件 内容
t3a.md 完整运行日志(约 8.8k 行):110 个任务的逐步执行轨迹(每步记录 Action / Reason / Summary),末尾附逐任务性能表与能力标签 × 难度矩阵
t3a_failed.md 失败任务轨迹(约 4.6k 行):53 个失败任务段的完整执行日志,从 t3a.md 中筛出,便于集中复盘
t3a_summary.md 报告解读:逐任务性能表的列释义与失败群定位,能力标签矩阵的阅读方法,Agent 的核心优势(multi_appmemorizationsearch)与关键短板(transcriptionmath_countingcomplex_ui_understandinginformation_retrievalrequires_setup
t3a_failed_analysis.md 失败根因分析:将失败归为五类——转录失败、复杂 UI 理解失败、应用初始化消耗步数、数学/计数失败、信息检索与复杂逻辑失败;并对 28 个「步数耗尽」案例归纳出四种低效模式(无效循环、非标 UI 交互受困、信息处理停滞、简单导航失败)

推荐阅读顺序

  1. t3a_summary.md —— 先学会读报告:逐任务表格 + 能力标签矩阵,建立「88% 成功率背后的结构性短板」这一全局认识。
  2. t3a_failed_analysis.md —— 再看根因分类:理解每类失败的「症状 → 过程 → 根本原因」链条。
  3. t3a_failed.md —— 带着分类框架回放失败轨迹,逐条验证(或推翻)分析结论。
  4. t3a.md —— 需要对照成功任务或查阅原始数据时的完整底稿。

与正文的对应关系

正文「从 Benchmark 报告到系统改进」一节的示教案例(H1–H8 假设、三层改进框架、成本收益决策)以本目录材料为原型;实验 6-10 要求以这里的评估报告为起点,走完「诊断 → 构建假设 → 分阶段实验 → 数据驱动决策 → 迭代」的完整闭环。

几个值得留意的细节:

  • 能力标签矩阵中 transcription 全难度 0.00、math_counting easy 档 0.00、complex_ui_understanding 0.17/0.50/0.14——总体成功率很高,但短板维度几乎是「全军覆没」,这正是「总体数字掩盖结构性短板」的实例。
  • 失败分析的核心结论:「步数耗尽」是症状而非病因——28 个超时案例背后是高效执行路径规划能力的缺失,而非步数限制过于苛刻。
  • 部分失败(如 ExpenseAddMultipleFromGallery)中 Agent 在拿不到真实信息时会「编造」合理数据完成流程——评估时只看最终状态验证才能识破,这是设计验证器时的重要教训。