AI Industry · model_release
Google 发布 Android Bench 2.0,用一周开发任务检验 AI 上限
摘要:Google 发布 Android Bench 2.0,用于衡量 AI 模型与智能体的编码能力,题目改为需要工程师花费数天的复杂长期任务。|亮点:最高通过率从约 91% 降至约 28%。|意义:通过率的大幅下滑说明现有模型在长周期、多步骤的真实开发任务上...
为什么重要
该事件已进入 3qk7 高价值新闻/事件层;新闻来源用于补充背景与验证,一手官方状态变化仍拥有更高证据优先级。
检测到的变化
- 新闻系统补充:Google 发布 Android Bench 2.0,用一周开发任务检验 AI 上限
一手证据
- ITmedia AI+ · 2026-09-26T22:06:02Z
- ITmedia AI+ · 2026-09-26T13:00:00+09:00