AI Industry · model_release

Google 发布 Android Bench 2.0,用一周开发任务检验 AI 上限

摘要:Google 发布 Android Bench 2.0,用于衡量 AI 模型与智能体的编码能力,题目改为需要工程师花费数天的复杂长期任务。|亮点:最高通过率从约 91% 降至约 28%。|意义:通过率的大幅下滑说明现有模型在长周期、多步骤的真实开发任务上...

首次发现 2026-09-26T22:06:02Z · 最近更新 2026-09-26T22:06:02Z · 置信度 medium · 重要性 8.1

为什么重要

该事件已进入 3qk7 高价值新闻/事件层;新闻来源用于补充背景与验证,一手官方状态变化仍拥有更高证据优先级。

检测到的变化

一手证据