AI Research · research

TRACE Bench: Task-driven Roleplay Agentic Checklist Evaluation

论文摘要:TRACE Bench:提出或使用新的基准评测,用来衡量模型在特定任务上的表现。

首次发现 2026-08-14T03:25:35Z · 最近更新 2026-08-14T03:53:00Z · 置信度 high · 重要性 7.7

为什么重要

该论文来自一手研究源并通过 3qk7 Research Radar 的新鲜度、来源与研究价值筛选;后续代码、模型权重、复现和相关产品事件可继续关联到该记录。

检测到的变化

一手证据