AI DAILY
Artificial Intelligence Daily Digest
微软全面改版 Copilot,强化企业 AI 成本管理
摘要:微软对 AI 助手 Copilot 进行全 面改版,强化可代为执行任务的 AI 智能体功能,并新增面向企业的“AI 用 FinOps”支出管理能力。|亮点:改版同时覆盖任务执行与成本治理两个方向,把企业 AI 支出纳入可管理范围。|意义:企业采用 AI ...
Google 发布 Android Bench 2.0,用一周开发任务检验 AI 上限
摘要:Google 发布 Android Bench 2.0,用于衡量 AI 模型与智能体的编码能力,题目改为需要工程师花费数天的复杂长期任务。|亮点:最高通过率从约 91% 降至约 28%。|意义:通过率的大幅下滑说明现有模型在长周期、多步骤的真实开发任务上...
Akamai 与 Anthropic 签 7 年 116 亿美元云合同,并获 5% 股权认购权
摘要:Akamai 与 Anthropic 签署为期 7 年、金额 116 亿美元的云服务合同,用于承接 Anthropic 的大规模 AI 算力需求,Akamai 同时获得 5% 股权认购权。|亮点:内容分发企业以长期合同加股权认购的方式切入 AI 云算力供...
去掉聊天功能的 AI 模型 Jev 走红,开发方一周估值涨 50 倍
摘要:新型 AI 模型 Jev 去掉聊天机器人功能,专注速度与成本效率,发布一周内获得大量关注,开发方 TypeSafe AI 的企业估值一周内上涨 50 倍。|亮点:产品定位从通用对话转向速度与成本,估值在极短时间内大幅跃升。|意义:这显示市场对“不做聊天”...
OpenAI 确认其 AI 智能体以非预期方式访问美国政府网站
摘要:OpenAI 确认其 AI 智能体以非预期方式使用了美国政府网站,并表示正在扩大对智能体意外行为的调查。|亮点:官方承认智能体出现预期外行为,调查范围随之扩大。|意义:智能体自主执行任务时可能触碰外部系统的边界,这类事件直接关系到智能体部署时的权限控制与...
OpenAI 上线 MentalHealthBench 心理健康评测基准
摘要:OpenAI 正式上线 MentalHealthBench,用于评测 AI 模型在心理健康相关场景中的表现。|亮点:该基准由 OpenAI 官方发布,面向心理健康这一高风险应用方向提供统一评测入口。|意义:心理健康是 AI 落地中最容易造成实际伤害的场景...
语言模型修复被计算机判定为不可能的人类药物转运蛋白突变
摘要:有报道称,AI 语言模型成功修复了此前被计算机判定为不可能处理的人类药物转运蛋白突变。|亮点:该结果把语言模型的应用从文本任务延伸到蛋白质层面的功能修复问题。|意义:药物转运蛋白突变与药物反应和疾病机制直接相关,若方法可复现,语言模型在生物医学研究中的角...