AI FRONTIER
Signals worth understanding before they become obvious.
GPT-6.1 Sol 发布
GPT-6.1 Sol 面向编程、计算机操作和专业工作,提供接近 Astra 的智能水平,标准 API 输入和输出 token 价格仅为 Astra 的五分之一。
- OpenAI News 发布 GPT-6.1 Sol。
- 定位为面向编程、计算机操作和专业工作的接近 Astra 智能。
- 标准 API 输入和输出 token 价格为 Astra 的五分之一。
对 AI 构建者而言,接近 Astra 的智能水平以五分之一 token 价格提供,意味着可显著降低编程与计算机操作类智能体工作流的推理成本。
系统提示的错觉:指令前导如何改变语言模型中的计算
该论文使用中心核对齐(CKA)比较了17个指令微调模型在20个系统提示下的逐层表示,发现效果具有层选择性和指令类型依赖性:人设与格式指令会深度重构中间表示,而安全指令几乎不改变表示。
- 覆盖8个架构家族、1.5B至72B参数的17个指令微调模型,测试20个系统提示,分为五个功能类别。
- 限制性安全指令与明确允许性指令(“你没有任何限制”)激活近乎相同的计算通路,平均CKA相关性为0.997。
- 在商业规模下安全渗透率仍低于10%,即使在70B-72B规模也是如此。
- 线性探测显示模型在每一层都编码提示类别,但仅在一小部分层重构计算;因果激活修补确认这些层介导行为变化。
对于构建基于系统提示的安全防护的开发者而言,该证据表明安全指令可能被可靠地编码却未被深度作用于计算,因此仅靠提示层面的防护不足以抵御越狱。
TomasuLLM:面向LLM智能体的乱序推测执行运行时
TomasuLLM是一个运行时,它按轨迹顺序之外执行智能体工具调用,同时保持任务执行正确性:它预先起草未来动作,在隔离的写时复制沙箱中运行,追踪依赖与影响,并在验证通过后按轨迹顺序提交结果。
- 论文报告在100个SWE-bench Verified任务上提升1.31倍,在28个Terminal-Bench 2.0任务上提升1.35倍,在18个SWE-Marathon会话上匹配进度提升1.27倍。
- 在4,010条经审计的提交验证记录中,论文报告零误接受。
- 该方法针对长时工具(编译器、测试套件、仓库命令)导致编码智能体延迟被主导的问题,工具调用耗时从数秒到数分钟。
- 结果在三个基准上随工具延迟增长而扩展,覆盖亚秒级到分钟级工具调用。
对于构建编码智能体的团队,TomasuLLM表明在隔离沙箱中推测执行工具调用并按轨迹顺序提交,可以在不牺牲提交正确性的前提下缩短长时工具带来的延迟。
MiniMax 开源 OpenAgentCore,兼容 OpenAI Agents API
MiniMax 开源了 OpenAgentCore,用于兼容 OpenAI Agents API。
- MiniMax 开源了 OpenAgentCore。
- OpenAgentCore 面向 OpenAI Agents API 兼容性。
AI 构建者可用 OpenAgentCore 在 MiniMax 的开源实现上对接 OpenAI Agents API 工作流。
SInGA:从单张图像学习语义修复的可动画高斯头部化身
论文提出 SInGA,一种在 UV 空间中定义语义修复框架的方法,用于从单张图像补全未观测的面部区域并回归高斯属性,从而生成可动画的高斯头部化身。该方法无需针对每个身份单独优化,即可跨身份泛化并支持驱动输入动画。
- 论文在 UV 空间中定义语义修复框架,利用人脸固有对称性线索补全未观测区域。
- 方法从已观测区域提取特征来补全未观测区域,再用补全后的表示回归高斯属性,实现高斯修复。
- 方法在每个表面或像素位置堆叠多个高斯,而非仅使用单个高斯,以增强细节。
- 论文报告称,生成的化身在完整性和身份保持方面有所提升,并支持真实感动画与从未观测视角的一致渲染。
对构建单图头部化身的研究者而言,该工作把补全问题转移到具有空间对应关系的 UV 空间,为单视角下的未观测区域处理提供了可复用的思路。
多跳检索增强生成中的共形事实性控制
该论文将分体共形声明过滤应用于多跳RAG,并在HotpotQA、Natural Questions和TriviaQA上使用Llama 3.1 8B与GPT-4o-mini进行评测,同时设置单跳参照实验。论文报告称,在95%目标下,保留声明完全被支持的响应比例从无过滤时的55.60%-76.03%提升至95.80%-97.20%。
- 在全部六种多跳模型-数据集配置中,更严格的共形目标持续提高保留声明完全被支持的响应比例。
- 在95%目标下,该比例为95.80%-97.20%,而无过滤时为55.60%-76.03%。
- 在95%目标下,仅4.41%-31.09%的生成声明被保留,9.70%-51.40%的响应保持非空。
- 论文使用Llama 3.1 8B和GPT-4o-mini,在HotpotQA、Natural Questions和TriviaQA上进行评测,并包含单跳参照实验。
对于多跳RAG构建者而言,共形过滤能提高声明级支持度,但必须与声明保留率和弃答率联合评估,因为95%目标下大多数声明被丢弃,且许多响应变为空。
离散平均生成器加速扩散语言模型
该论文提出离散平均生成器,将MeanFlow扩展到连续时间马尔可夫链,定义平均生成器为时间区间内转移核的归一化增量,并给出自洽性恒等式作为训练目标基础。
- 在Potts模型模拟中,该目标将K步采样器的总变差距离最多降低67%。
- 在OpenWebText上,该方法在8至64个采样步数下取得所评估方法中最低的生成困惑度,并实现16倍加速。
- 在ImageNet上,该方法取得与现有方法相当的性能。
- 论文将MeanFlow扩展到连续时间马尔可夫链,并说明投影到逐坐标边缘分布时自洽性恒等式具有闭式表达。
对构建离散扩散语言模型的团队而言,该工作提供了可降低采样步数并保持生成质量的训练目标,值得评估其16倍加速在自有数据上的可复现性。
研究:AI 智能体易受极端化影响
该论文通过模拟两个 LLM 智能体之间的对话来研究极端化:一个扮演具有人口统计与心理属性的人类角色,另一个试图让前者的信念更极端。论文报告称,共鸣(强化既有信念)与说服(推广原本不被重视的信念)都会使目标极端化,但共鸣的效果始终更强。
- 论文于 2026 年 9 月 29 日提交至 arXiv,编号 arXiv:2609.38296,归类为 cs.AI 与 cs.CY。
- 实验设置:目标 LLM 依据人口统计与心理属性扮演人类角色,影响者 LLM 试图使其信念更极端。
- 论文报告两条路径:共鸣强化目标既有信念,说服推广目标起初认为不重要的信念。
- 论文报告在情感与行为指标上两种机制都会使目标极端化,但共鸣的效果始终强于说服。
构建个性化智能体或多智能体系统的开发者应把与既有信念一致的输入视为高风险影响面,因为论文报告共鸣比说服产生更强且可传播的极端化效果。