AI FRONTIER
Signals worth understanding before they become obvious.
谷歌发布RRSI:无需重新训练模型即可让智能体“脚手架”自我改进
谷歌云AI研究团队与斯坦福大学、华盛顿大学等合作发布RRSI框架,通过反复修改提示、工具使用、控制流、记忆与上下文管理、技能模块和子智能体等模型外围的“脚手架”,在不改变模型权重的情况下提升智能体性能。
- 在8个基准测试中,Terminal-Bench 2.1从74.2%升至80.2%,提升6.0个百分点;SWE-Bench Verified从82.0%升至83.8%,提升1.8个百分点。
- JobBench从36.0%升至40.7%,提升4.7个百分点;GDPval从48.8%升至52.3%,提升3.5个百分点;Frontier-Eng从17.7%升至22.0%,提升4.3个百分点。
- 在5个外部评估集上报告最高4.7个百分点的提升,在分布外(OOD)评估环境中相比既有脚手架演化方法最高提升22.9%。
- 使用Gemini 3.5 Flash的单独实验中,Terminal-Bench 2.1从64.6%升至78.7%,提升14.1个百分点;SWE-Bench Verified从76.8%升至79.0%,提升2.2个百分点。
对构建智能体的团队而言,RRSI表明在固定模型权重的前提下,对脚手架进行受控的迭代搜索也能带来可测量的性能提升,并可能降低token成本。
OpenAI 发布 GPT-6.1 Sol
OpenAI 推出 GPT-6.1 Sol,面向编程、计算机操作和专业工作,官方称其智能接近 Astra,标准 API 输入与输出 token 价格仅为 Astra 的五分之一。
- OpenAI 称 GPT-6.1 Sol 的智能接近 Astra。
- 适用场景包括编程、计算机操作和专业工作。
- 标准 API 输入与输出 token 价格均为 Astra 的五分之一。
对 AI 开发者而言,接近 Astra 的智能水平配合五分之一的 token 价格,意味着在编程与计算机操作类负载上可以显著降低单位推理成本。
prism-ml 发布 Ternary-Bonsai-2-27B-gguf:三元权重 27B 模型,5.95 GB 可在笔记本运行
prism-ml 在 Hugging Face 发布 Ternary-Bonsai-2-27B-gguf,将 Qwen3.8-27B 的嵌入、注意力投影、MLP 投影与 LM head 全部量化为三元权重(g128,{−1,0,+1} 加 FP16 分组缩放),以 PTQ1_0 与 PQ2_0 两种 GGUF 打包供 llama.cpp 的 CUDA、Metal、CPU 后端使用。
- 语言模型体积 5.95 GB(PTQ1_0)或 7.21 GB(PQ2_0),相比 FP16 约 54 GB 缩小约 9.0 倍与 7.5 倍;理想三元格式为 1.72 bits/weight、5.8 GB。
- 论文报告在 14 项 thinking 模式基准上平均 84.78 分,为 FP16 参考(86.32)的 98.2%;对比 IQ2_XXS 的 72.59 分(7.27 GB)与 UD-Q4_K_XL 的 85.18 分(17.6 GB)。
- 论文报告 AIME26 95.83、LiveCodeBench 90.07,而 IQ2_XXS 分别为 57.5 与 56.4;数学 96.57、编码 89.42、BFCL v3 工具调用 74.92。
- 上下文长度 262K tokens,采用约 75% 线性注意力的混合注意力骨干;视觉塔为独立 Q8_0 mmproj 包(0.63 GB),仅图像输入时加载。
对需要在单卡或笔记本上部署 27B 级推理的团队,该模型说明全链路三元量化可在约 6 GB 体积下保留接近 FP16 的推理与工具调用表现,但必须配套专用内核与分支运行时。
面向智能体搜索的交互空间检索:RISE 论文提出用 BM25 构建有界交互空间
论文提出 RISE(Retrieving Interaction SpacE),用 BM25 构建智能体可探索的有界语料子集,并在索引阶段为文档处理 shell 式导航。在 BrowseComp-Plus 上,RISE 以约四分之一单查询成本达到与纯 shell DCI 基线相同的 78% 准确率。
- 论文报告:在 BrowseComp-Plus 上,RISE 使用 gpt-5.4-mini 达到 78% 准确率,与纯 shell DCI 基线持平,单查询成本约为其四分之一。
- 论文报告:在 100 万文档规模下,RISE-BM25 在 gpt-5.4-mini 上达到 81%。
- 论文报告:同一 100 万文档规模下,DCI 在 gpt-5.4-nano 上降至 60%,并出现 100 次挂钟时间失败中的 33 次。
- 论文指出:无界交互不可扩展,每条宽泛 shell 命令都是全语料扫描,延迟随语料增长急剧恶化。
对构建搜索智能体的团队而言,该结果表明检索层的价值在于划定有界交互空间,而非仅挑选可放入上下文窗口的文档,从而在扩大语料时控制成本与延迟。
Diffusion Controller 统一并简化 AI 图像生成
Google Research 提出 Diffusion Controller,一个轻量级“转向阻尼器”网络,可在基础模型冻结的情况下动态调整去噪轨迹,提升提示词对齐与图像质量。
- 在 Stable Diffusion v1.4 骨干上,使用 HPS-v2 评估 SFT、RWL 和 PPO 三种微调方式。
- 在 SFT 和 RWL 中,灰盒 Diffusion Controller 的 HPS-v2 胜率超过 LoRA,且操纵的内部模型层数明显更少。
- 完全解锁的白盒版本相对基线模型取得 90% 胜率。
- 通过调整单个推理时引导强度参数,可动态调节控制约束强度。
对构建者而言,这提供了一种无需访问闭源模型权重即可实现可控图像生成与个性化定制的轻量方案。
Google DeepMind 推出 SynthID Bio:为 AI 生成蛋白质嵌入可验证水印
Google DeepMind 发布 SynthID Bio,这是一套面向合成生物学的蛋白质水印方法,可在氨基酸序列和 AlphaFold 3 预测的 3D 结构中嵌入可检测信号,并在实验室测试中保持蛋白质的生物学功能。
- SynthID Bio 通过微调 AlphaFold 3 扩散网络的一小部分,将水印能力写入模型权重,使预测的 3D 坐标本身携带可检测信号。
- 在 VEGF-A、SARS-CoV-2 刺突蛋白 RBD 和 PD-L1 三个靶点的湿实验测试中,加水印设计的命中率、结合亲和力与天然序列多样性均与未加水印版本相当。
- 研究称该方法在保持 AlphaFold 3 预测精度的同时实现近乎完美的可检测性,并能抵抗数字噪声或轻微坐标变化。
- Google DeepMind 表示将发表方法论文,开源代码与体外数据,并向研究社区发布权重。
对生物设计工具开发者而言,水印可直接嵌入模型权重与序列生成流程,为 DNA 合成筛选和数据库溯源提供自动化验证信号,但抗蓄意篡改仍是待解问题。