AI FRONTIER
Signals worth understanding before they become obvious.
字节Seed团队论文揭示DeepSeek“抽风”原因:相位敏感性
界面新闻报道,字节Seed团队论文指出相位敏感性是DeepSeek出现“抽风”现象的原因。
- 来源为界面新闻(Jiemian.com)。
- 论文由字节Seed团队发表。
- 论文将DeepSeek的“抽风”现象归因于相位敏感性。
对AI构建者而言,该论文提示在排查大模型输出不稳定时,应把相位敏感性纳入诊断维度。
多模态大模型还需要视觉编码器吗?一份来自腾讯的缩放定律研究
腾讯的一项缩放定律研究探讨多模态大模型是否仍需独立的视觉编码器,属于新架构方向的探索。
- 来源为科技行者,标题指出该研究来自腾讯。
- 研究以缩放定律为方法,追问多模态大模型对视觉编码器的必要性。
对构建多模态系统的团队而言,该研究提示视觉编码器是否可被统一架构替代值得纳入架构选型评估。
Agentic AI 中的验证与自我改进:基础与极限
该论文提出以隐藏终端随机性的有界验证框架,比较智能体通过延长搜索、获得额外支持或修改提议与验证方式实现的改进,并证明独立多数放大可保持两类语言,而随机磁带上的存在性接受可能接纳错误输出。
- 论文证明随机验证类满足 Σ_k^P ⊆ Σ_k^RV ⊆ Σ_{k+1}^P,严格扩大与深度分离需要显式复杂度假设。
- 论文证明当 BPP = P 时,存在具有相同边界的确切伴随类。
- 论文指出在共同健全解释器与固定验证协议下,一致有界的自我修改仍处于同一验证类。
- 论文包含 26 页、5 幅图,并提供证明与可复现性工件。
该框架把自我改进主张绑定到正确性、可采纳证据、验证资源与选择错误的具体义务上,为智能体评估提供了区分搜索增益与验证增益的形式化工具。
Asana 在浏览器测试中用 GPT-6.1 Sol 将模型成本降低 76 倍
Asana 在 Codex 中使用 GPT-6 Astra,使其浏览器代理在测试中成本降低 76 倍、速度提升 5 倍,以便为客户提供能力更强的模型。
- Asana 在 Codex 中使用 GPT-6 Astra。
- Asana 的浏览器代理在测试中成本降低 76 倍。
- 同一测试中速度提升 5 倍。
对构建浏览器代理的团队而言,这一报告的成本与速度变化表明,在 Codex 中选用 GPT-6 Astra 可显著降低单次任务开销。
OpenAI Decisions API 进入公开测试版,类型化答案速度提升 10 倍
OpenAI Decisions API 已进入公开测试版,据报其类型化答案的返回速度提升至原来的 10 倍。
- OpenAI Decisions API 已进入公开测试版。
- 据报类型化答案速度提升 10 倍。
对于构建类型化输出流程的开发者而言,该 API 进入公开测试版意味着可以在正式发布前测试其延迟表现。
冻结解码器、修复编码器:面向SVD KV-Cache压缩的参数高效适配
论文指出,在共享学习率下比较可训练参数量差异很大的微调方案会产生虚假优势;在SVD低秩KV-Cache压缩场景中,为每个方案单独调参后,仅修复编码器与替代方案持平,同时可训练参数和优化器状态内存均减少3倍。
- 论文在Qwen2.5-VL-3B-Instruct视觉语言模型上,对每种配置使用逐方案学习率调优和三个随机种子验证了这一持平结果。
- 仅修复编码器相比替代方案实现3倍更少的可训练参数和3倍更少的优化器状态内存。
- 该协议仅覆盖一个压缩比,并在两个骨干模型的纯文本测试平台上得到复现。
对于在训练时改造低秩KV-Cache压缩的开发者,仅修复编码器是一种更低内存的即插即用方案,但比较不同参数量规模的微调方案时必须逐方案调参。
Anthropic的Claude Science完成人类首张完整紫外全天地图
Anthropic利用Claude Science生成了首张完整的紫外全天地图,填补了此前约三分之一天空缺乏紫外数据的空白。该项目由约翰斯·霍普金斯大学天体物理学家、Anthropic研究员Brice Ménard领导,在Claude Science环境中并行运行多个AI代理,完成从数据收集到可视化的全流程。
- NASA的GALEX卫星于2003年至2013年运行,为避免强光损坏探测器而刻意避开银河平面和亮星附近区域。
- 尽管韩国的FIMS/SPEAR和NASA的Swift等卫星补充了数据,全天空约三分之一仍完全没有紫外数据。
- 研究团队交叉校准了GALEX、Swift、FIMS/SPEAR、ESA的Gaia和Planck的数万张图像,并使用机器学习修复方法填补缺失的三分之一区域。
- 基于ESA Gaia的可见光测量,地图合成了超过1.19亿颗恒星和约16万个外星系的紫外辐射估计值。
这表明多代理AI工作流可以完成长期被推迟的大规模数据校准任务,但地图三分之一的像素为统计估计值,且需要专家监督才能发现残留伪影。
jialinyyzz/humanizer:12B 文本改写模型,95% 英文改写被 Originality.ai 最严格设置判为人类写作
jialinyyzz/humanizer 是一个 12B 文本生成模型,用于把 AI 撰写的邮件、文章、报告和论坛帖改写得更像人写的,支持英文和中文,可本地运行。模型卡称在 210 篇英文草稿上,95% 的改写被 Originality.ai 最严格设置判为人类写作,训练中未使用任何 AI 检测器。
- 模型卡报告:在 210 篇英文草稿、bf16 权重、2026-10-02 的测试中,210 篇改写有 11 篇被 Originality.ai 最严格设置标记为 AI,上一版本为 26 篇。
- 在 humanizer-12b-Q8_0.gguf 上,420 篇英文改写中有 376 篇未被严格 LLM 事实评判器发现事实问题;发现问题时,超过九成修复只涉及一个词或短语。
- GGUF 文件从 2-bit 的 3.9 GB(峰值内存 6.2 GB)到 Q8_0 的 12.7 GB(峰值内存 13.7 GB),2-bit 文件与 bf16 的 top-1 一致率为 87.4%,Q8_0 为 98.4%。
- 许可证为 apache-2.0,提供 GGUF、Safetensors 和 Transformers 格式,支持 llama.cpp、MLX、transformers、vLLM 和 Ollama,应用支持 Mac(Apple 芯片)和 Windows,可离线运行。
对需要发布 AI 辅助文本的开发者来说,这个模型提供了可本地部署、按内存选择量化档位的改写方案,但模型卡明确提示发送前仍需人工核对数字、日期和名称。