Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-09-30
01
watchresearchnew architecture

Diffusion Controller 如何统一并简化 AI 图像生成

Google Research 提出 Diffusion Controller,一个轻量级“转向阻尼器”网络,将扩散去噪过程重构为连续控制问题,可在不修改冻结基座模型的情况下提升提示词对齐与图像质量。

  • 论文在 Stable Diffusion v1.4 基座上评估了 SFT、RWL 和 PPO 三种微调方式,使用 HPS-v2 衡量与用户提示词及审美的对齐程度。
  • 在 SFT 和 RWL 实验中,灰盒 Diffusion Controller 转向阻尼器网络在 HPS-v2 胜率上超过了 LoRA,且改动的内部模型层数明显更少。
  • 论文报告其完全解锁版本(白盒、可修改内部权重)相对基线模型取得 90% 胜率。
  • 框架包含四种网络结构:Diffusion Controller、Diffusion Controller-Naive、Diffusion Controller-J 和 Diffusion Controller-S。

对构建者而言,这意味着无需白盒访问即可对闭源图像模型进行细粒度控制,且控制层与模型核心分离,便于扩展到个性化、安全与视频生成。

Google Research
02
watchagentsnew architecture

通过 Model Context Protocol 实现 LLM 智能体与数据空间的架构中介

该论文提出基于 Model Context Protocol (MCP) 的架构中介方法,并通过 Eunomia Agent 实现,使 LLM 智能体能够以受治理约束的方式与数据空间服务交互。原型验证了目录发现、元数据检索和数据服务调用的端到端交互,且无需修改现有数据空间组件。

  • 论文于 2026 年 9 月 24 日提交至 arXiv,编号 arXiv:2609.30341,属于 cs.AI 与 cs.DB 分类。
  • 中介层将数据空间能力转换为结构化、模式驱动的工具,供 AI 智能体发现和调用,同时保留治理约束。
  • 原型实现验证了跨目录发现、元数据检索和数据服务调用的端到端交互,且未修改现有数据空间组件。
  • 作者为 Jaime Alonso Ruiz、Carlos Aparicio、Gabriel Huecas、Joaquín Salvachúa 和 Andres Munoz-Arcentales。

对构建 AI 智能体的团队而言,该工作表明可用 MCP 作为中介层接入受治理的数据空间,从而在不改动既有数据基础设施的前提下实现合规的智能体数据访问。

arXiv cs.AI
03
watchinferencenew architecture

HybridInfer:面向端侧、边缘与云端LLM推理的热感知强化学习分层路由

HybridInfer 提出一种热感知强化学习路由器,在端侧 Llama 3.2 3B、带检索的边缘 Llama 3.1 8B 与云端 GPT-4o 三层之间选择推理层级,状态包含手机热余量与查询复杂度估计,策略为离线训练的 Q-learning。

  • 在真实 Android 硬件(Samsung Galaxy S25+、Snapdragon 8 Elite)上以 210 条提示词评测,学习到的路由器质量显著高于两个手工调优启发式(配对 Wilcoxon,p < 0.02),且成本为所有自适应条件中最低。
  • 论文报告:在旗舰 Snapdragon 设备上,持续端侧生成会使 GPU 推理运行时不稳定,连续几次查询后崩溃或静默卡死,问题源于 OpenCL 内核编译与移动 GPU 上的长提示词预填充。
  • 论文报告:始终端侧条件在可服务查询上达到与逐查询相当的质量,但慢三到六倍,并在长查询上失败。
  • 奖励在质量、延迟、成本与热惩罚之间权衡,并加入奖励端侧执行的本地性奖励;论文称若无该奖励,最优策略会将每条查询卸载。

对端侧 LLM 部署而言,热约束不只是性能下降,而是运行时稳定性问题,因此路由设计必须把热状态与本地性激励纳入策略,而非仅优化质量与延迟。

arXiv cs.LG
04
testdocumentsopen source unlock

XingChen-AGI 发布 TeleOCR:1.2B 参数文档解析视觉语言模型

TeleOCR 是一个约 1.2B 参数的开源视觉语言模型,统一处理数字文档与相机拍摄文档的解析,采用多节点共识投票、几何感知建模与四阶段渐进训练,权重与技术报告已发布。

  • 模型卡显示参数量约 1.2B,采用 apache-2.0 许可证,支持中文与英文,基于 qwen2_5_vl。
  • 在 OmniDocBench v1.6 上,TeleOCR 报告 Overall 96.87、Text Edit 0.027、Formula CDM 96.36、Table TEDS 97.05。
  • 在 Dr.DocBench Challenge 上,TeleOCR 报告 Overall 67.96,高于 MinerU 2.5 Pro 的 62.26 与 PaddleOCR-VL 1.6 的 55.11。
  • 模型卡称 TeleOCR 可直接对扭曲文档进行版面与内容解析,无需去畸变预处理或专用矫正模型。

对构建文档解析流水线的开发者而言,TeleOCR 以约 1.2B 参数在多个公开基准上报告了领先结果,并已提供权重与 GGUF 转换,适合作为轻量级自托管解析方案的候选。

Hugging Face Trending
05
testmodelsopen source unlock

Qwen 开源 Qwen-Image-2.1:7B 参数统一文生图与图像编辑模型

Qwen 开源 Qwen-Image-2.1,一个统一的文生图生成与图像编辑模型,视觉生成组件为 7B 参数、32 层 Single-Stream DiT,支持原生透明(RGBA)图像生成与编辑。

  • 视觉生成组件为 7B 参数,包含 32 层 Single-Stream DiT。
  • 支持最多 10 张参考图像,可通过圆圈、涂鸦标注或独立掩码指定局部编辑。
  • 支持 1:1、4:3、3:4、3:2、2:3、16:9、9:16 等宽高比,示例分辨率最高 2752×1536。
  • 采用 Qwen Research License Agreement 许可,模型页显示上月下载量 64,362。

对构建者而言,单一 7B 模型同时覆盖文生图、RGBA 透明图层生成与多参考图编辑,可减少为生成与编辑分别部署模型的需要。

Hugging Face Trending
06
watchresearchincremental

面向前沿AI训练的安全案例早期指南

OpenAI发布前沿AI训练安全案例的早期指南,涵盖技术保障措施、运营实践以及失准事件的调查。

  • 指南覆盖技术保障措施、运营实践与失准事件调查三个方面。
  • 该指南被描述为早期版本,尚未形成最终标准。

对构建前沿模型训练的团队而言,可将这三类要素作为内部安全论证文档的起步框架。

OpenAI News
07
testmodelsopen source unlock

TaichuAI 发布 ZDTaichu5.0-9B 多模态基础模型,支持空间推理与智能体工具调用

ZDTaichu5.0-9B 是 TaichuAI 推出的多模态基础模型,采用 Qwen3.5-9B 语言主干与 C-RADIOv4-H 视觉编码器,支持文本、图像和视频的任意分辨率输入,面向通用视觉理解、空间推理、智能体工具使用和具身 AI 研究。

  • 模型参数规模为 9.8B,采用 BF16 张量类型,上下文长度最高 128K tokens。
  • 模型卡报告在 TAU2-Bench 上得分 87.7、Claw-Eval 上得分 71.4、IFEval 上得分 93.7。
  • 模型卡报告在 ERQA 上得分 48、RoboSpatial 上得分 56。
  • 权重依据 NVIDIA Open Model License Agreement 发布,并保留 Qwen3.5 的 Apache-2.0 许可。

对于构建视觉智能体或具身 AI 管线的开发者,该模型在 10B 量级上同时提供空间推理与工具调用能力,但工具执行仍需由外围应用实现和保障。

Hugging Face Trending