Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-05
01
watchresearchnew architecture

Google Research 推出 Diffusion Controller,统一并简化 AI 图像生成控制

Google Research 提出 Diffusion Controller,一个轻量级“转向阻尼器”网络,将扩散模型的去噪过程视为连续控制问题,可在不修改基础模型的情况下提升提示词对齐与图像质量。

  • 论文在 Stable Diffusion v1.4 骨干上评估了 SFT、RWL 和 PPO 三种微调方式,使用 HPS-v2 衡量与用户提示词及审美的对齐程度。
  • 在 SFT 和 RWL 实验中,灰盒 Diffusion Controller 转向阻尼器网络在 HPS-v2 胜率上超过了 LoRA,且改动的内部模型层数明显更少。
  • 论文报告其完全解锁版本(白盒、可修改内部权重)相对基线模型取得 90% 胜率。
  • 该网络可附加到访问受限的闭源模型上,并通过调整单一推理时引导强度参数动态控制约束强度。

对构建者而言,这意味着无需白盒权重即可对闭源图像模型做轻量级、可调强度的行为引导,从而降低定制与对齐成本。

Google Research
02
testmodelsopen source unlock

Cloudflare/clef-flash:9B 多模态决策模型,单次前向传播输出结构化概率

Cloudflare 发布 clef-flash,一个基于 Qwen/Qwen3.5-9B 后训练得到的 9B 多模态模型,可将状态与类型化问题 schema 转换为决策,并在单次前向传播中为每个问题的每个允许选项返回概率,不生成自由文本。

  • 模型基于 Qwen/Qwen3.5-9B 及其视觉编码器后训练,采用标准分片 safetensors 存储。
  • 输入支持文本、JSON、图像或视频,输出为每个问题每个允许选项一个 logit,按问题做 softmax 得到概率。
  • 采用 Apache-2.0 许可,遵循基础模型 Qwen/Qwen3.5-9B。
  • 在单张 H200 上使用 torch 2.11 与 transformers 5.10.2 测试,图像和视频输入还需 pillow。

对于需要结构化决策而非自由文本生成的 AI 构建者,clef-flash 提供了可直接接入 Jev/SystemOne API 的 9B 单次前向概率输出方案。

Hugging Face Trending
03
testcreativeincremental

Qwen 开源 Qwen-Image-2.1:7B 统一文生图与图像编辑模型

Qwen 开源 Qwen-Image-2.1,一个统一文生图与图像编辑模型,视觉生成组件为 7B 参数、32 层 Single-Stream DiT,支持原生 RGBA 透明图生成与最多 10 张参考图编辑。

  • 视觉生成组件为 7B 参数,包含 32 层 Single-Stream DiT。
  • 支持最多 10 张参考图像,可通过圆圈、涂鸦标注或独立掩码指定局部编辑。
  • 支持 1:1、4:3、3:4、3:2、2:3、16:9、9:16 等宽高比,示例分辨率最高 2752×1536。
  • 采用 Qwen Research License Agreement 许可,上月下载量 90,003。

对构建创意工具的团队而言,单模型同时覆盖文生图、透明图层生成与多参考图编辑,可减少多模型拼接带来的工程复杂度。

Hugging Face Trending