Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-07
01
testmodelsopen source unlock

EmbeddingGemma 2:开放轻量级多模态嵌入模型

Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构,采用 Apache 2.0 许可,拥有 7.4 亿参数,可将文本、图像、音频和视频原生映射到统一嵌入空间。

  • 模型拥有 7.4 亿参数,基于 Gemma 4 架构,采用商业友好的 Apache 2.0 许可发布。
  • 文本工作负载最低仅需 2.7 亿参数,视觉编码器可选 1.7 亿参数,音频编码器可选 3 亿参数。
  • 在 MTEB Code 上代码性能提升 9.92 分,从 68.76 提升至 78.68。
  • 使用 MRL 可将输出向量从 768 维动态截断至 512、256 或 128 维,最多实现 6 倍存储缩减。

开发者可在本地硬件上构建跨模态检索与 RAG 流水线,并通过模块化编码器和 MRL 截断在内存与存储之间灵活权衡。

Google DeepMind
02
watchresearchnew architecture

面向智能体搜索的交互空间检索:RISE 方法

论文提出 RISE(Retrieving Interaction SpacE),用 BM25 构建有边界的交互空间,并在索引阶段处理文档以支持 shell 式导航,从而替代无界直接语料交互。

  • 在 BrowseComp-Plus 上,RISE 使用 gpt-5.4-mini 达到 78% 准确率,与纯 shell 的 DCI 基线持平,但每查询成本约为其四分之一。
  • 在 100 万文档规模下,RISE-BM25 在 gpt-5.4-mini 上达到 81%。
  • 同一规模下,DCI 在 gpt-5.4-nano 上降至 60%,并出现 100 次墙钟测试中的 33 次失败。
  • 论文指出无界交互不可扩展:每条宽泛 shell 命令都是全语料扫描,延迟随语料增长急剧恶化。

对构建搜索智能体的团队而言,检索层的价值正从“挑选文档”转向“划定可探索边界”,这直接决定大规模语料下的成本与稳定性。

arXiv watchlist
03
testdeveloperopen source unlock

AutoSynthData:为企业智能体生成训练数据

ServiceNow CoreAI 发布 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行任务用于后训练。

  • 在 EnterpriseOps Gym 的 Hybrid 域中,以 Gemma-4-26B-A4B-it 为目标模型、Qwen3.8-27B 为教师,约 18 小时生成 2,000 条合成训练样本。
  • Hybrid 上最佳检查点为第 5 个 epoch,平均 Pass@1 提升 7.2 个百分点,相对提升 35%,验证器成功率从 63.01% 升至 68.55%。
  • 报告称该结果缩小了 Gemma 与参考模型之间原始 Pass@1 差距的 59%。
  • 在 ITSM 域中同样以 Gemma-4-26B-A4B-it 为目标模型、DeepSeek-V4.1-Flash 为教师,66 小时生成 1,994 条合成训练样本。

对构建企业智能体的团队而言,该流程把环境中的具体失败转化为经过验证的训练任务,并提供可复用的难度校准方法,而不只是扩大合成数据规模。

Hugging Face Blog
04
watchresearchbenchmark jump

Open TTS Leaderboard:面向多语言文本转语音与声音克隆的可扩展评测

Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型:以 Qwen3 ASR 计算 WER/CER,以 H200 GPU 上的 RTFx 与 TTFA 衡量速度,并用 WavLM 说话人嵌入的余弦相似度(SIM)衡量音色相似度。

  • 截至 2026 年 9 月 30 日,Hugging Face Hub 上有超过 8K 个 TTS 模型。
  • 截至 2026 年 9 月 30 日,Artificial Analysis 的 92 个模型中只有 16 个是开放权重模型。
  • 依靠客观指标,评测一个模型的时间从收集投票所需的数周缩短到数小时。
  • 默认视图按 Seed TTS Eval 英文分片与 CV3 Eval(zero shot)的宏平均 WER 排名,hexgrad/Kokoro-82M、Supertone/supertonic-3 和 fishaudio/s2-pro 领先。

对构建语音智能体的团队而言,该榜单提供了可复现的开源模型 WER、RTFx、TTFA 与 SIM 对比,可用于在延迟、体积和多语言质量之间做取舍,但它不衡量自然度或听感偏好。

Hugging Face Blog
05
testmodelsopen source unlock

autotrust/JEV-27B-VL:具备视觉能力的27.8B多模态决策模型

autotrust/JEV-27B-VL 是 autotrust/JEV-27B 的视觉版本,在文本和图像上输出带校准概率的类型化 System 1 决策,并保留未修改的 Qwen3.8-27B 作为 System 2。

  • 参数规模 27.8B,Pipeline 为 image-text-to-text,采用 apache-2.0 许可证。
  • System 1 支持 yes/no、2–256 个选项中选择、0–5 评分,提示最长 256K tokens。
  • 在 20 个随机场景的机器人抓取放置任务中完成 75%,抓取成功的 15 个方块全部放入托盘,每次决策约 240 ms。
  • 在 60 个随机多步浏览器任务中完成 95%,每次点击约 0.26 s;仅给编号框而不给元素文本时降至 10%。

对需要在控制循环中做低延迟视觉判断的开发者,JEV-27B-VL 提供了单次前向传播输出校准概率的接口,但计算机使用场景必须提供元素文本。

Hugging Face Trending