Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-07
01
testmodelsopen source unlock

EmbeddingGemma 2:オープンで軽量なマルチモーダル埋め込みモデル

Google DeepMind は、Gemma 4 アーキテクチャに基づき Apache 2.0 ライセンスで公開された 7 億 4,000 万パラメータの EmbeddingGemma 2 を発表しました。テキスト、画像、音声、動画をネイティブに統合埋め込み空間へ写像します。

  • 7 億 4,000 万パラメータで、Gemma 4 アーキテクチャに基づき、商用利用可能な Apache 2.0 ライセンスで公開。
  • テキスト専用ワークロードでは最小 2 億 7,000 万パラメータ、オプションの視覚エンコーダは 1 億 7,000 万、音声エンコーダは 3 億パラメータ。
  • MTEB Code におけるコード性能が 68.76 から 78.68 へ 9.92 ポイント向上。
  • MRL により出力ベクトルを 768 次元から 512、256、128 次元へ動的に切り詰め可能で、最大 6 倍のストレージ削減。

開発者はモジュール式エンコーダと MRL の切り詰めを活用し、オンデバイスでのクロスモーダル検索や RAG パイプラインをメモリとストレージの制約内で構築できます。

Google DeepMind
02
watchresearchnew architecture

エージェント検索のためのインタラクション空間検索:RISE

論文は RISE(Retrieving Interaction SpacE)を提案し、BM25 で境界付きのインタラクション空間を構築し、索引時に文書をシェル風ナビゲーション用に処理することで、無制限な直接コーパス対話を置き換える。

  • BrowseComp-Plus で RISE は gpt-5.4-mini を用いて 78% の精度を達成し、純シェルの DCI ベースラインと同等でありながら、クエリあたりのコストは約 4 分の 1 である。
  • 100 万文書規模で RISE-BM25 は gpt-5.4-mini において 81% に達する。
  • 同規模で DCI は gpt-5.4-nano において 60% に低下し、100 回中 33 回の実時間失敗が発生する。
  • 論文は無制限な対話がスケールしないと指摘する。広範なシェルコマンドは毎回コーパス全体のスキャンとなり、コーパスの増大に伴い遅延が急激に悪化する。

検索エージェントを構築するチームにとって、検索層の役割は「文書の選択」から「探索可能な境界の設定」へ移り、大規模コーパスでのコストと安定性を左右する。

arXiv watchlist
03
testdeveloperopen source unlock

AutoSynthData:エンタープライズエージェント向けの訓練データ生成

ServiceNow CoreAI は、対象モデルの失敗とより強力な教師モデルの成功から能力ギャップを特定し、検証済みの新規実行可能タスクを生成して事後学習に使う AutoSynthData を公開した。

  • EnterpriseOps Gym の Hybrid 領域では、対象モデル Gemma-4-26B-A4B-it、教師 Qwen3.8-27B を使用し、約 18 時間で 2,000 件の合成訓練サンプルを生成した。
  • Hybrid の最良チェックポイントは epoch 5 で、平均 Pass@1 が 7.2 ポイント(相対 35%)向上し、検証器成功率は 63.01% から 68.55% に上昇した。
  • 報告によると、Gemma と参照モデルの間の元の Pass@1 ギャップの 59% を埋めた。
  • ITSM 領域でも対象モデル Gemma-4-26B-A4B-it、教師 DeepSeek-V4.1-Flash を使用し、66 時間で 1,994 件の合成訓練サンプルを生成した。

エンタープライズエージェントを構築するチームにとって、この手法は環境固有の失敗を検証済みの訓練タスクに変換し、合成データ量の拡大ではなく難易度調整を可能にする点が重要である。

Hugging Face Blog
04
watchresearchbenchmark jump

Open TTS Leaderboard:多言語テキスト読み上げと音声クローニングのスケーラブルな評価

Hugging Face が Open TTS Leaderboard を公開し、オープンソースの多言語 TTS と音声クローニングモデルを客観指標で評価する。Qwen3 ASR による WER/CER、H200 GPU 上の RTFx と TTFA、WavLM 話者埋め込みのコサイン類似度(SIM)を用いる。

  • 2026年9月30日時点で、Hugging Face Hub には 8K を超える TTS モデルがある。
  • 2026年9月30日時点で、Artificial Analysis の 92 モデルのうちオープンウェイトは 16 のみ。
  • 客観指標により、モデル1件の評価は投票収集の数週間から数時間に短縮される。
  • デフォルト表示は Seed TTS Eval の英語スプリットと CV3 Eval(zero shot)のマクロ平均 WER で順位付けし、hexgrad/Kokoro-82M、Supertone/supertonic-3、fishaudio/s2-pro が上位。

音声エージェントを構築するチームにとって、このリーダーボードはオープンモデルの WER、RTFx、TTFA、SIM を再現可能に比較でき、遅延・サイズ・多言語品質のトレードオフ判断に使えるが、自然さや聴感上の好みは測らない。

Hugging Face Blog
05
testmodelsopen source unlock

autotrust/JEV-27B-VL:視覚に対応した27.8Bマルチモーダル意思決定モデル

autotrust/JEV-27B-VL は autotrust/JEV-27B に視覚を加えたモデルで、テキストと画像に対して較正済み確率付きの型付き System 1 意思決定を出力し、未改変の Qwen3.8-27B を System 2 として保持する。

  • パラメータ数 27.8B、Pipeline は image-text-to-text、ライセンスは apache-2.0。
  • System 1 は yes/no、2〜256 個の選択肢からの選択、0〜5 の評価に対応し、プロンプトは最大 256K トークン。
  • ロボットアームのピックアンドプレースでは 20 ランダムシーン中 75% を完了し、把持に成功した 15 個すべてがトレイに入り、意思決定あたり約 240 ms。
  • ブラウザ操作では 60 ランダム多段タスクの 95% を完了し、クリックあたり約 0.26 秒。番号付きボックスのみでは 10% に低下する。

制御ループ内で低遅延の視覚判断を必要とする開発者にとって、JEV-27B-VL は単一の順伝播で較正済み確率を返すが、コンピュータ操作では要素テキストの提供が必須となる。

Hugging Face Trending