Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-09-30
01
watchresearchnew architecture

Diffusion Controller が AI 画像生成を統合・簡素化する仕組み

Google Research は、拡散のノイズ除去過程を連続制御問題として再定式化する軽量な「ステアリングダンパー」ネットワーク Diffusion Controller を発表した。凍結した基盤モデルを変更せずにプロンプト整合性と画質を高める。

  • 論文は Stable Diffusion v1.4 を基盤に SFT、RWL、PPO の 3 つの微調整方式を評価し、HPS-v2 でユーザープロンプトと美的選好への整合性を測定した。
  • SFT と RWL の実験で、グレーボックス版 Diffusion Controller のステアリングダンパーネットワークは HPS-v2 勝率で LoRA を上回り、変更した内部モデル層数は LoRA より大幅に少なかった。
  • 論文は完全解放版(白盒、内部重みを変更可能)がベースラインモデルに対して 90% の勝率を達成したと報告している。
  • フレームワークは Diffusion Controller、Diffusion Controller-Naive、Diffusion Controller-J、Diffusion Controller-S の 4 つのネットワーク構造を含む。

構築者にとって、これは白盒アクセスなしでクローズドソース画像モデルを細かく制御でき、制御層がモデル核心から分離されているためパーソナライズ、安全性、動画生成へ拡張しやすいことを意味する。

Google Research
02
watchagentsnew architecture

Model Context Protocol を用いた LLM エージェントとデータスペースのアーキテクチャ仲介

本論文は Model Context Protocol (MCP) に基づくアーキテクチャ仲介手法を提案し、Eunomia Agent を通じて LLM エージェントがガバナンス制約を保ったままデータスペースサービスと対話できるようにする。プロトタイプはカタログ探索、メタデータ取得、データサービス呼び出しのエンドツーエンド対話を、既存のデータスペースコンポーネントを変更せずに検証した。

  • 論文は 2026 年 9 月 24 日に arXiv に投稿され、arXiv:2609.30341、cs.AI および cs.DB に分類されている。
  • 仲介レイヤーはデータスペースの機能を構造化されたスキーマ駆動ツールに変換し、AI エージェントが発見・呼び出しできるようにしつつガバナンス制約を保持する。
  • プロトタイプ実装はカタログ探索、メタデータ取得、データサービス呼び出しにわたるエンドツーエンド対話を、既存のデータスペースコンポーネントを変更せずに検証した。
  • 著者は Jaime Alonso Ruiz、Carlos Aparicio、Gabriel Huecas、Joaquín Salvachúa、Andres Munoz-Arcentales である。

AI エージェントを構築するチームにとって、MCP を仲介レイヤーとして使えば既存のデータ基盤を変更せずにガバナンス下のデータスペースへ接続できる可能性を示している。

arXiv cs.AI
03
watchinferencenew architecture

HybridInfer:オンデバイス・エッジ・クラウドLLM推論のための熱認識強化学習ティアルーティング

HybridInferは、オンデバイスのLlama 3.2 3B、検索付きエッジのLlama 3.1 8B、クラウドのGPT-4oという3層構成で、スマートフォンの熱的余裕とクエリ複雑度推定を状態とし、オフライン学習したQ学習ポリシーで推論層を選択する熱認識強化学習ルーターを提案する。

  • 実機Android(Samsung Galaxy S25+、Snapdragon 8 Elite)上の210プロンプトのベンチマークで、学習済みルーターは2つの手調整ヒューリスティックより有意に高い品質を達成し(対応Wilcoxon、p < 0.02)、適応条件の中で最低コストだった。
  • 論文報告:フラッグシップSnapdragonデバイスでは持続的なオンデバイス生成がGPU推論ランタイムを不安定にし、数回連続のクエリ後にクラッシュまたは無言で停止する。原因はOpenCLカーネルコンパイルとモバイルGPUでの長いプロンプトのプリフィルにある。
  • 論文報告:常時オンデバイス条件は提供可能なクエリで1クエリあたりの品質に匹敵するが、3〜6倍遅く、長いクエリでは失敗する。
  • 報酬は品質と遅延、コスト、熱ペナルティをトレードオフし、オンデバイス実行を評価する局所性ボーナスを加える。論文はこのボーナスがないと最適ポリシーが全クエリをオフロードすると述べる。

オンデバイスLLM配備では熱制約は単なる速度低下ではなくランタイム安定性の問題であるため、ルーティング設計は品質と遅延だけでなく熱状態と局所性インセンティブをポリシーに組み込む必要がある。

arXiv cs.LG
04
testdocumentsopen source unlock

XingChen-AGI が TeleOCR を公開:1.2B パラメータの文書解析VLM

TeleOCR は約 1.2B パラメータのオープンソース視覚言語モデルで、デジタル文書とカメラ撮影文書の解析を単一フレームワークに統合し、重みと技術報告が公開されています。

  • モデルカードによるとパラメータ数は約 1.2B、ライセンスは apache-2.0、中国語と英語に対応し、qwen2_5_vl をベースとしています。
  • OmniDocBench v1.6 で TeleOCR は Overall 96.87、Text Edit 0.027、Formula CDM 96.36、Table TEDS 97.05 を報告しています。
  • Dr.DocBench Challenge で TeleOCR は Overall 67.96 を報告し、MinerU 2.5 Pro の 62.26、PaddleOCR-VL 1.6 の 55.11 を上回っています。
  • モデルカードは、TeleOCR が歪み補正の前処理や専用補正モデルなしで歪んだ文書のレイアウトと内容を解析できると述べています。

文書解析パイプラインを構築する開発者にとって、TeleOCR は約 1.2B パラメータで複数の公開ベンチマークの首位を報告し、重みと GGUF 変換が提供されているため、軽量な自前ホスティング解析の候補になります。

Hugging Face Trending
05
testmodelsopen source unlock

Qwen が Qwen-Image-2.1 をオープンソース化:7B パラメータでテキスト画像生成と画像編集を統合

Qwen は、テキストからの画像生成と画像編集を統合した Qwen-Image-2.1 をオープンソース化しました。視覚生成コンポーネントは 7B パラメータ、32 層の Single-Stream DiT で、ネイティブの透過(RGBA)画像生成と編集に対応します。

  • 視覚生成コンポーネントは 7B パラメータで、32 層の Single-Stream DiT を含む。
  • 最大 10 枚の参照画像に対応し、円、描き込み注釈、または個別マスクで局所編集を指定できる。
  • 1:1、4:3、3:4、3:2、2:3、16:9、9:16 のアスペクト比に対応し、例示解像度は最大 2752×1536。
  • ライセンスは Qwen Research License Agreement で、モデルページには先月のダウンロード数 64,362 が表示されている。

単一の 7B モデルでテキスト画像生成、RGBA 透過レイヤー生成、複数参照画像の編集をまとめて扱えるため、生成用と編集用に別々のモデルを配備する必要を減らせます。

Hugging Face Trending
06
watchresearchincremental

フロンティアAI訓練のセーフティケースに向けた初期ガイドライン

OpenAIがフロンティアAI訓練のセーフティケースに関する初期ガイドラインを公開し、技術的保護措置、運用プラクティス、ミスアラインメント事案の調査を対象としている。

  • ガイドラインは技術的保護措置、運用プラクティス、ミスアラインメント事案の調査を対象とする。
  • 初期段階のガイドラインとして提示されている。

フロンティアモデルの訓練を担うチームは、この3領域を内部セーフティケース文書の出発点として使える。

OpenAI News
07
testmodelsopen source unlock

TaichuAI が ZDTaichu5.0-9B マルチモーダル基盤モデルを公開、空間推論とエージェントツール利用に対応

ZDTaichu5.0-9B は TaichuAI によるマルチモーダル基盤モデルで、Qwen3.5-9B 言語バックボーンと C-RADIOv4-H 視覚エンコーダを組み合わせ、テキスト・画像・動画の任意解像度入力をサポートし、汎用視覚理解、空間推論、エージェントツール利用、身体性 AI 研究を対象としています。

  • パラメータ数は 9.8B、テンソル型は BF16、コンテキスト長は最大 128K tokens。
  • モデルカードは TAU2-Bench で 87.7、Claw-Eval で 71.4、IFEval で 93.7 のスコアを報告。
  • モデルカードは ERQA で 48、RoboSpatial で 56 のスコアを報告。
  • 重みは NVIDIA Open Model License Agreement の下で提供され、Qwen3.5 の Apache-2.0 ライセンスが保持される。

視覚エージェントや身体性 AI パイプラインを構築する開発者にとって、このモデルは 10B 規模で空間推論とツール呼び出しを両立させるが、ツール実行は周辺アプリ側で実装・検証・保護する必要がある。

Hugging Face Trending