Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-03
01
watchmodelsincremental

Gemini 4 Argon:Google DeepMindの新たなフロンティア知能モデル

Google DeepMindはGemini 4 Argonを発表し、長期的な複雑ワークフロー向けに出力トークン上限を64Kから100万に拡大、Fairwind Programを通じて信頼されたサイバー防御者へ順次提供を開始した。

  • 出力トークン上限は64Kから100万に拡大され、Googleは業界最大と説明している。
  • DeepSWE v1.1で77.9%の新たな最先端を達成。これは実世界の長期的ソフトウェアエンジニアリングタスクを測るベンチマーク。
  • ZapierのAutomationBenchで51.3%を記録し1位、LVBenchの長尺動画理解では91.7%で最先端。
  • CWE-bench v1では68%で首位タイ。導入価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドル、キャッシュ入力は入力価格から95%割引。

100万出力トークン上限と入力100万トークン2ドルの価格は長期的なエージェント軌跡を経済的に実行可能にするが、現時点では信頼された防御者に限定される。

Google DeepMind
02
watchagentsnew architecture

提案から検証済み効果へ:Praxa、統治されたAIエージェント実行のための証拠拘束ハーネス

本論文はPraxaエージェントハーネスを提案し、決定論的アドミッション、仲介実行、外部読み戻し、照合、レビュー付き昇格を通じて、提案・権限・ディスパッチ・検証済み外部効果・配信昇格という状態を明示的に区別する。著者が報告する4つの証拠レーンはいずれも本番成果や汎用的な優位性を示していない。

  • 著者が固定リビジョンで実施したリポジトリ内監査は1,027/1,027の単体テストと89/89のWorkerdテストに合格し、想定される363ソースファイルすべてを計測して4つのカバレッジ下限を満たしたが、テストごとの生ログと独立再現は利用できない。
  • Terminal-Bench Core 0.1.1の12厳選タスクによるプロバイダー依存パイロットでは、ベースラインと信頼性レイヤーの各アームが17/36の厳格試行に合格した。信頼性レイヤーは入力トークンを37.49%、出力トークンを50.73%多く使用したため、このパイロットは優位性を支持しない。
  • デバッグ後の2次調整プロキシ開発比較では、ベースラインと著者作成候補がそれぞれ180/180試行を完了し、測定精度は同等で、完全なハーメティック障害復旧と保護違反ゼロを達成した。
  • 候補はトークンを37.11%削減し、推定エンドポイントコストを33.84%削減し、ステップ数を11.63%削減した。論文はこれが品質・レイテンシ・本番挙動の改善を立証しないと明記している。

統治されたエージェントを構築するチームにとって、Praxaの意義は権限から外部効果への遷移をテスト可能な明示的状態にした点にあるが、現時点の証拠はアーキテクチャの検証可能性までであり、本番展開や安全性の主張を支えるには不十分である。

arXiv cs.AI
03
watchmodelsnew architecture

OpenRouter 新モデル:inclusionAI Ling 3.1 Flash

inclusionAI の Ling 3.1 Flash は、総パラメータ 560B のうち 25B をアクティブにするハイブリッド推論型 Mixture-of-Experts モデルで、コンテキストウィンドウは 262,144 トークンです。

  • 総パラメータ 560B、アクティブパラメータ 25B。
  • コンテキストウィンドウは 262,144 トークンで、最大 32,768 の補完トークンをサポート。
  • tools と tool_choice による関数呼び出しに対応するが、response_format は非対応のため JSON 出力は強制されない。
  • OpenRouter のページでは無料と表示され、リリース日は 2026 年 10 月 2 日。

ビルダーにとっては無料の長コンテキスト MoE かつツール呼び出し対応の選択肢だが、構造化出力の強制がないため JSON の信頼性はアプリ側で担保する必要がある。

OpenRouter Models
04
watchcreativenew architecture

DSSR-3D:3Dガウシアンにおける視点依存参照のための分離推論

DSSR-3Dは連続3Dガウシアンフィールド上の視点依存参照セグメンテーション向けの推論時フレームワークであり、姿勢不変の意味定位と姿勢条件付き空間推論の2インターフェースとして定式化され、基盤意味フィールドの再学習を必要としない。

  • 論文はフレームワークを姿勢不変の意味定位と姿勢条件付き空間推論の2インターフェースとして定式化し、制約を満たす任意の関数対が有効な実装となる。
  • 実装は温度鋭化softmax定位機構と投影ベースの方向スコア関数を、軽量で学習不要のステップで融合する。
  • 著者らは3Dガウシアンフィールド上の視点依存セグメンテーションを分離するViewRef-GSベンチマークを提案し、拡張Ref-LERFと併せて評価する。
  • 論文は既存の3DGSベース参照手法に対して一貫した改善を報告し、基盤意味フィールド以外の追加学習を要しない。

AI構築者にとって、視点依存の空間参照を推論時に分離して扱えることを示し、意味フィールドを再学習せず構造の異なるフィールドへ移行できる点が重要である。

arXiv cs.CV
05
watchresearchcost collapse

FlashDiffusion:融合タイルカーネルスペクトル分解

本論文は FlashDiffusion を提案する。これは融合 GPU タイル内で密なガウスカーネルブロックを評価する行列不要の手法であり、固有値ソルバーを経験的 β-flow と結合して有限サンプル解像度スケールを選択する。

  • 論文は密なガウスカーネルが O(N^2) メモリを必要とすると報告している。
  • 手法は融合 GPU タイル内で密なガウスカーネルブロックを評価し、密カーネルの実体化を回避する。
  • 固有値ソルバーは経験的 β-flow と結合され、有限サンプル解像度スケールを選択する。
  • サンプル数と帯域幅にわたる継続は、粗い解像度から高コストなスペクトル求解をウォームスタートする。

幾何学習でカーネル法を用いる AI 構築者にとって、この行列不要のタイル手法は O(N^2) の密カーネルメモリのボトルネックを除去し、より大規模なスペクトル求解を実行可能にする。

arXiv cs.LG
06
watchresearchincremental

ChainLoRA:LLMの継続学習のための幾何保存型タスクベクトル統合

ChainLoRAは、チェーン更新されたタスクベクトル幾何に基づくリプレイ不要の継続的統合フレームワークであり、チェーン更新トレーニングとストリーム後の適応的SVD統合を組み合わせている。論文は、LargeおよびSuperNIベンチマークにおいて、評価されたリプレイ不要手法の中で最先端の性能を達成したと報告している。

  • ChainLoRAはチェーン更新トレーニングとストリーム後の適応的SVD統合を組み合わせ、トレーニング時の初期化と片側直交性プロキシは最後のキャリアのみを使用する。
  • 統合時には、適応的SVDが共有キャリアを抽出し、Procrustes適応によって最新タスクに整列させる。
  • 理論分析は、Procrustes適応が共有成分とタスク固有成分の幾何学的近似分離を促進し、片側プロキシがタスク間干渉をさらに制限することを示している。
  • 論文は、LargeおよびSuperNIベンチマークにおいて、ChainLoRAが評価されたリプレイ不要手法の中で最先端の性能を達成し、3つのベンチマークすべてで評価されたリプレイベース手法にほぼ最も近い平均スコアを得たと報告している。

継続学習パイプラインを構築する開発者にとって、ChainLoRAのチェーン更新と適応的SVD統合は、タスクストリームが増えても履歴状態と正則化のオーバーヘッドが一定に保たれる、リプレイ不要のパラメータ効率の良い微調整経路を提供する。

arXiv stat.ML
07
testmodelsopen source unlock

NVIDIA Kumo Tabular が表形式予測の精度・効率フロンティアを更新

NVIDIA は表形式データ向けのオープン基盤モデル Kumo Tabular を公開し、学習・チューニング・特徴量エンジニアリングなしの単一フォワードパスで分類と回帰を実行する。28M から 215M の 3 サイズを提供し、OpenMDW-1.1 ライセンスで公開される。

  • モデルは Small/Medium/Large の 3 サイズ、28M から 215M パラメータで、OpenMDW-1.1 ライセンスにより商用利用が可能。
  • TabArena リーダーボードで ELO 1950 の総合 1 位となり、単一の RTX 6000 Pro による統一評価環境で LimiX-2 より 17 倍高速と報告されている。
  • BeyondArena では ELO 1418、Improvability スコア 7.78% で 1 位。
  • TALENT では分類精度、分類ログ損失、回帰 RMSE の総合 1 位を獲得し、平均順位はそれぞれ 6.67、3.98、4.22。

AI 構築者にとって、Kumo Tabular はタスクごとの学習なしに表形式予測を実行できる選択肢であり、公開された精度・効率の数値は自社のホールドアウトデータで検証した上で導入すべきである。

Hugging Face Blog