AI FRONTIER
Signals worth understanding before they become obvious.
SCION:インスタンス化ニューラルプリミティブによるシーン合成
SCION は、独立した 3D ガウシアンを再利用可能なプリミティブのコンパクトな語彙と軽量なワールド空間インスタンスに置き換える階層的合成シーン表現を提案し、離散・連続シーンパラメータの同時最適化で多視点キャプチャにフィットさせる。論文は 1.2 MB でも高品質を維持し、再学習なしのインスタンス単位の編集とアニメーションを可能にすると報告している。
- 本論文は NeurIPS 2026 に採択され、2026 年 10 月 1 日に投稿された。
- SCION はシーンごとに数百万個の独立ガウシアンを、再利用可能なプリミティブの語彙とワールド空間インスタンスに置き換える。
- 論文は 1.2 MB でも高品質を維持すると報告している。
- 論文は既存のガウシアン圧縮手法より有利なレート歪み性能を示し、再学習なしのインスタンス単位編集とアニメーションを可能にすると報告している。
3D シーンパイプラインを構築する開発者にとって、SCION はシーンを再利用可能なプリミティブとインスタンスとしてモデル化することで、約 1.2 MB のコンパクトな表現で編集・アニメーション可能なインスタンス単位の操作が得られることを示している。
DeskForge:コンピュータ操作エージェント向けにデスクトップ環境から密な監督を生成
DeskForge は実アプリケーションを組み合わせて探索する制御可能なデスクトップ環境で、120万件の注釈付きデスクトップ観測と1億5,970万件の要素インスタンスを含む DeskForge-1M を構築した。論文は DeskForge-1M から抽出した20万件の grounding 例で4つの視覚言語モデルを微調整し、すべてが留出デスクトップ条件と5つの外部 GUI grounding ベンチマークで改善したと報告している。
- DeskForge-1M は120万件の注釈付きデスクトップ観測と1億5,970万件の要素インスタンスを含む。
- 論文は DeskForge-1M から抽出した20万件の grounding 例で4つの視覚言語モデルを微調整した。
- 論文は Qwen3.5-4B が ScreenSpot-Pro で11.51ポイント、OSWorld-G で10.11ポイント精度向上したと報告している。
- 論文は固定プランナー下で Qwen3.5-4B が WebArena-Infinity で119件中31件から50件、OpenApps で100件中3件から15件へ解決数が増えたと報告している。
コンピュータ操作エージェントを構築するチームにとって、DeskForge は実デスクトップ環境の制御可能な組み合わせが密な要素注釈を大規模に生成し、GUI grounding と長時程タスク完了の両方を改善できることを示している。
Rank-Aware Speculative Sampling:拡散ドラフトツリー向けの順位考慮型検証規則
論文は Rank-Aware Speculative Sampling(RASS)を提案する。これは順位考慮型リスト結合に基づく拡散ドラフトツリーの検証規則で、候補を提案-目標平均変位に沿って並べ、選択提案と目標の法則間の全変動を最小化する重みで順位をサンプリングし、選択候補を目標と最大結合する。
- RASS は D-GRS を改善する。D-GRS は各ノードで K 個の条件付き独立候補を生成し、生成順に逐次検証する。
- 評価はガウス混合ターゲット、FFHQ での無条件ピクセル空間生成、CIFAR-10 での条件付き生成、COCO2014 プロンプトを用いた Stable Diffusion 3.5 の潜在拡散で行われた。
- 標準サンプリングと投機的サンプリングの目標モデル評価回数の比で測ると、論文は評価した全設定で RASS が D-GRS を上回り、同一計算予算の CIFAR-10 で約 20% の改善に達すると報告している。
- 残余補正により任意の順位重みの選択に対して正確なサンプリングが保証される。
拡散推論の高速化に取り組む開発者にとって、RASS は目標モデル評価を増やさずにドラフト候補の順位情報を活用することで、同一計算予算での目標モデル評価回数を削減できることを示す。
Lightricks が LTX-2.5 オープンウェイト音声映像ワールドモデルを公開
Lightricks/LTX-2.5 はテキスト・画像・動画入力から同期した映像と音声を生成するオープンウェイトモデルで、自社インフラへのセルフホストに対応します。ネイティブなマルチショット生成、拡散ビデオデコーダ、独自の Gemma 4 12B テキストエンコーダ、任意の尺予測器を追加しました。
- モデルカードではいいね 6.48k、過去 1 か月のダウンロード数 1,645,444 と表示。
- DiT チェックポイントは 22b 表記で、bf16、Comfy int8+convrot、NVFP4 版を提供。
- テキストエンコーダは Gemma4 12B と投影層、映像と音声はそれぞれ別の VAE を使用。
- 年間収益 1,000 万ドル未満は LTX-2.x コミュニティライセンスで商用利用無償、超える場合は有償の商用契約が必要。
構築者にとって LTX-2.5 は、分割された Comfy 整合の重みパックとしてセルフホスト可能な音声映像生成を提供し、dev transformer の微調整も可能ですが、int8 チェックポイントは ComfyUI 専用です。
制御実験なしで科学エミュレータの反事実予測を実現する ReRoute
論文は ReRoute を提案する。これは事実データと部分的な機構的知識を組み合わせた対象を絞った科学的 what-if 予測フレームワークであり、適応に制御介入データを必要としない。事前学習済みバックボーンのクエリ入力を参照値に固定し、既知の機構経路を通じてその変動を再導入し、元の事実データで微調整する。
- 保留された結合気候介入において、ReRoute は深刻な CO2 分布シフト下で総合気候誤差を 18.2-31.8% 削減し、標準条件下での性能も維持した。
- 論文は、正確な応答が得られる制御された移流拡散系において ReRoute が高精度の反事実予測を達成したと報告している。
- 論文はこの構成について明示的な構造仮定の下での因果識別結果を示し、中核的論証は Lean で機械検証されている。
- 歴史的 ERA5 再解析から訓練されたエミュレータにおいて、反事実参照が存在しない場合でも、ReRoute は固定 CO2 反事実下で観測境界条件が示唆する地表温暖化をより多く保持した。
科学エミュレータを構築するチームにとって、ReRoute は高コストな制御シミュレーションデータを生成せずに、事実データと部分的な機構的知識だけで分布シフト下の反事実予測を改善できることを示す。
DeReAct:分解された推論と行動による信頼性の高いAIエージェント
DeReActは、2つのゲーティングポリシーを外部化したモジュール型エージェントアーキテクチャである。Criticが実行前に提案された行動を検証し、Context Managerが環境に裏付けられたStateを再構築してタスク完了を認定する。
- 論文はQwen3-Coder-480BのPass@1が6.5~7.0ポイント向上したと報告している。
- 論文はClaude Sonnet 4.5のPass@1が4.2~5.2ポイント向上したと報告している。
- Claude Opus 4.5ではPass@1はReActと同等だが、DeReActはより証拠が揃い制約を満たす軌跡を生成する。
- 外部ゲーティングは、対象となる失敗が十分に頻繁で、ゲーティングポリシー自体が十分な場合に有効であると論文は示している。
エージェント開発者にとって、行動検証と完了認定を単一ポリシーから分離することで、基盤モデルを変更せずに弱いモデルの信頼性を高められる。
Cloudflare が Clef を公開:27B マルチモーダル意思決定モデル、単一フォワードパスで構造化確率を出力
Cloudflare は Qwen/Qwen3.8-27B からポストトレーニングしたマルチモーダルモデル Clef を公開した。状態と型付き質問スキーマを意思決定に変換し、各質問の各許可選択肢に確率を返すため、自由形式のテキスト生成や出力解析は不要である。
- パラメータ数 27B、BF16、標準のシャーディング safetensors で保存、ライセンスは Apache-2.0。
- 入力はテキスト、JSON、画像、動画に対応し、出力は各質問の各許可選択肢につき 1 つの logit で、質問ごとに softmax を適用して確率を得る。
- 単一の H200 上で torch 2.11 と transformers 5.10.2 を用いてテストされ、画像と動画の入力には pillow も必要。
- 社内 Decision Index 0.2.1 実行では BFCL のケース完全一致精度が 98.5、BANKING77 のマクロ F1 が 94.2、中央値レイテンシが 209.3 ミリ秒、p95 レイテンシが 238.6 ミリ秒。
自由形式テキストではなく構造化された意思決定を必要とする AI 開発者にとって、Clef は Jev/SystemOne API に直接接続できる 27B のマルチモーダル選択肢だが、レイテンシは Clef-flash などの小型変種より高い点に注意が必要である。
EditHero:長期的なパーツ単位3D編集とVibeモデリングのベンチマーク
論文はEditHeroを提案し、著者らによれば長期的かつパーツ単位の3D編集のための初のベンチマークであり、自然言語指示とジオメトリおよびテクスチャの目標画像を備える。決定論的アセンブリエンジンが各編集後に正確な目標を生成し、各シーケンスは人手でレビューされる。
- 論文はEditHeroを、著者らの知る限り長期的かつパーツ単位の3D編集のための初のベンチマークと位置づけ、自然言語指示とジオメトリおよびテクスチャの目標画像を提供する。
- 決定論的アセンブリエンジンが各編集後に正確な目標を生成し、すべてのシーケンスは人手でレビューされる。
- 非エージェント手法は学習済み3D表現からトップダウンで物体を再生成し、要求された変更を見逃し、固定すべき領域を乱すことが多い。
- LLM/VLMエージェントはメッシュを検査するコードを通じてボトムアップで編集し、指示が必要とする部分のみを書き換える。多くのLLMは指示により忠実で、未編集部分の保持もすべての手法の中でより良好だが、各編集に数分かかる。
このベンチマークは評価の焦点を単一編集から多段改訂における「必要な箇所だけを変更する」能力へ移し、信頼性の高い反復的3D編集を目指す開発者に再現可能な比較基盤を与える。