Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-01
01
watchagentsnew architecture

Google、モデル再学習なしで「ハーネス」を自己改善する「RRSI」を公開

Google Cloud AI Researchの研究チームがスタンフォード大学、ワシントン大学などと共同で、モデルの重みを変えずにプロンプト、ツール使用、制御フロー、メモリとコンテキスト管理、スキルモジュール、サブエージェントなどモデルを取り巻く「ハーネス」を反復的に修正するRRSIフレームワークを公開した。

  • 8つのベンチマークでRRSIをテストした結果、Terminal-Bench 2.1は74.2%から80.2%へ6.0ポイント上昇し、SWE-Bench Verifiedは82.0%から83.8%へ1.8ポイント上昇した。
  • JobBenchは36.0%から40.7%へ4.7ポイント、GDPvalは48.8%から52.3%へ3.5ポイント、Frontier-Engは17.7%から22.0%へ4.3ポイント改善した。
  • RRSIが直接最適化に使用していない5つの外部評価セットでも最大4.7ポイントの性能向上が確認され、分布外(OOD)評価環境では既存のハーネス進化手法と比べ最大22.9%優れた性能を記録した。
  • Gemini 3.5 Flashを基盤モデルとした別実験では、Terminal-Bench 2.1が64.6%から78.7%へ14.1ポイント、SWE-Bench Verifiedが76.8%から79.0%へ2.2ポイント向上した。

エージェントを構築するチームにとって、RRSIはモデルの重みを固定したままでもハーネスの統制された反復探索が測定可能な性能向上とトークンコスト削減をもたらし得ることを示している。

AI Times Korea
02
opportunitymodelscost collapse

OpenAI が GPT-6.1 Sol を発表

OpenAI は GPT-6.1 Sol を公開し、コーディング、コンピュータ操作、専門業務向けに Astra に近い知能を、Astra の標準 API 入力・出力トークン価格の5分の1で提供するとしている。

  • OpenAI は GPT-6.1 Sol の知能が Astra に近いと述べている。
  • 対象用途はコーディング、コンピュータ操作、専門業務。
  • 標準 API の入力・出力トークン価格は Astra の5分の1。

AI 開発者にとって、Astra に近い知能を5分の1のトークン単価で使えることは、コーディングやコンピュータ操作系ワークロードの推論コストを大きく下げる可能性がある。

OpenAI News
03
testinferenceopen source unlock

prism-ml が Ternary-Bonsai-2-27B-gguf を公開、三元重み 27B モデルを 5.95 GB でノート PC 動作

prism-ml は Hugging Face で Ternary-Bonsai-2-27B-gguf を公開し、Qwen3.8-27B の埋め込み、注意投影、MLP 投影、LM head を三元重み(g128、{−1,0,+1} と FP16 グループスケーリング)に量子化し、PTQ1_0 と PQ2_0 の 2 種類の GGUF パッキングで llama.cpp の CUDA・Metal・CPU バックエンド向けに提供する。

  • 言語モデルサイズは PTQ1_0 で 5.95 GB、PQ2_0 で 7.21 GB。FP16 の約 54 GB に対し約 9.0 倍・7.5 倍の削減で、理想的な三元形式は 1.72 bits/weight・5.8 GB。
  • 論文は 14 の thinking モードベンチマークで平均 84.78 を報告し、FP16 参照(86.32)の 98.2%。IQ2_XXS は 72.59(7.27 GB)、UD-Q4_K_XL は 85.18(17.6 GB)。
  • 論文は AIME26 で 95.83、LiveCodeBench で 90.07 を報告。IQ2_XXS はそれぞれ 57.5 と 56.4。数学 96.57、コーディング 89.42、BFCL v3 ツール呼び出し 74.92。
  • コンテキスト長は 262K トークンで、約 75% が線形注意のハイブリッド注意バックボーンを採用。ビジョンタワーは別個の Q8_0 mmproj パック(0.63 GB)で、画像入力時のみ読み込む。

単一 GPU やノート PC で 27B 級の推論を動かしたいチームにとって、全層三元量子化が約 6 GB で FP16 に近い推論・ツール呼び出し性能を保てる一方、専用カーネルとフォーク実行環境が必須であることを示す。

Hugging Face Trending
04
watchresearchnew architecture

エージェント検索向け相互作用空間の検索:RISE が BM25 で有界な探索空間を構築

論文は RISE(Retrieving Interaction SpacE)を提案し、BM25 でエージェントが探索できる有界なコーパス部分集合を構築し、索引時にシェル形式ナビゲーション用の処理を施す。BrowseComp-Plus では RISE が純シェル DCI ベースラインと同じ 78% の精度を約 4 分の 1 のクエリ単価で達成した。

  • 論文報告:BrowseComp-Plus で RISE は gpt-5.4-mini を用いて 78% の精度に達し、純シェル DCI ベースラインと同等で、クエリ単価は約 4 分の 1。
  • 論文報告:100 万文書規模で RISE-BM25 は gpt-5.4-mini において 81% に達した。
  • 論文報告:同じ 100 万文書規模で DCI は gpt-5.4-nano において 60% に低下し、100 回中 33 回の実時間失敗が発生した。
  • 論文の主張:無制限の相互作用はスケールせず、広範なシェルコマンドは毎回コーパス全体の走査となり、コーパス拡大に伴い遅延が急激に悪化する。

検索エージェントを構築するチームにとって、検索層の役割は文脈窓に収まる文書の選択ではなく有界な相互作用空間の画定であり、これによりコーパス拡大時のコストと遅延を抑えられる。

arXiv watchlist
05
watchcreativenew architecture

Diffusion Controller が AI 画像生成を統合・簡素化

Google Research は、ベースモデルを凍結したままデノイジング過程を動的に調整する軽量な「ステアリングダンパー」ネットワーク Diffusion Controller を発表した。

  • Stable Diffusion v1.4 をバックボーンに、SFT・RWL・PPO の3つの微調整方式で評価。
  • SFT と RWL において、グレーボックス版 Diffusion Controller の HPS-v2 勝率が LoRA を上回り、操作する内部層数も大幅に少ない。
  • 完全解放されたホワイトボックス版はベースラインモデルに対して90%の勝率を記録。
  • 単一の推論時ガイダンス強度パラメータを調整することで制御制約の強度を動的に変更できる。

構築者にとって、クローズドソースモデルの重みに触れずに制御可能な画像生成とパーソナライズを実現する軽量な手段となる。

Google Research
06
watchresearchcapability unlock

Google DeepMindがSynthID Bioを発表、AI生成タンパク質に検証可能な透かし

Google DeepMindは合成生物学向けの透かし手法群SynthID Bioを発表した。アミノ酸配列とAlphaFold 3が予測する3D構造に検出可能な信号を埋め込み、実験室試験でタンパク質の生物学的機能を損なわないことを確認した。

  • SynthID BioはAlphaFold 3の拡散ネットワークの一部を微調整し、透かし能力をモデルの重みに組み込むことで、予測される3D座標自体に検出可能な信号を持たせる。
  • VEGF-A、SARS-CoV-2スパイクタンパク質RBD、PD-L1の3標的に対する湿実験で、透かし入り設計は未処理版と同等のヒット率、結合親和性、天然配列多様性を示した。
  • AlphaFold 3の予測精度を保ちながらほぼ完全な検出性を実現し、デジタルノイズや軽微な座標変化にも耐えると報告されている。
  • Google DeepMindは手法論文の公開、コードとin vitroデータのオープンソース化、研究コミュニティへの重みの公開を予定している。

生物設計ツールの開発者にとって、透かしをモデル重みと配列生成に直接組み込める点は、DNA合成スクリーニングやデータベース来歴確認の自動検証層として重要だが、意図的な改ざんへの耐性が今後の課題となる。

Google DeepMind