3qk7 · AI LOCAL LABS
TECHNICAL SCOUTING
AI FRONTIER
Signals worth understanding before they become obvious.
2026-10-05
01
watchresearchnew architecture
Google ResearchのDiffusion ControllerがAI画像生成の制御を統合・簡素化
Google Researchは、拡散モデルのノイズ除去過程を連続制御問題として扱う軽量な「ステアリングダンパー」ネットワークDiffusion Controllerを発表した。基盤モデルを変更せずにプロンプト整合性と画質を高められる。
- Stable Diffusion v1.4をバックボーンに、SFT・RWL・PPOの3つの微調整方式で評価し、HPS-v2でユーザープロンプトと美的選好への整合性を測定した。
- SFTとRWLでは、グレーボックス版Diffusion Controllerのステアリングダンパーネットワークが、HPS-v2勝率でLoRAを上回り、しかも変更する内部モデル層数は大幅に少なかった。
- 論文は、完全解放版(白盒、内部重みを変更可能)がベースラインモデルに対して90%の勝率を達成したと報告している。
- このネットワークはアクセス制限されたクローズドソースモデルにも接続でき、推論時の単一のガイダンス強度パラメータで制約の強さを動的に調整できる。
ビルダーにとっては、白盒の重みなしでクローズドソース画像モデルの挙動を軽量かつ強度調整可能に誘導でき、カスタマイズと整合のコストを下げられることを意味する。
02
testmodelsopen source unlock
Cloudflare/clef-flash:9B マルチモーダル意思決定モデル、1回のフォワードパスで構造化確率を出力
Cloudflare は Qwen/Qwen3.5-9B からポストトレーニングされた 9B マルチモーダルモデル clef-flash を公開した。状態と型付き質問のスキーマを意思決定に変換し、1回のフォワードパスで各質問の各許容選択肢の確率を返し、自由形式のテキスト生成は行わない。
- Qwen/Qwen3.5-9B とその視覚エンコーダからポストトレーニングされ、標準のシャーディング safetensors として保存されている。
- 入力はテキスト、JSON、画像、動画に対応し、出力は各質問の各許容選択肢につき1つの logit で、質問ごとに softmax を適用して確率を得る。
- ライセンスは Apache-2.0 で、ベースモデル Qwen/Qwen3.5-9B に従う。
- 単一の H200 上で torch 2.11 と transformers 5.10.2 を用いてテストされ、画像・動画入力には pillow も必要。
自由形式の生成ではなく構造化された意思決定を必要とする AI ビルダーにとって、clef-flash は Jev/SystemOne API に直接接続できる 9B の単一フォワード確率出力ソリューションを提供する。
03
testcreativeincremental
Qwen が Qwen-Image-2.1 をオープンソース化:7B の統合テキスト画像生成・編集モデル
Qwen は、テキストからの画像生成と画像編集を統合した Qwen-Image-2.1 をオープンソース化した。視覚生成コンポーネントは 7B パラメータ、32 層の Single-Stream DiT で構成される。
- 視覚生成コンポーネントは 7B パラメータで、32 層の Single-Stream DiT を含む。
- 最大 10 枚の参照画像に対応し、円、描き込み注釈、個別マスクで局所編集を指定できる。
- 1:1、4:3、3:4、3:2、2:3、16:9、9:16 のアスペクト比に対応し、例では最大 2752×1536 の解像度を示す。
- ライセンスは Qwen Research License Agreement で、過去 1 か月のダウンロード数は 90,003。
テキスト生成、透明レイヤー生成、複数参照画像の編集を 1 モデルで扱えるため、制作パイプラインのモデル構成を簡素化できる。