Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-05
01
watchresearchnew architecture

Diffusion Controller di Google Research unifica e semplifica il controllo della generazione di immagini AI

Google Research presenta Diffusion Controller, una rete leggera tipo «ammortizzatore di sterzo» che tratta il processo di denoising della diffusione come un problema di controllo continuo, migliorando l'allineamento al prompt e la qualità dell'immagine senza modificare il modello di base.

  • Valutato su un backbone Stable Diffusion v1.4 in tre regimi di fine-tuning: SFT, reward-weighted loss (RWL) e PPO, usando l'Human Preference Score (HPS-v2) per misurare l'allineamento a prompt e scelte estetiche.
  • Nei percorsi SFT e RWL, la rete ammortizzatrice Diffusion Controller in modalità gray-box ha superato LoRA nei tassi di vittoria HPS-v2, manipolando inoltre molte meno layer interne del modello.
  • Il paper riporta che la versione completamente sbloccata (white-box, con accesso illimitato per modificare i pesi interni) ha raggiunto un tasso di vittoria del 90% rispetto al modello di base.
  • La rete si aggancia a modelli closed-source ad accesso limitato e consente di regolare un singolo parametro di intensità del guidance in inferenza per aumentare o ridurre i vincoli di controllo.

Per chi sviluppa, questo significa che un modello di immagini closed-source può essere indirizzato verso nuove preferenze con un componente leggero ad intensità regolabile, senza accesso white-box ai pesi.

Google Research
02
testmodelsopen source unlock

Cloudflare/clef-flash: un modello decisionale multimodale da 9B che restituisce probabilità strutturate in un singolo forward pass

Cloudflare ha rilasciato clef-flash, un modello multimodale da 9B post-addestrato da Qwen/Qwen3.5-9B che trasforma uno stato e uno schema di domande tipizzate in decisioni, restituendo una probabilità per ogni opzione consentita di ogni domanda in un singolo forward pass, senza generazione di testo libero.

  • Post-addestrato da Qwen/Qwen3.5-9B con il suo encoder visivo, memorizzato come safetensors shardati standard.
  • Legge lo stato come testo, JSON, immagini o video e restituisce un logit per ogni opzione consentita di ogni domanda, con un softmax per domanda per ottenere le probabilità.
  • Rilasciato con licenza Apache-2.0, seguendo il modello base Qwen/Qwen3.5-9B.
  • Testato con torch 2.11 e transformers 5.10.2 su una singola H200; gli input immagine e video richiedono anche pillow.

Per gli sviluppatori di IA che necessitano di decisioni strutturate anziché di generazione libera, clef-flash offre un output probabilistico da 9B in un singolo forward pass che si collega direttamente all'API Jev/SystemOne.

Hugging Face Trending
03
testcreativeincremental

Qwen rende open source Qwen-Image-2.1: modello unificato da 7B per testo-immagine ed editing

Qwen ha reso open source Qwen-Image-2.1, un modello unificato di generazione testo-immagine ed editing di immagini il cui componente di generazione visiva ha 7B di parametri su 32 layer Single-Stream DiT.

  • Il componente di generazione visiva ha 7B di parametri su 32 layer Single-Stream DiT.
  • Supporta fino a 10 immagini di riferimento e modifiche locali specificate tramite cerchi, annotazioni dipinte o maschere separate.
  • Le proporzioni supportate includono 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 e 9:16, con esempi fino a 2752×1536.
  • È distribuito con licenza Qwen Research License Agreement e ha registrato 90.003 download nell'ultimo mese.

Poiché un solo modello copre testo-immagine, generazione di livelli trasparenti ed editing con più riferimenti, i team possono ridurre il numero di modelli in una pipeline creativa.

Hugging Face Trending