AI FRONTIER
Signals worth understanding before they become obvious.
Diffusion Controller de Google Research unifie et simplifie le contrôle de la génération d'images par IA
Google Research présente Diffusion Controller, un réseau léger de type « amortisseur de direction » qui traite le processus de débruitage de la diffusion comme un problème de contrôle continu, améliorant l'alignement au prompt et la qualité d'image sans modifier le modèle de base.
- Dans les volets SFT et RWL, le réseau amortisseur Diffusion Controller en mode gray-box a dépassé LoRA en taux de victoire HPS-v2, tout en manipulant nettement moins de couches internes du modèle.
- L'article rapporte que sa version entièrement déverrouillée (white-box, avec accès illimité pour modifier les poids internes) a atteint un taux de victoire de 90 % face au modèle de base.
- Le réseau s'attache à des modèles fermés à accès restreint et permet de régler un unique paramètre d'intensité de guidage à l'inférence pour augmenter ou réduire les contraintes de contrôle.
Pour les développeurs, cela signifie qu'un modèle d'image fermé peut être orienté vers de nouvelles préférences via un module léger à intensité réglable, sans accès white-box aux poids.
Cloudflare/clef-flash : un modèle de décision multimodal de 9B qui renvoie des probabilités structurées en une seule passe avant
Cloudflare a publié clef-flash, un modèle multimodal de 9B post-entraîné à partir de Qwen/Qwen3.5-9B, qui transforme un état et un schéma de questions typées en décisions et renvoie une probabilité pour chaque option autorisée de chaque question en une seule passe avant, sans génération de texte libre.
- Post-entraîné à partir de Qwen/Qwen3.5-9B et de son encodeur visuel, stocké sous forme de safetensors shardés standard.
- Lit l'état sous forme de texte, JSON, images ou vidéo et produit un logit par option autorisée et par question, avec un softmax par question pour obtenir les probabilités.
- Publié sous licence Apache-2.0, à la suite du modèle de base Qwen/Qwen3.5-9B.
- Testé avec torch 2.11 et transformers 5.10.2 sur un seul H200 ; les entrées image et vidéo nécessitent aussi pillow.
Pour les développeurs IA qui ont besoin de décisions structurées plutôt que de génération libre, clef-flash offre une sortie probabiliste en une seule passe avant à 9B, directement compatible avec l'API Jev/SystemOne.
Qwen ouvre Qwen-Image-2.1 : un modèle unifié de génération et d'édition d'images de 7B
Qwen a ouvert Qwen-Image-2.1, un modèle unifié de génération texte-image et d'édition d'images dont le composant de génération visuelle compte 7B de paramètres répartis sur 32 couches Single-Stream DiT.
- Le composant de génération visuelle compte 7B de paramètres répartis sur 32 couches Single-Stream DiT.
- Il prend en charge jusqu'à 10 images de référence et des éditions locales spécifiées par cercles, annotations peintes ou masques séparés.
- Les ratios pris en charge incluent 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 et 9:16, avec des exemples jusqu'à 2752×1536.
- Il est sous licence Qwen Research License Agreement et a enregistré 90 003 téléchargements le mois dernier.
Comme un seul modèle couvre la génération texte-image, la génération de calques transparents et l'édition multi-références, les équipes peuvent réduire le nombre de modèles assemblés dans un pipeline créatif.