AI FRONTIER
Signals worth understanding before they become obvious.
Diffusion Controller von Google Research vereinheitlicht und vereinfacht die Steuerung der KI-Bildgenerierung
Google Research stellt Diffusion Controller vor, ein leichtgewichtiges „Lenkungsdämpfer“-Netzwerk, das den Denoising-Prozess der Diffusion als kontinuierliches Steuerungsproblem behandelt und Prompt-Treue sowie Bildqualität verbessert, ohne das Basismodell zu verändern.
- Bewertet auf einem Stable Diffusion v1.4-Backbone in drei Fine-Tuning-Regimen: SFT, Reward-Weighted Loss (RWL) und PPO, gemessen mit dem Human Preference Score (HPS-v2) für Prompt- und Ästhetik-Ausrichtung.
- In den SFT- und RWL-Varianten übertraf das Gray-Box-Diffusion-Controller-Netzwerk LoRA bei den HPS-v2-Gewinnraten, während es deutlich weniger interne Modellschichten veränderte.
- Das Paper berichtet, dass die vollständig entsperrte Version (White-Box, mit uneingeschränktem Zugriff auf interne Modellgewichte) eine Gewinnrate von 90 % gegenüber dem Basismodell erreichte.
- Das Netzwerk lässt sich an zugriffsbeschränkte Closed-Source-Modelle anfügen und erlaubt es, über einen einzigen Inferenz-Parameter für die Guidance-Stärke die Kontrollvorgaben dynamisch zu erhöhen oder zu verringern.
Für Entwickler bedeutet dies, dass Closed-Source-Bildmodelle mit einem leichten, in der Intensität regelbaren Zusatzmodul auf neue Präferenzen gelenkt werden können, ohne White-Box-Gewichtszugriff.
Cloudflare/clef-flash: ein multimodales 9B-Entscheidungsmodell, das strukturierte Wahrscheinlichkeiten in einem einzigen Vorwärtsdurchlauf liefert
Cloudflare hat clef-flash veröffentlicht, ein multimodales 9B-Modell, das aus Qwen/Qwen3.5-9B nachtrainiert wurde und einen Zustand sowie ein Schema typisierter Fragen in Entscheidungen umwandelt, wobei es in einem einzigen Vorwärtsdurchlauf für jede erlaubte Option jeder Frage eine Wahrscheinlichkeit zurückgibt und ke...
- Nachtrainiert aus Qwen/Qwen3.5-9B samt Vision-Encoder, gespeichert als standardmäßige geshardete safetensors.
- Liest den Zustand als Text, JSON, Bilder oder Video und gibt einen Logit pro erlaubter Option pro Frage aus, mit einem Softmax pro Frage zur Ermittlung der Wahrscheinlichkeiten.
- Veröffentlicht unter der Apache-2.0-Lizenz, in Anlehnung an das Basismodell Qwen/Qwen3.5-9B.
- Getestet mit torch 2.11 und transformers 5.10.2 auf einer einzelnen H200; Bild- und Videoeingaben benötigen zusätzlich pillow.
Für KI-Entwickler, die strukturierte Entscheidungen statt Freitextgenerierung benötigen, bietet clef-flash eine 9B-Wahrscheinlichkeitsausgabe in einem einzigen Vorwärtsdurchlauf, die direkt an die Jev/SystemOne-API angebunden werden kann.
Qwen veröffentlicht Qwen-Image-2.1: einheitliches 7B-Modell für Text-zu-Bild und Bildbearbeitung
Qwen hat Qwen-Image-2.1 als Open Source veröffentlicht, ein einheitliches Modell für Text-zu-Bild-Generierung und Bildbearbeitung, dessen visuelle Generierungskomponente 7B Parameter in 32 Single-Stream-DiT-Schichten umfasst.
- Die visuelle Generierungskomponente hat 7B Parameter in 32 Single-Stream-DiT-Schichten.
- Es unterstützt bis zu 10 Referenzbilder und lokale Bearbeitungen über Kreise, gemalte Anmerkungen oder separate Masken.
- Unterstützte Seitenverhältnisse sind unter anderem 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 und 9:16, mit Beispielen bis 2752×1536.
- Es steht unter der Qwen Research License Agreement und verzeichnete im letzten Monat 90.003 Downloads.
Da ein einziges Modell Text-zu-Bild, Transparenzebenen und Bearbeitung mit mehreren Referenzen abdeckt, können Teams die Zahl der Modelle in einer Kreativ-Pipeline reduzieren.