Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-05
01
watchresearchnew architecture

Diffusion Controller von Google Research vereinheitlicht und vereinfacht die Steuerung der KI-Bildgenerierung

Google Research stellt Diffusion Controller vor, ein leichtgewichtiges „Lenkungsdämpfer“-Netzwerk, das den Denoising-Prozess der Diffusion als kontinuierliches Steuerungsproblem behandelt und Prompt-Treue sowie Bildqualität verbessert, ohne das Basismodell zu verändern.

  • Bewertet auf einem Stable Diffusion v1.4-Backbone in drei Fine-Tuning-Regimen: SFT, Reward-Weighted Loss (RWL) und PPO, gemessen mit dem Human Preference Score (HPS-v2) für Prompt- und Ästhetik-Ausrichtung.
  • In den SFT- und RWL-Varianten übertraf das Gray-Box-Diffusion-Controller-Netzwerk LoRA bei den HPS-v2-Gewinnraten, während es deutlich weniger interne Modellschichten veränderte.
  • Das Paper berichtet, dass die vollständig entsperrte Version (White-Box, mit uneingeschränktem Zugriff auf interne Modellgewichte) eine Gewinnrate von 90 % gegenüber dem Basismodell erreichte.
  • Das Netzwerk lässt sich an zugriffsbeschränkte Closed-Source-Modelle anfügen und erlaubt es, über einen einzigen Inferenz-Parameter für die Guidance-Stärke die Kontrollvorgaben dynamisch zu erhöhen oder zu verringern.

Für Entwickler bedeutet dies, dass Closed-Source-Bildmodelle mit einem leichten, in der Intensität regelbaren Zusatzmodul auf neue Präferenzen gelenkt werden können, ohne White-Box-Gewichtszugriff.

Google Research
02
testmodelsopen source unlock

Cloudflare/clef-flash: ein multimodales 9B-Entscheidungsmodell, das strukturierte Wahrscheinlichkeiten in einem einzigen Vorwärtsdurchlauf liefert

Cloudflare hat clef-flash veröffentlicht, ein multimodales 9B-Modell, das aus Qwen/Qwen3.5-9B nachtrainiert wurde und einen Zustand sowie ein Schema typisierter Fragen in Entscheidungen umwandelt, wobei es in einem einzigen Vorwärtsdurchlauf für jede erlaubte Option jeder Frage eine Wahrscheinlichkeit zurückgibt und ke...

  • Nachtrainiert aus Qwen/Qwen3.5-9B samt Vision-Encoder, gespeichert als standardmäßige geshardete safetensors.
  • Liest den Zustand als Text, JSON, Bilder oder Video und gibt einen Logit pro erlaubter Option pro Frage aus, mit einem Softmax pro Frage zur Ermittlung der Wahrscheinlichkeiten.
  • Veröffentlicht unter der Apache-2.0-Lizenz, in Anlehnung an das Basismodell Qwen/Qwen3.5-9B.
  • Getestet mit torch 2.11 und transformers 5.10.2 auf einer einzelnen H200; Bild- und Videoeingaben benötigen zusätzlich pillow.

Für KI-Entwickler, die strukturierte Entscheidungen statt Freitextgenerierung benötigen, bietet clef-flash eine 9B-Wahrscheinlichkeitsausgabe in einem einzigen Vorwärtsdurchlauf, die direkt an die Jev/SystemOne-API angebunden werden kann.

Hugging Face Trending
03
testcreativeincremental

Qwen veröffentlicht Qwen-Image-2.1: einheitliches 7B-Modell für Text-zu-Bild und Bildbearbeitung

Qwen hat Qwen-Image-2.1 als Open Source veröffentlicht, ein einheitliches Modell für Text-zu-Bild-Generierung und Bildbearbeitung, dessen visuelle Generierungskomponente 7B Parameter in 32 Single-Stream-DiT-Schichten umfasst.

  • Die visuelle Generierungskomponente hat 7B Parameter in 32 Single-Stream-DiT-Schichten.
  • Es unterstützt bis zu 10 Referenzbilder und lokale Bearbeitungen über Kreise, gemalte Anmerkungen oder separate Masken.
  • Unterstützte Seitenverhältnisse sind unter anderem 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 und 9:16, mit Beispielen bis 2752×1536.
  • Es steht unter der Qwen Research License Agreement und verzeichnete im letzten Monat 90.003 Downloads.

Da ein einziges Modell Text-zu-Bild, Transparenzebenen und Bearbeitung mit mehreren Referenzen abdeckt, können Teams die Zahl der Modelle in einer Kreativ-Pipeline reduzieren.

Hugging Face Trending