Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-05
01
watchresearchnew architecture

Google Research का Diffusion Controller AI इमेज जनरेशन नियंत्रण को एकीकृत और सरल बनाता है

Google Research ने Diffusion Controller पेश किया है, एक हल्का "स्टीयरिंग डैम्पर" नेटवर्क जो डिफ्यूज़न के डीनॉइज़िंग प्रक्रिया को सतत नियंत्रण समस्या मानता है और बेस मॉडल बदले बिना प्रॉम्प्ट अनुरूपता तथा इमेज गुणवत्ता बढ़ाता है।

  • Stable Diffusion v1.4 बैकबोन पर SFT, reward-weighted loss (RWL) और PPO तीन फाइन-ट्यूनिंग व्यवस्थाओं में मूल्यांकन किया गया, और Human Preference Score (HPS-v2) से प्रॉम्प्ट तथा सौंदर्य संबंधी पसंद के अनुरूपता मापी गई।
  • SFT और RWL में ग्रे-बॉक्स Diffusion Controller स्टीयरिंग डैम्पर नेटवर्क ने HPS-v2 जीत दर में LoRA को पीछे छोड़ा, और इसने मॉडल की बहुत कम आंतरिक परतें बदलीं।
  • पेपर बताता है कि इसका पूरी तरह अनलॉक संस्करण (व्हाइट-बॉक्स, आंतरिक वेट बदलने की अप्रतिबंधित पहुँच के साथ) ने बेसलाइन मॉडल पर 90% जीत दर हासिल की।
  • यह नेटवर्क सीमित पहुँच वाले क्लोज़्ड-सोर्स मॉडलों से जुड़ सकता है और इन्फरेंस के समय एक ही गाइडेंस स्ट्रेंथ पैरामीटर से नियंत्रण प्रतिबंधों की तीव्रता घटाई-बढ़ाई जा सकती है।

बिल्डरों के लिए इसका अर्थ है कि क्लोज़्ड-सोर्स इमेज मॉडल को व्हाइट-बॉक्स वेट एक्सेस के बिना हल्के, तीव्रता-समायोज्य ऐड-ऑन से नई प्राथमिकताओं की ओर मोड़ा जा सकता है।

Google Research
02
testmodelsopen source unlock

Cloudflare/clef-flash: एक ही फ़ॉरवर्ड पास में संरचित प्रायिकताएँ लौटाने वाला 9B मल्टीमॉडल निर्णय मॉडल

Cloudflare ने clef-flash जारी किया है, जो Qwen/Qwen3.5-9B से पोस्ट-ट्रेन किया गया 9B मल्टीमॉडल मॉडल है और एक स्थिति तथा टाइप्ड प्रश्नों के स्कीमा को निर्णयों में बदलता है, हर प्रश्न के हर अनुमत विकल्प के लिए एक ही फ़ॉरवर्ड पास में प्रायिकता लौटाता है और कोई मुक्त-रूप पाठ उत्पन्न नहीं करता।

  • Qwen/Qwen3.5-9B और उसके विज़न एनकोडर से पोस्ट-ट्रेन किया गया, मानक शार्डेड safetensors के रूप में संग्रहीत।
  • स्थिति को टेक्स्ट, JSON, छवियों या वीडियो के रूप में पढ़ता है और प्रति प्रश्न प्रति अनुमत विकल्प एक logit देता है, प्रायिकताओं के लिए प्रति प्रश्न softmax लागू होता है।
  • Apache-2.0 लाइसेंस के अंतर्गत जारी, आधार मॉडल Qwen/Qwen3.5-9B के अनुसार।
  • एक ही H200 पर torch 2.11 और transformers 5.10.2 के साथ परीक्षण किया गया; छवि और वीडियो इनपुट के लिए pillow भी आवश्यक है।

जिन AI बिल्डरों को मुक्त-रूप जनरेशन के बजाय संरचित निर्णय चाहिए, उनके लिए clef-flash Jev/SystemOne API से सीधे जुड़ने वाला 9B एकल-फ़ॉरवर्ड प्रायिकता आउटपुट प्रदान करता है।

Hugging Face Trending
03
testcreativeincremental

Qwen ने Qwen-Image-2.1 ओपन-सोर्स किया: 7B एकीकृत टेक्स्ट-टू-इमेज और एडिटिंग मॉडल

Qwen ने Qwen-Image-2.1 ओपन-सोर्स किया है, जो एकीकृत टेक्स्ट-टू-इमेज जनरेशन और इमेज एडिटिंग मॉडल है और जिसके विज़ुअल जनरेशन घटक में 32 Single-Stream DiT लेयर में 7B पैरामीटर हैं।

  • विज़ुअल जनरेशन घटक में 32 Single-Stream DiT लेयर में 7B पैरामीटर हैं।
  • यह 10 तक संदर्भ छवियों का समर्थन करता है और वृत्त, चित्रित एनोटेशन या अलग मास्क द्वारा स्थानीय संपादन निर्दिष्ट करता है।
  • समर्थित अनुपातों में 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 और 9:16 शामिल हैं, उदाहरणों में अधिकतम 2752×1536 है।
  • यह Qwen Research License Agreement के अंतर्गत है और पिछले महीने 90,003 डाउनलोड दर्ज किए।

चूंकि एक ही मॉडल टेक्स्ट-टू-इमेज, पारदर्शी लेयर जनरेशन और बहु-संदर्भ एडिटिंग को कवर करता है, टीमें क्रिएटिव पाइपलाइन में जोड़े जाने वाले मॉडलों की संख्या घटा सकती हैं।

Hugging Face Trending