AI FRONTIER
Signals worth understanding before they become obvious.
Google Research का Diffusion Controller AI इमेज जनरेशन नियंत्रण को एकीकृत और सरल बनाता है
Google Research ने Diffusion Controller पेश किया है, एक हल्का "स्टीयरिंग डैम्पर" नेटवर्क जो डिफ्यूज़न के डीनॉइज़िंग प्रक्रिया को सतत नियंत्रण समस्या मानता है और बेस मॉडल बदले बिना प्रॉम्प्ट अनुरूपता तथा इमेज गुणवत्ता बढ़ाता है।
- Stable Diffusion v1.4 बैकबोन पर SFT, reward-weighted loss (RWL) और PPO तीन फाइन-ट्यूनिंग व्यवस्थाओं में मूल्यांकन किया गया, और Human Preference Score (HPS-v2) से प्रॉम्प्ट तथा सौंदर्य संबंधी पसंद के अनुरूपता मापी गई।
- SFT और RWL में ग्रे-बॉक्स Diffusion Controller स्टीयरिंग डैम्पर नेटवर्क ने HPS-v2 जीत दर में LoRA को पीछे छोड़ा, और इसने मॉडल की बहुत कम आंतरिक परतें बदलीं।
- पेपर बताता है कि इसका पूरी तरह अनलॉक संस्करण (व्हाइट-बॉक्स, आंतरिक वेट बदलने की अप्रतिबंधित पहुँच के साथ) ने बेसलाइन मॉडल पर 90% जीत दर हासिल की।
- यह नेटवर्क सीमित पहुँच वाले क्लोज़्ड-सोर्स मॉडलों से जुड़ सकता है और इन्फरेंस के समय एक ही गाइडेंस स्ट्रेंथ पैरामीटर से नियंत्रण प्रतिबंधों की तीव्रता घटाई-बढ़ाई जा सकती है।
बिल्डरों के लिए इसका अर्थ है कि क्लोज़्ड-सोर्स इमेज मॉडल को व्हाइट-बॉक्स वेट एक्सेस के बिना हल्के, तीव्रता-समायोज्य ऐड-ऑन से नई प्राथमिकताओं की ओर मोड़ा जा सकता है।
Cloudflare/clef-flash: एक ही फ़ॉरवर्ड पास में संरचित प्रायिकताएँ लौटाने वाला 9B मल्टीमॉडल निर्णय मॉडल
Cloudflare ने clef-flash जारी किया है, जो Qwen/Qwen3.5-9B से पोस्ट-ट्रेन किया गया 9B मल्टीमॉडल मॉडल है और एक स्थिति तथा टाइप्ड प्रश्नों के स्कीमा को निर्णयों में बदलता है, हर प्रश्न के हर अनुमत विकल्प के लिए एक ही फ़ॉरवर्ड पास में प्रायिकता लौटाता है और कोई मुक्त-रूप पाठ उत्पन्न नहीं करता।
- Qwen/Qwen3.5-9B और उसके विज़न एनकोडर से पोस्ट-ट्रेन किया गया, मानक शार्डेड safetensors के रूप में संग्रहीत।
- स्थिति को टेक्स्ट, JSON, छवियों या वीडियो के रूप में पढ़ता है और प्रति प्रश्न प्रति अनुमत विकल्प एक logit देता है, प्रायिकताओं के लिए प्रति प्रश्न softmax लागू होता है।
- Apache-2.0 लाइसेंस के अंतर्गत जारी, आधार मॉडल Qwen/Qwen3.5-9B के अनुसार।
- एक ही H200 पर torch 2.11 और transformers 5.10.2 के साथ परीक्षण किया गया; छवि और वीडियो इनपुट के लिए pillow भी आवश्यक है।
जिन AI बिल्डरों को मुक्त-रूप जनरेशन के बजाय संरचित निर्णय चाहिए, उनके लिए clef-flash Jev/SystemOne API से सीधे जुड़ने वाला 9B एकल-फ़ॉरवर्ड प्रायिकता आउटपुट प्रदान करता है।
Qwen ने Qwen-Image-2.1 ओपन-सोर्स किया: 7B एकीकृत टेक्स्ट-टू-इमेज और एडिटिंग मॉडल
Qwen ने Qwen-Image-2.1 ओपन-सोर्स किया है, जो एकीकृत टेक्स्ट-टू-इमेज जनरेशन और इमेज एडिटिंग मॉडल है और जिसके विज़ुअल जनरेशन घटक में 32 Single-Stream DiT लेयर में 7B पैरामीटर हैं।
- विज़ुअल जनरेशन घटक में 32 Single-Stream DiT लेयर में 7B पैरामीटर हैं।
- यह 10 तक संदर्भ छवियों का समर्थन करता है और वृत्त, चित्रित एनोटेशन या अलग मास्क द्वारा स्थानीय संपादन निर्दिष्ट करता है।
- समर्थित अनुपातों में 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 और 9:16 शामिल हैं, उदाहरणों में अधिकतम 2752×1536 है।
- यह Qwen Research License Agreement के अंतर्गत है और पिछले महीने 90,003 डाउनलोड दर्ज किए।
चूंकि एक ही मॉडल टेक्स्ट-टू-इमेज, पारदर्शी लेयर जनरेशन और बहु-संदर्भ एडिटिंग को कवर करता है, टीमें क्रिएटिव पाइपलाइन में जोड़े जाने वाले मॉडलों की संख्या घटा सकती हैं।