AI FRONTIER
Signals worth understanding before they become obvious.
Diffusion Controller कैसे AI इमेज जनरेशन को एकीकृत और सरल बनाता है
Google Research ने Diffusion Controller पेश किया है, एक हल्का "स्टीयरिंग डैम्पर" नेटवर्क जो डीनॉइज़िंग प्रक्रिया को सतत नियंत्रण समस्या के रूप में पुनर्परिभाषित करता है और फ्रोज़न बेस मॉडल बदले बिना प्रॉम्प्ट अनुरूपता तथा इमेज गुणवत्ता बढ़ाता है।
- पेपर ने Stable Diffusion v1.4 बैकबोन पर SFT, reward-weighted loss (RWL) और PPO तीन फाइन-ट्यूनिंग व्यवस्थाओं में मूल्यांकन किया, और HPS-v2 से उपयोगकर्ता प्रॉम्प्ट तथा सौंदर्य संबंधी पसंद के साथ अनुरूपता मापी।
- SFT और RWL प्रयोगों में ग्रे-बॉक्स Diffusion Controller स्टीयरिंग डैम्पर नेटवर्क ने HPS-v2 जीत दर में LoRA को पीछे छोड़ा, और LoRA की तुलना में बहुत कम आंतरिक मॉडल परतें बदलीं।
- पेपर बताता है कि इसका पूरी तरह अनलॉक संस्करण, जिसमें आंतरिक मॉडल वेट बदलने के लिए व्हाइट-बॉक्स पहुंच है, बेसलाइन मॉडल पर 90% जीत दर हासिल करता है।
- फ्रेमवर्क चार नेटवर्क संरचनाएं लागू करता है: Diffusion Controller, Diffusion Controller-Naive, Diffusion Controller-J और Diffusion Controller-S।
बिल्डरों के लिए इसका अर्थ है कि व्हाइट-बॉक्स पहुंच के बिना क्लोज़्ड-सोर्स इमेज मॉडल पर सूक्ष्म नियंत्रण संभव है, और नियंत्रण परत मॉडल कोर से अलग होने से इसे पर्सनलाइज़ेशन, सुरक्षा और वीडियो जनरेशन तक बढ़ाया जा सकता है।
LLM एजेंट और डेटा स्पेस को जोड़ना: Model Context Protocol के माध्यम से आर्किटेक्चरल मध्यस्थता
यह पेपर Model Context Protocol (MCP) पर आधारित आर्किटेक्चरल मध्यस्थता दृष्टिकोण प्रस्तुत करता है, जिसे Eunomia Agent के माध्यम से लागू किया गया है, ताकि LLM एजेंट और डेटा स्पेस सेवाओं के बीच नियंत्रित अंतःक्रिया संभव हो सके। एक प्रोटोटाइप ने मौजूदा डेटा स्पेस घटकों को बदले बिना कैटलॉग खोज, मेटाडेटा पुनर्प्राप्ति और डेट...
- पेपर 24 सितंबर 2026 को arXiv पर arXiv:2609.30341 के रूप में जमा किया गया, जो cs.AI और cs.DB में वर्गीकृत है।
- मध्यस्थता परत डेटा स्पेस क्षमताओं को संरचित, स्कीमा-आधारित टूल में बदलती है जिन्हें AI एजेंट खोज और आह्वान कर सकते हैं, साथ ही गवर्नेंस बाधाएँ संरक्षित रहती हैं।
- प्रोटोटाइप कार्यान्वयन ने मौजूदा डेटा स्पेस घटकों को बदले बिना कैटलॉग खोज, मेटाडेटा पुनर्प्राप्ति और डेटा सेवा आह्वान में एंड-टू-एंड अंतःक्रिया को मान्य किया।
- लेखक Jaime Alonso Ruiz, Carlos Aparicio, Gabriel Huecas, Joaquín Salvachúa और Andres Munoz-Arcentales हैं।
AI एजेंट बनाने वाली टीमों के लिए यह काम दर्शाता है कि MCP को मध्यस्थता परत के रूप में उपयोग करके मौजूदा डेटा अवसंरचना बदले बिना शासित डेटा स्पेस से एजेंट जोड़े जा सकते हैं।
HybridInfer: ऑन-डिवाइस, एज और क्लाउड LLM इन्फ़रेंस के लिए थर्मल-जागरूक रीइन्फ़ोर्समेंट-लर्निंग टियर रूटिंग
HybridInfer एक थर्मल-जागरूक रीइन्फ़ोर्समेंट-लर्निंग राउटर है जो तीन-स्तरीय व्यवस्था (ऑन-डिवाइस Llama 3.2 3B, रिट्रीवल सहित एज Llama 3.1 8B, क्लाउड GPT-4o) के लिए फ़ोन के थर्मल हेडरूम और क्वेरी-जटिलता अनुमान को स्टेट के रूप में उपयोग करता है और ऑफ़लाइन प्रशिक्षित Q-learning नीति से टियर चुनता है।
- पेपर रिपोर्ट करता है कि हमेशा ऑन-डिवाइस स्थितियाँ सेवा-योग्य क्वेरी पर प्रति-क्वेरी गुणवत्ता के बराबर हैं, लेकिन तीन से छह गुना धीमी हैं और लंबी क्वेरी पर विफल होती हैं।
ऑन-डिवाइस LLM तैनाती में थर्मल सीमाएँ केवल धीमापन नहीं बल्कि रनटाइम-स्थिरता की समस्या हैं, इसलिए रूटिंग नीतियों को केवल गुणवत्ता और लेटेंसी नहीं, बल्कि थर्मल स्टेट और लोकैलिटी प्रोत्साहन भी शामिल करना चाहिए।
XingChen-AGI ने 1.2B पैरामीटर वाला दस्तावेज़ पार्सिंग VLM TeleOCR जारी किया
TeleOCR लगभग 1.2B पैरामीटर का ओपन-सोर्स विज़न-लैंग्वेज मॉडल है जो डिजिटल और कैमरे से ली गई छवियों वाले दस्तावेज़ों की पार्सिंग को एक ही फ्रेमवर्क में जोड़ता है, और इसके वेट तथा तकनीकी रिपोर्ट जारी की गई है।
- मॉडल कार्ड के अनुसार पैरामीटर लगभग 1.2B, लाइसेंस apache-2.0, चीनी और अंग्रेज़ी समर्थन, तथा आधार qwen2_5_vl है।
- OmniDocBench v1.6 पर TeleOCR ने Overall 96.87, Text Edit 0.027, Formula CDM 96.36 और Table TEDS 97.05 रिपोर्ट किया।
- Dr.DocBench Challenge में TeleOCR ने Overall 67.96 रिपोर्ट किया, जो MinerU 2.5 Pro के 62.26 और PaddleOCR-VL 1.6 के 55.11 से अधिक है।
- मॉडल कार्ड कहता है कि TeleOCR विकृत दस्तावेज़ों का लेआउट और सामग्री बिना डीवार्पिंग प्रीप्रोसेसिंग या समर्पित सुधार मॉडल के पार्स करता है।
दस्तावेज़ पार्सिंग पाइपलाइन बनाने वाले डेवलपर्स के लिए TeleOCR लगभग 1.2B पैरामीटर पर कई सार्वजनिक बेंचमार्क में अग्रणी परिणाम रिपोर्ट करता है और वेट तथा GGUF कन्वर्ज़न देता है, इसलिए यह हल्के सेल्फ-होस्टेड पार्सिंग का उम्मीदवार है।
Qwen ने Qwen-Image-2.1 ओपन-सोर्स किया: 7B पैरामीटर वाला एकीकृत टेक्स्ट-टू-इमेज और इमेज-एडिटिंग मॉडल
Qwen ने Qwen-Image-2.1 ओपन-सोर्स किया है, जो टेक्स्ट-टू-इमेज जनरेशन और इमेज एडिटिंग का एकीकृत मॉडल है; इसके विज़ुअल जनरेशन घटक में 32 Single-Stream DiT लेयर पर 7B पैरामीटर हैं और यह नेटिव पारदर्शी (RGBA) जनरेशन और एडिटिंग का समर्थन करता है।
- विज़ुअल जनरेशन घटक में 32 Single-Stream DiT लेयर पर 7B पैरामीटर हैं।
- यह अधिकतम 10 संदर्भ छवियों और वृत्त, पेंट किए गए एनोटेशन या अलग मास्क द्वारा निर्दिष्ट स्थानीय संपादन का समर्थन करता है।
- समर्थित आस्पेक्ट अनुपात में 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 और 9:16 शामिल हैं, उदाहरण रिज़ॉल्यूशन अधिकतम 2752×1536 है।
- यह Qwen Research License Agreement के अंतर्गत लाइसेंस प्राप्त है, और मॉडल पृष्ठ पर पिछले महीने 64,362 डाउनलोड दर्ज हैं।
चूंकि एक ही 7B मॉडल टेक्स्ट-टू-इमेज जनरेशन, RGBA पारदर्शी लेयर जनरेशन और बहु-संदर्भ संपादन को कवर करता है, बिल्डर जनरेशन और एडिटिंग के लिए अलग मॉडल तैनात करने से बच सकते हैं।
फ्रंटियर AI प्रशिक्षण के लिए सेफ्टी केस पर शुरुआती दिशानिर्देश
OpenAI ने फ्रंटियर AI प्रशिक्षण में सेफ्टी केस के लिए शुरुआती दिशानिर्देश जारी किए, जिनमें तकनीकी सुरक्षा उपाय, परिचालन प्रथाएँ और मिसअलाइनमेंट घटनाओं की जाँच शामिल हैं।
- दिशानिर्देश तकनीकी सुरक्षा उपायों, परिचालन प्रथाओं और मिसअलाइनमेंट घटनाओं की जाँच को कवर करते हैं।
- इन्हें शुरुआती दिशानिर्देश के रूप में प्रस्तुत किया गया है, अंतिम मानक के रूप में नहीं।
फ्रंटियर मॉडल प्रशिक्षित करने वाली टीमें इन तीन क्षेत्रों को अपने आंतरिक सेफ्टी केस दस्तावेज़ के शुरुआती ढाँचे के रूप में उपयोग कर सकती हैं।
TaichuAI ने स्थानिक तर्क और एजेंटिक टूल उपयोग के लिए ZDTaichu5.0-9B मल्टीमॉडल फाउंडेशन मॉडल जारी किया
ZDTaichu5.0-9B, TaichuAI का एक मल्टीमॉडल फाउंडेशन मॉडल है जो Qwen3.5-9B भाषा बैकबोन को C-RADIOv4-H विज़न एनकोडर के साथ जोड़ता है, किसी भी रिज़ॉल्यूशन पर टेक्स्ट, इमेज और वीडियो का समर्थन करता है, और सामान्य विज़ुअल समझ, स्थानिक तर्क, एजेंटिक टूल उपयोग तथा एम्बॉडिड-AI शोध को लक्षित करता है।
- मॉडल में 9.8B पैरामीटर, BF16 टेंसर प्रकार और अधिकतम 128K tokens की कॉन्टेक्स्ट लंबाई है।
- मॉडल कार्ड TAU2-Bench पर 87.7, Claw-Eval पर 71.4 और IFEval पर 93.7 स्कोर रिपोर्ट करता है।
- मॉडल कार्ड ERQA पर 48 और RoboSpatial पर 56 स्कोर रिपोर्ट करता है।
- वेट NVIDIA Open Model License Agreement के तहत जारी किए गए हैं, और Qwen3.5 का Apache-2.0 लाइसेंस बरकरार रखा गया है।
विज़न एजेंट या एम्बॉडिड-AI पाइपलाइन बनाने वालों के लिए यह मॉडल 10B पैमाने पर स्थानिक तर्क और टूल कॉलिंग देता है, लेकिन टूल निष्पादन को आसपास के एप्लिकेशन द्वारा ही लागू, सत्यापित और सुरक्षित करना होगा।