Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-09-30
01
watchresearchnew architecture

Diffusion Controller कैसे AI इमेज जनरेशन को एकीकृत और सरल बनाता है

Google Research ने Diffusion Controller पेश किया है, एक हल्का "स्टीयरिंग डैम्पर" नेटवर्क जो डीनॉइज़िंग प्रक्रिया को सतत नियंत्रण समस्या के रूप में पुनर्परिभाषित करता है और फ्रोज़न बेस मॉडल बदले बिना प्रॉम्प्ट अनुरूपता तथा इमेज गुणवत्ता बढ़ाता है।

  • पेपर ने Stable Diffusion v1.4 बैकबोन पर SFT, reward-weighted loss (RWL) और PPO तीन फाइन-ट्यूनिंग व्यवस्थाओं में मूल्यांकन किया, और HPS-v2 से उपयोगकर्ता प्रॉम्प्ट तथा सौंदर्य संबंधी पसंद के साथ अनुरूपता मापी।
  • SFT और RWL प्रयोगों में ग्रे-बॉक्स Diffusion Controller स्टीयरिंग डैम्पर नेटवर्क ने HPS-v2 जीत दर में LoRA को पीछे छोड़ा, और LoRA की तुलना में बहुत कम आंतरिक मॉडल परतें बदलीं।
  • पेपर बताता है कि इसका पूरी तरह अनलॉक संस्करण, जिसमें आंतरिक मॉडल वेट बदलने के लिए व्हाइट-बॉक्स पहुंच है, बेसलाइन मॉडल पर 90% जीत दर हासिल करता है।
  • फ्रेमवर्क चार नेटवर्क संरचनाएं लागू करता है: Diffusion Controller, Diffusion Controller-Naive, Diffusion Controller-J और Diffusion Controller-S।

बिल्डरों के लिए इसका अर्थ है कि व्हाइट-बॉक्स पहुंच के बिना क्लोज़्ड-सोर्स इमेज मॉडल पर सूक्ष्म नियंत्रण संभव है, और नियंत्रण परत मॉडल कोर से अलग होने से इसे पर्सनलाइज़ेशन, सुरक्षा और वीडियो जनरेशन तक बढ़ाया जा सकता है।

Google Research
02
watchagentsnew architecture

LLM एजेंट और डेटा स्पेस को जोड़ना: Model Context Protocol के माध्यम से आर्किटेक्चरल मध्यस्थता

यह पेपर Model Context Protocol (MCP) पर आधारित आर्किटेक्चरल मध्यस्थता दृष्टिकोण प्रस्तुत करता है, जिसे Eunomia Agent के माध्यम से लागू किया गया है, ताकि LLM एजेंट और डेटा स्पेस सेवाओं के बीच नियंत्रित अंतःक्रिया संभव हो सके। एक प्रोटोटाइप ने मौजूदा डेटा स्पेस घटकों को बदले बिना कैटलॉग खोज, मेटाडेटा पुनर्प्राप्ति और डेट...

  • पेपर 24 सितंबर 2026 को arXiv पर arXiv:2609.30341 के रूप में जमा किया गया, जो cs.AI और cs.DB में वर्गीकृत है।
  • मध्यस्थता परत डेटा स्पेस क्षमताओं को संरचित, स्कीमा-आधारित टूल में बदलती है जिन्हें AI एजेंट खोज और आह्वान कर सकते हैं, साथ ही गवर्नेंस बाधाएँ संरक्षित रहती हैं।
  • प्रोटोटाइप कार्यान्वयन ने मौजूदा डेटा स्पेस घटकों को बदले बिना कैटलॉग खोज, मेटाडेटा पुनर्प्राप्ति और डेटा सेवा आह्वान में एंड-टू-एंड अंतःक्रिया को मान्य किया।
  • लेखक Jaime Alonso Ruiz, Carlos Aparicio, Gabriel Huecas, Joaquín Salvachúa और Andres Munoz-Arcentales हैं।

AI एजेंट बनाने वाली टीमों के लिए यह काम दर्शाता है कि MCP को मध्यस्थता परत के रूप में उपयोग करके मौजूदा डेटा अवसंरचना बदले बिना शासित डेटा स्पेस से एजेंट जोड़े जा सकते हैं।

arXiv cs.AI
03
watchinferencenew architecture

HybridInfer: ऑन-डिवाइस, एज और क्लाउड LLM इन्फ़रेंस के लिए थर्मल-जागरूक रीइन्फ़ोर्समेंट-लर्निंग टियर रूटिंग

HybridInfer एक थर्मल-जागरूक रीइन्फ़ोर्समेंट-लर्निंग राउटर है जो तीन-स्तरीय व्यवस्था (ऑन-डिवाइस Llama 3.2 3B, रिट्रीवल सहित एज Llama 3.1 8B, क्लाउड GPT-4o) के लिए फ़ोन के थर्मल हेडरूम और क्वेरी-जटिलता अनुमान को स्टेट के रूप में उपयोग करता है और ऑफ़लाइन प्रशिक्षित Q-learning नीति से टियर चुनता है।

  • पेपर रिपोर्ट करता है कि हमेशा ऑन-डिवाइस स्थितियाँ सेवा-योग्य क्वेरी पर प्रति-क्वेरी गुणवत्ता के बराबर हैं, लेकिन तीन से छह गुना धीमी हैं और लंबी क्वेरी पर विफल होती हैं।

ऑन-डिवाइस LLM तैनाती में थर्मल सीमाएँ केवल धीमापन नहीं बल्कि रनटाइम-स्थिरता की समस्या हैं, इसलिए रूटिंग नीतियों को केवल गुणवत्ता और लेटेंसी नहीं, बल्कि थर्मल स्टेट और लोकैलिटी प्रोत्साहन भी शामिल करना चाहिए।

arXiv cs.LG
04
testdocumentsopen source unlock

XingChen-AGI ने 1.2B पैरामीटर वाला दस्तावेज़ पार्सिंग VLM TeleOCR जारी किया

TeleOCR लगभग 1.2B पैरामीटर का ओपन-सोर्स विज़न-लैंग्वेज मॉडल है जो डिजिटल और कैमरे से ली गई छवियों वाले दस्तावेज़ों की पार्सिंग को एक ही फ्रेमवर्क में जोड़ता है, और इसके वेट तथा तकनीकी रिपोर्ट जारी की गई है।

  • मॉडल कार्ड के अनुसार पैरामीटर लगभग 1.2B, लाइसेंस apache-2.0, चीनी और अंग्रेज़ी समर्थन, तथा आधार qwen2_5_vl है।
  • OmniDocBench v1.6 पर TeleOCR ने Overall 96.87, Text Edit 0.027, Formula CDM 96.36 और Table TEDS 97.05 रिपोर्ट किया।
  • Dr.DocBench Challenge में TeleOCR ने Overall 67.96 रिपोर्ट किया, जो MinerU 2.5 Pro के 62.26 और PaddleOCR-VL 1.6 के 55.11 से अधिक है।
  • मॉडल कार्ड कहता है कि TeleOCR विकृत दस्तावेज़ों का लेआउट और सामग्री बिना डीवार्पिंग प्रीप्रोसेसिंग या समर्पित सुधार मॉडल के पार्स करता है।

दस्तावेज़ पार्सिंग पाइपलाइन बनाने वाले डेवलपर्स के लिए TeleOCR लगभग 1.2B पैरामीटर पर कई सार्वजनिक बेंचमार्क में अग्रणी परिणाम रिपोर्ट करता है और वेट तथा GGUF कन्वर्ज़न देता है, इसलिए यह हल्के सेल्फ-होस्टेड पार्सिंग का उम्मीदवार है।

Hugging Face Trending
05
testmodelsopen source unlock

Qwen ने Qwen-Image-2.1 ओपन-सोर्स किया: 7B पैरामीटर वाला एकीकृत टेक्स्ट-टू-इमेज और इमेज-एडिटिंग मॉडल

Qwen ने Qwen-Image-2.1 ओपन-सोर्स किया है, जो टेक्स्ट-टू-इमेज जनरेशन और इमेज एडिटिंग का एकीकृत मॉडल है; इसके विज़ुअल जनरेशन घटक में 32 Single-Stream DiT लेयर पर 7B पैरामीटर हैं और यह नेटिव पारदर्शी (RGBA) जनरेशन और एडिटिंग का समर्थन करता है।

  • विज़ुअल जनरेशन घटक में 32 Single-Stream DiT लेयर पर 7B पैरामीटर हैं।
  • यह अधिकतम 10 संदर्भ छवियों और वृत्त, पेंट किए गए एनोटेशन या अलग मास्क द्वारा निर्दिष्ट स्थानीय संपादन का समर्थन करता है।
  • समर्थित आस्पेक्ट अनुपात में 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 और 9:16 शामिल हैं, उदाहरण रिज़ॉल्यूशन अधिकतम 2752×1536 है।
  • यह Qwen Research License Agreement के अंतर्गत लाइसेंस प्राप्त है, और मॉडल पृष्ठ पर पिछले महीने 64,362 डाउनलोड दर्ज हैं।

चूंकि एक ही 7B मॉडल टेक्स्ट-टू-इमेज जनरेशन, RGBA पारदर्शी लेयर जनरेशन और बहु-संदर्भ संपादन को कवर करता है, बिल्डर जनरेशन और एडिटिंग के लिए अलग मॉडल तैनात करने से बच सकते हैं।

Hugging Face Trending
06
watchresearchincremental

फ्रंटियर AI प्रशिक्षण के लिए सेफ्टी केस पर शुरुआती दिशानिर्देश

OpenAI ने फ्रंटियर AI प्रशिक्षण में सेफ्टी केस के लिए शुरुआती दिशानिर्देश जारी किए, जिनमें तकनीकी सुरक्षा उपाय, परिचालन प्रथाएँ और मिसअलाइनमेंट घटनाओं की जाँच शामिल हैं।

  • दिशानिर्देश तकनीकी सुरक्षा उपायों, परिचालन प्रथाओं और मिसअलाइनमेंट घटनाओं की जाँच को कवर करते हैं।
  • इन्हें शुरुआती दिशानिर्देश के रूप में प्रस्तुत किया गया है, अंतिम मानक के रूप में नहीं।

फ्रंटियर मॉडल प्रशिक्षित करने वाली टीमें इन तीन क्षेत्रों को अपने आंतरिक सेफ्टी केस दस्तावेज़ के शुरुआती ढाँचे के रूप में उपयोग कर सकती हैं।

OpenAI News
07
testmodelsopen source unlock

TaichuAI ने स्थानिक तर्क और एजेंटिक टूल उपयोग के लिए ZDTaichu5.0-9B मल्टीमॉडल फाउंडेशन मॉडल जारी किया

ZDTaichu5.0-9B, TaichuAI का एक मल्टीमॉडल फाउंडेशन मॉडल है जो Qwen3.5-9B भाषा बैकबोन को C-RADIOv4-H विज़न एनकोडर के साथ जोड़ता है, किसी भी रिज़ॉल्यूशन पर टेक्स्ट, इमेज और वीडियो का समर्थन करता है, और सामान्य विज़ुअल समझ, स्थानिक तर्क, एजेंटिक टूल उपयोग तथा एम्बॉडिड-AI शोध को लक्षित करता है।

  • मॉडल में 9.8B पैरामीटर, BF16 टेंसर प्रकार और अधिकतम 128K tokens की कॉन्टेक्स्ट लंबाई है।
  • मॉडल कार्ड TAU2-Bench पर 87.7, Claw-Eval पर 71.4 और IFEval पर 93.7 स्कोर रिपोर्ट करता है।
  • मॉडल कार्ड ERQA पर 48 और RoboSpatial पर 56 स्कोर रिपोर्ट करता है।
  • वेट NVIDIA Open Model License Agreement के तहत जारी किए गए हैं, और Qwen3.5 का Apache-2.0 लाइसेंस बरकरार रखा गया है।

विज़न एजेंट या एम्बॉडिड-AI पाइपलाइन बनाने वालों के लिए यह मॉडल 10B पैमाने पर स्थानिक तर्क और टूल कॉलिंग देता है, लेकिन टूल निष्पादन को आसपास के एप्लिकेशन द्वारा ही लागू, सत्यापित और सुरक्षित करना होगा।

Hugging Face Trending