AI FRONTIER
Signals worth understanding before they become obvious.
SCION: इंस्टैंसिएटेड न्यूरल प्रिमिटिव्स के साथ दृश्य संयोजन
SCION एक पदानुक्रमित संयोजनात्मक दृश्य निरूपण प्रस्तुत करता है जो स्वतंत्र 3D गाउसियनों को पुनः प्रयोग योग्य प्रिमिटिव्स की संक्षिप्त शब्दावली और हल्के वर्ल्ड-स्पेस इंस्टैंस से बदल देता है, और असतत व सतत दृश्य पैरामीटरों के संयुक्त अनुकूलन द्वारा बहु-दृश्य कैप्चर पर फिट किया जाता है। पेपर 1.2 MB पर भी उच्च गुणवत्ता बना...
- यह पेपर NeurIPS 2026 में स्वीकृत हुआ और 1 अक्टूबर 2026 को सबमिट किया गया।
- SCION प्रति दृश्य लाखों स्वतंत्र गाउसियनों को पुनः प्रयोग योग्य प्रिमिटिव्स की शब्दावली और वर्ल्ड-स्पेस इंस्टैंस से बदलता है।
- पेपर के अनुसार 1.2 MB पर भी उच्च गुणवत्ता बनी रहती है।
- पेपर मौजूदा गाउसियन कम्प्रेशन विधियों के मुकाबले अनुकूल रेट-डिस्टॉर्शन की सूचना देता है और बिना पुनः प्रशिक्षण इंस्टैंस-स्तरीय संपादन व एनिमेशन सक्षम बनाता है।
3D दृश्य पाइपलाइन बनाने वालों के लिए SCION दर्शाता है कि दृश्यों को पुनः प्रयोग योग्य प्रिमिटिव्स और इंस्टैंस के रूप में मॉडल करने से लगभग 1.2 MB के संक्षिप्त निरूपण में संपादन योग्य, एनिमेट करने योग्य इंस्टैंस-स्तरीय नियंत्रण मिल सकते हैं।
DeskForge: कंप्यूटर-उपयोग एजेंटों के लिए डेस्कटॉप वातावरण से सघन सुपरविज़न
DeskForge एक नियंत्रणीय डेस्कटॉप वातावरण है जो वास्तविक अनुप्रयोगों को संयोजित और अन्वेषित करके बड़े पैमाने पर सुपरविज़न उत्पन्न करता है, जिससे DeskForge-1M बनता है, जो 1.2 मिलियन एनोटेटेड डेस्कटॉप अवलोकनों का कोष है जिसमें 159.7 मिलियन एलिमेंट इंस्टेंस हैं। पेपर DeskForge-1M से लिए गए 200K ग्राउंडिंग उदाहरणों पर चार व...
- DeskForge-1M में 1.2 मिलियन एनोटेटेड डेस्कटॉप अवलोकन और 159.7 मिलियन एलिमेंट इंस्टेंस हैं।
- पेपर DeskForge-1M से लिए गए 200K ग्राउंडिंग उदाहरणों पर चार विज़न-लैंग्वेज मॉडलों को फाइन-ट्यून करता है।
- पेपर बताता है कि Qwen3.5-4B की सटीकता ScreenSpot-Pro पर 11.51 प्रतिशत अंक और OSWorld-G पर 10.11 अंक बढ़ती है।
- पेपर बताता है कि एक निश्चित प्लानर के अंतर्गत Qwen3.5-4B WebArena-Infinity पर 119 में से 31 से 50 कार्यों तक और OpenApps पर 100 में से 3 से 15 कार्यों तक पहुँचता है।
कंप्यूटर-उपयोग एजेंट बनाने वाली टीमों के लिए DeskForge दर्शाता है कि वास्तविक डेस्कटॉप वातावरणों का नियंत्रणीय संयोजन सघन एलिमेंट एनोटेशन को स्केल कर सकता है और GUI ग्राउंडिंग तथा दीर्घ-क्षितिज कार्य पूर्णता दोनों को सुधार सकता है।
Rank-Aware Speculative Sampling: डिफ्यूज़न ड्राफ्ट ट्री के लिए एक सत्यापन नियम
पेपर Rank-Aware Speculative Sampling (RASS) पेश करता है, जो रैंक-जागरूक सूची युग्मन पर आधारित स्पेक्युलेटिव ड्राफ्ट ट्री के लिए सत्यापन नियम है; यह उम्मीदवारों को प्रस्ताव-लक्ष्य औसत विस्थापन के अनुसार क्रमित करता है, चयनित-प्रस्ताव और लक्ष्य वितरणों के बीच कुल विचरण को न्यूनतम करने के लिए अनुकूलित भारों के साथ रैंक नम...
- RASS, D-GRS को बेहतर बनाता है; D-GRS प्रत्येक नोड पर K सशर्त रूप से स्वतंत्र उम्मीदवार उत्पन्न करता है और उन्हें उनके जनरेशन क्रम में क्रमिक रूप से परखता है।
- RASS का मूल्यांकन गाऊसी-मिश्रण लक्ष्य, FFHQ पर बिना शर्त पिक्सेल-स्पेस जनरेशन, CIFAR-10 पर सशर्त जनरेशन, और COCO2014 प्रॉम्प्ट के साथ Stable Diffusion 3.5 के लेटेंट डिफ्यूज़न पर किया गया।
- अवशिष्ट सुधार रैंक भार के किसी भी चयन के लिए सटीक सैंपलिंग सुनिश्चित करता है।
डिफ्यूज़न इन्फरेंस को तेज़ करने वाले बिल्डरों के लिए, RASS दर्शाता है कि अतिरिक्त लक्ष्य-मॉडल मूल्यांकनों के बिना ड्राफ्ट उम्मीदवारों की रैंकिंग का उपयोग करने से समान कंप्यूट बजट पर लक्ष्य-मॉडल मूल्यांकन गणनाएं घट सकती हैं।
Lightricks ने LTX-2.5 ओपन-वेट वीडियो और ऑडियो मॉडल जारी किया
Lightricks/LTX-2.5 एक ओपन-वेट मॉडल है जो टेक्स्ट, इमेज और वीडियो इनपुट से सिंक्रनाइज़्ड वीडियो और ऑडियो बनाता है और इसे स्वयं होस्ट किया जा सकता है। इसमें नेटिव मल्टीशॉट जनरेशन, डिफ्यूज़न वीडियो डिकोडर, कस्टम Gemma 4 12B टेक्स्ट एनकोडर और वैकल्पिक ड्यूरेशन प्रेडिक्टर जोड़े गए हैं।
- मॉडल कार्ड में 6.48k लाइक और पिछले महीने 1,645,444 डाउनलोड दर्ज हैं।
- DiT चेकपॉइंट 22b लेबल वाले हैं और bf16, Comfy int8+convrot तथा NVFP4 वेरिएंट में उपलब्ध हैं।
- टेक्स्ट एनकोडर Gemma4 12B और प्रोजेक्शन है, तथा वीडियो और ऑडियो अलग-अलग VAE उपयोग करते हैं।
- 10 मिलियन अमेरिकी डॉलर से कम वार्षिक राजस्व वाली संस्थाओं को LTX-2.x कम्युनिटी लाइसेंस के तहत मुफ्त व्यावसायिक उपयोग मिलता है; इससे अधिक पर सशुल्क व्यावसायिक समझौता आवश्यक है।
बिल्डरों के लिए LTX-2.5 एक स्प्लिट, Comfy-अलाइन्ड वेट पैक के रूप में स्वयं होस्ट करने योग्य ऑडियो-वीडियो जनरेशन देता है और dev transformer को फाइन-ट्यून किया जा सकता है, लेकिन int8 चेकपॉइंट केवल ComfyUI के लिए हैं।
नियंत्रित प्रयोगों के बिना वैज्ञानिक एमुलेटर में काउंटरफैक्चुअल भविष्यवाणी के लिए ReRoute
यह पेपर ReRoute प्रस्तुत करता है, जो लक्षित वैज्ञानिक what-if भविष्यवाणी के लिए एक फ्रेमवर्क है जो तथ्यात्मक डेटा को आंशिक मेकैनिस्टिक ज्ञान के साथ जोड़ता है और अनुकूलन के लिए नियंत्रित हस्तक्षेप डेटा की आवश्यकता नहीं रखता। ReRoute पूर्व-प्रशिक्षित बैकबोन के क्वेरी किए गए इनपुट को एक संदर्भ मान पर स्थिर करता है, ज्ञात ...
- होल्ड-आउट युग्मित जलवायु हस्तक्षेपों पर, ReRoute गंभीर CO2 वितरण बदलावों के तहत समग्र जलवायु त्रुटि को 18.2-31.8% तक कम करता है, साथ ही मानक परिस्थितियों में प्रदर्शन बनाए रखता है।
- पेपर रिपोर्ट करता है कि ReRoute एक नियंत्रित एडवेक्शन-डिफ्यूजन सिस्टम में अत्यधिक सटीक काउंटरफैक्चुअल भविष्यवाणियां प्राप्त करता है, जहां सटीक प्रतिक्रियाएं उपलब्ध हैं।
- पेपर स्पष्ट संरचनात्मक मान्यताओं के तहत इस निर्माण के लिए एक कारणात्मक पहचान परिणाम प्रदान करता है, जिसके मुख्य तर्क को Lean में मशीन-सत्यापित किया गया है।
वैज्ञानिक एमुलेटर बनाने वाली टीमों के लिए, ReRoute दर्शाता है कि तथ्यात्मक डेटा और आंशिक मेकैनिस्टिक ज्ञान महंगे नियंत्रित सिमुलेशन डेटा उत्पन्न किए बिना वितरण बदलाव के तहत काउंटरफैक्चुअल भविष्यवाणी को बेहतर बना सकते हैं।
DeReAct: विश्वसनीय AI एजेंट के लिए विघटित तर्क और कार्य
DeReAct एक मॉड्यूलर एजेंट आर्किटेक्चर है जो दो गेटिंग नीतियों को बाहरी बनाता है: एक Critic जो निष्पादन से पहले प्रस्तावित कार्यों को मान्य करता है, और एक Context Manager जो पर्यावरण-समर्थित State का पुनर्निर्माण करता है और कार्य पूर्णता को प्रमाणित करता है। पेपर बताता है कि GAIA और SWE-bench Verified पर DeReAct कमजोर B...
- पेपर Qwen3-Coder-480B के लिए Pass@1 में 6.5 से 7.0 अंक की वृद्धि बताता है।
- पेपर Claude Sonnet 4.5 के लिए Pass@1 में 4.2 से 5.2 अंक की वृद्धि बताता है।
- Claude Opus 4.5 के साथ Pass@1 ReAct के तुलनीय रहता है, जबकि DeReAct अधिक साक्ष्य-पूर्ण और बाधा-संतुष्ट करने वाले ट्रैजेक्टरी उत्पन्न करता है।
- पेपर कहता है कि बाहरी गेटिंग तब प्रभावी होती है जब लक्षित विफलताएँ पर्याप्त रूप से प्रचलित हों और गेटिंग नीति स्वयं पर्याप्त हो।
एजेंट बनाने वालों के लिए, कार्रवाई सत्यापन और पूर्णता प्रमाणन को एक ही नीति से अलग करना अंतर्निहित Brain मॉडल बदले बिना कमजोर मॉडलों की विश्वसनीयता बढ़ा सकता है।
Cloudflare ने Clef जारी किया: 27B मल्टीमॉडल निर्णय मॉडल, एक ही फॉरवर्ड पास में संरचित संभावनाएँ देता है
Cloudflare ने Clef जारी किया है, जो Qwen/Qwen3.8-27B से पोस्ट-ट्रेन किया गया मल्टीमॉडल मॉडल है और किसी स्थिति तथा टाइप्ड प्रश्नों के स्कीमा को निर्णयों में बदलता है, हर प्रश्न के हर अनुमत विकल्प के लिए संभावना लौटाता है, बिना मुक्त-रूप पाठ निर्माण या आउटपुट पार्सिंग के।
- 27B पैरामीटर, BF16, मानक शार्डेड safetensors के रूप में संग्रहीत, Apache-2.0 लाइसेंस के अंतर्गत जारी।
- स्थिति के रूप में टेक्स्ट, JSON, छवियाँ या वीडियो स्वीकार करता है और प्रति प्रश्न प्रति अनुमत विकल्प एक logit देता है, प्रति प्रश्न softmax से संभावनाएँ मिलती हैं।
- एक H200 पर torch 2.11 और transformers 5.10.2 के साथ परीक्षण किया गया; छवि और वीडियो इनपुट के लिए pillow भी आवश्यक है।
- आंतरिक Decision Index 0.2.1 रन में BFCL केस सटीक सटीकता 98.5, BANKING77 मैक्रो-F1 94.2, माध्यिका विलंबता 209.3 मिलीसेकंड और p95 विलंबता 238.6 मिलीसेकंड है।
जिन AI बिल्डरों को मुक्त-रूप पाठ के बजाय संरचित निर्णय चाहिए, उनके लिए Clef Jev/SystemOne-संगत API वाला 27B मल्टीमॉडल विकल्प है, हालाँकि इसकी विलंबता Clef-flash जैसे छोटे वेरिएंट से अधिक है।
EditHero: लंबी अवधि के पार्ट-स्तरीय 3D एडिटिंग और Vibe Modeling के लिए एक बेंचमार्क
यह पेपर EditHero पेश करता है, जिसे लेखकों के अनुसार लंबी अवधि के पार्ट-स्तरीय 3D एडिटिंग के लिए पहला बेंचमार्क बताया गया है, जिसमें प्राकृतिक भाषा के निर्देश और ज्यामिति तथा टेक्सचर दोनों के लिए लक्ष्य छवियाँ शामिल हैं। एक नियतात्मक असेंबली इंजन हर एडिट के बाद सटीक लक्ष्य उत्पन्न करता है, और हर अनुक्रम की मैन्युअल समीक...
- पेपर EditHero को लेखकों के ज्ञान के अनुसार लंबी अवधि के पार्ट-स्तरीय 3D एडिटिंग के लिए पहला बेंचमार्क बताता है, जिसमें प्राकृतिक भाषा के निर्देश और ज्यामिति तथा टेक्सचर के लिए लक्ष्य छवियाँ हैं।
- एक नियतात्मक असेंबली इंजन हर एडिट के बाद सटीक लक्ष्य उत्पन्न करता है, और हर अनुक्रम की मैन्युअल समीक्षा की जाती है।
- गैर-एजेंटिक तरीके ऊपर से नीचे काम करते हैं, सीखे गए 3D प्रतिनिधित्व से ऑब्जेक्ट को फिर से बनाते हैं, और अक्सर अनुरोधित बदलाव चूक जाते हैं तथा उन क्षेत्रों को बिगाड़ देते हैं जिन्हें स्थिर रहना चाहिए।
यह बेंचमार्क मूल्यांकन को एकल एडिट से बहु-चरणीय संशोधनों में केवल वही बदलने की क्षमता पर ले जाता है जो मांगा गया था, जिससे पुनरावृत्तीय 3D एडिटिंग पाइपलाइन बनाने वालों को पुनरुत्पादनीय तुलना लक्ष्य मिलता है।