Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-03
01
watchmodelsincremental

Gemini 4 Argon: Google DeepMind का अगला फ्रंटियर इंटेलिजेंस मॉडल

Google DeepMind ने Gemini 4 Argon की घोषणा की है, जो लंबे-क्षितिज वाले वर्कफ़्लो के लिए आउटपुट टोकन सीमा 64K से बढ़ाकर 1 मिलियन करता है और Fairwind Program के ज़रिए भरोसेमंद साइबर रक्षकों को उपलब्ध कराया जा रहा है।

  • आउटपुट टोकन सीमा 64K से बढ़ाकर 1 मिलियन टोकन की गई, जिसे Google उद्योग में अग्रणी बताता है।
  • वास्तविक दुनिया के लंबे-क्षितिज सॉफ़्टवेयर इंजीनियरिंग कार्यों के बेंचमार्क DeepSWE v1.1 पर 77.9% के साथ नया स्टेट ऑफ़ द आर्ट स्थापित किया।
  • Zapier के AutomationBench पर 51.3% के साथ पहला स्थान और LVBench लंबे वीडियो समझ पर 91.7% के साथ स्टेट ऑफ़ द आर्ट।
  • CWE-bench v1 पर 68% के साथ संयुक्त रूप से पहला स्थान; शुरुआती कीमत प्रति मिलियन इनपुट टोकन 2 डॉलर और प्रति मिलियन आउटपुट टोकन 10 डॉलर, कैश्ड इनपुट पर इनपुट कीमत से 95% छूट।

बिल्डरों के लिए 1 मिलियन आउटपुट टोकन की सीमा और प्रति मिलियन इनपुट टोकन 2 डॉलर की कीमत लंबी एजेंट ट्रैजेक्ट्री को आर्थिक रूप से व्यवहार्य बनाती है, लेकिन पहुँच फ़िलहाल भरोसेमंद साइबर रक्षकों तक सीमित है।

Google DeepMind
02
watchagentsnew architecture

प्रस्ताव से सत्यापित प्रभाव तक: Praxa, शासित AI एजेंट निष्पादन के लिए साक्ष्य-बद्ध हार्नेस

यह पेपर Praxa एजेंट हार्नेस प्रस्तुत करता है, जो नियतात्मक प्रवेश, ब्रोकर-आधारित निष्पादन, बाहरी रीड-बैक, मिलान और समीक्षित प्रोन्नति के माध्यम से प्रस्ताव, अधिकार, डिस्पैच, सत्यापित बाहरी प्रभाव और सर्विंग प्रोन्नति को स्पष्ट रूप से दर्शाता है। रिपोर्ट की गई चारों साक्ष्य-धाराएँ उत्पादन परिणाम में वृद्धि या सामान्य श्...

  • डीबग के बाद दो-क्रम समन्वय-प्रॉक्सी विकास तुलना में बेसलाइन और लेखक-लिखित उम्मीदवार ने प्रत्येक 180/180 परीक्षण पूरे किए, मापी गई सटीकता समान रही, पूर्ण हर्मेटिक क्रैश रिकवरी हुई और शून्य संरक्षित उल्लंघन दर्ज हुए।
  • उम्मीदवार ने 37.11% कम टोकन, 33.84% कम अनुमानित एंडपॉइंट लागत और 11.63% कम चरण उपयोग किए; पेपर कहता है कि यह गुणवत्ता, विलंबता या उत्पादन व्यवहार में सुधार सिद्ध नहीं करता।

शासित एजेंट बनाने वाली टीमों के लिए Praxa का योगदान अधिकार-से-प्रभाव संक्रमणों को स्पष्ट और परीक्षण-योग्य बनाना है, लेकिन वर्तमान साक्ष्य केवल आर्किटेक्चरल सत्यापनीयता का समर्थन करता है, उत्पादन परिनियोजन या सुरक्षा दावों का नहीं।

arXiv cs.AI
03
watchmodelsnew architecture

OpenRouter का नया मॉडल: inclusionAI Ling 3.1 Flash

Ling 3.1 Flash, inclusionAI का हाइब्रिड रीज़निंग mixture-of-experts मॉडल है, जिसमें कुल 560B में से 25B सक्रिय पैरामीटर हैं और कॉन्टेक्स्ट विंडो 262,144 टोकन है।

  • कुल 560B पैरामीटर, जिनमें 25B सक्रिय पैरामीटर हैं।
  • 262,144 टोकन की कॉन्टेक्स्ट विंडो, जो अधिकतम 32,768 कम्प्लीशन टोकन का समर्थन करती है।
  • फ़ंक्शन कॉलिंग के लिए tools और tool_choice स्वीकार करता है, लेकिन response_format का समर्थन नहीं करता, इसलिए JSON आउटपुट लागू नहीं होता।
  • OpenRouter पर मुफ़्त के रूप में सूचीबद्ध, रिलीज़ तिथि 2 अक्टूबर 2026।

बिल्डरों के लिए यह टूल कॉलिंग वाला मुफ़्त लंबे-कॉन्टेक्स्ट MoE विकल्प है, लेकिन लागू संरचित आउटपुट न होने से JSON विश्वसनीयता ऐप्लिकेशन लेयर पर संभालनी होगी।

OpenRouter Models
04
watchcreativenew architecture

DSSR-3D: 3D गॉसियन में दृश्य-निर्भर रेफरिंग के लिए डिकपल्ड रीज़निंग

DSSR-3D निरंतर 3D गॉसियन फ़ील्ड पर दृश्य-निर्भर रेफरिंग सेगमेंटेशन के लिए एक इन्फ़रेंस-टाइम फ़्रेमवर्क है, जिसे दो इंटरफ़ेस के रूप में औपचारिक बनाया गया है, पोज़-इनवेरिएंट सिमैंटिक लोकलाइज़ेशन और पोज़-कंडीशंड स्पेशियल रीज़निंग, और इसके लिए अंतर्निहित सिमैंटिक फ़ील्ड के पुनः प्रशिक्षण की आवश्यकता नहीं है।

  • पेपर फ़्रेमवर्क को दो इंटरफ़ेस के रूप में औपचारिक बनाता है, पोज़-इनवेरिएंट सिमैंटिक लोकलाइज़ेशन और पोज़-कंडीशंड स्पेशियल रीज़निंग, जहाँ इन शर्तों को पूरा करने वाला कोई भी फ़ंक्शन युग्म वैध इंस्टैंशिएशन देता है।
  • इंस्टैंशिएशन में तापमान-शार्पन्ड softmax लोकलाइज़ेशन तंत्र और प्रोजेक्शन-आधारित दिशात्मक स्कोरिंग फ़ंक्शन का उपयोग होता है, जिन्हें हल्के, प्रशिक्षण-रहित चरण से जोड़ा जाता है।
  • लेखक ViewRef-GS प्रस्तावित करते हैं, जो 3D गॉसियन फ़ील्ड पर दृश्य-निर्भर सेगमेंटेशन को अलग करने वाला बेंचमार्क है, और इसे बढ़ाए गए Ref-LERF के साथ मिलकर मूल्यांकित किया जाता है।
  • पेपर मौजूदा 3DGS-आधारित रेफरिंग विधियों की तुलना में लगातार सुधार की रिपोर्ट करता है, और आधार सिमैंटिक फ़ील्ड के अतिरिक्त कोई प्रशिक्षण आवश्यक नहीं है।

AI बिल्डरों के लिए यह दर्शाता है कि दृश्य-निर्भर स्थानिक रेफरिंग को इन्फ़रेंस समय पर अलग किया जा सकता है और बिना पुनः प्रशिक्षण संरचनात्मक रूप से भिन्न सिमैंटिक फ़ील्ड पर स्थानांतरित किया जा सकता है।

arXiv cs.CV
05
watchresearchcost collapse

FlashDiffusion: फ्यूज़्ड टाइल्ड कर्नेल स्पेक्ट्रल डीकंपोज़िशन

यह पेपर FlashDiffusion पेश करता है, एक मैट्रिक्स-रहित विधि जो फ्यूज़्ड GPU टाइल्स में सघन गाऊसी कर्नेल ब्लॉक का मूल्यांकन करती है और आइगेनसॉल्वर को एक अनुभवजन्य β-flow से जोड़ती है जो सीमित-नमूना रिज़ॉल्यूशन स्केल चुनता है।

  • पेपर रिपोर्ट करता है कि सघन गाऊसी कर्नेल को भौतिक रूप देने के लिए O(N^2) मेमोरी चाहिए।
  • यह विधि फ्यूज़्ड GPU टाइल्स में सघन गाऊसी कर्नेल ब्लॉक का मूल्यांकन करती है, जिससे सघन कर्नेल को भौतिक रूप देने से बचा जाता है।
  • आइगेनसॉल्वर एक अनुभवजन्य β-flow से जुड़ा है जो सीमित-नमूना रिज़ॉल्यूशन स्केल चुनता है।
  • नमूना आकार और बैंडविड्थ पर एक कंटिन्यूएशन मोटे रिज़ॉल्यूशन से बढ़ती महँगी स्पेक्ट्रल हलों को वॉर्म-स्टार्ट करता है।

ज्यामितीय लर्निंग में कर्नेल विधियों का उपयोग करने वाले AI बिल्डरों के लिए, यह मैट्रिक्स-रहित टाइल्ड दृष्टिकोण O(N^2) सघन-कर्नेल मेमोरी अवरोध को हटाता है, जिससे बड़े स्पेक्ट्रल हल संभव होते हैं।

arXiv cs.LG
06
watchresearchincremental

ChainLoRA: LLM में सतत शिक्षण के लिए ज्यामिति-संरक्षण करने वाला टास्क वेक्टर मर्जिंग

ChainLoRA एक रीप्ले-रहित सतत मर्जिंग फ्रेमवर्क है, जो चेन-अपडेटेड टास्क-वेक्टर ज्यामिति पर आधारित है और चेन-अपडेटेड ट्रेनिंग को पोस्ट-स्ट्रीम एडाप्टिव SVD मर्जिंग के साथ जोड़ता है। पेपर Large और SuperNI बेंचमार्क पर मूल्यांकित रीप्ले-रहित तरीकों में अत्याधुनिक प्रदर्शन की रिपोर्ट करता है।

  • ChainLoRA चेन-अपडेटेड ट्रेनिंग को पोस्ट-स्ट्रीम एडाप्टिव SVD मर्जिंग के साथ जोड़ता है, जहाँ ट्रेनिंग के दौरान इनिशियलाइज़ेशन और एक-तरफ़ा ऑर्थोगोनैलिटी प्रॉक्सी केवल अंतिम कैरियर का उपयोग करते हैं।
  • मर्जिंग के समय, एडाप्टिव SVD एक साझा कैरियर निकालता है और Procrustes एडाप्टेशन के माध्यम से उसे नवीनतम टास्क से संरेखित करता है।
  • सैद्धांतिक विश्लेषण दर्शाता है कि Procrustes एडाप्टेशन साझा और टास्क-विशिष्ट घटकों के ज्यामितीय अनुमानित पृथक्करण को सुविधाजनक बनाता है, और एक-तरफ़ा प्रॉक्सी अंतर-टास्क हस्तक्षेप को और सीमित करता है।

सतत शिक्षण पाइपलाइन बनाने वालों के लिए, ChainLoRA की चेन-अपडेटेड ट्रेनिंग और एडाप्टिव SVD मर्जिंग एक रीप्ले-रहित, पैरामीटर-कुशल फाइन-ट्यूनिंग मार्ग प्रदान करती है, जिसका ऐतिहासिक-स्थिति फुटप्रिंट और रेगुलराइज़ेशन ओवरहेड टास्क स्ट्रीम बढ़ने ...

arXiv stat.ML
07
testmodelsopen source unlock

NVIDIA Kumo Tabular ने टेबुलर भविष्यवाणी के लिए नई सटीकता-दक्षता सीमा तय की

NVIDIA ने Kumo Tabular जारी किया है, जो टेबुलर वर्गीकरण और रिग्रेशन के लिए एक ओपन फाउंडेशन मॉडल है और बिना प्रशिक्षण, ट्यूनिंग या फीचर इंजीनियरिंग के एक ही फॉरवर्ड पास में नई पंक्तियों की भविष्यवाणी करता है, 28M से 215M पैरामीटर तक तीन आकारों में OpenMDW-1.1 लाइसेंस के तहत उपलब्ध है।

  • Kumo Tabular Small/Medium/Large तीन आकारों में उपलब्ध है, जिनमें 28M से 215M पैरामीटर हैं, और यह व्यावसायिक उपयोग के लिए OpenMDW-1.1 लाइसेंस के तहत जारी किया गया है।
  • यह TabArena लीडरबोर्ड पर 1950 के ELO के साथ समग्र रूप से पहले स्थान पर है और एक समान एकल RTX 6000 Pro मूल्यांकन सेटअप में LimiX-2 से 17 गुना तेज़ बताया गया है।
  • BeyondArena पर यह 1418 के ELO और 7.78% के Improvability स्कोर के साथ लीडरबोर्ड पर पहले स्थान पर है।
  • TALENT पर यह वर्गीकरण सटीकता, वर्गीकरण लॉग-लॉस और रिग्रेशन RMSE में शीर्ष समग्र रैंकिंग प्राप्त करता है, जिसमें औसत रैंक 6.67, 3.98 और 4.22 हैं।

AI बिल्डरों के लिए Kumo Tabular प्रति-कार्य प्रशिक्षण के बिना टेबुलर भविष्यवाणी का रास्ता देता है, और इसके बताए गए सटीकता-दक्षता आंकड़ों को तैनाती से पहले होल्ड-आउट डेटा पर सत्यापित करना चाहिए।

Hugging Face Blog