AI FRONTIER
Signals worth understanding before they become obvious.
Gemini 4 Argon: Google DeepMind का अगला फ्रंटियर इंटेलिजेंस मॉडल
Google DeepMind ने Gemini 4 Argon की घोषणा की है, जो लंबे-क्षितिज वाले वर्कफ़्लो के लिए आउटपुट टोकन सीमा 64K से बढ़ाकर 1 मिलियन करता है और Fairwind Program के ज़रिए भरोसेमंद साइबर रक्षकों को उपलब्ध कराया जा रहा है।
- आउटपुट टोकन सीमा 64K से बढ़ाकर 1 मिलियन टोकन की गई, जिसे Google उद्योग में अग्रणी बताता है।
- वास्तविक दुनिया के लंबे-क्षितिज सॉफ़्टवेयर इंजीनियरिंग कार्यों के बेंचमार्क DeepSWE v1.1 पर 77.9% के साथ नया स्टेट ऑफ़ द आर्ट स्थापित किया।
- Zapier के AutomationBench पर 51.3% के साथ पहला स्थान और LVBench लंबे वीडियो समझ पर 91.7% के साथ स्टेट ऑफ़ द आर्ट।
- CWE-bench v1 पर 68% के साथ संयुक्त रूप से पहला स्थान; शुरुआती कीमत प्रति मिलियन इनपुट टोकन 2 डॉलर और प्रति मिलियन आउटपुट टोकन 10 डॉलर, कैश्ड इनपुट पर इनपुट कीमत से 95% छूट।
बिल्डरों के लिए 1 मिलियन आउटपुट टोकन की सीमा और प्रति मिलियन इनपुट टोकन 2 डॉलर की कीमत लंबी एजेंट ट्रैजेक्ट्री को आर्थिक रूप से व्यवहार्य बनाती है, लेकिन पहुँच फ़िलहाल भरोसेमंद साइबर रक्षकों तक सीमित है।
प्रस्ताव से सत्यापित प्रभाव तक: Praxa, शासित AI एजेंट निष्पादन के लिए साक्ष्य-बद्ध हार्नेस
यह पेपर Praxa एजेंट हार्नेस प्रस्तुत करता है, जो नियतात्मक प्रवेश, ब्रोकर-आधारित निष्पादन, बाहरी रीड-बैक, मिलान और समीक्षित प्रोन्नति के माध्यम से प्रस्ताव, अधिकार, डिस्पैच, सत्यापित बाहरी प्रभाव और सर्विंग प्रोन्नति को स्पष्ट रूप से दर्शाता है। रिपोर्ट की गई चारों साक्ष्य-धाराएँ उत्पादन परिणाम में वृद्धि या सामान्य श्...
- डीबग के बाद दो-क्रम समन्वय-प्रॉक्सी विकास तुलना में बेसलाइन और लेखक-लिखित उम्मीदवार ने प्रत्येक 180/180 परीक्षण पूरे किए, मापी गई सटीकता समान रही, पूर्ण हर्मेटिक क्रैश रिकवरी हुई और शून्य संरक्षित उल्लंघन दर्ज हुए।
- उम्मीदवार ने 37.11% कम टोकन, 33.84% कम अनुमानित एंडपॉइंट लागत और 11.63% कम चरण उपयोग किए; पेपर कहता है कि यह गुणवत्ता, विलंबता या उत्पादन व्यवहार में सुधार सिद्ध नहीं करता।
शासित एजेंट बनाने वाली टीमों के लिए Praxa का योगदान अधिकार-से-प्रभाव संक्रमणों को स्पष्ट और परीक्षण-योग्य बनाना है, लेकिन वर्तमान साक्ष्य केवल आर्किटेक्चरल सत्यापनीयता का समर्थन करता है, उत्पादन परिनियोजन या सुरक्षा दावों का नहीं।
OpenRouter का नया मॉडल: inclusionAI Ling 3.1 Flash
Ling 3.1 Flash, inclusionAI का हाइब्रिड रीज़निंग mixture-of-experts मॉडल है, जिसमें कुल 560B में से 25B सक्रिय पैरामीटर हैं और कॉन्टेक्स्ट विंडो 262,144 टोकन है।
- कुल 560B पैरामीटर, जिनमें 25B सक्रिय पैरामीटर हैं।
- 262,144 टोकन की कॉन्टेक्स्ट विंडो, जो अधिकतम 32,768 कम्प्लीशन टोकन का समर्थन करती है।
- फ़ंक्शन कॉलिंग के लिए tools और tool_choice स्वीकार करता है, लेकिन response_format का समर्थन नहीं करता, इसलिए JSON आउटपुट लागू नहीं होता।
- OpenRouter पर मुफ़्त के रूप में सूचीबद्ध, रिलीज़ तिथि 2 अक्टूबर 2026।
बिल्डरों के लिए यह टूल कॉलिंग वाला मुफ़्त लंबे-कॉन्टेक्स्ट MoE विकल्प है, लेकिन लागू संरचित आउटपुट न होने से JSON विश्वसनीयता ऐप्लिकेशन लेयर पर संभालनी होगी।
DSSR-3D: 3D गॉसियन में दृश्य-निर्भर रेफरिंग के लिए डिकपल्ड रीज़निंग
DSSR-3D निरंतर 3D गॉसियन फ़ील्ड पर दृश्य-निर्भर रेफरिंग सेगमेंटेशन के लिए एक इन्फ़रेंस-टाइम फ़्रेमवर्क है, जिसे दो इंटरफ़ेस के रूप में औपचारिक बनाया गया है, पोज़-इनवेरिएंट सिमैंटिक लोकलाइज़ेशन और पोज़-कंडीशंड स्पेशियल रीज़निंग, और इसके लिए अंतर्निहित सिमैंटिक फ़ील्ड के पुनः प्रशिक्षण की आवश्यकता नहीं है।
- पेपर फ़्रेमवर्क को दो इंटरफ़ेस के रूप में औपचारिक बनाता है, पोज़-इनवेरिएंट सिमैंटिक लोकलाइज़ेशन और पोज़-कंडीशंड स्पेशियल रीज़निंग, जहाँ इन शर्तों को पूरा करने वाला कोई भी फ़ंक्शन युग्म वैध इंस्टैंशिएशन देता है।
- इंस्टैंशिएशन में तापमान-शार्पन्ड softmax लोकलाइज़ेशन तंत्र और प्रोजेक्शन-आधारित दिशात्मक स्कोरिंग फ़ंक्शन का उपयोग होता है, जिन्हें हल्के, प्रशिक्षण-रहित चरण से जोड़ा जाता है।
- लेखक ViewRef-GS प्रस्तावित करते हैं, जो 3D गॉसियन फ़ील्ड पर दृश्य-निर्भर सेगमेंटेशन को अलग करने वाला बेंचमार्क है, और इसे बढ़ाए गए Ref-LERF के साथ मिलकर मूल्यांकित किया जाता है।
- पेपर मौजूदा 3DGS-आधारित रेफरिंग विधियों की तुलना में लगातार सुधार की रिपोर्ट करता है, और आधार सिमैंटिक फ़ील्ड के अतिरिक्त कोई प्रशिक्षण आवश्यक नहीं है।
AI बिल्डरों के लिए यह दर्शाता है कि दृश्य-निर्भर स्थानिक रेफरिंग को इन्फ़रेंस समय पर अलग किया जा सकता है और बिना पुनः प्रशिक्षण संरचनात्मक रूप से भिन्न सिमैंटिक फ़ील्ड पर स्थानांतरित किया जा सकता है।
FlashDiffusion: फ्यूज़्ड टाइल्ड कर्नेल स्पेक्ट्रल डीकंपोज़िशन
यह पेपर FlashDiffusion पेश करता है, एक मैट्रिक्स-रहित विधि जो फ्यूज़्ड GPU टाइल्स में सघन गाऊसी कर्नेल ब्लॉक का मूल्यांकन करती है और आइगेनसॉल्वर को एक अनुभवजन्य β-flow से जोड़ती है जो सीमित-नमूना रिज़ॉल्यूशन स्केल चुनता है।
- पेपर रिपोर्ट करता है कि सघन गाऊसी कर्नेल को भौतिक रूप देने के लिए O(N^2) मेमोरी चाहिए।
- यह विधि फ्यूज़्ड GPU टाइल्स में सघन गाऊसी कर्नेल ब्लॉक का मूल्यांकन करती है, जिससे सघन कर्नेल को भौतिक रूप देने से बचा जाता है।
- आइगेनसॉल्वर एक अनुभवजन्य β-flow से जुड़ा है जो सीमित-नमूना रिज़ॉल्यूशन स्केल चुनता है।
- नमूना आकार और बैंडविड्थ पर एक कंटिन्यूएशन मोटे रिज़ॉल्यूशन से बढ़ती महँगी स्पेक्ट्रल हलों को वॉर्म-स्टार्ट करता है।
ज्यामितीय लर्निंग में कर्नेल विधियों का उपयोग करने वाले AI बिल्डरों के लिए, यह मैट्रिक्स-रहित टाइल्ड दृष्टिकोण O(N^2) सघन-कर्नेल मेमोरी अवरोध को हटाता है, जिससे बड़े स्पेक्ट्रल हल संभव होते हैं।
ChainLoRA: LLM में सतत शिक्षण के लिए ज्यामिति-संरक्षण करने वाला टास्क वेक्टर मर्जिंग
ChainLoRA एक रीप्ले-रहित सतत मर्जिंग फ्रेमवर्क है, जो चेन-अपडेटेड टास्क-वेक्टर ज्यामिति पर आधारित है और चेन-अपडेटेड ट्रेनिंग को पोस्ट-स्ट्रीम एडाप्टिव SVD मर्जिंग के साथ जोड़ता है। पेपर Large और SuperNI बेंचमार्क पर मूल्यांकित रीप्ले-रहित तरीकों में अत्याधुनिक प्रदर्शन की रिपोर्ट करता है।
- ChainLoRA चेन-अपडेटेड ट्रेनिंग को पोस्ट-स्ट्रीम एडाप्टिव SVD मर्जिंग के साथ जोड़ता है, जहाँ ट्रेनिंग के दौरान इनिशियलाइज़ेशन और एक-तरफ़ा ऑर्थोगोनैलिटी प्रॉक्सी केवल अंतिम कैरियर का उपयोग करते हैं।
- मर्जिंग के समय, एडाप्टिव SVD एक साझा कैरियर निकालता है और Procrustes एडाप्टेशन के माध्यम से उसे नवीनतम टास्क से संरेखित करता है।
- सैद्धांतिक विश्लेषण दर्शाता है कि Procrustes एडाप्टेशन साझा और टास्क-विशिष्ट घटकों के ज्यामितीय अनुमानित पृथक्करण को सुविधाजनक बनाता है, और एक-तरफ़ा प्रॉक्सी अंतर-टास्क हस्तक्षेप को और सीमित करता है।
सतत शिक्षण पाइपलाइन बनाने वालों के लिए, ChainLoRA की चेन-अपडेटेड ट्रेनिंग और एडाप्टिव SVD मर्जिंग एक रीप्ले-रहित, पैरामीटर-कुशल फाइन-ट्यूनिंग मार्ग प्रदान करती है, जिसका ऐतिहासिक-स्थिति फुटप्रिंट और रेगुलराइज़ेशन ओवरहेड टास्क स्ट्रीम बढ़ने ...
NVIDIA Kumo Tabular ने टेबुलर भविष्यवाणी के लिए नई सटीकता-दक्षता सीमा तय की
NVIDIA ने Kumo Tabular जारी किया है, जो टेबुलर वर्गीकरण और रिग्रेशन के लिए एक ओपन फाउंडेशन मॉडल है और बिना प्रशिक्षण, ट्यूनिंग या फीचर इंजीनियरिंग के एक ही फॉरवर्ड पास में नई पंक्तियों की भविष्यवाणी करता है, 28M से 215M पैरामीटर तक तीन आकारों में OpenMDW-1.1 लाइसेंस के तहत उपलब्ध है।
- Kumo Tabular Small/Medium/Large तीन आकारों में उपलब्ध है, जिनमें 28M से 215M पैरामीटर हैं, और यह व्यावसायिक उपयोग के लिए OpenMDW-1.1 लाइसेंस के तहत जारी किया गया है।
- यह TabArena लीडरबोर्ड पर 1950 के ELO के साथ समग्र रूप से पहले स्थान पर है और एक समान एकल RTX 6000 Pro मूल्यांकन सेटअप में LimiX-2 से 17 गुना तेज़ बताया गया है।
- BeyondArena पर यह 1418 के ELO और 7.78% के Improvability स्कोर के साथ लीडरबोर्ड पर पहले स्थान पर है।
- TALENT पर यह वर्गीकरण सटीकता, वर्गीकरण लॉग-लॉस और रिग्रेशन RMSE में शीर्ष समग्र रैंकिंग प्राप्त करता है, जिसमें औसत रैंक 6.67, 3.98 और 4.22 हैं।
AI बिल्डरों के लिए Kumo Tabular प्रति-कार्य प्रशिक्षण के बिना टेबुलर भविष्यवाणी का रास्ता देता है, और इसके बताए गए सटीकता-दक्षता आंकड़ों को तैनाती से पहले होल्ड-आउट डेटा पर सत्यापित करना चाहिए।