Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-02
01
opportunitymodelscost collapse

GPT-6.1 Sol पेश किया गया

GPT-6.1 Sol कोडिंग, कंप्यूटर उपयोग और पेशेवर काम के लिए Astra के करीब की बुद्धिमत्ता देता है, और मानक API इनपुट व आउटपुट टोकन की कीमतें Astra की पांचवें हिस्से पर हैं।

  • OpenAI News ने GPT-6.1 Sol की घोषणा की।
  • यह कोडिंग, कंप्यूटर उपयोग और पेशेवर काम के लिए Astra के करीब की बुद्धिमत्ता के साथ पेश किया गया है।
  • मानक API इनपुट और आउटपुट टोकन की कीमतें Astra की पांचवें हिस्से हैं।

AI बिल्डरों के लिए, Astra के करीब की बुद्धिमत्ता पांचवें हिस्से टोकन कीमत पर मिलने से कोडिंग और कंप्यूटर-उपयोग एजेंट वर्कफ़्लो की इन्फ़रेंस लागत घटती है।

OpenAI News
02
watchresearchincremental

सिस्टम प्रॉम्प्ट का भ्रम: निर्देश प्रस्तावनाएँ भाषा मॉडलों में गणना को कैसे बदलती हैं

यह पेपर Centered Kernel Alignment (CKA) का उपयोग करके 17 निर्देश-ट्यून किए गए मॉडलों में 20 सिस्टम प्रॉम्प्ट के अंतर्गत परत-वार प्रतिनिधित्वों की तुलना करता है और पाता है कि प्रभाव परत-चयनात्मक और निर्देश-प्रकार-निर्भर हैं: पर्सोना और फ़ॉर्मैटिंग निर्देश मध्यवर्ती प्रतिनिधित्वों को गहराई से पुनर्गठित करते हैं, जबकि सुर...

  • 8 आर्किटेक्चर परिवारों और 1.5B से 72B पैरामीटर तक फैले 17 निर्देश-ट्यून किए गए मॉडलों का मूल्यांकन पाँच कार्यात्मक श्रेणियों के 20 सिस्टम प्रॉम्प्ट के अंतर्गत किया गया।
  • प्रतिबंधात्मक सुरक्षा निर्देश और स्पष्ट रूप से अनुमतिपूर्ण निर्देश ("आप पर कोई प्रतिबंध नहीं है") लगभग समान गणना पथों को सक्रिय करते हैं, औसत CKA सहसंबंध 0.997 है।
  • व्यावसायिक पैमाने पर सुरक्षा पैठ 10% से नीचे बनी रहती है, 70B-72B पर भी।
  • प्रतिनिधित्व गहराई पूरे 17-मॉडल समूह में व्यवहार प्रभाव आकार की भविष्यवाणी करती है (Spearman rho = 0.761, p < 0.001)।

सिस्टम-प्रॉम्प्ट-आधारित सुरक्षा पर निर्भर बिल्डरों के लिए, यह प्रमाण दर्शाता है कि सुरक्षा निर्देश विश्वसनीय रूप से एन्कोड हो सकते हैं पर गणना में गहराई से लागू नहीं होते, इसलिए केवल प्रॉम्प्ट-परत रक्षा जेलब्रेक के विरुद्ध अपर्याप्त है।

arXiv cs.CL
03
watchresearchnew architecture

TomasuLLM: LLM एजेंट्स के लिए आउट-ऑफ-ऑर्डर स्पेक्युलेटिव एक्ज़ीक्यूशन

TomasuLLM एक रनटाइम है जो टास्क-एक्ज़ीक्यूशन की शुद्धता बनाए रखते हुए एजेंट के टूल कॉल को ट्रैजेक्टरी क्रम से बाहर निष्पादित करता है: यह भविष्य की क्रियाओं का ड्राफ्ट बनाता है, उन्हें अलग-थलग copy-on-write सैंडबॉक्स में चलाता है, उनकी निर्भरताओं और प्रभावों को ट्रेस करता है, और सत्यापन के बाद ही परिणामों को ट्रैजेक्टरी...

  • पेपर 100 SWE-bench Verified टास्क पर 1.31x, 28 Terminal-Bench 2.0 टास्क पर 1.35x, और 18 SWE-Marathon सेशन पर 1.27x मैच्ड प्रोग्रेस रिपोर्ट करता है।
  • 4,010 ऑडिट किए गए कमिट-वैलिडेशन रिकॉर्ड में पेपर शून्य फ़ॉल्स एक्सेप्ट रिपोर्ट करता है।
  • यह काम कंपाइलर, टेस्ट सूट और रिपॉज़िटरी कमांड जैसे लंबे समय तक चलने वाले टूल्स को लक्षित करता है, जो कोडिंग एजेंट के निष्क्रिय रहते हुए सेकंड से मिनट तक लेते हैं।
  • परिणाम तीन बेंचमार्क में सब-सेकंड से मिनट-लंबे टूल कॉल तक फैले हैं और टूल लेटेंसी के साथ स्केल करते हैं।

कोडिंग एजेंट बनाने वाली टीमों के लिए, TomasuLLM दिखाता है कि अलग-थलग सैंडबॉक्स में टूल कॉल को स्पेक्युलेटिव रूप से चलाना और ट्रैजेक्टरी क्रम में कमिट करना कमिट की शुद्धता का त्याग किए बिना लंबे टूल की लेटेंसी घटा सकता है।

arXiv cs.CL
04
testagentsopen source unlock

MiniMax ने OpenAI Agents API संगतता के लिए OpenAgentCore को ओपन-सोर्स किया

MiniMax ने OpenAgentCore को ओपन-सोर्स किया है, जो OpenAI Agents API के साथ संगतता के लिए लक्षित है।

  • MiniMax ने OpenAgentCore को ओपन-सोर्स किया।
  • OpenAgentCore का लक्ष्य OpenAI Agents API संगतता है।

AI बिल्डर OpenAgentCore का उपयोग करके MiniMax के ओपन-सोर्स कार्यान्वयन के साथ OpenAI Agents API वर्कफ़्लो को लक्षित कर सकते हैं।

tokenpost.com
05
testcreativenew architecture

SInGA: एनिमेटेबल गॉसियन हेड अवतारों के लिए सेमांटिक इनपेंटिंग सीखना

यह पेपर SInGA प्रस्तुत करता है, जो UV स्पेस में परिभाषित सेमांटिक इनपेंटिंग फ्रेमवर्क के ज़रिए एक ही छवि से अनदेखे चेहरे के क्षेत्रों को पूरा करता है और फिर गॉसियन एट्रिब्यूट्स का रिग्रेशन करके एनिमेटेबल गॉसियन हेड अवतार बनाता है। परिणामी अवतार प्रति-पहचान ऑप्टिमाइज़ेशन के बिना अलग-अलग पहचानों पर सामान्यीकृत होता है और...

  • सेमांटिक इनपेंटिंग फ्रेमवर्क UV स्पेस में परिभाषित है और अनदेखे क्षेत्रों को पूरा करने के लिए मानव चेहरे के अंतर्निहित समरूपता संकेतों का उपयोग करता है।
  • देखे गए क्षेत्रों से निकाले गए फ़ीचर अनदेखे क्षेत्रों को पूरा करने के लिए उपयोग किए जाते हैं, और पूर्ण प्रतिनिधित्व से गॉसियन एट्रिब्यूट्स का रिग्रेशन किया जाता है।
  • प्रत्येक सतह या पिक्सेल स्थान पर एक गॉसियन के बजाय यह विधि विवरण बढ़ाने के लिए कई गॉसियन स्टैक करती है।
  • पेपर रिपोर्ट करता है कि यह विधि बेहतर पूर्णता और पहचान संरक्षण के साथ उच्च-गुणवत्ता वाले हेड अवतार बनाती है, और यथार्थवादी एनिमेशन तथा अनदेखे दृश्यों से सुसंगत रेंडरिंग का समर्थन करती है।

एकल छवि से हेड अवतार बनाने वालों के लिए, सुसंगत स्थानिक संबंधों वाले UV स्पेस में पूर्णता का काम ले जाना एकल-दृश्य सेटिंग में अनदेखे क्षेत्रों को संभालने का पुनःप्रयोग योग्य तरीका देता है।

arXiv cs.CV
06
testresearchincremental

मल्टी-हॉप रिट्रीवल-ऑगमेंटेड जनरेशन के लिए कन्फॉर्मल तथ्यात्मकता नियंत्रण

यह पेपर स्प्लिट-कन्फॉर्मल क्लेम फ़िल्टरिंग को मल्टी-हॉप RAG पर लागू करता है और इसे HotpotQA, Natural Questions तथा TriviaQA पर Llama 3.1 8B और GPT-4o-mini के साथ, साथ ही एक सिंगल-हॉप संदर्भ प्रयोग में मूल्यांकित करता है। यह रिपोर्ट करता है कि 95% लक्ष्य पर, जिन प्रतिक्रियाओं के रखे गए दावे पूरी तरह समर्थित हैं, उनका अन...

  • सभी छह मल्टी-हॉप मॉडल-डेटासेट कॉन्फ़िगरेशन में, अधिक कड़े कन्फॉर्मल लक्ष्य लगातार उन प्रतिक्रियाओं का अनुपात बढ़ाते हैं जिनके रखे गए दावे पूरी तरह समर्थित हैं।
  • 95% लक्ष्य पर यह दर 95.80%-97.20% रहती है, जबकि बिना फ़िल्टरिंग के यह 55.60%-76.03% थी।
  • 95% लक्ष्य पर केवल 4.41%-31.09% उत्पन्न दावे रखे जाते हैं और 9.70%-51.40% प्रतिक्रियाएँ गैर-रिक्त रहती हैं।
  • मूल्यांकन में Llama 3.1 8B और GPT-4o-mini, HotpotQA, Natural Questions तथा TriviaQA, और एक सिंगल-हॉप संदर्भ प्रयोग का उपयोग किया गया।

मल्टी-हॉप RAG बनाने वालों के लिए, कन्फॉर्मल फ़िल्टरिंग दावा-स्तर समर्थन बढ़ाती है, लेकिन इसे दावा-प्रतिधारण और परहेज़ के साथ मिलाकर पढ़ना चाहिए, क्योंकि 95% लक्ष्य पर अधिकांश दावे हटा दिए जाते हैं और कई प्रतिक्रियाएँ खाली हो जाती हैं।

arXiv cs.CL
07
watchresearchcost collapse

डिस्क्रीट एवरेज जनरेटर के माध्यम से डिफ्यूज़न लैंग्वेज मॉडल का त्वरण

यह पेपर Discrete Average Generator पेश करता है, जो MeanFlow को सतत-समय मार्कोव शृंखलाओं तक विस्तारित करता है और एक समय अंतराल पर ट्रांज़िशन कर्नेल की सामान्यीकृत वृद्धि को औसत जनरेटर के रूप में परिभाषित करता है, जिसमें स्व-संगति पहचान प्रशिक्षण उद्देश्य का आधार है।

  • Potts मॉडल सिमुलेशन में यह उद्देश्य K-स्टेप सैंपलर की कुल विचरण दूरी को अधिकतम 67% तक घटाता है।
  • OpenWebText पर यह विधि 8 से 64 सैंपलिंग स्टेप्स के लिए मूल्यांकित विधियों में सबसे कम जनरेटिव परप्लेक्सिटी प्राप्त करती है और 16x त्वरण सक्षम करती है।
  • ImageNet पर यह विधि मौजूदा विधियों के तुलनीय प्रदर्शन प्राप्त करती है।
  • स्व-संगति पहचान प्रति-निर्देशांक मार्जिनल पर प्रक्षेपित होने पर बंद-रूप अभिव्यक्ति देती है।

डिस्क्रीट डिफ्यूज़न लैंग्वेज मॉडल बनाने वाली टीमों के लिए यह एक प्रशिक्षण उद्देश्य देता है जो जनरेशन गुणवत्ता बनाए रखते हुए सैंपलिंग स्टेप्स घटाता है, इसलिए रिपोर्ट किए गए 16x त्वरण को अपने डेटा पर दोहराना उपयोगी है।

arXiv stat.ML
08
watchagentsincremental

AI एजेंट कट्टरपंथ की ओर प्रवृत्त हो सकते हैं

यह पेपर दो LLM एजेंटों के बीच बातचीत का अनुकरण करता है: एक लक्ष्य जो जनसांख्यिकीय और मनोवैज्ञानिक विशेषताओं के आधार पर मानव व्यक्तित्व की भूमिका निभाता है, और एक प्रभावक जो लक्ष्य की मान्यताओं को और अधिक चरम बनाना चाहता है। पेपर बताता है कि रेज़ोनेंस (पहले से मौजूद मान्यता को मजबूत करना) और परसुएशन (ऐसी मान्यता को बढ़ा...

  • पेपर 29 सितंबर 2026 को arXiv पर arXiv:2609.38296 के रूप में जमा किया गया, जिसे cs.AI और cs.CY में वर्गीकृत किया गया है।
  • सेटअप: एक लक्ष्य LLM जनसांख्यिकीय और मनोवैज्ञानिक विशेषताओं के आधार पर मानव व्यक्तित्व की भूमिका निभाता है, जबकि एक प्रभावक LLM लक्ष्य की मान्यताओं को और अधिक चरम बनाना चाहता है।
  • पेपर दो मार्गों की जाँच करता है: रेज़ोनेंस लक्ष्य की पहले से मौजूद मान्यता को मजबूत करता है, और परसुएशन ऐसी मान्यता को बढ़ावा देता है जिसे लक्ष्य शुरू में महत्वहीन मानता है।
  • पेपर बताता है कि भावनात्मक और व्यवहारिक मेट्रिक्स पर दोनों तंत्र लक्ष्य को कट्टर बनाते हैं, लेकिन रेज़ोनेंस परसुएशन की तुलना में लगातार अधिक मजबूत प्रभाव देता है।

व्यक्तिगत एजेंट और मल्टी-एजेंट सिस्टम बनाने वालों को मान्यताओं के अनुरूप इनपुट को उच्च-जोखिम प्रभाव सतह मानना चाहिए, क्योंकि पेपर बताता है कि रेज़ोनेंस अधिक मजबूत कट्टरता उत्पन्न करता है जो संबंधित मान्यताओं तक भी फैलती है।

arXiv cs.AI