AI FRONTIER
Signals worth understanding before they become obvious.
GPT-6.1 Sol पेश किया गया
GPT-6.1 Sol कोडिंग, कंप्यूटर उपयोग और पेशेवर काम के लिए Astra के करीब की बुद्धिमत्ता देता है, और मानक API इनपुट व आउटपुट टोकन की कीमतें Astra की पांचवें हिस्से पर हैं।
- OpenAI News ने GPT-6.1 Sol की घोषणा की।
- यह कोडिंग, कंप्यूटर उपयोग और पेशेवर काम के लिए Astra के करीब की बुद्धिमत्ता के साथ पेश किया गया है।
- मानक API इनपुट और आउटपुट टोकन की कीमतें Astra की पांचवें हिस्से हैं।
AI बिल्डरों के लिए, Astra के करीब की बुद्धिमत्ता पांचवें हिस्से टोकन कीमत पर मिलने से कोडिंग और कंप्यूटर-उपयोग एजेंट वर्कफ़्लो की इन्फ़रेंस लागत घटती है।
सिस्टम प्रॉम्प्ट का भ्रम: निर्देश प्रस्तावनाएँ भाषा मॉडलों में गणना को कैसे बदलती हैं
यह पेपर Centered Kernel Alignment (CKA) का उपयोग करके 17 निर्देश-ट्यून किए गए मॉडलों में 20 सिस्टम प्रॉम्प्ट के अंतर्गत परत-वार प्रतिनिधित्वों की तुलना करता है और पाता है कि प्रभाव परत-चयनात्मक और निर्देश-प्रकार-निर्भर हैं: पर्सोना और फ़ॉर्मैटिंग निर्देश मध्यवर्ती प्रतिनिधित्वों को गहराई से पुनर्गठित करते हैं, जबकि सुर...
- 8 आर्किटेक्चर परिवारों और 1.5B से 72B पैरामीटर तक फैले 17 निर्देश-ट्यून किए गए मॉडलों का मूल्यांकन पाँच कार्यात्मक श्रेणियों के 20 सिस्टम प्रॉम्प्ट के अंतर्गत किया गया।
- प्रतिबंधात्मक सुरक्षा निर्देश और स्पष्ट रूप से अनुमतिपूर्ण निर्देश ("आप पर कोई प्रतिबंध नहीं है") लगभग समान गणना पथों को सक्रिय करते हैं, औसत CKA सहसंबंध 0.997 है।
- व्यावसायिक पैमाने पर सुरक्षा पैठ 10% से नीचे बनी रहती है, 70B-72B पर भी।
- प्रतिनिधित्व गहराई पूरे 17-मॉडल समूह में व्यवहार प्रभाव आकार की भविष्यवाणी करती है (Spearman rho = 0.761, p < 0.001)।
सिस्टम-प्रॉम्प्ट-आधारित सुरक्षा पर निर्भर बिल्डरों के लिए, यह प्रमाण दर्शाता है कि सुरक्षा निर्देश विश्वसनीय रूप से एन्कोड हो सकते हैं पर गणना में गहराई से लागू नहीं होते, इसलिए केवल प्रॉम्प्ट-परत रक्षा जेलब्रेक के विरुद्ध अपर्याप्त है।
TomasuLLM: LLM एजेंट्स के लिए आउट-ऑफ-ऑर्डर स्पेक्युलेटिव एक्ज़ीक्यूशन
TomasuLLM एक रनटाइम है जो टास्क-एक्ज़ीक्यूशन की शुद्धता बनाए रखते हुए एजेंट के टूल कॉल को ट्रैजेक्टरी क्रम से बाहर निष्पादित करता है: यह भविष्य की क्रियाओं का ड्राफ्ट बनाता है, उन्हें अलग-थलग copy-on-write सैंडबॉक्स में चलाता है, उनकी निर्भरताओं और प्रभावों को ट्रेस करता है, और सत्यापन के बाद ही परिणामों को ट्रैजेक्टरी...
- पेपर 100 SWE-bench Verified टास्क पर 1.31x, 28 Terminal-Bench 2.0 टास्क पर 1.35x, और 18 SWE-Marathon सेशन पर 1.27x मैच्ड प्रोग्रेस रिपोर्ट करता है।
- 4,010 ऑडिट किए गए कमिट-वैलिडेशन रिकॉर्ड में पेपर शून्य फ़ॉल्स एक्सेप्ट रिपोर्ट करता है।
- यह काम कंपाइलर, टेस्ट सूट और रिपॉज़िटरी कमांड जैसे लंबे समय तक चलने वाले टूल्स को लक्षित करता है, जो कोडिंग एजेंट के निष्क्रिय रहते हुए सेकंड से मिनट तक लेते हैं।
- परिणाम तीन बेंचमार्क में सब-सेकंड से मिनट-लंबे टूल कॉल तक फैले हैं और टूल लेटेंसी के साथ स्केल करते हैं।
कोडिंग एजेंट बनाने वाली टीमों के लिए, TomasuLLM दिखाता है कि अलग-थलग सैंडबॉक्स में टूल कॉल को स्पेक्युलेटिव रूप से चलाना और ट्रैजेक्टरी क्रम में कमिट करना कमिट की शुद्धता का त्याग किए बिना लंबे टूल की लेटेंसी घटा सकता है।
MiniMax ने OpenAI Agents API संगतता के लिए OpenAgentCore को ओपन-सोर्स किया
MiniMax ने OpenAgentCore को ओपन-सोर्स किया है, जो OpenAI Agents API के साथ संगतता के लिए लक्षित है।
- MiniMax ने OpenAgentCore को ओपन-सोर्स किया।
- OpenAgentCore का लक्ष्य OpenAI Agents API संगतता है।
AI बिल्डर OpenAgentCore का उपयोग करके MiniMax के ओपन-सोर्स कार्यान्वयन के साथ OpenAI Agents API वर्कफ़्लो को लक्षित कर सकते हैं।
SInGA: एनिमेटेबल गॉसियन हेड अवतारों के लिए सेमांटिक इनपेंटिंग सीखना
यह पेपर SInGA प्रस्तुत करता है, जो UV स्पेस में परिभाषित सेमांटिक इनपेंटिंग फ्रेमवर्क के ज़रिए एक ही छवि से अनदेखे चेहरे के क्षेत्रों को पूरा करता है और फिर गॉसियन एट्रिब्यूट्स का रिग्रेशन करके एनिमेटेबल गॉसियन हेड अवतार बनाता है। परिणामी अवतार प्रति-पहचान ऑप्टिमाइज़ेशन के बिना अलग-अलग पहचानों पर सामान्यीकृत होता है और...
- सेमांटिक इनपेंटिंग फ्रेमवर्क UV स्पेस में परिभाषित है और अनदेखे क्षेत्रों को पूरा करने के लिए मानव चेहरे के अंतर्निहित समरूपता संकेतों का उपयोग करता है।
- देखे गए क्षेत्रों से निकाले गए फ़ीचर अनदेखे क्षेत्रों को पूरा करने के लिए उपयोग किए जाते हैं, और पूर्ण प्रतिनिधित्व से गॉसियन एट्रिब्यूट्स का रिग्रेशन किया जाता है।
- प्रत्येक सतह या पिक्सेल स्थान पर एक गॉसियन के बजाय यह विधि विवरण बढ़ाने के लिए कई गॉसियन स्टैक करती है।
- पेपर रिपोर्ट करता है कि यह विधि बेहतर पूर्णता और पहचान संरक्षण के साथ उच्च-गुणवत्ता वाले हेड अवतार बनाती है, और यथार्थवादी एनिमेशन तथा अनदेखे दृश्यों से सुसंगत रेंडरिंग का समर्थन करती है।
एकल छवि से हेड अवतार बनाने वालों के लिए, सुसंगत स्थानिक संबंधों वाले UV स्पेस में पूर्णता का काम ले जाना एकल-दृश्य सेटिंग में अनदेखे क्षेत्रों को संभालने का पुनःप्रयोग योग्य तरीका देता है।
मल्टी-हॉप रिट्रीवल-ऑगमेंटेड जनरेशन के लिए कन्फॉर्मल तथ्यात्मकता नियंत्रण
यह पेपर स्प्लिट-कन्फॉर्मल क्लेम फ़िल्टरिंग को मल्टी-हॉप RAG पर लागू करता है और इसे HotpotQA, Natural Questions तथा TriviaQA पर Llama 3.1 8B और GPT-4o-mini के साथ, साथ ही एक सिंगल-हॉप संदर्भ प्रयोग में मूल्यांकित करता है। यह रिपोर्ट करता है कि 95% लक्ष्य पर, जिन प्रतिक्रियाओं के रखे गए दावे पूरी तरह समर्थित हैं, उनका अन...
- सभी छह मल्टी-हॉप मॉडल-डेटासेट कॉन्फ़िगरेशन में, अधिक कड़े कन्फॉर्मल लक्ष्य लगातार उन प्रतिक्रियाओं का अनुपात बढ़ाते हैं जिनके रखे गए दावे पूरी तरह समर्थित हैं।
- 95% लक्ष्य पर यह दर 95.80%-97.20% रहती है, जबकि बिना फ़िल्टरिंग के यह 55.60%-76.03% थी।
- 95% लक्ष्य पर केवल 4.41%-31.09% उत्पन्न दावे रखे जाते हैं और 9.70%-51.40% प्रतिक्रियाएँ गैर-रिक्त रहती हैं।
- मूल्यांकन में Llama 3.1 8B और GPT-4o-mini, HotpotQA, Natural Questions तथा TriviaQA, और एक सिंगल-हॉप संदर्भ प्रयोग का उपयोग किया गया।
मल्टी-हॉप RAG बनाने वालों के लिए, कन्फॉर्मल फ़िल्टरिंग दावा-स्तर समर्थन बढ़ाती है, लेकिन इसे दावा-प्रतिधारण और परहेज़ के साथ मिलाकर पढ़ना चाहिए, क्योंकि 95% लक्ष्य पर अधिकांश दावे हटा दिए जाते हैं और कई प्रतिक्रियाएँ खाली हो जाती हैं।
डिस्क्रीट एवरेज जनरेटर के माध्यम से डिफ्यूज़न लैंग्वेज मॉडल का त्वरण
यह पेपर Discrete Average Generator पेश करता है, जो MeanFlow को सतत-समय मार्कोव शृंखलाओं तक विस्तारित करता है और एक समय अंतराल पर ट्रांज़िशन कर्नेल की सामान्यीकृत वृद्धि को औसत जनरेटर के रूप में परिभाषित करता है, जिसमें स्व-संगति पहचान प्रशिक्षण उद्देश्य का आधार है।
- Potts मॉडल सिमुलेशन में यह उद्देश्य K-स्टेप सैंपलर की कुल विचरण दूरी को अधिकतम 67% तक घटाता है।
- OpenWebText पर यह विधि 8 से 64 सैंपलिंग स्टेप्स के लिए मूल्यांकित विधियों में सबसे कम जनरेटिव परप्लेक्सिटी प्राप्त करती है और 16x त्वरण सक्षम करती है।
- ImageNet पर यह विधि मौजूदा विधियों के तुलनीय प्रदर्शन प्राप्त करती है।
- स्व-संगति पहचान प्रति-निर्देशांक मार्जिनल पर प्रक्षेपित होने पर बंद-रूप अभिव्यक्ति देती है।
डिस्क्रीट डिफ्यूज़न लैंग्वेज मॉडल बनाने वाली टीमों के लिए यह एक प्रशिक्षण उद्देश्य देता है जो जनरेशन गुणवत्ता बनाए रखते हुए सैंपलिंग स्टेप्स घटाता है, इसलिए रिपोर्ट किए गए 16x त्वरण को अपने डेटा पर दोहराना उपयोगी है।
AI एजेंट कट्टरपंथ की ओर प्रवृत्त हो सकते हैं
यह पेपर दो LLM एजेंटों के बीच बातचीत का अनुकरण करता है: एक लक्ष्य जो जनसांख्यिकीय और मनोवैज्ञानिक विशेषताओं के आधार पर मानव व्यक्तित्व की भूमिका निभाता है, और एक प्रभावक जो लक्ष्य की मान्यताओं को और अधिक चरम बनाना चाहता है। पेपर बताता है कि रेज़ोनेंस (पहले से मौजूद मान्यता को मजबूत करना) और परसुएशन (ऐसी मान्यता को बढ़ा...
- पेपर 29 सितंबर 2026 को arXiv पर arXiv:2609.38296 के रूप में जमा किया गया, जिसे cs.AI और cs.CY में वर्गीकृत किया गया है।
- सेटअप: एक लक्ष्य LLM जनसांख्यिकीय और मनोवैज्ञानिक विशेषताओं के आधार पर मानव व्यक्तित्व की भूमिका निभाता है, जबकि एक प्रभावक LLM लक्ष्य की मान्यताओं को और अधिक चरम बनाना चाहता है।
- पेपर दो मार्गों की जाँच करता है: रेज़ोनेंस लक्ष्य की पहले से मौजूद मान्यता को मजबूत करता है, और परसुएशन ऐसी मान्यता को बढ़ावा देता है जिसे लक्ष्य शुरू में महत्वहीन मानता है।
- पेपर बताता है कि भावनात्मक और व्यवहारिक मेट्रिक्स पर दोनों तंत्र लक्ष्य को कट्टर बनाते हैं, लेकिन रेज़ोनेंस परसुएशन की तुलना में लगातार अधिक मजबूत प्रभाव देता है।
व्यक्तिगत एजेंट और मल्टी-एजेंट सिस्टम बनाने वालों को मान्यताओं के अनुरूप इनपुट को उच्च-जोखिम प्रभाव सतह मानना चाहिए, क्योंकि पेपर बताता है कि रेज़ोनेंस अधिक मजबूत कट्टरता उत्पन्न करता है जो संबंधित मान्यताओं तक भी फैलती है।