Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-01
01
watchagentsnew architecture

Google ने RRSI जारी किया, जो मॉडल को दोबारा प्रशिक्षित किए बिना एजेंट हार्नेस को स्वयं बेहतर बनाता है

Google Cloud AI Research के शोधकर्ताओं ने Stanford University और University of Washington के साथ RRSI फ्रेमवर्क जारी किया है, जो मॉडल के वेट बदले बिना मॉडल के इर्द-गिर्द मौजूद हार्नेस को बार-बार संशोधित करता है, जिसमें प्रॉम्प्ट, टूल उपयोग, कंट्रोल फ्लो, मेमोरी और कॉन्टेक्स्ट प्रबंधन, स्किल मॉड्यूल और सब-एजेंट शामिल है...

  • आठ बेंचमार्क पर Terminal-Bench 2.1 74.2% से 80.2% हो गया, यानी 6.0 प्रतिशत अंक की बढ़त, और SWE-Bench Verified 82.0% से 83.8% हो गया, यानी 1.8 प्रतिशत अंक की बढ़त।
  • JobBench 36.0% से 40.7% हो गया, यानी 4.7 प्रतिशत अंक की बढ़त; GDPval 48.8% से 52.3% हो गया, यानी 3.5 प्रतिशत अंक की बढ़त; Frontier-Eng 17.7% से 22.0% हो गया, यानी 4.3 प्रतिशत अंक की बढ़त।
  • Gemini 3.5 Flash को आधार मॉडल बनाकर किए गए अलग प्रयोग में Terminal-Bench 2.1 64.6% से 78.7% हो गया, यानी 14.1 प्रतिशत अंक की बढ़त, और SWE-Bench Verified 76.8% से 79.0% हो गया, यानी 2.2 प्रतिशत अंक की बढ़त।
  • एजेंट वर्कस्पेस प्रयोग में RRSI ने प्रति प्रयोग 24.2 लाख पॉलिसी टोकन इस्तेमाल किए, जबकि अनियमित हार्नेस इवोल्यूशन तरीके ने 38 लाख टोकन इस्तेमाल किए; शोधकर्ताओं का कहना है कि RRSI ने पॉलिसी टोकन उपयोग 30% से अधिक घटाया।

एजेंट बनाने वाली टीमों के लिए RRSI दिखाता है कि मॉडल के वेट स्थिर रखते हुए हार्नेस पर नियंत्रित पुनरावृत्ति खोज मापने योग्य बेंचमार्क लाभ और कम टोकन लागत दे सकती है।

AI Times Korea
02
opportunitymodelscost collapse

OpenAI ने GPT-6.1 Sol पेश किया

OpenAI ने कोडिंग, कंप्यूटर उपयोग और पेशेवर काम के लिए GPT-6.1 Sol पेश किया है, जिसके बारे में कंपनी कहती है कि इसकी बुद्धिमत्ता Astra के करीब है और यह Astra के मानक API इनपुट और आउटपुट टोकन कीमतों के पांचवें हिस्से पर उपलब्ध है।

  • OpenAI के अनुसार GPT-6.1 Sol की बुद्धिमत्ता Astra के करीब है।
  • इसके उपयोग क्षेत्र कोडिंग, कंप्यूटर उपयोग और पेशेवर काम हैं।
  • मानक API इनपुट और आउटपुट टोकन कीमतें Astra की कीमतों की पांचवीं हिस्सा हैं।

AI बिल्डरों के लिए Astra के करीब की बुद्धिमत्ता पांचवें हिस्से टोकन कीमत पर मिलने का मतलब है कि कोडिंग और कंप्यूटर-उपयोग वर्कलोड पर प्रति इकाई अनुमान लागत घट सकती है।

OpenAI News
03
testinferenceopen source unlock

prism-ml ने Ternary-Bonsai-2-27B-gguf जारी किया: 5.95 GB से चलने वाला 27B टर्नरी-वेट मॉडल

prism-ml ने Hugging Face पर Ternary-Bonsai-2-27B-gguf प्रकाशित किया है, जिसमें Qwen3.8-27B के embeddings, attention projections, MLP projections और LM head को टर्नरी वेट (g128, {−1,0,+1} के साथ FP16 ग्रुप स्केलिंग) में क्वांटाइज़ किया गया है, और llama.cpp के CUDA, Metal तथा CPU बैकएंड के लिए PTQ1_0 और PQ2_0 नामक दो GGU...

  • भाषा मॉडल का आकार 5.95 GB (PTQ1_0) या 7.21 GB (PQ2_0) है, जो लगभग 54 GB के FP16 बेसलाइन से क्रमशः लगभग 9.0x और 7.5x छोटा है; आदर्श टर्नरी प्रारूप 1.72 bits/weight पर 5.8 GB है।
  • पेपर 14 thinking-मोड बेंचमार्क पर 84.78 औसत रिपोर्ट करता है, जो FP16 संदर्भ (86.32) का 98.2% है, जबकि IQ2_XXS 72.59 (7.27 GB) और UD-Q4_K_XL 85.18 (17.6 GB) है।
  • पेपर AIME26 पर 95.83 और LiveCodeBench पर 90.07 रिपोर्ट करता है, जहाँ IQ2_XXS क्रमशः 57.5 और 56.4 स्कोर करता है; गणित 96.57, कोडिंग 89.42, BFCL v3 टूल कॉलिंग 74.92।
  • कॉन्टेक्स्ट लंबाई 262K टोकन है और बैकबोन हाइब्रिड अटेंशन है जिसमें लगभग 75% लीनियर अटेंशन है; विज़न टावर अलग Q8_0 mmproj पैक (0.63 GB) है जो केवल इमेज इनपुट पर लोड होता है।

एक ही GPU या लैपटॉप पर 27B-श्रेणी का रीज़निंग तैनात करने वाली टीमों के लिए यह दर्शाता है कि एंड-टू-एंड टर्नरी क्वांटाइज़ेशन लगभग 6 GB में FP16 के करीब रीज़निंग और टूल-कॉलिंग स्कोर बनाए रख सकता है, पर केवल समर्पित कर्नेल और फोर्क रनटाइम के स...

Hugging Face Trending
04
watchresearchnew architecture

एजेंटिक सर्च के लिए इंटरैक्शन स्पेस की रिट्रीवल की ओर: RISE BM25 से सीमित स्पेस बनाता है

पेपर RISE (Retrieving Interaction SpacE) प्रस्तावित करता है, जो BM25 का उपयोग करके कॉर्पस का एक सीमित उपसमुच्चय बनाता है जिसे एजेंट खोज सकता है और इंडेक्सिंग के दौरान इसके दस्तावेज़ों को शेल-शैली नेविगेशन के लिए संसाधित करता है। BrowseComp-Plus पर RISE, gpt-5.4-mini के साथ 78% सटीकता प्राप्त करता है, जो प्रति-क्वेरी ला...

  • पेपर रिपोर्ट करता है कि BrowseComp-Plus पर RISE, gpt-5.4-mini के साथ 78% सटीकता प्राप्त करता है, जो प्रति-क्वेरी लागत के लगभग एक चौथाई पर शुद्ध-शेल DCI बेसलाइन के बराबर है।
  • पेपर रिपोर्ट करता है कि 10 लाख दस्तावेज़ों पर RISE-BM25, gpt-5.4-mini के साथ 81% तक पहुँचता है।
  • पेपर रिपोर्ट करता है कि उसी 10 लाख दस्तावेज़ पैमाने पर DCI, gpt-5.4-nano के साथ 60% तक गिर जाता है, जिसमें 100 में से 33 वॉल-क्लॉक विफलताएँ होती हैं।
  • पेपर तर्क देता है कि असीमित इंटरैक्शन स्केल नहीं करता: हर व्यापक शेल कमांड पूरे कॉर्पस पर स्कैन है और कॉर्पस बढ़ने पर लेटेंसी तेज़ी से बिगड़ती है।

सर्च एजेंट बनाने वाली टीमों के लिए यह परिणाम दर्शाता है कि रिट्रीवल को केवल कॉन्टेक्स्ट विंडो में फिट होने वाले दस्तावेज़ चुनने के बजाय इंटरैक्शन स्पेस को सीमित करना चाहिए, जिससे कॉर्पस बढ़ने पर लागत और लेटेंसी नियंत्रित रहती है।

arXiv watchlist
05
watchcreativenew architecture

Diffusion Controller AI इमेज जनरेशन को एकीकृत और सरल बनाता है

Google Research ने Diffusion Controller पेश किया है, एक हल्का "स्टीयरिंग डैम्पर" नेटवर्क जो बेस मॉडल को फ्रीज़ रखते हुए डीनॉइज़िंग ट्रैजेक्टरी को गतिशील रूप से समायोजित करता है, जिससे प्रॉम्प्ट अनुपालन और इमेज गुणवत्ता बेहतर होती है।

  • Stable Diffusion v1.4 बैकबोन पर SFT, रिवॉर्ड-वेटेड लॉस (RWL) और PPO तीन फाइन-ट्यूनिंग व्यवस्थाओं में मूल्यांकन किया गया।
  • SFT और RWL ट्रैक में ग्रे-बॉक्स Diffusion Controller ने HPS-v2 जीत दर में LoRA को पीछे छोड़ा, जबकि इसने काफी कम आंतरिक मॉडल परतों को संशोधित किया।
  • पूरी तरह अनलॉक व्हाइट-बॉक्स संस्करण ने बेसलाइन मॉडल पर 90% जीत दर हासिल की।
  • इन्फरेंस के समय एक ही गाइडेंस स्ट्रेंथ पैरामीटर बदलकर नियंत्रण बाधाओं की तीव्रता गतिशील रूप से समायोजित की जा सकती है।

बिल्डरों के लिए यह बंद-स्रोत मॉडल के वेट्स तक पहुंचे बिना नियंत्रणीय इमेज जनरेशन और व्यक्तिगतकरण का हल्का रास्ता प्रदान करता है।

Google Research
06
watchresearchcapability unlock

Google DeepMind ने AI-निर्मित प्रोटीन पर वॉटरमार्क के लिए SynthID Bio पेश किया

Google DeepMind ने SynthID Bio जारी किया है, जो सिंथेटिक बायोलॉजी के लिए वॉटरमार्किंग विधियों का समूह है और अमीनो एसिड अनुक्रमों तथा AlphaFold 3 द्वारा अनुमानित 3D संरचनाओं में पता लगाने योग्य हस्ताक्षर एम्बेड करता है, जबकि प्रयोगशाला परीक्षण में प्रोटीन की जैविक कार्यक्षमता बनी रहती है।

  • SynthID Bio, AlphaFold 3 के डिफ्यूजन नेटवर्क के एक छोटे हिस्से को फाइन-ट्यून करता है और वॉटरमार्क को मॉडल के वेट्स में शामिल करता है, जिससे अनुमानित 3D निर्देशांक स्वयं में पता लगाने योग्य हस्ताक्षर लेकर आते हैं।
  • तीन लक्ष्यों (VEGF-A, SARS-CoV-2 स्पाइक प्रोटीन RBD और PD-L1) पर वेट-लैब परीक्षण में वॉटरमार्क किए गए डिज़ाइनों की हिट दर, बाइंडिंग एफिनिटी और प्राकृतिक अनुक्रम विविधता बिना वॉटरमार्क वाले संस्करणों के बराबर रही।
  • कार्य में बताया गया है कि SynthID Bio, AlphaFold 3 की भविष्यवाणी सटीकता बनाए रखते हुए लगभग पूर्ण पहचान क्षमता देता है और डिजिटल शोर या मामूली निर्देशांक परिवर्तनों का सामना करता है।
  • Google DeepMind का कहना है कि वह अपना तरीका-पत्र प्रकाशित करेगा, कोड और इन विट्रो डेटा ओपन-सोर्स करेगा तथा शोध समुदाय को वेट्स जारी करेगा।

जैविक डिज़ाइन उपकरण बनाने वालों के लिए, वॉटरमार्क को सीधे मॉडल वेट्स और अनुक्रम निर्माण में शामिल करना DNA संश्लेषण स्क्रीनिंग और डेटाबेस प्रोवेनेंस के लिए स्वचालित सत्यापन परत देता है, परंतु जानबूझकर छेड़छाड़ के विरुद्ध मजबूती एक खुली चुनौ...

Google DeepMind