AI FRONTIER
Signals worth understanding before they become obvious.
Google ने RRSI जारी किया, जो मॉडल को दोबारा प्रशिक्षित किए बिना एजेंट हार्नेस को स्वयं बेहतर बनाता है
Google Cloud AI Research के शोधकर्ताओं ने Stanford University और University of Washington के साथ RRSI फ्रेमवर्क जारी किया है, जो मॉडल के वेट बदले बिना मॉडल के इर्द-गिर्द मौजूद हार्नेस को बार-बार संशोधित करता है, जिसमें प्रॉम्प्ट, टूल उपयोग, कंट्रोल फ्लो, मेमोरी और कॉन्टेक्स्ट प्रबंधन, स्किल मॉड्यूल और सब-एजेंट शामिल है...
- आठ बेंचमार्क पर Terminal-Bench 2.1 74.2% से 80.2% हो गया, यानी 6.0 प्रतिशत अंक की बढ़त, और SWE-Bench Verified 82.0% से 83.8% हो गया, यानी 1.8 प्रतिशत अंक की बढ़त।
- JobBench 36.0% से 40.7% हो गया, यानी 4.7 प्रतिशत अंक की बढ़त; GDPval 48.8% से 52.3% हो गया, यानी 3.5 प्रतिशत अंक की बढ़त; Frontier-Eng 17.7% से 22.0% हो गया, यानी 4.3 प्रतिशत अंक की बढ़त।
- Gemini 3.5 Flash को आधार मॉडल बनाकर किए गए अलग प्रयोग में Terminal-Bench 2.1 64.6% से 78.7% हो गया, यानी 14.1 प्रतिशत अंक की बढ़त, और SWE-Bench Verified 76.8% से 79.0% हो गया, यानी 2.2 प्रतिशत अंक की बढ़त।
- एजेंट वर्कस्पेस प्रयोग में RRSI ने प्रति प्रयोग 24.2 लाख पॉलिसी टोकन इस्तेमाल किए, जबकि अनियमित हार्नेस इवोल्यूशन तरीके ने 38 लाख टोकन इस्तेमाल किए; शोधकर्ताओं का कहना है कि RRSI ने पॉलिसी टोकन उपयोग 30% से अधिक घटाया।
एजेंट बनाने वाली टीमों के लिए RRSI दिखाता है कि मॉडल के वेट स्थिर रखते हुए हार्नेस पर नियंत्रित पुनरावृत्ति खोज मापने योग्य बेंचमार्क लाभ और कम टोकन लागत दे सकती है।
OpenAI ने GPT-6.1 Sol पेश किया
OpenAI ने कोडिंग, कंप्यूटर उपयोग और पेशेवर काम के लिए GPT-6.1 Sol पेश किया है, जिसके बारे में कंपनी कहती है कि इसकी बुद्धिमत्ता Astra के करीब है और यह Astra के मानक API इनपुट और आउटपुट टोकन कीमतों के पांचवें हिस्से पर उपलब्ध है।
- OpenAI के अनुसार GPT-6.1 Sol की बुद्धिमत्ता Astra के करीब है।
- इसके उपयोग क्षेत्र कोडिंग, कंप्यूटर उपयोग और पेशेवर काम हैं।
- मानक API इनपुट और आउटपुट टोकन कीमतें Astra की कीमतों की पांचवीं हिस्सा हैं।
AI बिल्डरों के लिए Astra के करीब की बुद्धिमत्ता पांचवें हिस्से टोकन कीमत पर मिलने का मतलब है कि कोडिंग और कंप्यूटर-उपयोग वर्कलोड पर प्रति इकाई अनुमान लागत घट सकती है।
prism-ml ने Ternary-Bonsai-2-27B-gguf जारी किया: 5.95 GB से चलने वाला 27B टर्नरी-वेट मॉडल
prism-ml ने Hugging Face पर Ternary-Bonsai-2-27B-gguf प्रकाशित किया है, जिसमें Qwen3.8-27B के embeddings, attention projections, MLP projections और LM head को टर्नरी वेट (g128, {−1,0,+1} के साथ FP16 ग्रुप स्केलिंग) में क्वांटाइज़ किया गया है, और llama.cpp के CUDA, Metal तथा CPU बैकएंड के लिए PTQ1_0 और PQ2_0 नामक दो GGU...
- भाषा मॉडल का आकार 5.95 GB (PTQ1_0) या 7.21 GB (PQ2_0) है, जो लगभग 54 GB के FP16 बेसलाइन से क्रमशः लगभग 9.0x और 7.5x छोटा है; आदर्श टर्नरी प्रारूप 1.72 bits/weight पर 5.8 GB है।
- पेपर 14 thinking-मोड बेंचमार्क पर 84.78 औसत रिपोर्ट करता है, जो FP16 संदर्भ (86.32) का 98.2% है, जबकि IQ2_XXS 72.59 (7.27 GB) और UD-Q4_K_XL 85.18 (17.6 GB) है।
- पेपर AIME26 पर 95.83 और LiveCodeBench पर 90.07 रिपोर्ट करता है, जहाँ IQ2_XXS क्रमशः 57.5 और 56.4 स्कोर करता है; गणित 96.57, कोडिंग 89.42, BFCL v3 टूल कॉलिंग 74.92।
- कॉन्टेक्स्ट लंबाई 262K टोकन है और बैकबोन हाइब्रिड अटेंशन है जिसमें लगभग 75% लीनियर अटेंशन है; विज़न टावर अलग Q8_0 mmproj पैक (0.63 GB) है जो केवल इमेज इनपुट पर लोड होता है।
एक ही GPU या लैपटॉप पर 27B-श्रेणी का रीज़निंग तैनात करने वाली टीमों के लिए यह दर्शाता है कि एंड-टू-एंड टर्नरी क्वांटाइज़ेशन लगभग 6 GB में FP16 के करीब रीज़निंग और टूल-कॉलिंग स्कोर बनाए रख सकता है, पर केवल समर्पित कर्नेल और फोर्क रनटाइम के स...
एजेंटिक सर्च के लिए इंटरैक्शन स्पेस की रिट्रीवल की ओर: RISE BM25 से सीमित स्पेस बनाता है
पेपर RISE (Retrieving Interaction SpacE) प्रस्तावित करता है, जो BM25 का उपयोग करके कॉर्पस का एक सीमित उपसमुच्चय बनाता है जिसे एजेंट खोज सकता है और इंडेक्सिंग के दौरान इसके दस्तावेज़ों को शेल-शैली नेविगेशन के लिए संसाधित करता है। BrowseComp-Plus पर RISE, gpt-5.4-mini के साथ 78% सटीकता प्राप्त करता है, जो प्रति-क्वेरी ला...
- पेपर रिपोर्ट करता है कि BrowseComp-Plus पर RISE, gpt-5.4-mini के साथ 78% सटीकता प्राप्त करता है, जो प्रति-क्वेरी लागत के लगभग एक चौथाई पर शुद्ध-शेल DCI बेसलाइन के बराबर है।
- पेपर रिपोर्ट करता है कि 10 लाख दस्तावेज़ों पर RISE-BM25, gpt-5.4-mini के साथ 81% तक पहुँचता है।
- पेपर रिपोर्ट करता है कि उसी 10 लाख दस्तावेज़ पैमाने पर DCI, gpt-5.4-nano के साथ 60% तक गिर जाता है, जिसमें 100 में से 33 वॉल-क्लॉक विफलताएँ होती हैं।
- पेपर तर्क देता है कि असीमित इंटरैक्शन स्केल नहीं करता: हर व्यापक शेल कमांड पूरे कॉर्पस पर स्कैन है और कॉर्पस बढ़ने पर लेटेंसी तेज़ी से बिगड़ती है।
सर्च एजेंट बनाने वाली टीमों के लिए यह परिणाम दर्शाता है कि रिट्रीवल को केवल कॉन्टेक्स्ट विंडो में फिट होने वाले दस्तावेज़ चुनने के बजाय इंटरैक्शन स्पेस को सीमित करना चाहिए, जिससे कॉर्पस बढ़ने पर लागत और लेटेंसी नियंत्रित रहती है।
Diffusion Controller AI इमेज जनरेशन को एकीकृत और सरल बनाता है
Google Research ने Diffusion Controller पेश किया है, एक हल्का "स्टीयरिंग डैम्पर" नेटवर्क जो बेस मॉडल को फ्रीज़ रखते हुए डीनॉइज़िंग ट्रैजेक्टरी को गतिशील रूप से समायोजित करता है, जिससे प्रॉम्प्ट अनुपालन और इमेज गुणवत्ता बेहतर होती है।
- Stable Diffusion v1.4 बैकबोन पर SFT, रिवॉर्ड-वेटेड लॉस (RWL) और PPO तीन फाइन-ट्यूनिंग व्यवस्थाओं में मूल्यांकन किया गया।
- SFT और RWL ट्रैक में ग्रे-बॉक्स Diffusion Controller ने HPS-v2 जीत दर में LoRA को पीछे छोड़ा, जबकि इसने काफी कम आंतरिक मॉडल परतों को संशोधित किया।
- पूरी तरह अनलॉक व्हाइट-बॉक्स संस्करण ने बेसलाइन मॉडल पर 90% जीत दर हासिल की।
- इन्फरेंस के समय एक ही गाइडेंस स्ट्रेंथ पैरामीटर बदलकर नियंत्रण बाधाओं की तीव्रता गतिशील रूप से समायोजित की जा सकती है।
बिल्डरों के लिए यह बंद-स्रोत मॉडल के वेट्स तक पहुंचे बिना नियंत्रणीय इमेज जनरेशन और व्यक्तिगतकरण का हल्का रास्ता प्रदान करता है।
Google DeepMind ने AI-निर्मित प्रोटीन पर वॉटरमार्क के लिए SynthID Bio पेश किया
Google DeepMind ने SynthID Bio जारी किया है, जो सिंथेटिक बायोलॉजी के लिए वॉटरमार्किंग विधियों का समूह है और अमीनो एसिड अनुक्रमों तथा AlphaFold 3 द्वारा अनुमानित 3D संरचनाओं में पता लगाने योग्य हस्ताक्षर एम्बेड करता है, जबकि प्रयोगशाला परीक्षण में प्रोटीन की जैविक कार्यक्षमता बनी रहती है।
- SynthID Bio, AlphaFold 3 के डिफ्यूजन नेटवर्क के एक छोटे हिस्से को फाइन-ट्यून करता है और वॉटरमार्क को मॉडल के वेट्स में शामिल करता है, जिससे अनुमानित 3D निर्देशांक स्वयं में पता लगाने योग्य हस्ताक्षर लेकर आते हैं।
- तीन लक्ष्यों (VEGF-A, SARS-CoV-2 स्पाइक प्रोटीन RBD और PD-L1) पर वेट-लैब परीक्षण में वॉटरमार्क किए गए डिज़ाइनों की हिट दर, बाइंडिंग एफिनिटी और प्राकृतिक अनुक्रम विविधता बिना वॉटरमार्क वाले संस्करणों के बराबर रही।
- कार्य में बताया गया है कि SynthID Bio, AlphaFold 3 की भविष्यवाणी सटीकता बनाए रखते हुए लगभग पूर्ण पहचान क्षमता देता है और डिजिटल शोर या मामूली निर्देशांक परिवर्तनों का सामना करता है।
- Google DeepMind का कहना है कि वह अपना तरीका-पत्र प्रकाशित करेगा, कोड और इन विट्रो डेटा ओपन-सोर्स करेगा तथा शोध समुदाय को वेट्स जारी करेगा।
जैविक डिज़ाइन उपकरण बनाने वालों के लिए, वॉटरमार्क को सीधे मॉडल वेट्स और अनुक्रम निर्माण में शामिल करना DNA संश्लेषण स्क्रीनिंग और डेटाबेस प्रोवेनेंस के लिए स्वचालित सत्यापन परत देता है, परंतु जानबूझकर छेड़छाड़ के विरुद्ध मजबूती एक खुली चुनौ...