AI FRONTIER
Signals worth understanding before they become obvious.
EmbeddingGemma 2: एक ओपन, हल्का मल्टीमॉडल एम्बेडिंग मॉडल
Google DeepMind ने EmbeddingGemma 2 जारी किया है, जो Gemma 4 आर्किटेक्चर पर आधारित 740 मिलियन पैरामीटर वाला मॉडल है और Apache 2.0 लाइसेंस के तहत उपलब्ध है। यह टेक्स्ट, इमेज, ऑडियो और वीडियो को एकीकृत एम्बेडिंग स्पेस में मैप करता है।
- 740 मिलियन पैरामीटर, Gemma 4 आर्किटेक्चर पर आधारित और व्यावसायिक रूप से अनुमेय Apache 2.0 लाइसेंस के तहत जारी।
- केवल टेक्स्ट वर्कलोड के लिए 270M पैरामीटर पर्याप्त हैं, साथ में वैकल्पिक विज़न (170M) और ऑडियो (300M) एनकोडर उपलब्ध हैं।
- MTEB Code में कोड प्रदर्शन में 9.92 अंकों का सुधार रिपोर्ट किया गया, जो 68.76 से 78.68 हुआ।
- Matryoshka Representation Learning से आउटपुट वेक्टर को 768 आयामों से 512, 256 या 128 तक छोटा किया जा सकता है, जिससे 6x तक स्टोरेज बचत होती है।
डेवलपर्स मॉड्यूलर एनकोडर और MRL ट्रंकेशन के जरिए मेमोरी और स्टोरेज को संतुलित करते हुए पूरी तरह ऑन-डिवाइस क्रॉस-मोडल सर्च और RAG पाइपलाइन बना सकते हैं।
एजेंटिक सर्च के लिए इंटरैक्शन स्पेस की रिट्रीवल की ओर: RISE
पेपर RISE (Retrieving Interaction SpacE) प्रस्तावित करता है, जो BM25 से एक सीमित इंटरैक्शन स्पेस बनाता है और शेल-शैली नेविगेशन के लिए इंडेक्सिंग के दौरान उसके दस्तावेज़ों को प्रोसेस करता है, जिससे असीमित सीधा कॉर्पस इंटरैक्शन प्रतिस्थापित होता है।
- BrowseComp-Plus पर RISE, gpt-5.4-mini के साथ 78% सटीकता प्राप्त करता है और प्रति-क्वेरी लागत के लगभग एक-चौथाई पर शुद्ध-शेल DCI बेसलाइन की बराबरी करता है।
- 10 लाख दस्तावेज़ों पर RISE-BM25, gpt-5.4-mini के साथ 81% तक पहुँचता है।
- उसी पैमाने पर DCI, gpt-5.4-nano के साथ 60% तक गिर जाता है, जिसमें 100 में से 33 वॉल-क्लॉक विफलताएँ होती हैं।
- पेपर तर्क देता है कि असीमित इंटरैक्शन स्केल नहीं करता: हर व्यापक शेल कमांड पूरे कॉर्पस पर स्कैन है, और कॉर्पस बढ़ने पर लेटेंसी तेज़ी से खराब होती है।
सर्च एजेंट बनाने वाली टीमों के लिए रिट्रीवल की भूमिका दस्तावेज़ चुनने से हटकर एक खोजने योग्य सीमा तय करने की ओर बदलती है, जो बड़े कॉर्पस पर लागत और विश्वसनीयता तय करती है।
AutoSynthData: एंटरप्राइज़ एजेंट के लिए प्रशिक्षण डेटा तैयार करना
ServiceNow CoreAI ने AutoSynthData जारी किया है, जो लक्ष्य मॉडल की विफलताओं और अधिक मजबूत शिक्षक की सफलताओं से क्षमता अंतराल पहचानता है, फिर पोस्ट-ट्रेनिंग के लिए नए निष्पादन योग्य कार्य बनाता और सत्यापित करता है।
- EnterpriseOps Gym के Hybrid डोमेन में, लक्ष्य मॉडल Gemma-4-26B-A4B-it और शिक्षक Qwen3.8-27B के साथ, AutoSynthData ने लगभग 18 घंटे में 2,000 सिंथेटिक प्रशिक्षण नमूने बनाए।
- Hybrid का सर्वश्रेष्ठ चेकपॉइंट epoch 5 था, जिसने औसत Pass@1 को 7.2 प्रतिशत अंक यानी 35% सापेक्ष सुधार दिया और सत्यापनकर्ता की सफलता 63.01% से 68.55% कर दी।
- रिपोर्ट के अनुसार इसने Gemma और संदर्भ मॉडल के बीच मूल Pass@1 अंतर का 59% पाटा।
- ITSM डोमेन में भी लक्ष्य मॉडल Gemma-4-26B-A4B-it और शिक्षक DeepSeek-V4.1-Flash के साथ, AutoSynthData ने 66 घंटे में 1,994 सिंथेटिक प्रशिक्षण नमूने बनाए।
एंटरप्राइज़ एजेंट बनाने वाली टीमों के लिए यह पाइपलाइन पर्यावरण-विशिष्ट विफलताओं को सत्यापित प्रशिक्षण कार्यों में बदलती है और केवल अधिक सिंथेटिक डेटा के बजाय दोबारा उपयोग होने वाला कठिनाई-अंशांकन चक्र देती है।
Open TTS Leaderboard: बहुभाषी टेक्स्ट-टू-स्पीच और वॉइस क्लोनिंग के लिए स्केलेबल मूल्यांकन
Hugging Face ने Open TTS Leaderboard जारी किया है, जो ओपन-सोर्स बहुभाषी TTS और वॉइस क्लोनिंग मॉडलों को वस्तुनिष्ठ मेट्रिक्स से आंकता है: Qwen3 ASR से WER/CER, H200 GPU पर RTFx और TTFA, तथा WavLM स्पीकर एम्बेडिंग के बीच कोसाइन समानता (SIM)।
- 30 सितंबर 2026 तक Hugging Face Hub पर 8K से अधिक TTS मॉडल उपलब्ध हैं।
- 30 सितंबर 2026 तक Artificial Analysis के 92 मॉडलों में से केवल 16 ओपन-वेट हैं।
- वस्तुनिष्ठ मेट्रिक्स अपनाने से एक मॉडल का मूल्यांकन वोट जमा करने के कुछ हफ्तों से घटकर कुछ घंटों का रह जाता है।
- डिफ़ॉल्ट व्यू मॉडलों को Seed TTS Eval और CV3 Eval (zero shot) के अंग्रेज़ी स्प्लिट पर मैक्रो-औसत WER से रैंक करता है, जिसमें hexgrad/Kokoro-82M, Supertone/supertonic-3 और fishaudio/s2-pro आगे हैं।
वॉइस एजेंट बनाने वाली टीमों के लिए यह लीडरबोर्ड WER, RTFx, TTFA और SIM पर ओपन मॉडलों की पुनरुत्पादनीय तुलना देता है, जिससे लेटेंसी, आकार और बहुभाषी गुणवत्ता के बीच चुनाव हो सके, पर यह प्राकृतिकता या श्रोता पसंद नहीं मापता।
autotrust/JEV-27B-VL: देख सकने वाला 27.8B मल्टीमॉडल निर्णय मॉडल
autotrust/JEV-27B-VL, autotrust/JEV-27B में दृष्टि जोड़ता है और टेक्स्ट तथा छवियों पर कैलिब्रेटेड प्रायिकताओं के साथ टाइप्ड System 1 निर्णय देता है, जबकि अपरिवर्तित Qwen3.8-27B को System 2 के रूप में रखता है।
- 27.8B पैरामीटर, image-text-to-text पाइपलाइन, apache-2.0 लाइसेंस।
- System 1 हाँ/नहीं, 2–256 विकल्पों में से एक चुनना और 0–5 रेटिंग का समर्थन करता है, प्रॉम्प्ट 256K टोकन तक।
- रोबोट आर्म पिक एंड प्लेस ने 20 यादृच्छिक दृश्यों में से 75% पूरे किए, पकड़े गए सभी 15 क्यूब ट्रे में पहुँचे, प्रति निर्णय लगभग 240 ms।
- कंप्यूटर उपयोग ने 60 यादृच्छिक बहु-चरण कार्यों में से 95% पूरे किए, प्रति क्लिक लगभग 0.26 s, केवल क्रमांकित बॉक्स देने पर यह 10% रह जाता है।
कंट्रोल लूप में कम विलंबता वाले दृश्य निर्णय चाहने वाले बिल्डरों के लिए JEV-27B-VL एक ही फॉरवर्ड पास में कैलिब्रेटेड प्रायिकताएँ देता है, पर कंप्यूटर-उपयोग कार्यों में एलिमेंट टेक्स्ट देना आवश्यक है।