Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-07
01
testmodelsopen source unlock

EmbeddingGemma 2: एक ओपन, हल्का मल्टीमॉडल एम्बेडिंग मॉडल

Google DeepMind ने EmbeddingGemma 2 जारी किया है, जो Gemma 4 आर्किटेक्चर पर आधारित 740 मिलियन पैरामीटर वाला मॉडल है और Apache 2.0 लाइसेंस के तहत उपलब्ध है। यह टेक्स्ट, इमेज, ऑडियो और वीडियो को एकीकृत एम्बेडिंग स्पेस में मैप करता है।

  • 740 मिलियन पैरामीटर, Gemma 4 आर्किटेक्चर पर आधारित और व्यावसायिक रूप से अनुमेय Apache 2.0 लाइसेंस के तहत जारी।
  • केवल टेक्स्ट वर्कलोड के लिए 270M पैरामीटर पर्याप्त हैं, साथ में वैकल्पिक विज़न (170M) और ऑडियो (300M) एनकोडर उपलब्ध हैं।
  • MTEB Code में कोड प्रदर्शन में 9.92 अंकों का सुधार रिपोर्ट किया गया, जो 68.76 से 78.68 हुआ।
  • Matryoshka Representation Learning से आउटपुट वेक्टर को 768 आयामों से 512, 256 या 128 तक छोटा किया जा सकता है, जिससे 6x तक स्टोरेज बचत होती है।

डेवलपर्स मॉड्यूलर एनकोडर और MRL ट्रंकेशन के जरिए मेमोरी और स्टोरेज को संतुलित करते हुए पूरी तरह ऑन-डिवाइस क्रॉस-मोडल सर्च और RAG पाइपलाइन बना सकते हैं।

Google DeepMind
02
watchresearchnew architecture

एजेंटिक सर्च के लिए इंटरैक्शन स्पेस की रिट्रीवल की ओर: RISE

पेपर RISE (Retrieving Interaction SpacE) प्रस्तावित करता है, जो BM25 से एक सीमित इंटरैक्शन स्पेस बनाता है और शेल-शैली नेविगेशन के लिए इंडेक्सिंग के दौरान उसके दस्तावेज़ों को प्रोसेस करता है, जिससे असीमित सीधा कॉर्पस इंटरैक्शन प्रतिस्थापित होता है।

  • BrowseComp-Plus पर RISE, gpt-5.4-mini के साथ 78% सटीकता प्राप्त करता है और प्रति-क्वेरी लागत के लगभग एक-चौथाई पर शुद्ध-शेल DCI बेसलाइन की बराबरी करता है।
  • 10 लाख दस्तावेज़ों पर RISE-BM25, gpt-5.4-mini के साथ 81% तक पहुँचता है।
  • उसी पैमाने पर DCI, gpt-5.4-nano के साथ 60% तक गिर जाता है, जिसमें 100 में से 33 वॉल-क्लॉक विफलताएँ होती हैं।
  • पेपर तर्क देता है कि असीमित इंटरैक्शन स्केल नहीं करता: हर व्यापक शेल कमांड पूरे कॉर्पस पर स्कैन है, और कॉर्पस बढ़ने पर लेटेंसी तेज़ी से खराब होती है।

सर्च एजेंट बनाने वाली टीमों के लिए रिट्रीवल की भूमिका दस्तावेज़ चुनने से हटकर एक खोजने योग्य सीमा तय करने की ओर बदलती है, जो बड़े कॉर्पस पर लागत और विश्वसनीयता तय करती है।

arXiv watchlist
03
testdeveloperopen source unlock

AutoSynthData: एंटरप्राइज़ एजेंट के लिए प्रशिक्षण डेटा तैयार करना

ServiceNow CoreAI ने AutoSynthData जारी किया है, जो लक्ष्य मॉडल की विफलताओं और अधिक मजबूत शिक्षक की सफलताओं से क्षमता अंतराल पहचानता है, फिर पोस्ट-ट्रेनिंग के लिए नए निष्पादन योग्य कार्य बनाता और सत्यापित करता है।

  • EnterpriseOps Gym के Hybrid डोमेन में, लक्ष्य मॉडल Gemma-4-26B-A4B-it और शिक्षक Qwen3.8-27B के साथ, AutoSynthData ने लगभग 18 घंटे में 2,000 सिंथेटिक प्रशिक्षण नमूने बनाए।
  • Hybrid का सर्वश्रेष्ठ चेकपॉइंट epoch 5 था, जिसने औसत Pass@1 को 7.2 प्रतिशत अंक यानी 35% सापेक्ष सुधार दिया और सत्यापनकर्ता की सफलता 63.01% से 68.55% कर दी।
  • रिपोर्ट के अनुसार इसने Gemma और संदर्भ मॉडल के बीच मूल Pass@1 अंतर का 59% पाटा।
  • ITSM डोमेन में भी लक्ष्य मॉडल Gemma-4-26B-A4B-it और शिक्षक DeepSeek-V4.1-Flash के साथ, AutoSynthData ने 66 घंटे में 1,994 सिंथेटिक प्रशिक्षण नमूने बनाए।

एंटरप्राइज़ एजेंट बनाने वाली टीमों के लिए यह पाइपलाइन पर्यावरण-विशिष्ट विफलताओं को सत्यापित प्रशिक्षण कार्यों में बदलती है और केवल अधिक सिंथेटिक डेटा के बजाय दोबारा उपयोग होने वाला कठिनाई-अंशांकन चक्र देती है।

Hugging Face Blog
04
watchresearchbenchmark jump

Open TTS Leaderboard: बहुभाषी टेक्स्ट-टू-स्पीच और वॉइस क्लोनिंग के लिए स्केलेबल मूल्यांकन

Hugging Face ने Open TTS Leaderboard जारी किया है, जो ओपन-सोर्स बहुभाषी TTS और वॉइस क्लोनिंग मॉडलों को वस्तुनिष्ठ मेट्रिक्स से आंकता है: Qwen3 ASR से WER/CER, H200 GPU पर RTFx और TTFA, तथा WavLM स्पीकर एम्बेडिंग के बीच कोसाइन समानता (SIM)।

  • 30 सितंबर 2026 तक Hugging Face Hub पर 8K से अधिक TTS मॉडल उपलब्ध हैं।
  • 30 सितंबर 2026 तक Artificial Analysis के 92 मॉडलों में से केवल 16 ओपन-वेट हैं।
  • वस्तुनिष्ठ मेट्रिक्स अपनाने से एक मॉडल का मूल्यांकन वोट जमा करने के कुछ हफ्तों से घटकर कुछ घंटों का रह जाता है।
  • डिफ़ॉल्ट व्यू मॉडलों को Seed TTS Eval और CV3 Eval (zero shot) के अंग्रेज़ी स्प्लिट पर मैक्रो-औसत WER से रैंक करता है, जिसमें hexgrad/Kokoro-82M, Supertone/supertonic-3 और fishaudio/s2-pro आगे हैं।

वॉइस एजेंट बनाने वाली टीमों के लिए यह लीडरबोर्ड WER, RTFx, TTFA और SIM पर ओपन मॉडलों की पुनरुत्पादनीय तुलना देता है, जिससे लेटेंसी, आकार और बहुभाषी गुणवत्ता के बीच चुनाव हो सके, पर यह प्राकृतिकता या श्रोता पसंद नहीं मापता।

Hugging Face Blog
05
testmodelsopen source unlock

autotrust/JEV-27B-VL: देख सकने वाला 27.8B मल्टीमॉडल निर्णय मॉडल

autotrust/JEV-27B-VL, autotrust/JEV-27B में दृष्टि जोड़ता है और टेक्स्ट तथा छवियों पर कैलिब्रेटेड प्रायिकताओं के साथ टाइप्ड System 1 निर्णय देता है, जबकि अपरिवर्तित Qwen3.8-27B को System 2 के रूप में रखता है।

  • 27.8B पैरामीटर, image-text-to-text पाइपलाइन, apache-2.0 लाइसेंस।
  • System 1 हाँ/नहीं, 2–256 विकल्पों में से एक चुनना और 0–5 रेटिंग का समर्थन करता है, प्रॉम्प्ट 256K टोकन तक।
  • रोबोट आर्म पिक एंड प्लेस ने 20 यादृच्छिक दृश्यों में से 75% पूरे किए, पकड़े गए सभी 15 क्यूब ट्रे में पहुँचे, प्रति निर्णय लगभग 240 ms।
  • कंप्यूटर उपयोग ने 60 यादृच्छिक बहु-चरण कार्यों में से 95% पूरे किए, प्रति क्लिक लगभग 0.26 s, केवल क्रमांकित बॉक्स देने पर यह 10% रह जाता है।

कंट्रोल लूप में कम विलंबता वाले दृश्य निर्णय चाहने वाले बिल्डरों के लिए JEV-27B-VL एक ही फॉरवर्ड पास में कैलिब्रेटेड प्रायिकताएँ देता है, पर कंप्यूटर-उपयोग कार्यों में एलिमेंट टेक्स्ट देना आवश्यक है।

Hugging Face Trending