Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-04
01
watchresearchcost collapse

तेज़ FP4 प्रीट्रेनिंग के लिए फ़ॉर्मैट-जागरूक फ़्यूज़न

यह पेपर फ़ॉर्मैट-जागरूक फ़्यूज़न प्रस्तुत करता है, जो प्रत्येक क्वांटाइज़ेशन प्रोड्यूसर को उसके स्केल डोमेन और कंज़्यूमर लेआउट के साथ सह-डिज़ाइन करता है, नेटिव mxfp, ग्लोबल nvfp और कोऑपरेटिव-थ्रेड-एरे-लोकल nvfp के लिए। Llama-3 परिवार 8B के 160 अरब टोकन तक प्रीट्रेनिंग में सबसे तेज़ कस्टम रूट 37.9K tokens/s/GPU तक पहुँच...

  • एक ही एक्सेलेरेटर पर मिलान किए गए प्रोब में bfloat16 और Transformer Engine nvfp क्रमशः 18.8K और 27.6K tokens/s/GPU तक पहुँचते हैं, जबकि सबसे तेज़ कस्टम रूट 37.9K tokens/s/GPU तक पहुँचता है।
  • रो-ग्रेडिएंट स्टोकास्टिक राउंडिंग और फ़िक्स्ड-साइन 32-वैल्यू Hadamard वेट-ग्रेडिएंट प्रीकंडीशनिंग के साथ mxfp 37.2K tokens/s/GPU और bfloat16 मॉडल FLOP उपयोग का 86.3% तक पहुँचता है।
  • वह mxfp कॉन्फ़िगरेशन कच्चे bfloat16 ट्रेनिंग-लॉस एंडपॉइंट से 2.11% ऊपर समाप्त होता है।
  • चार अंतिम bfloat16 ब्लॉक वाला Transformer Engine रेसिपी 27.1K tokens/s/GPU पर bfloat16 से 0.87% ऊपर समाप्त होता है।

FP4 प्रीट्रेनिंग का लाभ केवल Tensor Cores पर नहीं, बल्कि स्केल कॉन्ट्रैक्ट, ऑपरेंड और एक्ज़ीक्यूशन पाथ के संयुक्त डिज़ाइन पर निर्भर करता है।

arXiv cs.LG
02
testdeveloperopen source unlock

Meta ने ESP32 के लिए SDK जारी किया, कोई भी बना सकता है Muse AI एजेंट के अनुकूल डिवाइस

Meta ने ESP32 के लिए SDK जारी किया है, जिससे कोई भी अपने Muse AI एजेंट के अनुकूल हार्डवेयर बना सकता है।

  • Meta ने ESP32 को लक्षित करते हुए एक SDK जारी किया।
  • इस SDK का उद्देश्य है कि कोई भी Muse AI एजेंट के अनुकूल डिवाइस बना सके।

ESP32 डेवलपर अब आधिकारिक SDK पर Muse-अनुकूल हार्डवेयर बना सकते हैं, बजाय विक्रेता के तैयार डिवाइस का इंतज़ार करने के।

ビジネス+IT
03
watchmodelsnew architecture

OpenAI ने GPT-6 Sol और Luna पेश किए

OpenAI ने GPT-6 Sol और Luna की घोषणा की, जो उसकी GPT-6 श्रृंखला के दो नए मॉडल हैं।

  • OpenAI ने GPT-6 Sol और Luna नाम के नए मॉडल पेश किए।
  • यह घोषणा OpenAI के आधिकारिक चैनल से आई।

AI निर्माताओं को GPT-6 Sol और Luna पर नज़र रखनी चाहिए ताकि वे अपने अनुप्रयोगों के लिए उनकी उपयुक्तता आंक सकें।

OpenAI
04
testcreativeopen source unlock

Open TTS Leaderboard: बहुभाषी टेक्स्ट-टू-स्पीच और वॉइस क्लोनिंग के लिए स्केलेबल मूल्यांकन

Hugging Face ने Open TTS Leaderboard शुरू किया है, जो ओपन-सोर्स बहुभाषी TTS और वॉइस क्लोनिंग मॉडलों को वस्तुनिष्ठ मेट्रिक्स से आंकता है: Qwen3 ASR से WER/CER, H200 GPU पर RTFx और TTFA, तथा WavLM एम्बेडिंग से कोसाइन स्पीकर समानता (SIM)।

  • 30 सितंबर 2026 तक Hugging Face Hub पर 8K से अधिक TTS मॉडल उपलब्ध हैं।
  • 30 सितंबर 2026 तक Artificial Analysis के 92 मॉडलों में से केवल 16 ओपन-वेट हैं।
  • वस्तुनिष्ठ मेट्रिक्स पर निर्भरता से एक मॉडल का मूल्यांकन वोट जमा करने के कुछ हफ्तों से घटकर कुछ घंटों का रह जाता है।
  • डिफ़ॉल्ट व्यू Seed TTS Eval के अंग्रेज़ी स्प्लिट और CV3 Eval (zero shot) के मैक्रो-औसत WER पर रैंक करता है, जिसमें hexgrad/Kokoro-82M, Supertone/supertonic-3 और fishaudio/s2-pro आगे हैं।

वॉइस उत्पाद बनाने वाली टीमों के लिए ये पुनरुत्पादनीय वस्तुनिष्ठ मेट्रिक्स कुछ घंटों में कई ओपन TTS मॉडल छांट सकते हैं, पर स्वाभाविकता और श्रोता की पसंद के लिए मानव वोटिंग अब भी ज़रूरी है।

Hugging Face Blog
05
testcreativeincremental

Lightricks ने LTX-2.5 ओपन-वेट वीडियो, ऑडियो और वर्ल्ड मॉडल जारी किया

Lightricks/LTX-2.5 एक ओपन-वेट मॉडल है जो टेक्स्ट, इमेज और वीडियो इनपुट से सिंक्रनाइज़ वीडियो और ऑडियो बनाता है और सेल्फ-होस्टिंग का समर्थन करता है। इसमें नेटिव मल्टीशॉट जनरेशन, डिफ्यूज़न वीडियो डिकोडर, Gemma 4 12B टेक्स्ट एनकोडर और वैकल्पिक अवधि प्रेडिक्टर जोड़े गए हैं।

  • मॉडल कार्ड के अनुसार पिछले महीने 1,629,984 डाउनलोड और 6.12k लाइक्स हैं।
  • यह स्प्लिट, Comfy-अलाइन्ड पैक के रूप में जारी होता है जिसमें प्रति कंपोनेंट एक .safetensors फ़ाइल होती है, जिसमें 22B डिस्टिल्ड और फुल DiT चेकपॉइंट शामिल हैं।
  • डिस्टिल्ड DiT फिक्स्ड 8-स्टेप शेड्यूल और CFG=1 का उपयोग करता है; num_frames को num_frames % 8 == 1 पूरा करना होता है और चौड़ाई व ऊँचाई 32 से विभाज्य होनी चाहिए।
  • 10 मिलियन अमेरिकी डॉलर से कम वार्षिक राजस्व पर LTX-2.x कम्युनिटी लाइसेंस के तहत व्यावसायिक और प्रोडक्शन उपयोग निःशुल्क है; 10 मिलियन डॉलर से अधिक पर सशुल्क व्यावसायिक उपयोग समझौता आवश्यक है।

बिल्डर्स के लिए LTX-2.5 सिंक्रनाइज़ वीडियो और ऑडियो जनरेशन का सेल्फ-होस्ट करने योग्य ओपन-वेट रास्ता देता है, जिसमें स्प्लिट चेकपॉइंट और int8 या NVFP4 क्वांटाइज़्ड वेरिएंट अलग-अलग VRAM बजट के लिए उपलब्ध हैं।

Hugging Face Trending
06
watchresearchincremental

क्या “very likely” का अर्थ “अनिश्चित” है? भाषिक अनिश्चितता मात्राकरण में LLM मनुष्यों से कैसे भिन्न होते हैं

यह पेपर मनोविज्ञान और निर्णय-विज्ञान साहित्य से मानव अनिश्चितता मार्करों का एक कॉर्पस बनाता है और LLM की तुलना उससे करता है, तथा रिपोर्ट करता है कि LLM मौखिक अनिश्चितता को ऐसे संख्यात्मक स्तरों में एन्कोड करते हैं जो मनुष्यों से काफी भिन्न हैं। लेखक एक अनुकूलन-आधारित एल्गोरिदम पेश करते हैं जो LLM आउटपुट से सीधे अनिश्चि...

  • लेखक Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu और Tianlong Chen हैं; 6 सितंबर 2026 को सबमिट किया गया और ICML 2026 में स्वीकृत।
  • लेखक मनोविज्ञान और निर्णय-विज्ञान साहित्य से मानव अनिश्चितता मार्करों का कॉर्पस बनाते हैं और उस पर LLM को बेंचमार्क करते हैं।
  • पेपर रिपोर्ट करता है कि LLM मौखिक अनिश्चितता को ऐसे संख्यात्मक स्तरों में एन्कोड करते हैं जो मनुष्यों से काफी भिन्न हैं।
  • प्रस्तावित एल्गोरिदम बार-बार सैंपलिंग द्वारा अनिश्चितता अनुमान लगाने के बजाय अनुभवजन्य शुद्धता को सर्वोत्तम रूप से समझाने के लिए मार्कर-अनिश्चितता मैपिंग फिट करता है।

अनिश्चितता-जागरूक सिस्टम बनाने वाली टीमों को यह मानने के बजाय कि LLM और मनुष्य एक जैसे हैं, “likely” और “possible” जैसे मार्करों की LLM की संख्यात्मक व्याख्या को मानव निर्णयों के विरुद्ध सत्यापित करना चाहिए।

arXiv cs.LG
07
watchresearchnew architecture

LLM के लिए तेज़ बहुपद ट्रान्सेंडेंटल

यह पेपर LLM में मूल sigmoid, tanh और SiLU को छोटे बहुपद कार्यक्रमों से बदलने का परीक्षण करता है, GB200 एकीकरण कार्यों पर प्रशिक्षण-चरण थ्रूपुट लाभ और लगभग 100 अरब टोकन पर अंतिम प्रशिक्षण-हानि अंतर की रिपोर्ट करता है।

  • पृथक FP16 स्वीप में, पैक्ड FMA कार्यक्रम L2-निवास कार्य सेट पर 1.19–2.19x और HBM-निवास कार्य सेट पर 1.00–1.70x सुधार करते हैं।
  • चार GB200 एकीकरण कार्यों में, dense SiLU, tanh-softcapped attention और routed-expert SwiGLU प्रतिस्थापन पूर्ण प्रशिक्षण-चरण थ्रूपुट को क्रमशः 2.7%, 2.9% और 8.0% बढ़ाते हैं।
  • sigmoid attention प्रतिस्थापन पूर्ण attention फॉरवर्ड को 7.4% और पूर्ण GPU चरण को 0.3% बढ़ाता है।
  • लगभग 100 अरब टोकन के सामान्य क्षितिज पर, चार कार्यों में अंतिम स्मूद प्रशिक्षण-हानि अंतर (बहुपद घटा मूल) -0.107 से +0.079 तक है।

AI निर्माताओं के लिए, यह दर्शाता है कि SFU ट्रान्सेंडेंटल के लिए निम्न-डिग्री BF16 बहुपद प्रतिस्थापन Blackwell-श्रेणी GPU पर मापनीय प्रशिक्षण थ्रूपुट लाभ दे सकते हैं, पर हानि प्रभाव प्रति कार्य सत्यापित करना आवश्यक है।

arXiv cs.LG
08
watchresearchincremental

Adam प्राकृतिक ग्रेडिएंट डिसेंट से कितना दूर है?

यह पेपर Adam के पूर्ण अपडेट नियम को, मोमेंटम सहित, विकर्ण ट्रंकेशन, अनुभवजन्य लेबल प्रतिस्थापन और समय अंतराल के अधीन एक विकर्ण अनुभवजन्य Fisher सन्निकटन मानता है, और चार लॉस लैंडस्केप पर स्केल-इनवेरिएंट γ(Δθ) मीट्रिक से Adam के वास्तविक NGD से ज्यामितीय विचलन को मापता है।

  • अध्ययन चार लॉस लैंडस्केप को कवर करता है: अच्छी तरह कंडीशन्ड लीनियर रिग्रेशन, खराब कंडीशन्ड लीनियर रिग्रेशन, लॉजिस्टिक रिग्रेशन और एक नॉन-कॉन्वेक्स छोटा न्यूरल नेटवर्क।
  • अच्छी कंडीशनिंग में विचलन कम रहता है, लेकिन खराब कंडीशनिंग में काफी बढ़ जाता है, और न्यूरल नेटवर्क में लगभग 10^3 तक मिसअलाइनमेंट पहुंचता है।
  • अधिक ज्यामितीय ड्रिफ्ट का संबंध धीमे प्रारंभिक ऑप्टिमाइज़ेशन से है, लेकिन यह अंतिम उद्देश्य न्यूनीकरण को खराब नहीं करता; Adam लगातार कम लॉस तक पहुंचता है।
  • सुधरा हुआ अनुभवजन्य Fisher (iEF) मानक अनुभवजन्य Fisher (EF) की तुलना में अधिक स्थिर पथ ट्रैक करता है, जबकि EF अक्सर दोलन या विचलन करता है।

बिल्डरों के लिए, यह संकेत देता है कि Adam की व्यावहारिक ऑप्टिमाइज़ेशन शक्ति प्राकृतिक ग्रेडिएंट पथ के निकट अनुसरण के बजाय संरचनात्मक सन्निकटन त्रुटियों और मोमेंटम स्मूदिंग के संतुलन से आ सकती है।

arXiv cs.LG