AI FRONTIER
Signals worth understanding before they become obvious.
हार्वर्ड अध्ययन: AI एजेंट से Pull Request में 49 प्रतिशत की वृद्धि
हार्वर्ड अध्ययन के सारांश के अनुसार, AI एजेंट के उपयोग पर Pull Request में 49 प्रतिशत अधिक समय लगता है।
- अध्ययन सारांश Pull Request की अवधि में 49 प्रतिशत वृद्धि की रिपोर्ट करता है।
- यह परिणाम हार्वर्ड अध्ययन से है, जिसे BornCity ने रिपोर्ट किया।
AI एजेंट बनाने वाली टीमों को Pull Request चक्र समय को प्रमुख मीट्रिक के रूप में ट्रैक करना चाहिए, क्योंकि अध्ययन 49 प्रतिशत वृद्धि की रिपोर्ट करता है।
Nat. Mach. Intell. | SynCraft: संश्लेषणीयता सुधारने के लिए LLM से अणुओं का सटीक संपादन
SynCraft एक ऐसी विधि है जो LLM को अणुओं का सटीक संपादन करके संश्लेषणीयता सुधारने देती है, और यह Nature Machine Intelligence में प्रकाशित हुई है।
- यह शोध Nature Machine Intelligence में प्रकाशित हुआ है।
- SynCraft LLM को अणुओं का सटीक संपादन करने देता है।
- लक्ष्य अणु की संश्लेषणीयता सुधारना है।
AI निर्माताओं के लिए SynCraft अणु संरचनाओं के सटीक संपादन और संश्लेषणीयता सुधार के लिए LLM उपयोग की दिशा दर्शाता है।
Nano Banana बनाम GPT Image API: 13-चरणीय AI बेंचमार्क [2026]
पेपर सारांश विशिष्ट कार्यों पर मॉडल के प्रदर्शन को मापने के लिए एक नया बेंचमार्क प्रस्तावित या उपयोग करता है, जिसमें Nano Banana की तुलना GPT Image API से की गई है।
- पेपर सारांश का शीर्षक Nano Banana vs GPT Image API: 13-Step AI Benchmark [2026] है।
- सारांश बताता है कि यह बेंचमार्क विशिष्ट कार्यों पर मॉडल के प्रदर्शन को मापता है।
- सारांश Nano Banana की तुलना GPT Image API से करता है।
AI निर्माताओं के लिए संकेत यह है कि एक समर्पित मूल्यांकन ढांचा सामने आया है जो Nano Banana को सीधे GPT Image API के सामने रखता है, जिससे विशिष्ट कार्यों पर इमेज मॉडल के प्रदर्शन को ट्रैक किया जा सकता है।
एजेंट ने कहा कि काम हो गया। डेटाबेस ने इनकार किया।
Microsoft और Hugging Face ने ThinkingBox जारी किया है, जो 507 स्टेटफुल बिज़नेस वर्कफ़्लो को 20-20 बार चलाता है और एजेंट को उसके जनरेट किए टेक्स्ट के बजाय छोड़े गए टर्मिनल बैकएंड स्टेट और साइड इफ़ेक्ट पर आंकता है।
- 12 LLM मॉडलों पर 121,680 वैध ट्रायल्स वाले कॉमन-सेट एब्लेशन में 79,853 प्रयास executable जाँच में विफल रहे।
- उन विफलताओं में से 67.24% फिर भी साफ़ तौर पर समाप्त हुए, स्टेट बदलने वाला टूल चलाया और कोई अंतिम टूल त्रुटि नहीं बताई।
- executable जाँचों ने उनमें 77.61% में गलत फ़ील्ड मान, 43.30% में अनपेक्षित अतिरिक्त प्रभाव और 25.36% में आवश्यक प्रभाव गायब पाए।
- विफलता हस्ताक्षर थे टूल उपयोग 79.9%, गलत स्टेट अपडेट 10.3%, अधूरे उपयोगकर्ता समाधान 7.0% और कोई स्टेट-बदलाव कार्रवाई नहीं 2.9%।
एजेंट बनाने वाली टीमों के लिए 20/20 निरंतरता दर ही डिज़ाइन इनपुट है, और कमिट से पहले मॉडल के सारांश के बजाय टर्मिनल स्टेट जाँचनी चाहिए।
जो मॉडल मौजूद नहीं था, इसलिए आपने खुद बनाया
लेखक ने ML Intern से छह मॉडल बनाए, जिनमें एक 0.8B प्रॉम्प्ट रीराइटर शामिल है जो CPU पर चलता है, 99.7% बार मान्य आउटपुट देता है और 9B शिक्षक मॉडल के लगभग एक चौथाई टोकन इस्तेमाल करता है।
- 0.8B छात्र मॉडल CPU पर चलाने के लिए 812 MB की GGUF फ़ाइल के रूप में उपलब्ध है।
- 9B शिक्षक मॉडल को लगभग 20 GB मेमोरी चाहिए और एक पैराग्राफ लिखने से पहले हज़ारों टोकन तक सोचता है।
- 9B मॉडल द्वारा 8,797 उदाहरण अनुरोधों को लेबल करने सहित पूरे प्रोजेक्ट की कंप्यूट लागत 16 USD रही।
- छह प्रोजेक्टों की कुल कंप्यूट लागत लगभग 103 USD थी।
ML Intern व्यक्तिगत डेवलपर्स को अपना प्रशिक्षण बुनियादी ढांचा खड़ा किए बिना कुछ दसियों डॉलर में विशेष छोटे मॉडल डिस्टिल और प्रकाशित करने देता है।
InnovationEval: AI शोध क्षमता का परीक्षण
पेपर सारांश InnovationEval प्रस्तुत करता है, जो AI शोध क्षमता का परीक्षण करने वाला मूल्यांकन है।
- स्रोत JournalArta है और शीर्षक InnovationEval: Uji Kemampuan Riset AI है।
- उपलब्ध सारांश केवल बताता है कि InnovationEval AI शोध क्षमता का परीक्षण करता है।
AI निर्माताओं को InnovationEval पर नज़र रखनी चाहिए ताकि पता चले कि यह शोध क्षमता के किन आयामों को मापता है, क्योंकि अभी ठोस मेट्रिक्स नहीं दिए गए हैं।
Venastine-Research ने Xing4.0-29B-A4B-GGUF क्वांटाइज़्ड वेट जारी किए
Xing4.0-29B-A4B, Xing श्रृंखला (पूर्व में TeleChat) का अगली पीढ़ी का बड़ा भाषा मॉडल है, जिसमें कुल 29B पैरामीटर हैं और प्रति टोकन केवल 4B सक्रिय होते हैं, यह मूल रूप से 256K कॉन्टेक्स्ट लंबाई का समर्थन करता है जिसे 512K तक बढ़ाया जा सकता है, और यह रिपॉज़िटरी GGUF क्वांटाइज़्ड वेट प्रदान करती है।
- कुल 29B पैरामीटर, प्रति टोकन 4B सक्रिय, 40 लेयर, हिडन साइज़ 3584।
- MLA अटेंशन के साथ 64 रूटेड एक्सपर्ट, प्रति टोकन 4 सक्रिय एक्सपर्ट और 1 साझा एक्सपर्ट।
- मूल कॉन्टेक्स्ट लंबाई 256K है, जिसे 512K तक बढ़ाया जा सकता है।
- GGUF क्वांटाइज़ेशन 2-bit IQ2_M के 9.9 GB से 16-bit F16 के 62.5 GB तक उपलब्ध हैं।
जो डेवलपर लंबे कॉन्टेक्स्ट वाले MoE मॉडल को लोकल या सीमित VRAM में तैनात करना चाहते हैं, उनके लिए यह रिपॉज़िटरी 9.9 GB से 62.5 GB तक GGUF क्वांटाइज़ेशन विकल्प देती है।
LegalOn ने विकास गति बनाए रखते हुए Codex लागत आधी की
LegalOn ने Astra, Sol और Luna को कार्यों से मिलाकर और बजट का रणनीतिक प्रबंधन करके विकास गति बनाए रखते हुए अनुमानित दैनिक Codex लागत 65% कम की।
- LegalOn ने अनुमानित दैनिक Codex लागत 65% कम की।
- कंपनी ने लागत घटाते हुए विकास गति बनाए रखी।
- इसने Astra, Sol और Luna को कार्यों से मिलाया और बजट का रणनीतिक प्रबंधन किया।
AI निर्माताओं के लिए यह दर्शाता है कि मॉडलों को कार्यों से मिलाना और बजट का रणनीतिक प्रबंधन विकास गति का त्याग किए बिना अनुमान लागत को तेजी से घटा सकता है।