AI FRONTIER
Signals worth understanding before they become obvious.
EmbeddingGemma 2: نموذج تضمين متعدد الوسائط مفتوح وخفيف
أصدرت Google DeepMind نموذج EmbeddingGemma 2 بـ 740 مليون معامل، المبني على معمارية Gemma 4 بترخيص Apache 2.0، والذي يربط النصوص والصور والصوت والفيديو أصلاً في فضاء تضمين موحّد.
- 740 مليون معامل، مبني على معمارية Gemma 4 ومصدر بترخيص Apache 2.0 المسموح تجارياً.
- يتطلب 270 مليون معامل فقط لأحمال النصوص فقط، مع مشفّرات اختيارية للرؤية (170 مليون) والصوت (300 مليون).
- يُبلّغ عن تحسّن بمقدار 9.92 نقطة في أداء الكود في MTEB Code، من 68.76 إلى 78.68.
- يتيح Matryoshka Representation Learning اقتطاع متجهات الإخراج من 768 بُعداً إلى 512 أو 256 أو 128، مما يوفر تخفيضاً في التخزين يصل إلى 6 أضعاف.
يمكن للمطورين تشغيل البحث متعدد الوسائط وخطوط RAG بالكامل على الجهاز، مع الموازنة بين الذاكرة والتخزين عبر المشفّرات المعيارية واقتطاع MRL.
نحو استرجاع فضاءات التفاعل للبحث الوكيلي: RISE
تقترح الورقة RISE (Retrieving Interaction SpacE)، الذي يستخدم BM25 لبناء فضاء تفاعل محدود، ويعالج مستنداته أثناء الفهرسة للتنقل بأسلوب الصدفة، بديلاً عن التفاعل المباشر غير المحدود مع المجموعة.
- على BrowseComp-Plus، يحقق RISE دقة 78% مع gpt-5.4-mini، ليعادل خط الأساس DCI القائم على الصدفة البحتة بنحو ربع التكلفة لكل استعلام.
- عند مليون مستند، يصل RISE-BM25 إلى 81% مع gpt-5.4-mini.
- وعند النطاق نفسه، ينخفض DCI مع gpt-5.4-nano إلى 60%، مع 33 فشلاً من 100 في الزمن الفعلي.
- ترى الورقة أن التفاعل غير المحدود لا يتوسع: فكل أمر صدفة واسع هو مسح للمجموعة بأكملها، وتتدهور زمن الاستجابة بحدة مع نمو المجموعة.
بالنسبة للفرق التي تبني وكلاء بحث، يتحول دور الاسترجاع من اختيار المستندات إلى تحديد حدود قابلة للاستكشاف، وهو ما يحدد التكلفة والموثوقية مباشرة عند أحجام المجموعات الكبيرة.
AutoSynthData: توليد بيانات التدريب لوكلاء المؤسسات
أصدرت ServiceNow CoreAI أداة AutoSynthData التي تستخدم إخفاقات النموذج الهدف ونجاحات معلّم أقوى لتحديد فجوات القدرات، ثم تولّد مهامًا قابلة للتنفيذ وتتحقق منها للتدريب اللاحق.
- في نطاق Hybrid من EnterpriseOps Gym، وباستخدام Gemma-4-26B-A4B-it نموذجًا هدفًا وQwen3.8-27B معلّمًا، ولّدت AutoSynthData 2,000 عينة تدريب اصطناعية في نحو 18 ساعة.
- كان أفضل نقطة تفتيش في Hybrid عند epoch 5، إذ حسّن متوسط Pass@1 بمقدار 7.2 نقطة مئوية، أي تحسن نسبي 35%، ورفع نجاح المدقق من 63.01% إلى 68.55%.
- يذكر التقرير أنه يسد 59% من فجوة Pass@1 الأصلية بين Gemma والنموذج المرجعي.
- في نطاق ITSM، وأيضًا باستخدام Gemma-4-26B-A4B-it نموذجًا هدفًا وDeepSeek-V4.1-Flash معلّمًا، ولّدت AutoSynthData 1,994 عينة تدريب اصطناعية في 66 ساعة.
بالنسبة للفرق التي تبني وكلاء مؤسسات، يحوّل هذا المسار الإخفاقات الخاصة بالبيئة إلى مهام تدريب موثّقة، ويقدّم حلقة معايرة صعوبة قابلة لإعادة الاستخدام بدل الاكتفاء بزيادة البيانات الاصطناعية.
Open TTS Leaderboard: تقييم قابل للتوسع لتحويل النص إلى كلام متعدد اللغات واستنساخ الصوت
أطلقت Hugging Face لوحة Open TTS Leaderboard التي تقيّم نماذج تحويل النص إلى كلام متعددة اللغات واستنساخ الصوت مفتوحة المصدر بمقاييس موضوعية: WER/CER عبر Qwen3 ASR، وRTFx وTTFA على وحدة GPU من نوع H200، وتشابه جيبي (SIM) بين تضمينات المتحدث WavLM.
- حتى 30 سبتمبر 2026، يتوفر أكثر من 8K نموذج TTS على Hugging Face Hub.
- حتى 30 سبتمبر 2026، لا يوجد سوى 16 من أصل 92 نموذجًا على Artificial Analysis بأوزان مفتوحة.
- الاعتماد على مقاييس موضوعية يقلص تقييم النموذج الواحد من أسبوعين لجمع الأصوات إلى ساعتين.
- يعرض الوضع الافتراضي ترتيب النماذج حسب متوسط WER الكلي على تقسيمات اللغة الإنجليزية في Seed TTS Eval وCV3 Eval (zero shot)، وتتصدرها hexgrad/Kokoro-82M وSupertone/supertonic-3 وfishaudio/s2-pro.
بالنسبة للفرق التي تبني وكلاء صوتيين، توفر اللوحة مقارنات قابلة للتكرار لنماذج مفتوحة على WER وRTFx وTTFA وSIM للموازنة بين زمن الاستجابة والحجم والجودة متعددة اللغات، لكنها لا تقيس الطبيعية ولا تفضيل المستمعين.
autotrust/JEV-27B-VL: نموذج قرار متعدد الوسائط بحجم 27.8B قادر على الرؤية
يضيف autotrust/JEV-27B-VL الرؤية إلى autotrust/JEV-27B ويعيد قرارات System 1 مصنّفة باحتمالات معايرة على النص والصور، مع الإبقاء على Qwen3.8-27B دون تعديل بوصفه System 2.
- 27.8B معامل، وخط أنابيب image-text-to-text، ورخصة apache-2.0.
- يدعم System 1 نعم/لا، والاختيار من 2–256 خيارًا، والتقييم من 0 إلى 5، مع مطالبات تصل إلى 256K رمزًا.
- أكمل الذراع الروبوتي مهمة الالتقاط والوضع في 75% من 20 مشهدًا عشوائيًا، وانتهت المكعبات الـ15 التي التقطها جميعًا في الصينية، بمعدل نحو 240 ms لكل قرار.
- أكمل استخدام الحاسوب 95% من 60 مهمة عشوائية متعددة الخطوات بمعدل نحو 0.26 ثانية لكل نقرة، وينخفض إلى 10% عند تقديم المربعات المرقّمة فقط.
للمطوّرين الذين يحتاجون قرارات بصرية منخفضة الكمون داخل حلقة تحكم، يعيد JEV-27B-VL احتمالات معايرة في تمريرة أمامية واحدة، لكن مهام استخدام الحاسوب تتطلب نص العناصر.