Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-04
01
watchresearchcost collapse

دمج واعٍ بالتنسيق لتدريب FP4 المسبق السريع

تقدم الورقة دمجًا واعيًا بالتنسيق يصمم كل منتج تكميم مع نطاق مقياسه وتخطيط مستهلكه لـ mxfp الأصلي وnvfp العام وnvfp المحلي لمصفوفة الخيوط التعاونية. في التدريب المسبق لعائلة Llama-3 بحجم 8B حتى 160 مليار رمز، يصل أسرع مسار مخصص إلى 37.9K tokens/s/GPU.

  • في اختبارات مقترنة على المسرّع نفسه، يصل bfloat16 وTransformer Engine nvfp إلى 18.8K و27.6K tokens/s/GPU، بينما يصل أسرع مسار مخصص إلى 37.9K tokens/s/GPU.
  • يصل mxfp مع التقريب العشوائي لتدرج الصف وتهيئة مسبقة لتدرج الأوزان Hadamard بقيمة 32 وإشارة ثابتة إلى 37.2K tokens/s/GPU واستخدام FLOP لنموذج bfloat16 بنسبة 86.3%.
  • ينتهي إعداد mxfp هذا أعلى بنسبة 2.11% من نقطة نهاية خسارة التدريب لـ bfloat16 الخام.
  • تنتهي وصفة Transformer Engine بأربع كتل bfloat16 نهائية أعلى بنسبة 0.87% من bfloat16 عند 27.1K tokens/s/GPU.

تعتمد مكاسب التدريب المسبق FP4 على العقد المقياسي والمعامل ومسار التنفيذ معًا، وليس على Tensor Cores وحدها.

arXiv cs.LG
02
testdeveloperopen source unlock

ميتا تنشر SDK لـ ESP32 يتيح لأي شخص صنع أجهزة متوافقة مع وكيل الذكاء الاصطناعي Muse

نشرت ميتا SDK موجهاً إلى ESP32 يتيح لأي شخص بناء أجهزة متوافقة مع وكيل الذكاء الاصطناعي Muse.

  • نشرت ميتا SDK يستهدف ESP32.
  • يهدف SDK إلى تمكين أي شخص من بناء أجهزة متوافقة مع وكيل الذكاء الاصطناعي Muse.

يمكن لمطوري ESP32 الآن بناء أجهزة متوافقة مع Muse اعتماداً على SDK رسمي بدلاً من انتظار أجهزة جاهزة من المورّدين.

ビジネス+IT
03
watchmodelsnew architecture

OpenAI تطلق GPT-6 Sol وLuna

أعلنت OpenAI عن GPT-6 Sol وLuna، وهما نموذجان جديدان ضمن سلسلة GPT-6.

  • قدّمت OpenAI نموذجين جديدين باسم GPT-6 Sol وLuna.
  • جاء الإعلان من القناة الرسمية لـOpenAI.

ينبغي لمطوري الذكاء الاصطناعي متابعة GPT-6 Sol وLuna لتقييم مدى ملاءمتهما لتطبيقاتهم.

OpenAI
04
testcreativeopen source unlock

Open TTS Leaderboard: تقييم قابل للتوسع لتحويل النص إلى كلام متعدد اللغات واستنساخ الصوت

أطلقت Hugging Face لوحة Open TTS Leaderboard التي تقيّم نماذج تحويل النص إلى كلام متعددة اللغات واستنساخ الصوت مفتوحة المصدر بمقاييس موضوعية: WER/CER عبر Qwen3 ASR، وRTFx وTTFA على وحدة H200 GPU، وتشابه المتحدث (SIM) بجيب التمام من تضمينات WavLM.

  • حتى 30 سبتمبر 2026، يتوفر أكثر من 8K نموذج TTS على Hugging Face Hub.
  • حتى 30 سبتمبر 2026، لا يزيد عدد النماذج مفتوحة الأوزان على 16 من أصل 92 نموذجًا في Artificial Analysis.
  • الاعتماد على مقاييس موضوعية يقلص تقييم النموذج الواحد من أسبوعين لجمع الأصوات إلى ساعتين.
  • يعرض الوضع الافتراضي الترتيب حسب متوسط WER الكلي على تقسيمات اللغة الإنجليزية في Seed TTS Eval وCV3 Eval (zero shot)، وتتصدره hexgrad/Kokoro-82M وSupertone/supertonic-3 وfishaudio/s2-pro.

بالنسبة للفرق التي تبني منتجات صوتية، تتيح هذه المقاييس الموضوعية القابلة للتكرار فرز العديد من نماذج TTS المفتوحة خلال ساعات، لكن الطبيعية وتفضيل المستمعين لا يزالان بحاجة إلى تصويت بشري.

Hugging Face Blog
05
testcreativeincremental

Lightricks تطلق LTX-2.5 كنموذج مفتوح الأوزان للفيديو والصوت ومحاكاة العالم

Lightricks/LTX-2.5 نموذج مفتوح الأوزان يولّد فيديو وصوتًا متزامنين من مدخلات نصية وصورية ومرئية، ويدعم الاستضافة الذاتية. يضيف توليد مشاهد متعددة أصليًا، ومفكك ترميز فيديو بالانتشار، ومشفّر نص Gemma 4 12B، ومتنبئ مدة اختياريًا.

  • تشير بطاقة النموذج إلى 1,629,984 عملية تنزيل الشهر الماضي و6.12k إعجاب.
  • يُطرح كحزمة مقسّمة متوافقة مع Comfy، بملف .safetensors واحد لكل مكوّن، وتشمل نقاط حفظ DiT بحجم 22B المقطّرة والكاملة.
  • يستخدم DiT المقطّر جدولًا ثابتًا من 8 خطوات مع CFG=1؛ ويجب أن يحقق num_frames الشرط num_frames % 8 == 1 وأن يكون العرض والارتفاع قابلين للقسمة على 32.
  • عند إيرادات سنوية أقل من 10 ملايين دولار أمريكي يكون الاستخدام التجاري والإنتاجي مجانيًا بموجب رخصة مجتمع LTX-2.x؛ وفوق 10 ملايين دولار يلزم اتفاق استخدام تجاري مدفوع.

بالنسبة للمطوّرين، يوفّر LTX-2.5 مسارًا مفتوح الأوزان قابلًا للاستضافة الذاتية لتوليد فيديو وصوت متزامنين، مع نقاط حفظ مقسّمة ونسخ مُكمَّمة int8 أو NVFP4 لتناسب ميزانيات VRAM المختلفة.

Hugging Face Trending
06
watchresearchincremental

هل تعني “very likely” أنها “غير مؤكدة”؟ كيف تختلف النماذج اللغوية الكبيرة عن البشر في القياس اللغوي لعدم اليقين

تبني الورقة مجموعة نصوص من علامات عدم اليقين البشرية مستمدة من أدبيات علم النفس وعلوم القرار، ثم تقارن النماذج اللغوية الكبيرة بها، وتفيد بأن هذه النماذج ترمز عدم اليقين اللفظي بمستويات عددية تختلف اختلافًا كبيرًا عن مستويات البشر. ويقدّم المؤلفون خوارزمية قائمة على التحسين تتعلم ملف عدم يقين أمثل على علامات عدم اليقين...

  • المؤلفون هم Jinhao Duan وZicheng Liu وZijie Liu وKaidi Xu وTianlong Chen؛ قُدّمت في 6 سبتمبر 2026 وقُبلت في ICML 2026.
  • يبني المؤلفون مجموعة نصوص من علامات عدم اليقين البشرية مستمدة من أدبيات علم النفس وعلوم القرار ويقارنون النماذج اللغوية الكبيرة بها.
  • تفيد الورقة بأن النماذج اللغوية الكبيرة ترمز عدم اليقين اللفظي بمستويات عددية تختلف اختلافًا كبيرًا عن مستويات البشر.
  • تلائم الخوارزمية المقترحة تعيينًا بين العلامة وعدم اليقين لتفسير الصحة التجريبية على أفضل وجه بدلًا من تقدير عدم اليقين عبر أخذ عينات متكرر.

على الفرق التي تبني أنظمة تراعي عدم اليقين أن تتحقق من كيفية تفسير النماذج اللغوية الكبيرة عدديًا لعلامات مثل “likely” و“possible” مقابل أحكام البشر بدلًا من افتراض التوافق.

arXiv cs.LG
07
watchresearchnew architecture

دوال متسامية كثيرة الحدود سريعة لنماذج اللغة الكبيرة

تختبر الورقة استبدال دوال sigmoid وtanh وSiLU الأصلية ببرامج كثيرة الحدود قصيرة في نماذج اللغة الكبيرة، وتُبلغ عن تحسينات في إنتاجية خطوة التدريب في مهام تكامل GB200 وفروق في الخسارة قرب 100 مليار رمز.

  • في مسح FP16 معزول، تُحسّن برامج FMA المحزومة بمقدار 1.19–2.19x على مجموعات العمل المقيمة في L2 و1.00–1.70x على المقيمة في HBM.
  • في أربع مهام تكامل GB200، تُحسّن بدائل dense SiLU وtanh-softcapped attention وrouted-expert SwiGLU إنتاجية خطوة التدريب الكاملة بنسبة 2.7% و2.9% و8.0% على التوالي.
  • يُحسّن بديل sigmoid attention التمرير الأمامي الكامل للانتباه بنسبة 7.4% وخطوة GPU الكاملة بنسبة 0.3%.
  • عند آفاق شائعة قرب 100 مليار رمز، تتراوح فروق خسارة التدريب الممهدة النهائية (كثيرة الحدود ناقص الأصلية) من -0.107 إلى +0.079 عبر المهام الأربع.

بالنسبة لبناة الذكاء الاصطناعي، يشير هذا إلى أن بدائل كثيرة الحدود BF16 منخفضة الدرجة لدوال SFU المتسامية قد تحقق مكاسب إنتاجية تدريب قابلة للقياس على وحدات GPU من فئة Blackwell، لكن يجب التحقق من أثر الخسارة لكل مهمة.

arXiv cs.LG
08
watchresearchincremental

ما مدى بُعد Adam عن النزول بالتدرج الطبيعي؟

تتعامل الورقة مع قاعدة التحديث الكاملة لـ Adam، بما في ذلك الزخم، كتقريب Fisher تجريبي قطري يخضع للاقتطاع القطري واستبدال التسميات التجريبي والتأخر الزمني، وتقيس الانحراف الهندسي لـ Adam عن NGD الحقيقي باستخدام مقياس γ(Δθ) الثابت بالمقياس عبر أربعة مشاهد للخسارة.

  • تشمل الدراسة أربعة مشاهد للخسارة: الانحدار الخطي جيد التكييف، والانحدار الخطي سيئ التكييف، والانحدار اللوجستي، وشبكة عصبية صغيرة غير محدبة.
  • يبقى الانحراف منخفضًا في الإعدادات جيدة التكييف لكنه يرتفع بشكل ملحوظ في ظروف التكييف السيئ، ليصل عدم التوافق إلى نحو 10^3 في الشبكة العصبية.
  • يرتبط الانحراف الهندسي الأعلى بتحسين أولي أبطأ لكنه لا يضعف التصغير النهائي للهدف؛ ويصل Adam باستمرار إلى خسارة منخفضة.
  • يتتبع Fisher التجريبي المحسّن (iEF) مسارات أكثر استقرارًا من Fisher التجريبي القياسي (EF)، الذي كثيرًا ما يتذبذب أو يتباعد.

بالنسبة للمطورين، يشير هذا إلى أن قوة التحسين العملية لدى Adam قد تنبع من توازن بين أخطاء التقريب البنيوية وتنعيم الزخم، بدلًا من التتبع الوثيق لمسار التدرج الطبيعي.

arXiv cs.LG