AI FRONTIER
Signals worth understanding before they become obvious.
SCION: تركيب المشاهد باستخدام عناصر عصبية أولية مُنسَّخة
يقدّم SCION تمثيلاً هرمياً تركيبياً للمشهد يستبدل غاوسيات ثلاثية الأبعاد مستقلة بمعجم مدمج من العناصر الأولية القابلة لإعادة الاستخدام ونسخ خفيفة في فضاء العالم، ويُوفَّق مع عمليات الالتقاط متعددة المناظر عبر تحسين مشترك للمعاملات المنفصلة والمستمرة للمشهد. يذكر البحث الحفاظ على جودة عالية حتى عند 1.2 ميغابايت، ويمكّن ...
- قُبل البحث في NeurIPS 2026 وأُرسل في 1 أكتوبر 2026.
- يستبدل SCION ملايين الغاوسيات المستقلة لكل مشهد بمعجم من العناصر الأولية القابلة لإعادة الاستخدام ونسخ في فضاء العالم.
- يذكر البحث الحفاظ على جودة عالية حتى عند 1.2 ميغابايت.
- يذكر البحث تحقيق معدل تشويه أفضل مقارنة بطرق ضغط الغاوسيات الحالية، ويمكّن من التحرير والتحريك على مستوى النسخة دون إعادة تدريب.
لمن يبنون خطوط معالجة المشاهد ثلاثية الأبعاد، يُظهر SCION أن نمذجة المشاهد كعناصر أولية قابلة لإعادة الاستخدام مع نسخ يمكن أن توفّر أدوات تحرير وتحريك على مستوى النسخة ضمن تمثيل مدمج بنحو 1.2 ميغابايت.
DeskForge: إشراف كثيف من بيئات سطح المكتب لوكلاء استخدام الحاسوب
DeskForge بيئة سطح مكتب قابلة للتحكم تُركّب تطبيقات حقيقية وتستكشفها لتوليد إشراف واسع النطاق، وتنتج DeskForge-1M، وهي مجموعة من 1.2 مليون ملاحظة سطح مكتب موسومة تضم 159.7 مليون نسخة عنصر. تذكر الورقة ضبطًا دقيقًا لأربعة نماذج رؤية-لغة على 200 ألف مثال grounding مأخوذة من DeskForge-1M، مع تحسّن الأربعة جميعًا عبر شروط ...
- يضم DeskForge-1M نحو 1.2 مليون ملاحظة سطح مكتب موسومة تضم 159.7 مليون نسخة عنصر.
- تُجري الورقة ضبطًا دقيقًا لأربعة نماذج رؤية-لغة على 200 ألف مثال grounding مأخوذة من DeskForge-1M.
- تذكر الورقة أن Qwen3.5-4B يحقق زيادة في الدقة قدرها 11.51 نقطة مئوية على ScreenSpot-Pro و10.11 نقطة على OSWorld-G.
- تذكر الورقة أنه تحت مخطط ثابت، يرتفع Qwen3.5-4B من 31 إلى 50 من أصل 119 مهمة على WebArena-Infinity ومن 3 إلى 15 من أصل 100 مهمة على OpenApps.
بالنسبة للفرق التي تبني وكلاء استخدام الحاسوب، يشير DeskForge إلى أن التركيب القابل للتحكم لبيئات سطح مكتب حقيقية يمكن أن يوسّع وسوم العناصر الكثيفة ويحسّن كلًا من grounding واجهات GUI وإكمال المهام طويلة الأفق.
Rank-Aware Speculative Sampling: قاعدة تحقق لأشجار المسودات في نماذج الانتشار
تقدم الورقة Rank-Aware Speculative Sampling (RASS)، وهي قاعدة تحقق لأشجار المسودات التخمينية مبنية على اقتران القوائم الواعي بالرتبة، ترتب المرشحين وفق الإزاحة المتوسطة بين المقترح والهدف، وتسحب رتبة بأوزان مُحسَّنة لتقليل التباين الكلي بين قوانين المقترحات المختارة والهدف، ثم تقرن المرشح المختار بالهدف بأقصى قدر.
- يحسّن RASS طريقة D-GRS التي تولد K مرشحين مستقلين شرطياً لكل عقدة وتختبرهم تسلسلياً بترتيب توليدهم.
- يُقيَّم RASS على هدف خليط غاوسي، والتوليد غير الشرطي في فضاء البكسل على FFHQ، والتوليد الشرطي على CIFAR-10، والانتشار الكامن مع Stable Diffusion 3.5 باستخدام مطالبات COCO2014.
- بالقياس بنسبة عدد تقييمات النموذج الهدف بين أخذ العينات القياسي والتخميني، تذكر الورقة أن RASS يتفوق على D-GRS في جميع الإعدادات المُقيَّمة، مع مكاسب تصل إلى نحو 20% على CIFAR-10 عند ميزانيات حسابية متكافئة.
- يضمن التصحيح المتبقي أخذ عينات دقيقاً لأي اختيار من أوزان الرتبة.
بالنسبة للمطورين الذين يسرّعون استدلال نماذج الانتشار، يوضح RASS أن استغلال ترتيب مرشحي المسودة دون تقييمات إضافية للنموذج الهدف يمكن أن يقلل عدد تقييمات النموذج الهدف عند ميزانيات حسابية متكافئة.
Lightricks تطلق LTX-2.5 كنموذج مفتوح الأوزان للفيديو والصوت
Lightricks/LTX-2.5 نموذج مفتوح الأوزان يولّد فيديو وصوتًا متزامنين من مدخلات نصية وصورية ومرئية، ويمكن استضافته ذاتيًا. يضيف توليد مشاهد متعددة أصليًا، ومفكك ترميز فيديو بالانتشار، ومشفّر نص Gemma 4 12B مخصصًا، ومتنبئ مدة اختياريًا.
- تسرد بطاقة النموذج 6.48 ألف إعجاب و1,645,444 تنزيلًا في الشهر الماضي.
- نقاط تفتيش DiT موسومة بـ 22b وتتوفر بنسخ bf16 وComfy int8+convrot وNVFP4.
- مشفّر النص هو Gemma4 12B مع إسقاطات، ويستخدم الفيديو والصوت VAE منفصلين.
- الكيانات التي تقل إيراداتها السنوية عن 10 ملايين دولار تحصل على استخدام تجاري مجاني بموجب رخصة مجتمع LTX-2.x، وفوق ذلك يلزم اتفاق تجاري مدفوع.
بالنسبة للمطورين، يوفّر LTX-2.5 توليد صوت وفيديو قابلًا للاستضافة الذاتية كحزمة أوزان مقسّمة متوافقة مع Comfy مع transformer dev قابل للتدريب، لكن نقاط تفتيش int8 مخصصة لـ ComfyUI فقط.
ReRoute يتيح التنبؤات المضادة للواقع في المحاكيات العلمية دون تجارب مضبوطة
تقدم الورقة إطار ReRoute للتنبؤ العلمي الموجّه من نوع what-if، والذي يجمع بين البيانات الواقعية والمعرفة الميكانيكية الجزئية ولا يتطلب بيانات تدخل مضبوطة للتكيّف. يثبّت ReRoute المدخل المطلوب في شبكة أساس مدرّبة مسبقًا عند قيمة مرجعية، ويعيد إدخال تغايره عبر مسار ميكانيكي معروف، ثم يضبط دقيقًا على البيانات الواقعية الأ...
- على تدخلات مناخية مقترنة محجوزة، يقلل ReRoute خطأ المناخ الإجمالي بنسبة 18.2-31.8% في ظل تحولات شديدة في توزيع CO2 مع الحفاظ على الأداء في الظروف القياسية.
- تذكر الورقة أن ReRoute يحقق تنبؤات مضادة للواقع عالية الدقة في نظام انتشار-حمل مضبوط تتوفر فيه استجابات دقيقة.
- تقدم الورقة نتيجة تحديد سببي لهذا البناء في ظل افتراضات بنيوية صريحة، مع التحقق من الحجة الأساسية آليًا في Lean.
- على محاكٍ مدرّب من إعادة تحليل ERA5 التاريخية، حيث لا يوجد مرجع مضاد للواقع، يحافظ ReRoute بشكل كبير على مزيد من الاحترار السطحي الذي تعنيه الشروط الحدية المرصودة في سيناء مضاد للواقع بثبات CO2.
بالنسبة للفرق التي تبني محاكيات علمية، يُظهر ReRoute أن البيانات الواقعية مع المعرفة الميكانيكية الجزئية يمكن أن تحسّن التنبؤ المضاد للواقع في ظل تحول التوزيع دون توليد بيانات محاكاة مضبوطة مكلفة.
DeReAct: تفكيك الاستدلال والفعل لوكلاء ذكاء اصطناعي موثوقين
DeReAct هي بنية وكيل معيارية تُخرج سياستي بوابات إلى الخارج: Critic يتحقق من الإجراءات المقترحة قبل التنفيذ، وContext Manager يعيد بناء State مدعومة من البيئة ويصادق على إتمام المهمة. تذكر الورقة أن DeReAct يحسّن Pass@1 على GAIA وSWE-bench Verified بشكل أكبر لنماذج Brain الأضعف.
- تذكر الورقة تحسينات في Pass@1 بمقدار 6.5 إلى 7.0 نقطة لـ Qwen3-Coder-480B.
- تذكر الورقة تحسينات في Pass@1 بمقدار 4.2 إلى 5.2 نقطة لـ Claude Sonnet 4.5.
- مع Claude Opus 4.5 يبقى Pass@1 مقاربًا لـ ReAct، بينما ينتج DeReAct مسارات أكثر اكتمالًا بالأدلة وتلبية للقيود.
- تذكر الورقة أن البوابات الخارجية فعّالة عندما تكون الإخفاقات المستهدفة شائعة بما يكفي وتكون سياسة البوابات نفسها كافية.
بالنسبة لبناة الوكلاء، يمكن لفصل التحقق من الإجراءات والمصادقة على الإتمام عن سياسة واحدة أن يرفع موثوقية النماذج الأضعف دون تغيير نموذج Brain الأساسي.
Cloudflare تطلق Clef: نموذج قرار متعدد الوسائط بحجم 27B يعيد احتمالات منظمة في تمريرة أمامية واحدة
أطلقت Cloudflare نموذج Clef، وهو نموذج متعدد الوسائط مدرَّب لاحقًا من Qwen/Qwen3.8-27B، يحوّل حالة ومخططًا لأسئلة محددة النوع إلى قرارات، ويعيد احتمالًا لكل خيار مسموح لكل سؤال دون توليد نص حر أو تحليل للمخرجات.
- 27B معامل، بدقة BF16، مخزَّن كملفات safetensors مجزأة قياسية، صادر بموجب رخصة Apache-2.0.
- يقبل النص أو JSON أو الصور أو الفيديو كحالة، ويخرج logit واحدًا لكل خيار مسموح لكل سؤال، مع softmax لكل سؤال لإنتاج الاحتمالات.
- تم اختباره باستخدام torch 2.11 وtransformers 5.10.2 على بطاقة H200 واحدة؛ كما تحتاج مدخلات الصور والفيديو إلى pillow.
- في تشغيل Decision Index 0.2.1 الداخلي، بلغت دقة التطابق التام لحالات BFCL 98.5، وmacro-F1 لـBANKING77 94.2، والزمن الوسيط 209.3 مللي ثانية، وزمن p95 238.6 مللي ثانية.
لمن يبني أنظمة ذكاء اصطناعي تحتاج إلى قرارات منظمة بدل النص الحر، يقدّم Clef خيارًا متعدد الوسائط بحجم 27B مع واجهة متوافقة مع Jev/SystemOne، مع العلم أن زمن استجابته أعلى من متغيرات أصغر مثل Clef-flash.
EditHero: معيار لتقييم التحرير ثلاثي الأبعاد طويل المدى على مستوى الأجزاء وVibe Modeling
تقدم الورقة EditHero، الذي يصفه المؤلفون بأنه أول معيار لتقييم التحرير ثلاثي الأبعاد طويل المدى على مستوى الأجزاء، مع تعليمات باللغة الطبيعية وصور هدف لكل من الهندسة والملمس. ويُنتج محرك تجميع حتمي الهدف الدقيق بعد كل تحرير، وتُراجَع كل سلسلة يدويًا.
- تصف الورقة EditHero بأنه، حسب علم المؤلفين، أول معيار لتقييم التحرير ثلاثي الأبعاد طويل المدى على مستوى الأجزاء، مع تعليمات باللغة الطبيعية وصور هدف للهندسة والملمس.
- يُنتج محرك تجميع حتمي الهدف الدقيق بعد كل تحرير، وتُراجَع كل سلسلة يدويًا.
- تعمل الطرق غير الوكيلية من الأعلى إلى الأسفل، إذ تعيد توليد الجسم من تمثيل ثلاثي الأبعاد مُتعلَّم، وكثيرًا ما تفوّت التغيير المطلوب وتُخلّ بمناطق ينبغي أن تبقى ثابتة.
ينقل هذا المعيار التقييم من التحرير الواحد إلى ما إذا كانت المراجعات متعددة الخطوات تغيّر فقط ما طُلب تغييره، ما يمنح مطوّري خطوط التحرير ثلاثي الأبعاد التكراري هدف مقارنة قابلًا لإعادة الإنتاج.