Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-03
01
watchmodelsincremental

Gemini 4 Argon: حقبة جديدة من الذكاء المتقدم لدى Google DeepMind

أعلنت Google DeepMind عن Gemini 4 Argon، وهو نموذج متقدم لسير العمل الطويلة الأمد يرفع حد رموز الإخراج من 64K إلى مليون رمز، ويجري طرحه للمدافعين السيبرانيين الموثوقين عبر Fairwind Program.

  • تم توسيع حد رموز الإخراج من 64K إلى مليون رمز، وهو ما تصفه Google بأنه الأفضل في القطاع.
  • يحقق حالة جديدة من الفن على DeepSWE v1.1 بنسبة 77.9%، وهو معيار لمهام هندسة البرمجيات الواقعية الطويلة الأمد.
  • يحتل المرتبة الأولى على AutomationBench من Zapier بنسبة 51.3% ويحقق حالة الفن على LVBench لفهم الفيديو الطويل بنسبة 91.7%.
  • يتقاسم المركز الأول على CWE-bench v1 بنسبة 68%؛ السعر التمهيدي 2 دولار لكل مليون رمز إدخال و10 دولارات لكل مليون رمز إخراج، مع خصم 95% على سعر الإدخال للرموز المخزنة مؤقتًا.

بالنسبة للمطورين، يجعل سقف المليون رمز إخراج وسعر 2 دولار لكل مليون رمز إدخال مسار الوكيل الطويل مجديًا اقتصاديًا، لكن الوصول مقتصر حاليًا على المدافعين السيبرانيين الموثوقين.

Google DeepMind
02
watchagentsnew architecture

من الاقتراح إلى الأثر المُتحقق: Praxa، إطار مقيّد بالأدلة لتنفيذ وكلاء الذكاء الاصطناعي الخاضعين للحوكمة

تقدم الورقة Praxa، وهو إطار لوكيل يمثل صراحةً الاقتراح والصلاحية والإرسال والأثر الخارجي المُتحقق والترقية إلى الخدمة عبر القبول الحتمي والتنفيذ الوسيط والقراءة الخارجية والمطابقة والترقية المراجَعة. لا تُثبت أي من مسارات الأدلة الأربعة المبلَّغ عنها رفع نتائج الإنتاج أو تفوقًا عامًا.

  • في مقارنة تطوير لوسيط تنسيق من رتبتين بعد التنقيح، أكمل كل من خط الأساس ومرشح من تأليف المصدر 180/180 محاولة بدقة مقيسة متساوية، واستعادة كاملة للانهيار في بيئة مغلقة، وصفر انتهاكات محمية.
  • استخدم المرشح رموزًا أقل بنسبة 37.11%، وتكلفة نقطة نهاية تقديرية أقل بنسبة 33.84%، وخطوات أقل بنسبة 11.63%؛ وتذكر الورقة أن هذا لا يُثبت تحسن الجودة أو زمن الاستجابة أو سلوك الإنتاج.

بالنسبة للفرق التي تبني وكلاء خاضعين للحوكمة، تكمن مساهمة Praxa في جعل انتقالات الصلاحية إلى الأثر صريحة وقابلة للاختبار، لكن الأدلة الحالية تدعم فقط القابلية المعمارية للتحقق، لا النشر الإنتاجي أو ادعاءات السلامة.

arXiv cs.AI
03
watchmodelsnew architecture

نموذج جديد على OpenRouter: inclusionAI Ling 3.1 Flash

Ling 3.1 Flash هو نموذج mixture-of-experts هجين للاستدلال من inclusionAI، بمعاملات نشطة تبلغ 25B من إجمالي 560B، ونافذة سياق تبلغ 262,144 رمزًا.

  • إجمالي 560B معاملًا مع 25B معاملًا نشطًا.
  • نافذة سياق تبلغ 262,144 رمزًا، وتدعم حتى 32,768 رمز إكمال.
  • يقبل tools وtool_choice لاستدعاء الدوال، لكنه لا يدعم response_format، لذا لا يتم فرض إخراج JSON.
  • مُدرج كمجاني على OpenRouter، بتاريخ إصدار 2 أكتوبر 2026.

بالنسبة للمطورين، هذا خيار MoE مجاني بطويل السياق ويدعم استدعاء الأدوات، لكن غياب الإخراج المهيكل المفروض يعني أن موثوقية JSON يجب معالجتها في طبقة التطبيق.

OpenRouter Models
04
watchcreativenew architecture

DSSR-3D: استدلال مفصول للإحالة المعتمدة على زاوية النظر في غاوسيات ثلاثية الأبعاد

DSSR-3D إطار عمل عند الاستدلال لتجزئة الإحالة المعتمدة على زاوية النظر على حقول غاوسية ثلاثية الأبعاد متصلة، مُصاغ كواجهتين: توطين دلالي لا يتغير مع الوضعية، واستدلال مكاني مشروط بالوضعية، دون إعادة تدريب الحقل الدلالي الأساسي.

  • تصوغ الورقة الإطار كواجهتين: توطين دلالي لا يتغير مع الوضعية، واستدلال مكاني مشروط بالوضعية، بحيث ينتج أي زوج من الدوال يحقق هذه القيود تجسيدًا صالحًا.
  • يستخدم التجسيد آلية توطين softmax بدرجة حرارة مُحدَّدة، ودالة تسجيل اتجاهية قائمة على الإسقاط، مدمجتين عبر خطوة خفيفة بلا تدريب.
  • يقترح المؤلفون ViewRef-GS، وهو معيار يقيس تجزئة معتمدة على زاوية النظر على حقول غاوسية ثلاثية الأبعاد، ويُقيَّم مع Ref-LERF الموسَّع.
  • تذكر الورقة تحسينات متسقة مقارنة بطرق الإحالة القائمة على 3DGS الحالية، دون تدريب إضافي يتجاوز الحقل الدلالي الأساسي.

بالنسبة لبناة الذكاء الاصطناعي، يشير هذا إلى أن الإحالة المكانية المعتمدة على زاوية النظر يمكن فصلها عند الاستدلال ونقلها دون تكييف إلى حقول دلالية مختلفة بنيويًا.

arXiv cs.CV
05
watchresearchcost collapse

FlashDiffusion: تحليل طيفي لنوى مُبلَّطة مدمجة

تقدم الورقة FlashDiffusion، وهي طريقة بلا مصفوفات تقيّم كتل نوى غاوسية كثيفة في بلاطات GPU مدمجة، وتربط حلال القيم الذاتية بتدفق β تجريبي يختار مقياس الدقة عند العينة المحدودة.

  • تذكر الورقة أن تجسيد النوى الغاوسية الكثيفة يتطلب ذاكرة O(N^2).
  • تقيّم الطريقة كتل نوى غاوسية كثيفة في بلاطات GPU مدمجة، متجنبة تجسيد النواة الكثيفة.
  • يرتبط حلال القيم الذاتية بتدفق β تجريبي يختار مقياس الدقة عند العينة المحدودة.
  • الاستمرارية عبر حجم العينة وعرض النطاق تبدأ تشغيلًا دافئًا لحلول طيفية متزايدة التكلفة من دقات أخشن.

بالنسبة لبناة الذكاء الاصطناعي الذين يستخدمون طرق النوى في التعلم الهندسي، يزيل هذا النهج المُبلَّط بلا مصفوفات عنق زجاجة الذاكرة O(N^2) للنواة الكثيفة، مما يجعل الحلول الطيفية الأكبر ممكنة.

arXiv cs.LG
06
watchresearchincremental

ChainLoRA: دمج متجهات المهام مع الحفاظ على الهندسة للتعلّم المستمر في نماذج اللغة الكبيرة

ChainLoRA إطار دمج مستمر خالٍ من إعادة التشغيل، مبني على هندسة متجهات المهام المحدَّثة تسلسليًا، ويجمع بين التدريب بالتحديث التسلسلي والدمج التكيفي بطريقة SVD بعد التدفق. تُبلغ الورقة عن أداء متقدم بين الأساليب الخالية من إعادة التشغيل التي جرى تقييمها على معياري Large وSuperNI.

  • يجمع ChainLoRA بين التدريب بالتحديث التسلسلي والدمج التكيفي بطريقة SVD بعد التدفق، حيث تستخدم التهيئة ووكيل التعامد أحادي الجانب الحامل الأخير فقط أثناء التدريب.
  • عند وقت الدمج، تستخرج طريقة SVD التكيفية حاملًا مشتركًا وتُحاذيه مع أحدث مهمة عبر تكييف Procrustes.
  • يُظهر التحليل النظري أن تكييف Procrustes يسهّل الفصل الهندسي التقريبي بين المكوّنات المشتركة والمكوّنات الخاصة بالمهمة، كما يحدّ الوكيل أحادي الجانب من التداخل بين المهام.

لمن يبنون خطوط أنابيب التعلّم المستمر، يوفّر التدريب بالتحديث التسلسلي والدمج التكيفي بطريقة SVD في ChainLoRA مسارًا للضبط الدقيق فعّالًا في المعاملات وخاليًا من إعادة التشغيل، تبقى فيه بصمة الحالة التاريخية وتكلفة التنظيم ثابتتين مع نمو تد...

arXiv stat.ML
07
testmodelsopen source unlock

NVIDIA Kumo Tabular يضع حدودًا جديدة للدقة والكفاءة في التنبؤ الجدولي

أطلقت NVIDIA نموذج Kumo Tabular، وهو نموذج أساسي مفتوح للتصنيف والانحدار الجدولي يتنبأ بالصفوف الجديدة في تمريرة أمامية واحدة دون تدريب أو ضبط أو هندسة ميزات، بثلاثة أحجام من 28M إلى 215M معامل بموجب ترخيص OpenMDW-1.1.

  • يتوفر Kumo Tabular بأحجام Small/Medium/Large تتراوح من 28M إلى 215M معامل، وصدر بموجب ترخيص OpenMDW-1.1 للاستخدام التجاري.
  • يحتل المرتبة الأولى في لوحة صدارة TabArena بدرجة ELO تبلغ 1950، ويُذكر أنه أسرع 17 مرة من LimiX-2 في إعداد تقييم موحّد ببطاقة RTX 6000 Pro واحدة.
  • على BeyondArena يحقق درجة ELO تبلغ 1418 مع درجة Improvability بنسبة 7.78%، محتلًا المرتبة الأولى في لوحة الصدارة.
  • على TALENT يحقق أعلى ترتيب إجمالي في دقة التصنيف وخسارة لوغاريتم التصنيف وRMSE للانحدار، بمتوسط ترتيب 6.67 و3.98 و4.22.

بالنسبة لمطوري الذكاء الاصطناعي، يوفر Kumo Tabular مسارًا للتنبؤ الجدولي دون تدريب لكل مهمة، وينبغي التحقق من أرقام الدقة والكفاءة المذكورة على بيانات محجوزة قبل النشر.

Hugging Face Blog