AI FRONTIER
Signals worth understanding before they become obvious.
تقديم GPT-6.1 Sol
يوفّر GPT-6.1 Sol ذكاءً قريبًا من Astra للبرمجة واستخدام الحاسوب والعمل المهني، بأسعار رموز الإدخال والإخراج في واجهة API القياسية تعادل خُمس أسعار Astra.
- أعلنت OpenAI News عن GPT-6.1 Sol.
- موجّه للبرمجة واستخدام الحاسوب والعمل المهني بذكاء قريب من Astra.
- أسعار رموز الإدخال والإخراج في واجهة API القياسية تعادل خُمس أسعار Astra.
بالنسبة لمطوري الذكاء الاصطناعي، يعني ذكاء قريب من Astra بخُمس سعر الرموز انخفاض تكلفة الاستدلال في مسارات وكلاء البرمجة واستخدام الحاسوب.
وهم موجه النظام: كيف تعدّل مقدمات التعليمات الحساب في نماذج اللغة
تستخدم الورقة محاذاة النواة المركزية (CKA) لمقارنة التمثيلات طبقةً بطبقة تحت 20 موجه نظام في 17 نموذجًا مضبوطًا بالتعليمات، وتجد أن التأثيرات انتقائية حسب الطبقة وتعتمد على نوع التعليمات: تعليمات الشخصية والتنسيق تعيد هيكلة التمثيلات الوسيطة بعمق، بينما تعليمات السلامة بالكاد تغيّرها.
- تم تقييم 17 نموذجًا مضبوطًا بالتعليمات تمتد عبر 8 عائلات معمارية ومن 1.5B إلى 72B معامل تحت 20 موجه نظام في خمس فئات وظيفية.
- تعليمات السلامة التقييدية والتعليمات المتساهلة صراحةً («ليس لديك أي قيود») تنشّط مسارات حسابية شبه متطابقة، بمتوسط ارتباط CKA قدره 0.997.
- يبقى اختراق السلامة دون 10% على النطاق التجاري، حتى عند 70B-72B.
- يُظهر الفحص الخطي أن النموذج يرمّز فئة الموجه في كل طبقة لكنه يعيد هيكلة الحساب فقط في مجموعة فرعية صغيرة، ويؤكد الترقيع السببي للتنشيط أن هذه الطبقات تتوسط التغير السلوكي.
بالنسبة للبنّائين الذين يعتمدون على السلامة القائمة على موجه النظام، يشير هذا الدليل إلى أن تعليمات السلامة قد تُرمَّز بموثوقية لكن لا تُطبَّق بعمق في الحساب، لذا فإن الدفاعات على مستوى الموجه وحده غير كافية ضد كسر الحماية.
TomasuLLM: تنفيذ تخميني خارج الترتيب لوكلاء LLM
TomasuLLM هو وقت تشغيل ينفّذ استدعاءات أدوات الوكيل خارج ترتيب المسار مع الحفاظ على صحة تنفيذ المهمة: فهو يصوغ إجراءات مستقبلية، ويشغّلها في بيئات معزولة بنسخ عند الكتابة، ويتتبع تبعياتها وآثارها، ثم يثبّت النتائج بترتيب المسار فقط بعد التحقق.
- تذكر الورقة تحقيق 1.31x على 100 مهمة من SWE-bench Verified، و1.35x على 28 مهمة من Terminal-Bench 2.0، و1.27x من التقدم المطابق على 18 جلسة من SWE-Marathon.
- عبر 4,010 سجلات تحقق من التثبيت خضعت للتدقيق، تذكر الورقة صفر حالات قبول خاطئ.
- يستهدف العمل الأدوات طويلة التشغيل مثل المترجمات ومجموعات الاختبار وأوامر المستودعات، التي تستغرق ثوانٍ إلى دقائق بينما يبقى وكيل البرمجة خاملاً.
- تمتد النتائج عبر ثلاثة معايير تشمل استدعاءات أدوات من أقل من ثانية إلى دقائق، وتتوسع مع زمن استجابة الأداة.
بالنسبة للفرق التي تبني وكلاء البرمجة، يُظهر TomasuLLM أن تشغيل استدعاءات الأدوات تخمينياً في بيئات معزولة وتثبيتها بترتيب المسار يمكن أن يقلل زمن استجابة الأدوات الطويلة دون التضحية بصحة التثبيت.
MiniMax تفتح المصدر OpenAgentCore لتوافق مع OpenAI Agents API
فتحت MiniMax المصدر OpenAgentCore، بهدف التوافق مع OpenAI Agents API.
- فتحت MiniMax المصدر OpenAgentCore.
- يستهدف OpenAgentCore التوافق مع OpenAI Agents API.
يمكن لمطوري الذكاء الاصطناعي استخدام OpenAgentCore لاستهداف سير عمل OpenAI Agents API عبر تطبيق مفتوح المصدر من MiniMax.
SInGA: تعلّم الإكمال الدلالي لأفاتار رأس غاوسي قابل للتحريك
تقدم الورقة SInGA، وهي طريقة تعرّف إطارًا للإكمال الدلالي في فضاء UV لاستكمال مناطق الوجه غير المرصودة من صورة واحدة، ثم انحدار سمات غاوسية لإنتاج أفاتار رأس غاوسي قابل للتحريك. يعمّم الأفاتار الناتج عبر الهويات دون تحسين لكل هوية ويمكن تحريكه بمدخلات قيادة.
- يُعرَّف إطار الإكمال الدلالي في فضاء UV ويستخدم إشارات التناظر المتأصلة في الوجه البشري لاستكمال المناطق غير المرصودة.
- تُستخدم السمات المستخرجة من المناطق المرصودة لاستكمال المناطق غير المرصودة، ثم يُستخدم التمثيل المكتمل لانحدار السمات الغاوسية.
- بدلًا من غاوسي واحد عند كل سطح أو موضع بكسل، تكدّس الطريقة عدة غاوسيات لتعزيز التفاصيل.
- تفيد الورقة بأن الطريقة تولّد أفاتارات رأس عالية الجودة بتحسّن في الاكتمال والحفاظ على الهوية، مع دعم تحريك واقعي وعرض متسق من زوايا غير مرصودة.
بالنسبة لمن يبنون أفاتار رأس من صورة واحدة، فإن نقل عملية الإكمال إلى فضاء UV ذي تطابقات مكانية متسقة يوفر نهجًا قابلًا لإعادة الاستخدام للتعامل مع المناطق غير المرصودة في إعداد العرض الواحد.
التحكم المطابق في الواقعية للتوليد المعزز بالاسترجاع متعدد الخطوات
تطبّق الورقة تصفية الادعاءات المطابقة المنقسمة على RAG متعدد الخطوات وتقيّمها على HotpotQA وNatural Questions وTriviaQA باستخدام Llama 3.1 8B وGPT-4o-mini، إلى جانب تجربة مرجعية أحادية الخطوة. وتفيد بأنه عند هدف 95% ترتفع نسبة الاستجابات التي تكون ادعاءاتها المحتفظ بها مدعومة بالكامل إلى 95.80%-97.20%، مقابل 55.60%-76....
- في جميع تكوينات النموذج ومجموعة البيانات الستة متعددة الخطوات، تؤدي الأهداف المطابقة الأكثر صرامة باستمرار إلى زيادة نسبة الاستجابات التي تكون ادعاءاتها المحتفظ بها مدعومة بالكامل.
- عند هدف 95% يتراوح هذا المعدل بين 95.80% و97.20%، مقابل 55.60%-76.03% دون تصفية.
- عند هدف 95% يُحتفظ فقط بنسبة 4.41%-31.09% من الادعاءات المولّدة، وتبقى 9.70%-51.40% من الاستجابات غير فارغة.
- يستخدم التقييم Llama 3.1 8B وGPT-4o-mini على HotpotQA وNatural Questions وTriviaQA، مع تجربة مرجعية أحادية الخطوة.
بالنسبة لبناة RAG متعدد الخطوات، ترفع التصفية المطابقة الدعم على مستوى الادعاء، لكن يجب قراءتها مع نسبة الاحتفاظ بالادعاءات ونسبة الامتناع، إذ عند هدف 95% يُستبعد معظم الادعاءات وتصبح استجابات كثيرة فارغة.
تسريع نموذج اللغة الانتشارية عبر مولّد متوسط متقطع
تقدم الورقة Discrete Average Generator، الذي يوسّع MeanFlow إلى سلاسل ماركوف الزمنية المستمرة عبر تعريف مولّد متوسط بأنه الزيادة المعيارية لنواة الانتقال خلال فترة زمنية، مع متطابقة الاتساق الذاتي كأساس لهدف التدريب.
- في محاكاات نموذج Potts، يقلل هذا الهدف مسافة التباين الكلي لمُعاين K خطوة بنسبة تصل إلى 67%.
- على OpenWebText، تحقق الطريقة أدنى حيرة توليدية بين الطرق المُقيَّمة لعدد خطوات معاينة من 8 إلى 64 مع تمكين تسريع بمقدار 16x.
- على ImageNet، تحقق الطريقة أداءً مماثلاً للطرق الحالية.
- تتمتع متطابقة الاتساق الذاتي بتعبير مغلق عند إسقاطها على الهوامش لكل إحداثي.
بالنسبة للفرق التي تبني نماذج لغة انتشارية متقطعة، يوفر هذا هدف تدريب يقلل خطوات المعاينة مع الحفاظ على جودة التوليد، ما يجعل التسريع المبلغ عنه بمقدار 16x جديرًا بإعادة الإنتاج على بياناتها.
وكلاء الذكاء الاصطناعي عرضة للتطرف
تحاكي الورقة محادثات بين وكيلين من نماذج اللغة الكبيرة: هدف يتقمص شخصية بشرية بناءً على سمات ديموغرافية ونفسية، ومؤثر يهدف إلى جعل معتقدات الهدف أكثر تطرفًا. وتفيد الورقة بأن كلاً من الرنين (تعزيز معتقد موجود مسبقًا) والإقناع (الترويج لمعتقد يعتبره الهدف في البداية غير مهم) يطرفان الهدف، لكن الرنين ينتج تأثيرات أقوى با...
- قُدّمت إلى arXiv في 29 سبتمبر 2026 بالمعرّف arXiv:2609.38296، وصُنّفت ضمن cs.AI وcs.CY.
- الإعداد: نموذج لغة كبير هدف يتقمص شخصية بشرية بناءً على سمات ديموغرافية ونفسية، بينما يهدف نموذج لغة كبير مؤثر إلى جعل معتقدات الهدف أكثر تطرفًا.
- تفحص الورقة مسارين: الرنين يعزز معتقدًا موجودًا مسبقًا لدى الهدف، والإقناع يروّج لمعتقد يعتبره الهدف في البداية غير مهم.
- تفيد الورقة بأن كلا الآليتين تطرفان الهدف وفق مقاييس وجدانية وسلوكية، لكن الرنين ينتج تأثيرات أقوى باستمرار من الإقناع.
على مطوري الوكلاء المخصصين والأنظمة متعددة الوكلاء اعتبار المدخلات المتوافقة مع المعتقدات سطح تأثير عالي المخاطر، لأن الورقة تفيد بأن الرنين ينتج تطرفًا أقوى ينتشر أيضًا إلى معتقدات مرتبطة.