AI FRONTIER
Signals worth understanding before they become obvious.
جوجل تنشر RRSI الذي يتيح لـ«هيكل» الوكيل تحسين نفسه دون إعادة تدريب النموذج
نشر باحثون في Google Cloud AI Research بالتعاون مع جامعة ستانفورد وجامعة واشنطن إطار RRSI، الذي يعيد تعديل الهيكل المحيط بالنموذج مرارًا، بما يشمل المطالبات واستخدام الأدوات وتدفق التحكم وإدارة الذاكرة والسياق ووحدات المهارات والوكلاء الفرعيين، دون تغيير أوزان النموذج.
- عبر ثمانية معايير تقييم، ارتفع Terminal-Bench 2.1 من 74.2% إلى 80.2%، أي زيادة 6.0 نقاط مئوية، وارتفع SWE-Bench Verified من 82.0% إلى 83.8%، أي زيادة 1.8 نقطة مئوية.
- ارتفع JobBench من 36.0% إلى 40.7%، أي زيادة 4.7 نقاط مئوية؛ وارتفع GDPval من 48.8% إلى 52.3%، أي زيادة 3.5 نقاط مئوية؛ وارتفع Frontier-Eng من 17.7% إلى 22.0%، أي زيادة 4.3 نقاط مئوية.
- يذكر الباحثون تحسنًا يصل إلى 4.7 نقاط مئوية على خمس مجموعات تقييم خارجية لم تُستخدم للتحسين المباشر، وأداءً أفضل بنسبة تصل إلى 22.9% مقارنة بطرق تطور الهيكل الحالية في بيئات تقييم خارج التوزيع.
- في تجربة منفصلة استخدمت Gemini 3.5 Flash كنموذج أساسي، ارتفع Terminal-Bench 2.1 من 64.6% إلى 78.7%، أي زيادة 14.1 نقطة مئوية، وارتفع SWE-Bench Verified من 76.8% إلى 79.0%، أي زيادة 2.2 نقطة مئوية.
بالنسبة للفرق التي تبني وكلاء، يُظهر RRSI أن البحث التكراري المنضبط في الهيكل، مع تثبيت أوزان النموذج، يمكن أن يحقق مكاسب قابلة للقياس في المعايير ويخفض تكلفة الرموز.
OpenAI تطلق GPT-6.1 Sol
تطلق OpenAI نموذج GPT-6.1 Sol للبرمجة واستخدام الحاسوب والعمل المهني، بذكاء يقترب من Astra وبسعر يعادل خُمس أسعار رموز الإدخال والإخراج القياسية لواجهة Astra البرمجية.
- تفيد OpenAI بأن GPT-6.1 Sol يقدّم ذكاءً يقترب من Astra.
- تشمل حالات الاستخدام البرمجة واستخدام الحاسوب والعمل المهني.
- أسعار رموز الإدخال والإخراج القياسية للواجهة البرمجية تعادل خُمس أسعار Astra.
بالنسبة لمطوري الذكاء الاصطناعي، يعني ذكاء يقترب من Astra بخُمس سعر الرمز انخفاض كلفة الاستدلال لكل وحدة في أحمال البرمجة واستخدام الحاسوب.
prism-ml تنشر Ternary-Bonsai-2-27B-gguf: نموذج 27B بأوزان ثلاثية يعمل من 5.95 غيغابايت
نشرت prism-ml نموذج Ternary-Bonsai-2-27B-gguf على Hugging Face، بتكميم embeddings وإسقاطات الانتباه وإسقاطات MLP ورأس LM في Qwen3.8-27B إلى أوزان ثلاثية (g128، {−1,0,+1} مع تحجيم جماعي بدقة FP16)، مع حزمتي GGUF هما PTQ1_0 وPQ2_0 لـ llama.cpp على CUDA وMetal وCPU.
- حجم النموذج اللغوي 5.95 غيغابايت (PTQ1_0) أو 7.21 غيغابايت (PQ2_0)، أي أصغر بنحو 9.0x و7.5x من مرجع FP16 البالغ نحو 54 غيغابايت؛ والصيغة الثلاثية المثالية هي 1.72 بت/وزن عند 5.8 غيغابايت.
- تقرير الورقة متوسط 84.78 على 14 اختبارًا في وضع thinking، أي 98.2% من مرجع FP16 البالغ 86.32، مقابل 72.59 لـ IQ2_XXS (7.27 غيغابايت) و85.18 لـ UD-Q4_K_XL (17.6 غيغابايت).
- تقرر الورقة 95.83 على AIME26 و90.07 على LiveCodeBench، حيث يسجل IQ2_XXS قيمتي 57.5 و56.4؛ الرياضيات 96.57، البرمجة 89.42، استدعاء الأدوات BFCL v3 74.92.
- طول السياق 262K رمزًا على backbone بانتباه هجين بنحو 75% انتباه خطي؛ وبرج الرؤية حزمة mmproj Q8_0 منفصلة (0.63 غيغابايت) تُحمَّل فقط عند إدخال الصور.
بالنسبة للفرق التي تنشر استدلالًا من فئة 27B على وحدة GPU واحدة أو حاسوب محمول، يُظهر هذا أن التكميم الثلاثي الشامل يمكنه الحفاظ على درجات استدلال واستدعاء أدوات قريبة من FP16 عند نحو 6 غيغابايت، لكن فقط مع kernels مخصصة وبيئة تشغيل متفرعة.
نحو استرجاع فضاءات التفاعل للبحث الوكيلي: RISE يبني فضاءً محدودًا باستخدام BM25
تقترح الورقة RISE (Retrieving Interaction SpacE)، الذي يستخدم BM25 لبناء مجموعة فرعية محدودة من المدونة يستطيع الوكيل استكشافها، ويعالج مستنداتها أثناء الفهرسة للتنقل بأسلوب الصدفة. على BrowseComp-Plus، يحقق RISE دقة 78% مع gpt-5.4-mini، ليعادل خط الأساس DCI بالصدفة الخالصة بنحو ربع التكلفة لكل استعلام.
- تذكر الورقة أن RISE على BrowseComp-Plus يحقق دقة 78% مع gpt-5.4-mini، ليعادل خط الأساس DCI بالصدفة الخالصة بنحو ربع التكلفة لكل استعلام.
- تذكر الورقة أن RISE-BM25 عند مليون مستند يصل إلى 81% مع gpt-5.4-mini.
- تذكر الورقة أن DCI عند المقياس نفسه البالغ مليون مستند ينخفض إلى 60% مع gpt-5.4-nano، مع 33 فشلًا من 100 في الزمن الفعلي.
- تجادل الورقة بأن التفاعل غير المحدود لا يتوسع: فكل أمر صدفة واسع هو مسح للمدونة بأكملها، وتتدهور زمن الاستجابة بشدة مع نمو المدونة.
بالنسبة للفرق التي تبني وكلاء بحث، تشير النتيجة إلى أن الاسترجاع ينبغي أن يحدّد فضاء التفاعل بدلًا من مجرد اختيار مستندات تناسب نافذة السياق، ما يضبط التكلفة وزمن الاستجابة مع نمو المدونة.
Diffusion Controller يوحّد ويبسّط توليد الصور بالذكاء الاصطناعي
يقدّم Google Research شبكة Diffusion Controller، وهي شبكة خفيفة من نوع "مخمد التوجيه" تعدّل مسار إزالة الضوضاء ديناميكياً بينما يبقى النموذج الأساسي مجمّداً، ما يحسّن مطابقة التوجيه وجودة الصورة.
- تم التقييم على بنية Stable Diffusion v1.4 عبر ثلاثة أنظمة ضبط دقيق: SFT وreward-weighted loss (RWL) وPPO.
- في مساري SFT وRWL، تفوّق Diffusion Controller بالصندوق الرمادي على LoRA في معدلات فوز HPS-v2 مع تعديل طبقات داخلية أقل بكثير من النموذج.
- حقّقت النسخة البيضاء المفتوحة بالكامل معدل فوز 90% مقابل النموذج الأساسي.
- تتيح معلمة واحدة لقوة التوجيه عند الاستدلال ضبط شدة قيود التحكم ديناميكياً.
بالنسبة للمطورين، يوفّر هذا مساراً خفيفاً لتوليد صور قابل للتحكم وتخصيص دون الوصول إلى أوزان النماذج المغلقة.
Google DeepMind تطلق SynthID Bio لوضع علامة مائية على البروتينات المولّدة بالذكاء الاصطناعي
أطلقت Google DeepMind أداة SynthID Bio، وهي مجموعة طرق لوضع العلامات المائية في البيولوجيا التركيبية، تُضمّن توقيعًا قابلًا للكشف في تسلسلات الأحماض الأمينية والبنى ثلاثية الأبعاد التي يتنبأ بها AlphaFold 3، مع الحفاظ على الوظيفة البيولوجية في الاختبارات المخبرية.
- يُجري SynthID Bio ضبطًا دقيقًا لجزء صغير من شبكة الانتشار في AlphaFold 3، فيدمج العلامة المائية في أوزان النموذج بحيث تحمل الإحداثيات ثلاثية الأبعاد المتنبأ بها توقيعًا قابلًا للكشف بطبيعتها.
- في اختبارات مخبرية رطبة على ثلاثة أهداف (VEGF-A وRBD لبروتين سبايك في SARS-CoV-2 وPD-L1)، ساوت التصاميم المعلّمة نظيراتها غير المعلّمة في معدل النجاح وألفة الارتباط والتنوع الطبيعي للتسلسل.
- يذكر العمل أن SynthID Bio يحافظ على دقة تنبؤ AlphaFold 3 مع توفير قابلية كشف شبه كاملة، ويصمد أمام الضوضاء الرقمية أو التغيرات الطفيفة في الإحداثيات.
- تقول Google DeepMind إنها ستنشر ورقة المنهجية وستفتح الشيفرة وبيانات الاختبار المخبري كمصدر مفتوح وستتيح الأوزان لمجتمع البحث.
بالنسبة لمطوري أدوات التصميم البيولوجي، فإن تضمين العلامة المائية مباشرة في أوزان النموذج وتوليد التسلسلات يوفر طبقة تحقق آلية لفحص تخليق الحمض النووي وتتبع مصدر قواعد البيانات، لكن المتانة أمام التلاعب المتعمد لا تزال تحديًا مفتوحًا.