AI FRONTIER
Signals worth understanding before they become obvious.
كيف يوحّد Diffusion Controller توليد الصور بالذكاء الاصطناعي ويبسّطه
يقدّم Google Research إطار Diffusion Controller، وهي شبكة "مخمّد توجيه" خفيفة تعيد صياغة عملية إزالة الضوضاء كمسألة تحكّم مستمر، فتحسّن مطابقة الموجّه وجودة الصورة دون تغيير نموذج أساسي مجمّد.
- قيّمت الورقة الإطار على نموذج أساسي Stable Diffusion v1.4 عبر ثلاثة أنماط ضبط دقيق: SFT وreward-weighted loss (RWL) وPPO، وقاست المطابقة للموجّهات والاختيارات الجمالية عبر HPS-v2.
- في مساري SFT وRWL، تفوّقت شبكة مخمّد التوجيه Diffusion Controller ذات الصندوق الرمادي على LoRA في معدلات الفوز بـHPS-v2، مع تعديل طبقات داخلية أقل بكثير من LoRA.
- تذكر الورقة أن نسختها المفتوحة بالكامل، ذات وصول الصندوق الأبيض لتعديل الأوزان الداخلية، حقّقت معدل فوز 90% مقابل النموذج الأساسي.
- ينفّذ الإطار أربع بنى شبكية: Diffusion Controller وDiffusion Controller-Naive وDiffusion Controller-J وDiffusion Controller-S.
بالنسبة للمطوّرين، يعني هذا تحكّماً دقيقاً في نماذج الصور مغلقة المصدر دون وصول الصندوق الأبيض، مع طبقة تحكّم منفصلة عن نواة النموذج قابلة للتوسّع إلى التخصيص والأمان وتوليد الفيديو.
الجمع بين وكلاء النماذج اللغوية ومساحات البيانات: وساطة معمارية عبر Model Context Protocol
تقدم الورقة نهج وساطة معمارية قائماً على Model Context Protocol (MCP)، منفذاً عبر Eunomia Agent، لتمكين تفاعل مضبوط بين وكلاء النماذج اللغوية الكبيرة وخدمات مساحات البيانات. وقد تحقق نموذج أولي من التفاعل من طرف إلى طرف في اكتشاف الفهرس واسترجاع البيانات الوصفية واستدعاء خدمات البيانات دون تعديل مكونات مساحات البيانات ...
- قُدمت إلى arXiv في 24 سبتمبر 2026 بالمعرّف arXiv:2609.30341، وتصنف ضمن cs.AI وcs.DB.
- تحوّل طبقة الوساطة قدرات مساحات البيانات إلى أدوات منظمة قائمة على المخططات يمكن لوكلاء الذكاء الاصطناعي اكتشافها واستدعاؤها مع الحفاظ على قيود الحوكمة.
- تحقق التنفيذ الأولي من التفاعل من طرف إلى طرف في اكتشاف الفهرس واسترجاع البيانات الوصفية واستدعاء خدمات البيانات دون تعديل مكونات مساحات البيانات القائمة.
- المؤلفون هم Jaime Alonso Ruiz وCarlos Aparicio وGabriel Huecas وJoaquín Salvachúa وAndres Munoz-Arcentales.
بالنسبة للفرق التي تبني وكلاء ذكاء اصطناعي، يوضح هذا العمل أن MCP يمكن أن يعمل طبقة وساطة تربط الوكلاء بمساحات بيانات محوكمة دون تغيير البنية التحتية للبيانات القائمة.
HybridInfer: توجيه الطبقات بتعلّم معزّز واعٍ حرارياً لاستدلال نماذج اللغة الكبيرة على الجهاز والحافة والسحابة
HybridInfer هو موجّه بتعلّم معزّز واعٍ حرارياً لتسلسل هرمي من ثلاث طبقات (Llama 3.2 3B على الجهاز، وLlama 3.1 8B على الحافة مع الاسترجاع، وGPT-4o على السحابة)، يستخدم الهامش الحراري للهاتف وتقدير تعقيد الاستعلام كحالة ويختار الطبقة عبر سياسة Q-learning مدرّبة دون اتصال.
- تذكر الورقة أن حالات التشغيل الدائم على الجهاز تعادل الجودة لكل استعلام في الاستعلامات القابلة للخدمة لكنها أبطأ بثلاث إلى ست مرات وتفشل في الاستعلامات الطويلة.
- توازن المكافأة بين الجودة وزمن الاستجابة والتكلفة وعقوبة حرارية، إضافة إلى مكافأة محلية تُحتسب لتنفيذ على الجهاز؛ وتذكر الورقة أنه بدون هذه المكافأة تُفرّغ السياسة المثلى كل استعلام.
- يذكر المؤلف أن هذا أول استخدام للهامش الحراري على الجهاز للاختيار بين طبقات استدلال LLM ذات قدرات مختلفة على عتاد حقيقي؛ وقد أُتيح مقياس القياس على Android وخط التوجيه والتقييم الكامل لأغراض التكرار.
في نشر نماذج اللغة الكبيرة على الجهاز، تُعدّ القيود الحرارية مشكلة استقرار في زمن التشغيل وليست مجرد إبطاء، لذا يجب أن تُضمّن سياسات التوجيه الحالة الحرارية وحافزاً محلياً بدلاً من تحسين الجودة وزمن الاستجابة فقط.
XingChen-AGI تطلق TeleOCR، نموذج لغوي بصري لتحليل المستندات بحجم 1.2B معامل
TeleOCR نموذج لغوي بصري مفتوح المصدر بحجم يقارب 1.2B معامل يوحّد تحليل المستندات الرقمية والمستندات الملتقطة بالكاميرا في إطار واحد، وقد نُشرت أوزانه وتقرير تقني.
- تشير بطاقة النموذج إلى نحو 1.2B معامل، ورخصة apache-2.0، ودعم الصينية والإنجليزية، وأساس qwen2_5_vl.
- على OmniDocBench v1.6، يبلّغ TeleOCR عن Overall 96.87 وText Edit 0.027 وFormula CDM 96.36 وTable TEDS 97.05.
- في Dr.DocBench Challenge، يبلّغ TeleOCR عن Overall 67.96، متجاوزًا MinerU 2.5 Pro عند 62.26 وPaddleOCR-VL 1.6 عند 55.11.
- تذكر بطاقة النموذج أن TeleOCR يحلّل تخطيط ومحتوى المستندات المشوّهة دون معالجة مسبقة لإزالة التشويه أو نموذج تصحيح مخصص.
لمن يبنون خطوط تحليل المستندات، يبلّغ TeleOCR عن نتائج رائدة في عدة معايير عامة بحجم يقارب 1.2B معامل، ويوفّر الأوزان وتحويل GGUF، ما يجعله مرشحًا لتحليل خفيف مستضاف ذاتيًا.
Qwen تفتح المصدر لـ Qwen-Image-2.1: نموذج موحّد بـ 7B لتوليد الصور من النص وتحرير الصور
أطلقت Qwen نموذج Qwen-Image-2.1 كمصدر مفتوح، وهو نموذج موحّد لتوليد الصور من النص وتحرير الصور، إذ يضم مكوّن التوليد البصري 7B من المعاملات موزعة على 32 طبقة Single-Stream DiT ويدعم التوليد والتحرير الأصليين بالشفافية (RGBA).
- يضم مكوّن التوليد البصري 7B من المعاملات موزعة على 32 طبقة Single-Stream DiT.
- يدعم حتى 10 صور مرجعية وتحريرات موضعية تُحدَّد عبر دوائر أو تعليقات مرسومة أو أقنعة منفصلة.
- تشمل نسب الأبعاد المدعومة 1:1 و4:3 و3:4 و3:2 و2:3 و16:9 و9:16، مع دقات مثال تصل إلى 2752×1536.
- النموذج مرخّص بموجب Qwen Research License Agreement، وتفيد صفحة النموذج بـ 64,362 عملية تنزيل الشهر الماضي.
لأن نموذجًا واحدًا بحجم 7B يغطي توليد الصور من النص وتوليد طبقات الشفافية RGBA والتحرير بمراجع متعددة، يمكن للمطورين تجنّب نشر نماذج منفصلة للتوليد والتحرير.
إرشادات أولية لحالات السلامة في تدريب الذكاء الاصطناعي المتقدم
نشرت OpenAI إرشادات أولية حول حالات السلامة في تدريب الذكاء الاصطناعي المتقدم، تشمل الضمانات التقنية والممارسات التشغيلية والتحقيق في حوادث الانحراف.
- تشمل الإرشادات الضمانات التقنية والممارسات التشغيلية والتحقيق في حوادث الانحراف.
- قُدِّمت هذه الإرشادات كإرشادات أولية وليست معيارًا نهائيًا.
يمكن للفرق التي تدرّب نماذج متقدمة استخدام هذه المجالات الثلاثة كهيكل أولي لتوثيق حالات السلامة الداخلية لديها.
TaichuAI تنشر ZDTaichu5.0-9B، نموذج أساس متعدد الوسائط للاستدلال المكاني واستخدام الأدوات الوكيلية
ZDTaichu5.0-9B هو نموذج أساس متعدد الوسائط من TaichuAI يجمع بين العمود الفقري اللغوي Qwen3.5-9B ومشفّر الرؤية C-RADIOv4-H، ويدعم النصوص والصور والفيديو بأي دقة، ويستهدف الفهم البصري العام والاستدلال المكاني واستخدام الأدوات الوكيلية وأبحاث الذكاء الاصطناعي المتجسد.
- يمتلك النموذج 9.8B معامل، ونوع موتر BF16، وطول سياق يصل إلى 128K tokens.
- تقرير بطاقة النموذج تسجيل 87.7 على TAU2-Bench و71.4 على Claw-Eval و93.7 على IFEval.
- تقرير بطاقة النموذج تسجيل 48 على ERQA و56 على RoboSpatial.
- تُنشر الأوزان بموجب NVIDIA Open Model License Agreement، مع الاحتفاظ بترخيص Apache-2.0 الخاص بـ Qwen3.5.
لمن يبنون وكلاء الرؤية أو خطوط أنابيب الذكاء الاصطناعي المتجسد، يوفّر هذا النموذج استدلالاً مكانياً واستدعاءً للأدوات على مقياس 10B، لكن تنفيذ الأدوات يجب أن يظل منفّذاً ومُتحقَّقاً منه ومؤمَّناً بواسطة التطبيق المحيط.