AI FRONTIER
Signals worth understanding before they become obvious.
Diffusion Controller من Google Research يوحّد ويبسّط التحكم في توليد الصور بالذكاء الاصطناعي
تقدّم Google Research شبكة Diffusion Controller الخفيفة من نوع "مخمد التوجيه"، التي تعالج عملية إزالة الضوضاء في الانتشار كمسألة تحكم مستمر، فتحسّن مطابقة التوجيه النصي وجودة الصورة دون تعديل النموذج الأساسي.
- جُرى التقييم على backbone من Stable Diffusion v1.4 ضمن ثلاثة أنظمة ضبط دقيق: SFT وreward-weighted loss (RWL) وPPO، باستخدام Human Preference Score (HPS-v2) لقياس المطابقة مع التوجيهات النصية والاختيارات الجمالية.
- في مساري SFT وRWL، تفوّقت شبكة مخمد التوجيه Diffusion Controller بنمط gray-box على LoRA في معدلات الفوز بـHPS-v2، مع تعديل عدد أقل بكثير من الطبقات الداخلية للنموذج.
- تذكر الورقة أن النسخة المفتوحة بالكامل (white-box، مع وصول غير مقيّد لتعديل الأوزان الداخلية) حققت معدل فوز 90% مقابل النموذج الأساسي.
- يمكن ربط الشبكة بنماذج مغلقة المصدر ومقيّدة الوصول، وتتيح ضبط معامل واحد لقوة التوجيه عند الاستدلال لرفع شدة قيود التحكم أو خفضها.
بالنسبة للمطوّرين، يعني هذا إمكانية توجيه نموذج صور مغلق المصدر نحو تفضيلات جديدة عبر إضافة خفيفة قابلة لضبط الشدة دون الحاجة إلى وصول white-box للأوزان.
Cloudflare/clef-flash: نموذج قرار متعدد الوسائط بحجم 9B يعيد احتمالات منظمة في تمريرة أمامية واحدة
أصدرت Cloudflare نموذج clef-flash، وهو نموذج متعدد الوسائط بحجم 9B دُرِّب لاحقًا من Qwen/Qwen3.5-9B، يحوّل حالة ومخططًا لأسئلة محددة النوع إلى قرارات، ويعيد احتمالًا لكل خيار مسموح لكل سؤال في تمريرة أمامية واحدة دون توليد نص حر.
- دُرِّب لاحقًا من Qwen/Qwen3.5-9B مع مُرمِّز الرؤية الخاص به، ومخزَّن بصيغة safetensors مجزأة قياسية.
- يقرأ الحالة كنص أو JSON أو صور أو فيديو، ويُخرج logit واحدًا لكل خيار مسموح لكل سؤال، مع تطبيق softmax لكل سؤال للحصول على الاحتمالات.
- صدر تحت رخصة Apache-2.0، تبعًا للنموذج الأساسي Qwen/Qwen3.5-9B.
- اختُبر باستخدام torch 2.11 وtransformers 5.10.2 على وحدة H200 واحدة؛ كما تحتاج مدخلات الصور والفيديو إلى pillow.
لمن يبني حلول الذكاء الاصطناعي ويحتاج إلى قرارات منظمة بدلًا من التوليد الحر، يوفّر clef-flash مخرجات احتمالية بحجم 9B في تمريرة أمامية واحدة تتصل مباشرة بواجهة Jev/SystemOne.
Qwen تفتح المصدر Qwen-Image-2.1: نموذج موحّد بحجم 7B لتوليد الصور من النص وتحريرها
أطلقت Qwen نموذج Qwen-Image-2.1 مفتوح المصدر، وهو نموذج موحّد لتوليد الصور من النص وتحرير الصور، إذ يضم مكوّن التوليد البصري 7B معامل موزعة على 32 طبقة Single-Stream DiT.
- يضم مكوّن التوليد البصري 7B معامل موزعة على 32 طبقة Single-Stream DiT.
- يدعم النموذج حتى 10 صور مرجعية وتحريرات موضعية تُحدَّد بدوائر أو تعليقات مرسومة أو أقنعة منفصلة.
- تشمل نسب الأبعاد المدعومة 1:1 و4:3 و3:4 و3:2 و2:3 و16:9 و9:16، مع أمثلة تصل إلى 2752×1536.
- النموذج مرخّص بموجب Qwen Research License Agreement وسجّل 90,003 عملية تنزيل الشهر الماضي.
لأن نموذجًا واحدًا يغطي توليد الصور من النص وتوليد الطبقات الشفافة والتحرير بمراجع متعددة، يمكن للفرق تقليل عدد النماذج المجمّعة في مسار العمل الإبداعي.