AI FRONTIER
Signals worth understanding before they become obvious.
Diffusion Controller dari Google Research menyatukan dan menyederhanakan kendali pembuatan gambar AI
Google Research memperkenalkan Diffusion Controller, jaringan "steering damper" ringan yang memperlakukan proses denoising difusi sebagai masalah kendali kontinu, meningkatkan keselarasan prompt dan kualitas gambar tanpa mengubah model dasar.
- Pada jalur SFT dan RWL, jaringan steering damper Diffusion Controller mode gray-box mengungguli LoRA dalam tingkat kemenangan HPS-v2, sekaligus memanipulasi jauh lebih sedikit lapisan internal model.
- Makalah melaporkan versi yang sepenuhnya terbuka (white-box, dengan akses tanpa batas untuk mengubah bobot internal) mencapai tingkat kemenangan 90% terhadap model baseline.
- Jaringan ini dapat dipasang pada model closed-source dengan akses terbatas dan memungkinkan penyesuaian satu parameter kekuatan guidance saat inferensi untuk menaikkan atau menurunkan intensitas kendali.
Bagi para pembangun, ini berarti model gambar closed-source dapat diarahkan ke preferensi baru dengan add-on ringan yang intensitasnya dapat diatur, tanpa akses bobot white-box.
Cloudflare/clef-flash: model keputusan multimodal 9B yang mengembalikan probabilitas terstruktur dalam satu forward pass
Cloudflare merilis clef-flash, model multimodal 9B yang dilatih lanjut dari Qwen/Qwen3.5-9B dan mengubah suatu state serta skema pertanyaan bertipe menjadi keputusan, mengembalikan probabilitas untuk setiap opsi yang diizinkan pada setiap pertanyaan dalam satu forward pass tanpa menghasilkan teks bebas.
- Dilatih lanjut dari Qwen/Qwen3.5-9B beserta encoder visinya, disimpan sebagai safetensors ter-shard standar.
- Membaca state sebagai teks, JSON, gambar, atau video dan mengeluarkan satu logit per opsi yang diizinkan per pertanyaan, dengan softmax per pertanyaan untuk memperoleh probabilitas.
- Dirilis di bawah lisensi Apache-2.0, mengikuti model dasar Qwen/Qwen3.5-9B.
- Diuji dengan torch 2.11 dan transformers 5.10.2 pada satu H200; input gambar dan video juga memerlukan pillow.
Bagi pengembang AI yang membutuhkan keputusan terstruktur alih-alih generasi bebas, clef-flash menawarkan keluaran probabilitas 9B dalam satu forward pass yang langsung terhubung ke API Jev/SystemOne.
Qwen merilis Qwen-Image-2.1 sebagai open source: model terpadu 7B untuk text-to-image dan editing
Qwen merilis Qwen-Image-2.1 sebagai open source, model terpadu untuk pembuatan text-to-image dan pengeditan gambar yang komponen generasi visualnya memiliki 7B parameter pada 32 lapisan Single-Stream DiT.
- Komponen generasi visual memiliki 7B parameter pada 32 lapisan Single-Stream DiT.
- Model mendukung hingga 10 gambar referensi dan pengeditan lokal yang ditentukan lewat lingkaran, anotasi lukis, atau mask terpisah.
- Rasio yang didukung mencakup 1:1, 4:3, 3:4, 3:2, 2:3, 16:9, dan 9:16, dengan contoh hingga 2752×1536.
- Model berlisensi Qwen Research License Agreement dan mencatat 90.003 unduhan bulan lalu.
Karena satu model menangani text-to-image, pembuatan lapisan transparan, dan pengeditan multi-referensi, tim dapat mengurangi jumlah model yang dirangkai dalam pipeline kreatif.