Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-05
01
watchresearchnew architecture

Diffusion Controller của Google Research hợp nhất và đơn giản hóa việc điều khiển tạo ảnh AI

Google Research giới thiệu Diffusion Controller, một mạng "giảm xóc lái" nhẹ coi quá trình khử nhiễu của diffusion như một bài toán điều khiển liên tục, cải thiện độ khớp với prompt và chất lượng ảnh mà không sửa đổi mô hình nền.

  • Được đánh giá trên backbone Stable Diffusion v1.4 qua ba chế độ tinh chỉnh: SFT, reward-weighted loss (RWL) và PPO, dùng Human Preference Score (HPS-v2) để đo mức khớp với prompt và lựa chọn thẩm mỹ.
  • Ở các nhánh SFT và RWL, mạng giảm xóc lái Diffusion Controller chế độ gray-box vượt LoRA về tỷ lệ thắng HPS-v2, đồng thời chỉ can thiệp vào ít lớp nội bộ của mô hình hơn nhiều.
  • Bài báo báo cáo phiên bản mở hoàn toàn (white-box, có quyền truy cập không hạn chế để thay đổi trọng số nội bộ) đạt tỷ lệ thắng 90% so với mô hình cơ sở.
  • Mạng này gắn được vào các mô hình mã đóng bị hạn chế truy cập và cho phép điều chỉnh một tham số cường độ guidance duy nhất lúc suy luận để tăng hoặc giảm mức ràng buộc điều khiển.

Với nhà phát triển, điều này nghĩa là mô hình ảnh mã đóng có thể được lái theo sở thích mới bằng một add-on nhẹ, điều chỉnh được cường độ, mà không cần truy cập trọng số white-box.

Google Research
02
testmodelsopen source unlock

Cloudflare/clef-flash: mô hình quyết định đa phương thức 9B trả về xác suất có cấu trúc trong một lượt lan truyền tiến

Cloudflare đã phát hành clef-flash, một mô hình đa phương thức 9B được huấn luyện hậu kỳ từ Qwen/Qwen3.5-9B, chuyển một trạng thái và một lược đồ câu hỏi có kiểu thành các quyết định, trả về xác suất cho mọi lựa chọn được phép của mọi câu hỏi trong một lượt lan truyền tiến duy nhất và không sinh văn bản tự do.

  • Được huấn luyện hậu kỳ từ Qwen/Qwen3.5-9B cùng bộ mã hóa thị giác của nó, lưu dưới dạng safetensors phân mảnh tiêu chuẩn.
  • Đọc trạng thái dưới dạng văn bản, JSON, hình ảnh hoặc video và xuất một logit cho mỗi lựa chọn được phép của mỗi câu hỏi, áp dụng softmax theo từng câu hỏi để có xác suất.
  • Phát hành theo giấy phép Apache-2.0, theo mô hình cơ sở Qwen/Qwen3.5-9B.
  • Được thử nghiệm với torch 2.11 và transformers 5.10.2 trên một H200 duy nhất; đầu vào hình ảnh và video cũng cần pillow.

Với các nhà phát triển AI cần quyết định có cấu trúc thay vì sinh tự do, clef-flash cung cấp đầu ra xác suất 9B trong một lượt lan truyền tiến, kết nối trực tiếp với API Jev/SystemOne.

Hugging Face Trending
03
testcreativeincremental

Qwen mở mã nguồn Qwen-Image-2.1: mô hình 7B hợp nhất cho text-to-image và chỉnh sửa ảnh

Qwen đã mở mã nguồn Qwen-Image-2.1, một mô hình hợp nhất cho tạo ảnh từ văn bản và chỉnh sửa ảnh, với thành phần tạo hình ảnh có 7B tham số trên 32 lớp Single-Stream DiT.

  • Thành phần tạo hình ảnh có 7B tham số trên 32 lớp Single-Stream DiT.
  • Mô hình hỗ trợ tối đa 10 ảnh tham chiếu và chỉnh sửa cục bộ được chỉ định bằng vòng tròn, chú thích vẽ hoặc mặt nạ riêng.
  • Các tỷ lệ được hỗ trợ gồm 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 và 9:16, với ví dụ lên tới 2752×1536.
  • Mô hình dùng giấy phép Qwen Research License Agreement và đạt 90.003 lượt tải trong tháng trước.

Vì một mô hình đảm nhiệm text-to-image, tạo lớp trong suốt và chỉnh sửa nhiều ảnh tham chiếu, các nhóm có thể giảm số mô hình phải ghép trong pipeline sáng tạo.

Hugging Face Trending