AI FRONTIER
Signals worth understanding before they become obvious.
Diffusion Controller hợp nhất và đơn giản hóa việc tạo ảnh AI như thế nào
Google Research giới thiệu Diffusion Controller, một mạng "giảm xóc lái" nhẹ tái định hình quá trình khử nhiễu thành bài toán điều khiển liên tục, cải thiện độ khớp với prompt và chất lượng ảnh mà không thay đổi mô hình nền đã đóng băng.
- Bài báo đánh giá khung này trên backbone Stable Diffusion v1.4 qua ba chế độ tinh chỉnh: SFT, reward-weighted loss (RWL) và PPO, đo mức khớp với prompt và lựa chọn thẩm mỹ bằng HPS-v2.
- Ở các nhánh SFT và RWL, mạng giảm xóc lái Diffusion Controller dạng gray-box vượt LoRA về tỷ lệ thắng HPS-v2, trong khi thay đổi ít lớp nội bộ của mô hình hơn đáng kể so với LoRA.
- Bài báo báo cáo phiên bản mở hoàn toàn, có quyền truy cập white-box để thay đổi trọng số nội bộ, đạt tỷ lệ thắng 90% so với mô hình cơ sở.
- Khung này triển khai bốn cấu trúc mạng: Diffusion Controller, Diffusion Controller-Naive, Diffusion Controller-J và Diffusion Controller-S.
Với nhà phát triển, điều này nghĩa là có thể điều khiển tinh vi các mô hình ảnh mã đóng mà không cần truy cập white-box, với lớp điều khiển tách khỏi lõi mô hình nên có thể mở rộng sang cá nhân hóa, an toàn và tạo video.
Kết nối tác nhân LLM và không gian dữ liệu: trung gian kiến trúc qua Model Context Protocol
Bài báo trình bày cách tiếp cận trung gian kiến trúc dựa trên Model Context Protocol (MCP), được triển khai qua Eunomia Agent, nhằm cho phép tương tác có kiểm soát giữa tác nhân LLM và các dịch vụ không gian dữ liệu. Một nguyên mẫu đã kiểm chứng tương tác đầu-cuối gồm khám phá danh mục, truy xuất siêu dữ liệu và gọi dị...
- Được gửi lên arXiv ngày 24 tháng 9 năm 2026 với mã arXiv:2609.30341, thuộc phân loại cs.AI và cs.DB.
- Lớp trung gian chuyển đổi năng lực của không gian dữ liệu thành các công cụ có cấu trúc, dựa trên lược đồ để tác nhân AI có thể khám phá và gọi, đồng thời giữ nguyên các ràng buộc quản trị.
- Bản triển khai nguyên mẫu kiểm chứng tương tác đầu-cuối gồm khám phá danh mục, truy xuất siêu dữ liệu và gọi dịch vụ dữ liệu mà không sửa đổi các thành phần không gian dữ liệu hiện có.
- Các tác giả là Jaime Alonso Ruiz, Carlos Aparicio, Gabriel Huecas, Joaquín Salvachúa và Andres Munoz-Arcentales.
Với các nhóm xây dựng tác nhân AI, công trình này cho thấy MCP có thể đóng vai trò lớp trung gian kết nối tác nhân tới không gian dữ liệu có quản trị mà không cần thay đổi hạ tầng dữ liệu hiện có.
HybridInfer: Định tuyến tầng bằng học tăng cường nhận biết nhiệt cho suy luận LLM trên thiết bị, biên và đám mây
HybridInfer là một bộ định tuyến học tăng cường nhận biết nhiệt cho hệ thống ba tầng (Llama 3.2 3B trên thiết bị, Llama 3.1 8B ở biên có truy xuất, GPT-4o trên đám mây), dùng phần dư nhiệt của điện thoại và ước lượng độ phức tạp truy vấn làm trạng thái và chọn tầng bằng chính sách Q-learning được huấn luyện ngoại tuyến...
- Bài báo báo cáo rằng các điều kiện luôn chạy trên thiết bị ngang bằng chất lượng mỗi truy vấn trên các truy vấn có thể phục vụ nhưng chậm hơn ba đến sáu lần và thất bại trên truy vấn dài.
- Phần thưởng cân bằng chất lượng với độ trễ, chi phí và hình phạt nhiệt, cộng thêm thưởng cục bộ ghi nhận thực thi trên thiết bị; bài báo nêu rằng nếu không có thưởng này, chính sách tối ưu sẽ đẩy mọi truy vấn ra ngoài.
Với triển khai LLM trên thiết bị, giới hạn nhiệt là vấn đề ổn định runtime chứ không chỉ là chậm hơn, nên chính sách định tuyến phải mã hóa trạng thái nhiệt và ưu đãi cục bộ thay vì chỉ tối ưu chất lượng và độ trễ.
XingChen-AGI phát hành TeleOCR, VLM phân tích tài liệu 1,2B tham số
TeleOCR là mô hình thị giác-ngôn ngữ mã nguồn mở với khoảng 1,2B tham số, hợp nhất việc phân tích tài liệu số và tài liệu chụp bằng camera trong một khung thống nhất, đã phát hành trọng số và báo cáo kỹ thuật.
- Thẻ mô hình ghi khoảng 1,2B tham số, giấy phép apache-2.0, hỗ trợ tiếng Trung và tiếng Anh, nền tảng qwen2_5_vl.
- Trên OmniDocBench v1.6, TeleOCR báo cáo Overall 96,87, Text Edit 0,027, Formula CDM 96,36 và Table TEDS 97,05.
- Tại Dr.DocBench Challenge, TeleOCR báo cáo Overall 67,96, cao hơn MinerU 2.5 Pro 62,26 và PaddleOCR-VL 1.6 55,11.
- Thẻ mô hình nêu TeleOCR phân tích bố cục và nội dung tài liệu bị biến dạng mà không cần tiền xử lý làm phẳng hay mô hình hiệu chỉnh riêng.
Với người xây dựng pipeline phân tích tài liệu, TeleOCR báo cáo kết quả dẫn đầu trên nhiều benchmark công khai với khoảng 1,2B tham số và cung cấp trọng số cùng bản chuyển đổi GGUF, phù hợp làm lựa chọn tự lưu trữ nhẹ.
Qwen mở mã nguồn Qwen-Image-2.1: mô hình hợp nhất 7B cho tạo ảnh từ văn bản và chỉnh sửa ảnh
Qwen đã mở mã nguồn Qwen-Image-2.1, một mô hình hợp nhất cho tạo ảnh từ văn bản và chỉnh sửa ảnh, với thành phần tạo hình ảnh có 7B tham số trên 32 lớp Single-Stream DiT và hỗ trợ tạo cùng chỉnh sửa trong suốt (RGBA) gốc.
- Thành phần tạo hình ảnh có 7B tham số trên 32 lớp Single-Stream DiT.
- Mô hình hỗ trợ tối đa 10 ảnh tham chiếu và chỉnh sửa cục bộ được chỉ định bằng vòng tròn, chú thích vẽ tay hoặc mặt nạ riêng.
- Các tỷ lệ khung hình được hỗ trợ gồm 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 và 9:16, với độ phân giải ví dụ lên tới 2752×1536.
- Mô hình được cấp phép theo Qwen Research License Agreement, và trang mô hình báo cáo 64.362 lượt tải xuống trong tháng trước.
Vì một mô hình 7B duy nhất bao quát tạo ảnh từ văn bản, tạo lớp trong suốt RGBA và chỉnh sửa nhiều ảnh tham chiếu, nhà phát triển có thể tránh triển khai các mô hình riêng cho tạo và chỉnh sửa.
Hướng dẫn ban đầu cho hồ sơ an toàn trong huấn luyện AI tiên phong
OpenAI công bố hướng dẫn ban đầu về hồ sơ an toàn trong huấn luyện AI tiên phong, bao gồm biện pháp bảo vệ kỹ thuật, thực hành vận hành và điều tra các sự cố lệch hướng.
- Hướng dẫn bao gồm biện pháp bảo vệ kỹ thuật, thực hành vận hành và điều tra các sự cố lệch hướng.
- Đây được trình bày là hướng dẫn ban đầu, không phải tiêu chuẩn đã hoàn thiện.
Các nhóm huấn luyện mô hình tiên phong có thể dùng ba lĩnh vực này làm cấu trúc khởi đầu cho tài liệu hồ sơ an toàn nội bộ của họ.
TaichuAI công bố ZDTaichu5.0-9B, mô hình nền tảng đa phương thức cho suy luận không gian và sử dụng công cụ dạng tác tử
ZDTaichu5.0-9B là mô hình nền tảng đa phương thức của TaichuAI, kết hợp xương sống ngôn ngữ Qwen3.5-9B với bộ mã hóa thị giác C-RADIOv4-H, hỗ trợ văn bản, hình ảnh và video ở mọi độ phân giải, hướng tới hiểu thị giác tổng quát, suy luận không gian, sử dụng công cụ dạng tác tử và nghiên cứu AI hiện thân.
- Mô hình có 9,8B tham số, kiểu tensor BF16 và độ dài ngữ cảnh lên tới 128K tokens.
- Thẻ mô hình báo cáo điểm 87,7 trên TAU2-Bench, 71,4 trên Claw-Eval và 93,7 trên IFEval.
- Thẻ mô hình báo cáo điểm 48 trên ERQA và 56 trên RoboSpatial.
- Trọng số được phát hành theo NVIDIA Open Model License Agreement, đồng thời giữ lại giấy phép Apache-2.0 của Qwen3.5.
Với người xây dựng tác tử thị giác hoặc pipeline AI hiện thân, mô hình này cung cấp suy luận không gian và gọi công cụ ở quy mô 10B, nhưng việc thực thi công cụ vẫn phải do ứng dụng xung quanh triển khai, kiểm chứng và bảo đảm an toàn.