Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-06
01
watchresearchnew architecture

SCION: Tổng hợp cảnh với các nguyên thủy nơ-ron được thể hiện dưới dạng thực thể

SCION giới thiệu một biểu diễn cảnh tổng hợp phân cấp thay thế các Gaussian 3D độc lập bằng một từ vựng gọn gồm các nguyên thủy tái sử dụng và các thực thể không gian thế giới nhẹ, được khớp với các bản ghi đa góc nhìn thông qua tối ưu hóa đồng thời các tham số cảnh rời rạc và liên tục. Bài báo báo cáo chất lượng cao n...

  • Bài báo đã được chấp nhận tại NeurIPS 2026 và được gửi ngày 1 tháng 10 năm 2026.
  • SCION thay thế hàng triệu Gaussian độc lập mỗi cảnh bằng một từ vựng các nguyên thủy tái sử dụng và các thực thể không gian thế giới.
  • Bài báo báo cáo duy trì chất lượng cao ngay cả ở 1,2 MB.
  • Bài báo báo cáo tỷ lệ méo hóa có lợi so với các phương pháp nén Gaussian hiện có và cho phép chỉnh sửa, hoạt họa ở cấp thực thể mà không cần huấn luyện lại.

Đối với người xây dựng pipeline cảnh 3D, SCION cho thấy mô hình hóa cảnh dưới dạng nguyên thủy tái sử dụng cộng với thực thể có thể mang lại khả năng thao tác cấp thực thể có thể chỉnh sửa và hoạt họa trong biểu diễn gọn khoảng 1,2 MB.

arXiv cs.CV
02
watchresearchbenchmark jump

DeskForge: Giám sát dày đặc từ môi trường máy tính để bàn cho tác nhân sử dụng máy tính

DeskForge là một môi trường máy tính để bàn có thể điều khiển, kết hợp và khám phá các ứng dụng thực để tạo giám sát quy mô lớn, tạo ra DeskForge-1M, một kho ngữ liệu gồm 1,2 triệu quan sát máy tính để bàn được chú thích với 159,7 triệu thực thể phần tử. Bài báo báo cáo việc tinh chỉnh bốn mô hình thị giác-ngôn ngữ trê...

  • DeskForge-1M chứa 1,2 triệu quan sát máy tính để bàn được chú thích với 159,7 triệu thực thể phần tử.
  • Bài báo tinh chỉnh bốn mô hình thị giác-ngôn ngữ trên 200K ví dụ grounding lấy từ DeskForge-1M.
  • Bài báo báo cáo Qwen3.5-4B tăng độ chính xác 11,51 điểm phần trăm trên ScreenSpot-Pro và 10,11 điểm trên OSWorld-G.
  • Bài báo báo cáo rằng dưới một planner cố định, Qwen3.5-4B tăng từ 31 lên 50 trong 119 nhiệm vụ trên WebArena-Infinity và từ 3 lên 15 trong 100 nhiệm vụ trên OpenApps.

Đối với các nhóm xây dựng tác nhân sử dụng máy tính, DeskForge cho thấy việc kết hợp có thể điều khiển các môi trường máy tính để bàn thực có thể mở rộng chú thích phần tử dày đặc và cải thiện cả grounding GUI lẫn hoàn thành nhiệm vụ dài hạ...

arXiv cs.CV
03
testresearchincremental

Rank-Aware Speculative Sampling: Quy tắc xác minh cho cây bản nháp khuếch tán

Bài báo giới thiệu Rank-Aware Speculative Sampling (RASS), một quy tắc xác minh cho cây bản nháp suy đoán dựa trên ghép nối danh sách nhận biết thứ hạng, sắp xếp các ứng viên theo độ dịch chuyển trung bình đề xuất-mục tiêu, lấy mẫu một thứ hạng với trọng số được tối ưu để giảm thiểu tổng biến thiên giữa phân phối đề xu...

  • RASS cải thiện D-GRS, phương pháp tạo K ứng viên độc lập có điều kiện mỗi nút và kiểm tra tuần tự theo thứ tự sinh.
  • RASS được đánh giá trên mục tiêu hỗn hợp Gaussian, sinh không điều kiện trong không gian điểm ảnh trên FFHQ, sinh có điều kiện trên CIFAR-10, và khuếch tán tiềm ẩn với Stable Diffusion 3.5 dùng prompt COCO2014.
  • Hiệu chỉnh phần dư đảm bảo lấy mẫu chính xác cho mọi lựa chọn trọng số thứ hạng.

Với những người xây dựng đang tăng tốc suy luận khuếch tán, RASS cho thấy việc khai thác thứ hạng của các ứng viên bản nháp mà không cần thêm đánh giá mô hình mục tiêu có thể giảm số lần đánh giá mô hình mục tiêu ở ngân sách tính toán tương...

arXiv cs.LG
04
testcreativeincremental

Lightricks phát hành LTX-2.5, mô hình video và âm thanh trọng số mở

Lightricks/LTX-2.5 là mô hình trọng số mở tạo video và âm thanh đồng bộ từ đầu vào văn bản, hình ảnh và video, có thể tự lưu trữ. Mô hình bổ sung khả năng tạo nhiều cảnh gốc, bộ giải mã video khuếch tán, bộ mã hóa văn bản Gemma 4 12B tùy chỉnh và bộ dự đoán thời lượng tùy chọn.

  • Thẻ mô hình ghi 6,48k lượt thích và 1.645.444 lượt tải trong tháng qua.
  • Các checkpoint DiT được ghi nhãn 22b và có các biến thể bf16, Comfy int8+convrot và NVFP4.
  • Bộ mã hóa văn bản là Gemma4 12B kèm phép chiếu, video và âm thanh dùng VAE riêng.
  • Tổ chức có doanh thu năm dưới 10 triệu USD được dùng thương mại miễn phí theo giấy phép cộng đồng LTX-2.x; trên mức đó cần thỏa thuận thương mại trả phí.

Với nhà phát triển, LTX-2.5 cung cấp khả năng tạo âm thanh-video tự lưu trữ dưới dạng gói trọng số tách rời tương thích Comfy với transformer dev có thể huấn luyện, nhưng checkpoint int8 chỉ dành cho ComfyUI.

Hugging Face Trending
05
watchresearchincremental

ReRoute cho phép dự đoán phản thực tế trong các bộ mô phỏng khoa học mà không cần thí nghiệm có kiểm soát

Bài báo giới thiệu ReRoute, một khung cho dự đoán khoa học what-if có mục tiêu, kết hợp dữ liệu thực tế với kiến thức cơ chế một phần và không yêu cầu dữ liệu can thiệp có kiểm soát để thích ứng. ReRoute cố định đầu vào được truy vấn của một backbone đã huấn luyện trước ở một giá trị tham chiếu, đưa lại biến thiên của ...

  • Trên các can thiệp khí hậu ghép nối được giữ lại, ReRoute giảm sai số khí hậu tổng hợp 18,2-31,8% dưới các dịch chuyển phân phối CO2 nghiêm trọng trong khi vẫn duy trì năng lực ở các điều kiện tiêu chuẩn.
  • Bài báo báo cáo rằng ReRoute đạt được các dự đoán phản thực tế có độ chính xác cao trong một hệ thống khuếch tán-bình lưu có kiểm soát, nơi các phản hồi chính xác có sẵn.
  • Bài báo cung cấp một kết quả nhận dạng nhân quả cho cấu trúc này dưới các giả định cấu trúc rõ ràng, với lập luận cốt lõi được kiểm chứng bằng máy trong Lean.

Đối với các nhóm xây dựng bộ mô phỏng khoa học, ReRoute cho thấy dữ liệu thực tế cộng với kiến thức cơ chế một phần có thể cải thiện dự đoán phản thực tế dưới dịch chuyển phân phối mà không cần tạo dữ liệu mô phỏng có kiểm soát tốn kém.

arXiv cs.LG
06
watchagentsnew architecture

DeReAct: Suy luận và hành động phân rã cho các tác nhân AI đáng tin cậy

DeReAct là một kiến trúc tác nhân mô-đun, đưa ra bên ngoài hai chính sách gating: Critic xác thực các hành động được đề xuất trước khi thực thi, và Context Manager tái tạo State được môi trường hỗ trợ và chứng nhận hoàn thành nhiệm vụ. Bài báo báo cáo rằng trên GAIA và SWE-bench Verified, DeReAct cải thiện Pass@1 nhiều...

  • Bài báo báo cáo mức tăng Pass@1 từ 6,5 đến 7,0 điểm đối với Qwen3-Coder-480B.
  • Bài báo báo cáo mức tăng Pass@1 từ 4,2 đến 5,2 điểm đối với Claude Sonnet 4.5.
  • Với Claude Opus 4.5, Pass@1 vẫn tương đương ReAct, trong khi DeReAct tạo ra các quỹ đạo đầy đủ bằng chứng hơn và thỏa mãn ràng buộc hơn.
  • Bài báo nêu rằng gating bên ngoài có hiệu quả khi các thất bại mục tiêu đủ phổ biến và bản thân chính sách gating là đủ.

Đối với người xây dựng tác nhân, tách xác thực hành động và chứng nhận hoàn thành khỏi một chính sách duy nhất có thể nâng cao độ tin cậy cho các mô hình yếu hơn mà không cần thay mô hình Brain nền tảng.

arXiv cs.AI
07
testmodelsopen source unlock

Cloudflare phát hành Clef: mô hình quyết định đa phương thức 27B trả về xác suất có cấu trúc trong một lượt lan truyền tiến

Cloudflare đã phát hành Clef, một mô hình đa phương thức được huấn luyện hậu kỳ từ Qwen/Qwen3.8-27B, chuyển một trạng thái và một lược đồ câu hỏi có kiểu thành các quyết định, trả về xác suất cho mọi lựa chọn được phép của mọi câu hỏi mà không cần sinh văn bản tự do hay phân tích đầu ra.

  • 27B tham số, BF16, lưu dưới dạng safetensors phân mảnh tiêu chuẩn, phát hành theo giấy phép Apache-2.0.
  • Nhận văn bản, JSON, hình ảnh hoặc video làm trạng thái và xuất một logit cho mỗi lựa chọn được phép của mỗi câu hỏi, với softmax theo từng câu hỏi để có xác suất.
  • Được thử nghiệm với torch 2.11 và transformers 5.10.2 trên một H200 duy nhất; đầu vào hình ảnh và video cũng cần pillow.
  • Trong lần chạy Decision Index 0.2.1 nội bộ, độ chính xác khớp chính xác theo ca của BFCL là 98,5, macro-F1 của BANKING77 là 94,2, độ trễ trung vị là 209,3 ms và độ trễ p95 là 238,6 ms.

Đối với các nhà phát triển AI cần quyết định có cấu trúc thay vì văn bản tự do, Clef mang đến lựa chọn đa phương thức 27B với API tương thích Jev/SystemOne, dù độ trễ cao hơn các biến thể nhỏ hơn như Clef-flash.

Hugging Face Trending
08
watchresearchbenchmark jump

EditHero: Benchmark cho chỉnh sửa 3D cấp bộ phận trong dài hạn và Vibe Modeling

Bài báo giới thiệu EditHero, được các tác giả mô tả là benchmark đầu tiên cho chỉnh sửa 3D cấp bộ phận trong dài hạn, với hướng dẫn bằng ngôn ngữ tự nhiên và ảnh mục tiêu cho cả hình học lẫn kết cấu. Một engine lắp ráp tất định tạo ra mục tiêu chính xác sau mỗi lần chỉnh sửa, và mọi chuỗi đều được rà soát thủ công.

  • Bài báo mô tả EditHero là, theo hiểu biết của các tác giả, benchmark đầu tiên cho chỉnh sửa 3D cấp bộ phận trong dài hạn, với hướng dẫn bằng ngôn ngữ tự nhiên và ảnh mục tiêu cho cả hình học lẫn kết cấu.
  • Một engine lắp ráp tất định tạo ra mục tiêu chính xác sau mỗi lần chỉnh sửa, và mọi chuỗi đều được rà soát thủ công.
  • Các phương pháp không dùng tác tử hoạt động từ trên xuống, tái tạo đối tượng từ biểu diễn 3D đã học, và thường bỏ sót thay đổi được yêu cầu cũng như làm xáo trộn những vùng lẽ ra phải giữ nguyên.

Benchmark này chuyển trọng tâm đánh giá từ chỉnh sửa đơn lẻ sang việc các sửa đổi nhiều bước có chỉ thay đổi đúng phần được yêu cầu hay không, mang lại cho người xây dựng pipeline chỉnh sửa 3D lặp lại một mục tiêu so sánh có thể tái lập.

arXiv cs.CV