AI FRONTIER
Signals worth understanding before they become obvious.
Gemini 4 Argon: kỷ nguyên mới về trí tuệ tiên phong của Google DeepMind
Google DeepMind công bố Gemini 4 Argon, mô hình tiên phong cho các quy trình dài hạn, nâng giới hạn token đầu ra từ 64K lên 1 triệu và đang được triển khai cho các chuyên gia phòng thủ mạng đáng tin cậy qua Fairwind Program.
- Giới hạn token đầu ra được mở rộng từ 64K lên 1 triệu token, được Google mô tả là dẫn đầu ngành.
- Thiết lập trạng thái tiên tiến mới trên DeepSWE v1.1 với 77,9%, một benchmark cho các tác vụ kỹ thuật phần mềm dài hạn trong thực tế.
- Đứng thứ 1 trên AutomationBench của Zapier với 51,3% và đạt trạng thái tiên tiến trên LVBench về hiểu video dài với 91,7%.
- Đồng hạng nhất trên CWE-bench v1 với 68%; giá giới thiệu 2 USD mỗi triệu token đầu vào và 10 USD mỗi triệu token đầu ra, token đầu vào được lưu đệm giảm 95% so với giá đầu vào.
Với các nhà phát triển, giới hạn 1 triệu token đầu ra và mức giá 2 USD mỗi triệu token đầu vào khiến một quỹ đạo tác nhân dài hạn khả thi về mặt kinh tế, nhưng quyền truy cập hiện chỉ giới hạn cho các chuyên gia phòng thủ mạng đáng tin cậy.
Từ đề xuất đến hiệu ứng đã xác minh: Praxa, harness ràng buộc bằng chứng cho thực thi tác nhân AI có quản trị
Bài báo giới thiệu Praxa, một harness tác nhân biểu diễn tường minh đề xuất, thẩm quyền, điều phối, hiệu ứng bên ngoài đã xác minh và thăng cấp phục vụ thông qua tiếp nhận tất định, thực thi qua trung gian, đọc lại bên ngoài, đối soát và thăng cấp có xét duyệt. Không có làn bằng chứng nào trong bốn làn được báo cáo chứ...
- Ứng viên dùng ít hơn 37,11% token, thấp hơn 33,84% chi phí endpoint ước tính và ít hơn 11,63% bước; bài báo nêu rõ điều này không chứng minh cải thiện chất lượng, độ trễ hay hành vi sản xuất.
Với các nhóm xây dựng tác nhân có quản trị, đóng góp của Praxa là làm cho chuyển tiếp từ thẩm quyền sang hiệu ứng trở nên tường minh và có thể kiểm thử, nhưng bằng chứng hiện tại chỉ hỗ trợ khả năng xác minh kiến trúc, không hỗ trợ triển kh...
Mô hình mới trên OpenRouter: inclusionAI Ling 3.1 Flash
Ling 3.1 Flash là mô hình mixture-of-experts suy luận lai của inclusionAI với 25B tham số hoạt động trên tổng 560B và cửa sổ ngữ cảnh 262.144 token.
- Tổng 560B tham số với 25B tham số hoạt động.
- Cửa sổ ngữ cảnh 262.144 token, hỗ trợ tối đa 32.768 token hoàn thành.
- Chấp nhận tools và tool_choice để gọi hàm, nhưng không hỗ trợ response_format, nên đầu ra JSON không được ép buộc.
- Được niêm yết miễn phí trên OpenRouter, ngày phát hành 2 tháng 10 năm 2026.
Với nhà phát triển, đây là lựa chọn MoE ngữ cảnh dài miễn phí có gọi công cụ, nhưng việc không ép buộc đầu ra có cấu trúc đồng nghĩa độ tin cậy JSON phải được xử lý ở tầng ứng dụng.
DSSR-3D: Suy luận tách rời cho chỉ định phụ thuộc góc nhìn trong Gaussian 3D
DSSR-3D là khung suy luận cho phân đoạn chỉ định phụ thuộc góc nhìn trên trường Gaussian 3D liên tục, được hình thức hóa thành hai giao diện, định vị ngữ nghĩa bất biến tư thế và suy luận không gian điều kiện theo tư thế, không cần huấn luyện lại trường ngữ nghĩa nền.
- Bài báo hình thức hóa khung thành hai giao diện, định vị ngữ nghĩa bất biến tư thế và suy luận không gian điều kiện theo tư thế, sao cho bất kỳ cặp hàm nào thỏa các ràng buộc này đều tạo ra một thể hiện hợp lệ.
- Thể hiện sử dụng cơ chế định vị softmax làm sắc nhiệt độ và hàm chấm điểm hướng dựa trên phép chiếu, được hợp nhất qua một bước nhẹ, không cần huấn luyện.
- Các tác giả đề xuất ViewRef-GS, một benchmark cô lập phân đoạn phụ thuộc góc nhìn trên trường Gaussian 3D, được đánh giá cùng với Ref-LERF mở rộng.
- Bài báo báo cáo mức cải thiện nhất quán so với các phương pháp chỉ định dựa trên 3DGS hiện có, không cần huấn luyện thêm ngoài trường ngữ nghĩa nền.
Với người xây dựng AI, điều này cho thấy chỉ định không gian phụ thuộc góc nhìn có thể được tách rời khi suy luận và chuyển sang các trường ngữ nghĩa khác biệt về cấu trúc mà không cần huấn luyện lại.
FlashDiffusion: Phân rã phổ kernel dạng ô hợp nhất
Bài báo giới thiệu FlashDiffusion, một phương pháp không dùng ma trận, đánh giá các khối kernel Gaussian dày đặc trong các ô GPU hợp nhất và ghép bộ giải trị riêng với β-flow thực nghiệm để chọn thang độ phân giải mẫu hữu hạn.
- Bài báo báo cáo rằng việc hiện thực hóa kernel Gaussian dày đặc cần O(N^2) bộ nhớ.
- Phương pháp đánh giá các khối kernel Gaussian dày đặc trong các ô GPU hợp nhất, tránh hiện thực hóa kernel dày đặc.
- Bộ giải trị riêng được ghép với β-flow thực nghiệm để chọn thang độ phân giải mẫu hữu hạn.
- Việc tiếp nối theo kích thước mẫu và băng thông khởi động nóng các lời giải phổ ngày càng tốn kém từ các độ phân giải thô hơn.
Đối với các nhà xây dựng AI dùng phương pháp kernel trong học hình học, cách tiếp cận dạng ô không dùng ma trận này loại bỏ nút thắt bộ nhớ kernel dày đặc O(N^2), giúp các lời giải phổ lớn hơn trở nên khả thi.
ChainLoRA: Hợp nhất vector tác vụ bảo toàn hình học cho học liên tục trong LLM
ChainLoRA là một khung hợp nhất liên tục không replay, được xây dựng trên hình học vector tác vụ cập nhật theo chuỗi, kết hợp huấn luyện cập nhật theo chuỗi với hợp nhất SVD thích ứng sau luồng. Bài báo báo cáo hiệu năng tiên tiến trong số các phương pháp không replay được đánh giá trên các benchmark Large và SuperNI.
- ChainLoRA kết hợp huấn luyện cập nhật theo chuỗi với hợp nhất SVD thích ứng sau luồng, trong đó khởi tạo và proxy trực giao một phía chỉ sử dụng carrier cuối cùng trong quá trình huấn luyện.
- Tại thời điểm hợp nhất, SVD thích ứng trích xuất một carrier chia sẻ và căn chỉnh nó với tác vụ mới nhất thông qua thích ứng Procrustes.
- Phân tích lý thuyết cho thấy thích ứng Procrustes tạo điều kiện tách gần đúng về mặt hình học giữa các thành phần chia sẻ và thành phần đặc thù theo tác vụ, và proxy một phía tiếp tục giới hạn can nhiễu giữa các tác vụ.
Đối với những người xây dựng pipeline học liên tục, huấn luyện cập nhật theo chuỗi và hợp nhất SVD thích ứng của ChainLoRA mang lại một con đường fine-tuning tiết kiệm tham số, không replay, với dấu vết trạng thái lịch sử và chi phí chính q...
NVIDIA Kumo Tabular thiết lập chuẩn mực mới về độ chính xác và hiệu quả cho dự đoán dạng bảng
NVIDIA phát hành Kumo Tabular, một mô hình nền tảng mở cho phân loại và hồi quy dạng bảng, dự đoán các hàng mới trong một lượt truyền xuôi duy nhất mà không cần huấn luyện, tinh chỉnh hay kỹ thuật đặc trưng, với ba kích thước từ 28M đến 215M tham số theo giấy phép OpenMDW-1.1.
- Kumo Tabular có ba kích thước Small/Medium/Large từ 28M đến 215M tham số và được phát hành theo giấy phép OpenMDW-1.1 cho mục đích thương mại.
- Mô hình đứng đầu bảng xếp hạng TabArena với ELO 1950 và được báo cáo nhanh hơn LimiX-2 17 lần trong thiết lập đánh giá đồng nhất trên một RTX 6000 Pro.
- Trên BeyondArena, mô hình đạt ELO 1418 với điểm Improvability 7,78%, đứng đầu bảng xếp hạng.
- Trên TALENT, mô hình đạt thứ hạng tổng thể cao nhất ở độ chính xác phân loại, log-loss phân loại và RMSE hồi quy, với thứ hạng trung bình lần lượt là 6,67, 3,98 và 4,22.
Đối với nhà phát triển AI, Kumo Tabular mang lại hướng dự đoán dạng bảng không cần huấn luyện theo từng tác vụ, và các con số độ chính xác-hiệu quả được báo cáo cần được kiểm chứng trên dữ liệu hold-out trước khi triển khai.