AI FRONTIER
Signals worth understanding before they become obvious.
Google công bố RRSI, cho phép “harness” của agent tự cải thiện mà không cần huấn luyện lại mô hình
Các nhà nghiên cứu của Google Cloud AI Research cùng Đại học Stanford và Đại học Washington đã công bố khung RRSI, liên tục chỉnh sửa harness bao quanh một mô hình, gồm prompt, cách dùng công cụ, luồng điều khiển, quản lý bộ nhớ và ngữ cảnh, mô-đun kỹ năng và sub-agent, mà không thay đổi trọng số mô hình.
- Trên tám benchmark, Terminal-Bench 2.1 tăng từ 74,2% lên 80,2%, tức tăng 6,0 điểm phần trăm, và SWE-Bench Verified tăng từ 82,0% lên 83,8%, tức tăng 1,8 điểm phần trăm.
- JobBench tăng từ 36,0% lên 40,7%, tức tăng 4,7 điểm phần trăm; GDPval tăng từ 48,8% lên 52,3%, tức tăng 3,5 điểm phần trăm; Frontier-Eng tăng từ 17,7% lên 22,0%, tức tăng 4,3 điểm phần trăm.
- Trong một thí nghiệm riêng dùng Gemini 3.5 Flash làm mô hình nền, Terminal-Bench 2.1 tăng từ 64,6% lên 78,7%, tức tăng 14,1 điểm phần trăm, và SWE-Bench Verified tăng từ 76,8% lên 79,0%, tức tăng 2,2 điểm phần trăm.
- RRSI được công bố như một khung nghiên cứu trên GitHub, với mã nguồn theo giấy phép Apache 2.0.
Với các nhóm xây dựng agent, RRSI cho thấy tìm kiếm lặp có kiểm soát trên harness, khi giữ nguyên trọng số mô hình, có thể mang lại mức cải thiện benchmark đo được và giảm chi phí token.
OpenAI ra mắt GPT-6.1 Sol
OpenAI ra mắt GPT-6.1 Sol cho lập trình, sử dụng máy tính và công việc chuyên môn, với trí tuệ được công bố là gần bằng Astra ở mức một phần năm giá token đầu vào và đầu ra của API tiêu chuẩn Astra.
- OpenAI cho biết GPT-6.1 Sol có trí tuệ gần bằng Astra.
- Các mục đích sử dụng là lập trình, sử dụng máy tính và công việc chuyên môn.
- Giá token đầu vào và đầu ra của API tiêu chuẩn bằng một phần năm giá của Astra.
Với nhà phát triển AI, trí tuệ gần bằng Astra ở mức một phần năm giá mỗi token giúp giảm chi phí suy luận trên các khối lượng công việc lập trình và sử dụng máy tính.
prism-ml phát hành Ternary-Bonsai-2-27B-gguf: mô hình 27B trọng số ternary chạy từ 5,95 GB
prism-ml đã công bố Ternary-Bonsai-2-27B-gguf trên Hugging Face, lượng tử hóa embeddings, phép chiếu attention, phép chiếu MLP và LM head của Qwen3.8-27B thành trọng số ternary (g128, {−1,0,+1} với chia tỷ lệ theo nhóm FP16), cùng hai gói GGUF là PTQ1_0 và PQ2_0 cho llama.cpp trên CUDA, Metal và CPU.
- Kích thước mô hình ngôn ngữ là 5,95 GB (PTQ1_0) hoặc 7,21 GB (PQ2_0), nhỏ hơn khoảng 9,0x và 7,5x so với mốc FP16 khoảng 54 GB; định dạng ternary lý tưởng là 1,72 bit/trọng số ở 5,8 GB.
- Bài báo báo cáo trung bình 84,78 trên 14 benchmark chế độ thinking, bằng 98,2% mốc FP16 (86,32), so với 72,59 của IQ2_XXS (7,27 GB) và 85,18 của UD-Q4_K_XL (17,6 GB).
- Bài báo báo cáo 95,83 trên AIME26 và 90,07 trên LiveCodeBench, nơi IQ2_XXS đạt 57,5 và 56,4; toán 96,57, lập trình 89,42, gọi công cụ BFCL v3 74,92.
- Độ dài ngữ cảnh là 262K token trên backbone attention lai với khoảng 75% linear attention; vision tower là gói mmproj Q8_0 riêng (0,63 GB) chỉ nạp khi có đầu vào hình ảnh.
Với các nhóm triển khai suy luận cấp 27B trên một GPU hoặc laptop, điều này cho thấy lượng tử hóa ternary toàn bộ có thể giữ điểm suy luận và gọi công cụ gần mức FP16 ở khoảng 6 GB, nhưng chỉ khi có kernel chuyên dụng và runtime fork.
Hướng tới truy xuất không gian tương tác cho tìm kiếm tác tử: RISE xây dựng không gian có biên bằng BM25
Bài báo đề xuất RISE (Retrieving Interaction SpacE), dùng BM25 để xây dựng một tập con có biên của kho ngữ liệu mà tác tử có thể khám phá và xử lý tài liệu của nó trong lúc lập chỉ mục để điều hướng kiểu shell. Trên BrowseComp-Plus, RISE đạt độ chính xác 78% với gpt-5.4-mini, ngang bằng đường cơ sở DCI thuần shell với ...
- Bài báo báo cáo rằng trên BrowseComp-Plus, RISE đạt độ chính xác 78% với gpt-5.4-mini, ngang bằng đường cơ sở DCI thuần shell với chi phí mỗi truy vấn khoảng một phần tư.
- Bài báo báo cáo rằng ở quy mô 1 triệu tài liệu, RISE-BM25 đạt 81% với gpt-5.4-mini.
- Bài báo báo cáo rằng ở cùng quy mô 1 triệu tài liệu, DCI với gpt-5.4-nano giảm xuống 60%, với 33 trong 100 lần thất bại theo thời gian thực.
- Bài báo lập luận rằng tương tác không giới hạn không mở rộng được: mỗi lệnh shell rộng là một lần quét toàn bộ kho ngữ liệu và độ trễ suy giảm mạnh khi kho ngữ liệu lớn lên.
Với các nhóm xây dựng tác tử tìm kiếm, kết quả này cho thấy truy xuất nên giới hạn không gian tương tác thay vì chỉ chọn tài liệu vừa cửa sổ ngữ cảnh, nhờ đó kiểm soát chi phí và độ trễ khi kho ngữ liệu lớn lên.
Diffusion Controller thống nhất và đơn giản hóa việc tạo ảnh AI
Google Research giới thiệu Diffusion Controller, một mạng "giảm xóc lái" nhẹ điều chỉnh động quỹ đạo khử nhiễu trong khi mô hình nền vẫn bị đóng băng, cải thiện mức độ khớp với prompt và chất lượng ảnh.
- Được đánh giá trên backbone Stable Diffusion v1.4 qua ba chế độ tinh chỉnh: SFT, reward-weighted loss (RWL) và PPO.
- Ở các nhánh SFT và RWL, Diffusion Controller hộp xám vượt LoRA về tỷ lệ thắng HPS-v2 trong khi thao tác ít lớp nội bộ của mô hình hơn đáng kể.
- Phiên bản hộp trắng được mở hoàn toàn đạt tỷ lệ thắng 90% so với mô hình cơ sở.
- Một tham số cường độ dẫn hướng tại thời điểm suy luận cho phép điều chỉnh động cường độ ràng buộc điều khiển.
Với nhà phát triển, đây là hướng nhẹ để tạo ảnh có thể điều khiển và cá nhân hóa mà không cần truy cập trọng số mô hình đóng.
Google DeepMind ra mắt SynthID Bio để gắn watermark cho protein do AI tạo ra
Google DeepMind đã công bố SynthID Bio, một nhóm phương pháp gắn watermark cho sinh học tổng hợp, nhúng dấu hiệu có thể phát hiện vào trình tự axit amin và cấu trúc 3D do AlphaFold 3 dự đoán, đồng thời duy trì chức năng sinh học trong thử nghiệm phòng thí nghiệm.
- SynthID Bio tinh chỉnh một phần nhỏ mạng khuếch tán của AlphaFold 3, đưa watermark vào trọng số mô hình để tọa độ 3D dự đoán vốn đã mang dấu hiệu có thể phát hiện.
- Công trình báo cáo rằng SynthID Bio giữ nguyên độ chính xác dự đoán của AlphaFold 3 đồng thời cho khả năng phát hiện gần như hoàn hảo và chống chịu nhiễu kỹ thuật số hoặc thay đổi tọa độ nhỏ.
- Google DeepMind cho biết sẽ công bố bài báo phương pháp, mở mã nguồn và dữ liệu in vitro, đồng thời phát hành trọng số cho cộng đồng nghiên cứu.
Với nhà phát triển công cụ thiết kế sinh học, việc nhúng watermark trực tiếp vào trọng số mô hình và quá trình tạo trình tự mang lại lớp xác minh tự động cho sàng lọc tổng hợp DNA và nguồn gốc cơ sở dữ liệu, nhưng độ bền trước sự can thiệp ...