AI FRONTIER
Signals worth understanding before they become obvious.
EmbeddingGemma 2: mô hình embedding đa phương thức mở, nhẹ
Google DeepMind đã phát hành EmbeddingGemma 2, mô hình 740 triệu tham số dựa trên kiến trúc Gemma 4 theo giấy phép Apache 2.0, ánh xạ gốc văn bản, hình ảnh, âm thanh và video vào một không gian embedding thống nhất.
- 740 triệu tham số, dựa trên kiến trúc Gemma 4 và phát hành theo giấy phép Apache 2.0 cho phép sử dụng thương mại.
- Chỉ cần 270M tham số cho khối lượng công việc chỉ văn bản, với bộ mã hóa thị giác (170M) và âm thanh (300M) tùy chọn.
- Báo cáo cải thiện 9,92 điểm về hiệu suất mã trong MTEB Code, từ 68,76 lên 78,68.
- Matryoshka Representation Learning cho phép cắt ngắn vectơ đầu ra từ 768 chiều xuống 512, 256 hoặc 128, giảm lưu trữ tới 6x.
Nhà phát triển có thể chạy tìm kiếm đa phương thức và pipeline RAG hoàn toàn trên thiết bị, cân bằng bộ nhớ và lưu trữ qua bộ mã hóa mô-đun và cắt ngắn MRL.
Hướng tới truy xuất không gian tương tác cho tìm kiếm tác tử: RISE
Bài báo đề xuất RISE (Retrieving Interaction SpacE), dùng BM25 để xây dựng không gian tương tác có giới hạn và xử lý tài liệu của nó trong quá trình lập chỉ mục cho điều hướng kiểu shell, thay thế tương tác trực tiếp không giới hạn với kho ngữ liệu.
- Trên BrowseComp-Plus, RISE đạt độ chính xác 78% với gpt-5.4-mini, ngang bằng đường cơ sở DCI thuần shell với chi phí mỗi truy vấn khoảng một phần tư.
- Ở 1 triệu tài liệu, RISE-BM25 đạt 81% với gpt-5.4-mini.
- Ở cùng quy mô, DCI với gpt-5.4-nano giảm xuống 60%, với 33 trong 100 lần thất bại theo thời gian thực.
- Bài báo lập luận tương tác không giới hạn không mở rộng được: mỗi lệnh shell rộng là một lần quét toàn bộ kho ngữ liệu, và độ trễ suy giảm mạnh khi kho ngữ liệu lớn lên.
Với các nhóm xây dựng tác tử tìm kiếm, vai trò của truy xuất chuyển từ chọn tài liệu sang xác định ranh giới có thể khám phá, điều quyết định trực tiếp chi phí và độ tin cậy ở quy mô kho ngữ liệu lớn.
AutoSynthData: Tạo dữ liệu huấn luyện cho agent doanh nghiệp
ServiceNow CoreAI đã phát hành AutoSynthData, công cụ dùng thất bại của mô hình mục tiêu và thành công của giáo viên mạnh hơn để xác định khoảng trống năng lực, rồi tạo và kiểm chứng các tác vụ thực thi mới cho hậu huấn luyện.
- Trong miền Hybrid của EnterpriseOps Gym, với Gemma-4-26B-A4B-it làm mô hình mục tiêu và Qwen3.8-27B làm giáo viên, AutoSynthData tạo 2.000 mẫu huấn luyện tổng hợp trong khoảng 18 giờ.
- Checkpoint Hybrid tốt nhất là epoch 5, cải thiện Pass@1 trung bình 7,2 điểm phần trăm, tức cải thiện tương đối 35%, và nâng tỷ lệ thành công của verifier từ 63,01% lên 68,55%.
- Báo cáo nêu rằng cách này thu hẹp 59% khoảng cách Pass@1 ban đầu giữa Gemma và mô hình tham chiếu.
- Trong miền ITSM, cũng với Gemma-4-26B-A4B-it làm mô hình mục tiêu và DeepSeek-V4.1-Flash làm giáo viên, AutoSynthData tạo 1.994 mẫu huấn luyện tổng hợp trong 66 giờ.
Với các nhóm xây dựng agent doanh nghiệp, pipeline này biến thất bại đặc thù theo môi trường thành tác vụ huấn luyện đã kiểm chứng và cung cấp vòng hiệu chỉnh độ khó tái sử dụng, thay vì chỉ tăng dữ liệu tổng hợp.
Open TTS Leaderboard: Đánh giá có khả năng mở rộng cho chuyển văn bản thành giọng nói đa ngôn ngữ và nhân bản giọng nói
Hugging Face ra mắt Open TTS Leaderboard, đánh giá các mô hình TTS đa ngôn ngữ và nhân bản giọng nói mã nguồn mở bằng các chỉ số khách quan: WER/CER qua Qwen3 ASR, RTFx và TTFA trên GPU H200, cùng độ tương đồng cosine (SIM) giữa embedding người nói WavLM.
- Tính đến ngày 30 tháng 9 năm 2026, có hơn 8K mô hình TTS trên Hugging Face Hub.
- Tính đến ngày 30 tháng 9 năm 2026, chỉ 16 trong số 92 mô hình trên Artificial Analysis là open-weights.
- Dựa vào chỉ số khách quan giúp rút ngắn đánh giá một mô hình từ vài tuần thu thập phiếu bầu xuống còn vài giờ.
- Chế độ xem mặc định xếp hạng mô hình theo WER trung bình macro trên các split tiếng Anh của Seed TTS Eval và CV3 Eval (zero shot), dẫn đầu là hexgrad/Kokoro-82M, Supertone/supertonic-3 và fishaudio/s2-pro.
Với các nhóm xây dựng tác nhân giọng nói, bảng xếp hạng này cung cấp so sánh mô hình mở có thể tái lập trên WER, RTFx, TTFA và SIM để cân nhắc độ trễ, kích thước và chất lượng đa ngôn ngữ, nhưng không đo độ tự nhiên hay sở thích người nghe.
autotrust/JEV-27B-VL: mô hình quyết định đa phương thức 27,8B có khả năng nhìn
autotrust/JEV-27B-VL bổ sung khả năng thị giác cho autotrust/JEV-27B và trả về các quyết định System 1 có kiểu với xác suất đã hiệu chỉnh trên văn bản và hình ảnh, đồng thời giữ nguyên Qwen3.8-27B làm System 2.
- 27,8B tham số, pipeline image-text-to-text, giấy phép apache-2.0.
- System 1 hỗ trợ có/không, chọn một trong 2–256 lựa chọn và chấm điểm 0–5, với prompt tối đa 256K token.
- Bài toán gắp và đặt bằng tay robot hoàn thành 75% trong 20 cảnh ngẫu nhiên, cả 15 khối gắp được đều vào khay, khoảng 240 ms mỗi quyết định.
- Sử dụng máy tính hoàn thành 95% trong 60 tác vụ nhiều bước ngẫu nhiên với khoảng 0,26 s mỗi lần nhấp, giảm còn 10% khi chỉ có hộp đánh số.
Với nhà phát triển cần quyết định thị giác độ trễ thấp trong vòng điều khiển, JEV-27B-VL trả về xác suất đã hiệu chỉnh trong một lượt lan truyền, nhưng tác vụ sử dụng máy tính đòi hỏi phải cung cấp văn bản của phần tử.