AI FRONTIER
Signals worth understanding before they become obvious.
Hợp nhất nhận biết định dạng cho tiền huấn luyện FP4 nhanh
Bài báo trình bày hợp nhất nhận biết định dạng, đồng thiết kế mỗi bộ sản xuất lượng tử hóa với miền tỷ lệ và bố cục bộ tiêu thụ cho mxfp gốc, nvfp toàn cục và nvfp cục bộ mảng luồng hợp tác. Trong tiền huấn luyện Llama-3 họ 8B tới 160 tỷ token, tuyến tùy chỉnh nhanh nhất đạt 37,9K tokens/s/GPU.
- Trong các phép đo ghép cặp trên cùng bộ tăng tốc, bfloat16 và Transformer Engine nvfp đạt 18,8K và 27,6K tokens/s/GPU, còn tuyến tùy chỉnh nhanh nhất đạt 37,9K tokens/s/GPU.
- mxfp với làm tròn ngẫu nhiên gradient hàng và tiền điều kiện gradient trọng số Hadamard 32 giá trị dấu cố định đạt 37,2K tokens/s/GPU và 86,3% mức sử dụng FLOP mô hình bfloat16.
- Cấu hình mxfp đó kết thúc cao hơn 2,11% so với điểm cuối tổn thất huấn luyện bfloat16 thô.
- Công thức Transformer Engine với bốn khối bfloat16 cuối kết thúc cao hơn 0,87% so với bfloat16 ở 27,1K tokens/s/GPU.
Lợi ích tiền huấn luyện FP4 phụ thuộc đồng thời vào hợp đồng tỷ lệ, toán hạng và đường thực thi, chứ không chỉ Tensor Core.
Meta phát hành SDK cho ESP32 để bất kỳ ai cũng có thể tự làm thiết bị tương thích với tác nhân AI Muse
Meta đã phát hành SDK dành cho ESP32, cho phép bất kỳ ai tự làm phần cứng tương thích với tác nhân AI Muse.
- Meta đã phát hành SDK nhắm tới ESP32.
- SDK này nhằm cho phép bất kỳ ai tự làm thiết bị tương thích với tác nhân AI Muse.
Nhà phát triển ESP32 giờ có thể làm phần cứng tương thích Muse trên SDK chính thức thay vì chờ thiết bị do nhà cung cấp làm sẵn.
OpenAI giới thiệu GPT-6 Sol và Luna
OpenAI đã công bố GPT-6 Sol và Luna, hai mô hình mới thuộc dòng GPT-6.
- OpenAI giới thiệu các mô hình mới có tên GPT-6 Sol và Luna.
- Thông báo đến từ kênh chính thức của OpenAI.
Các nhà phát triển AI nên theo dõi GPT-6 Sol và Luna để đánh giá mức độ phù hợp với ứng dụng của họ.
Open TTS Leaderboard: Đánh giá có khả năng mở rộng cho chuyển văn bản thành giọng nói đa ngôn ngữ và nhân bản giọng nói
Hugging Face ra mắt Open TTS Leaderboard, đánh giá các mô hình TTS đa ngôn ngữ và nhân bản giọng nói mã nguồn mở bằng chỉ số khách quan: WER/CER qua Qwen3 ASR, RTFx và TTFA trên GPU H200, cùng độ tương đồng người nói (SIM) bằng cosine từ embedding WavLM.
- Tính đến ngày 30 tháng 9 năm 2026, có hơn 8K mô hình TTS trên Hugging Face Hub.
- Tính đến ngày 30 tháng 9 năm 2026, chỉ 16 trong số 92 mô hình trên Artificial Analysis là trọng số mở.
- Dựa vào chỉ số khách quan rút ngắn việc đánh giá một mô hình từ vài tuần thu thập phiếu bầu xuống còn vài giờ.
- Chế độ xem mặc định xếp hạng theo WER trung bình macro trên các split tiếng Anh của Seed TTS Eval và CV3 Eval (zero shot), dẫn đầu là hexgrad/Kokoro-82M, Supertone/supertonic-3 và fishaudio/s2-pro.
Với các nhóm xây dựng sản phẩm giọng nói, các chỉ số khách quan có thể tái lập này giúp sàng lọc nhiều mô hình TTS mở trong vài giờ, nhưng độ tự nhiên và sở thích người nghe vẫn cần bỏ phiếu thủ công.
Lightricks phát hành LTX-2.5, mô hình mở về video, âm thanh và mô phỏng thế giới
Lightricks/LTX-2.5 là mô hình trọng số mở tạo video và âm thanh đồng bộ từ đầu vào văn bản, hình ảnh và video, đồng thời hỗ trợ tự lưu trữ. Mô hình bổ sung khả năng tạo nhiều cảnh gốc, bộ giải mã video khuếch tán, bộ mã hóa văn bản Gemma 4 12B và bộ dự đoán thời lượng tùy chọn.
- Thẻ mô hình báo cáo 1.629.984 lượt tải trong tháng trước và 6,12k lượt thích.
- Mô hình được phát hành dưới dạng gói chia nhỏ tương thích Comfy, mỗi thành phần một tệp .safetensors, gồm các checkpoint DiT 22B chưng cất và đầy đủ.
- DiT chưng cất dùng lịch trình cố định 8 bước với CFG=1; num_frames phải thỏa mãn num_frames % 8 == 1 và chiều rộng, chiều cao phải chia hết cho 32.
- Với doanh thu hằng năm dưới 10 triệu USD, sử dụng thương mại và sản xuất miễn phí theo giấy phép cộng đồng LTX-2.x; trên 10 triệu USD cần thỏa thuận sử dụng thương mại trả phí.
Với nhà phát triển, LTX-2.5 mang lại con đường trọng số mở có thể tự lưu trữ để tạo video và âm thanh đồng bộ, với checkpoint chia nhỏ và biến thể lượng tử hóa int8 hoặc NVFP4 cho các mức ngân sách VRAM khác nhau.
“very likely” có nghĩa là “không chắc chắn”? Cách LLM khác biệt với con người trong định lượng bất định ngôn ngữ
Bài báo xây dựng một kho ngữ liệu các dấu hiệu bất định của con người từ tài liệu tâm lý học và khoa học quyết định rồi đối chiếu LLM với kho này, và báo cáo rằng LLM mã hóa bất định bằng lời với các mức số khác biệt đáng kể so với con người. Các tác giả giới thiệu một thuật toán dựa trên tối ưu hóa, học một hồ sơ bất ...
- Các tác giả là Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu và Tianlong Chen; gửi ngày 6 tháng 9 năm 2026 và được chấp nhận tại ICML 2026.
- Các tác giả xây dựng một kho ngữ liệu các dấu hiệu bất định của con người từ tài liệu tâm lý học và khoa học quyết định rồi đối chiếu LLM với kho này.
- Bài báo báo cáo rằng LLM mã hóa bất định bằng lời với các mức số khác biệt đáng kể so với con người.
- Thuật toán đề xuất khớp một ánh xạ dấu hiệu-bất định để giải thích tốt nhất tính đúng đắn thực nghiệm thay vì ước lượng bất định bằng lấy mẫu lặp lại.
Các nhóm xây dựng hệ thống nhận biết bất định nên kiểm chứng cách LLM diễn giải bằng số các dấu hiệu như “likely” và “possible” so với phán đoán của con người thay vì giả định chúng khớp nhau.
Hàm siêu việt đa thức nhanh cho LLM
Bài báo thử thay thế sigmoid, tanh và SiLU gốc bằng các chương trình đa thức ngắn trong LLM, báo cáo mức tăng thông lượng bước huấn luyện trên các tác vụ tích hợp GB200 và chênh lệch loss gần 100 tỷ token.
- Trong một phép quét FP16 tách biệt, các chương trình FMA đóng gói cải thiện 1,19–2,19x trên tập làm việc cư trú L2 và 1,00–1,70x trên tập làm việc cư trú HBM.
- Trên bốn tác vụ tích hợp GB200, các thay thế dense SiLU, tanh-softcapped attention và routed-expert SwiGLU cải thiện thông lượng bước huấn luyện hoàn chỉnh lần lượt 2,7%, 2,9% và 8,0%.
- Thay thế sigmoid attention cải thiện forward attention hoàn chỉnh 7,4% và bước GPU hoàn chỉnh 0,3%.
- Ở các chân trời phổ biến gần 100 tỷ token, chênh lệch loss huấn luyện làm mượt cuối cùng (đa thức trừ gốc) nằm trong khoảng -0,107 đến +0,079 trên bốn tác vụ.
Với nhà xây dựng AI, điều này cho thấy thay thế đa thức BF16 bậc thấp cho hàm siêu việt SFU có thể mang lại lợi ích thông lượng huấn luyện đo được trên GPU lớp Blackwell, nhưng tác động loss phải được kiểm chứng theo từng tác vụ.
Adam cách Natural Gradient Descent bao xa?
Bài báo coi quy tắc cập nhật đầy đủ của Adam, bao gồm momentum, như một xấp xỉ Fisher thực nghiệm chéo chịu cắt tỉa chéo, thay thế nhãn thực nghiệm và độ trễ thời gian, đồng thời đo độ lệch hình học của Adam so với NGD thật bằng thước đo bất biến tỉ lệ γ(Δθ) trên bốn cảnh quan mất mát.
- Nghiên cứu bao gồm bốn cảnh quan mất mát: hồi quy tuyến tính điều kiện tốt, hồi quy tuyến tính điều kiện xấu, hồi quy logistic và một mạng nơ-ron nhỏ không lồi.
- Độ lệch vẫn thấp trong điều kiện tốt nhưng tăng đáng kể khi điều kiện xấu, đạt mức lệch khoảng 10^3 trong mạng nơ-ron.
- Độ trôi hình học cao hơn tương quan với tối ưu hóa ban đầu chậm hơn nhưng không làm giảm việc tối thiểu hóa mục tiêu cuối cùng; Adam luôn đạt mất mát thấp.
- Fisher thực nghiệm cải tiến (iEF) theo dõi các đường đi ổn định hơn so với Fisher thực nghiệm tiêu chuẩn (EF), vốn thường dao động hoặc phân kỳ.
Đối với nhà phát triển, điều này gợi ý rằng sức mạnh tối ưu hóa thực tế của Adam có thể đến từ sự cân bằng giữa sai số xấp xỉ cấu trúc và làm mượt momentum, thay vì bám sát đường đi natural gradient.