AI FRONTIER
Signals worth understanding before they become obvious.
Fusi Sadar-Format untuk Pretraining FP4 Cepat
Makalah ini menyajikan fusi sadar-format, yang merancang bersama setiap produsen kuantisasi dengan domain skala dan tata letak konsumennya untuk mxfp native, nvfp global, dan nvfp lokal cooperative-thread-array. Dalam pretraining Llama-3 keluarga 8B hingga 160 miliar token, rute kustom tercepat mencapai 37,9K tokens/s/...
- Dalam probe yang dipasangkan pada akselerator yang sama, bfloat16 dan Transformer Engine nvfp mencapai 18,8K dan 27,6K tokens/s/GPU, sedangkan rute kustom tercepat mencapai 37,9K tokens/s/GPU.
- mxfp dengan pembulatan stokastik gradien baris dan prakondisi gradien bobot Hadamard 32 nilai bertanda tetap mencapai 37,2K tokens/s/GPU dan 86,3% pemanfaatan FLOP model bfloat16.
- Konfigurasi mxfp tersebut berakhir 2,11% di atas titik akhir kerugian pelatihan bfloat16 mentah.
- Resep Transformer Engine dengan empat blok bfloat16 akhir berakhir 0,87% di atas bfloat16 pada 27,1K tokens/s/GPU.
Keuntungan pretraining FP4 bergantung bersama pada kontrak skala, operand, dan jalur eksekusi, bukan hanya pada Tensor Core.
Meta merilis SDK untuk ESP32 agar siapa pun dapat membuat perangkat yang kompatibel dengan agen AI Muse
Meta merilis SDK untuk ESP32 yang memungkinkan siapa pun membangun perangkat keras yang kompatibel dengan agen AI Muse.
- Meta merilis SDK yang menyasar ESP32.
- SDK ini dimaksudkan agar siapa pun dapat membuat perangkat yang kompatibel dengan agen AI Muse.
Pengembang ESP32 kini dapat membangun perangkat keras kompatibel Muse di atas SDK resmi, bukan menunggu perangkat buatan vendor.
OpenAI memperkenalkan GPT-6 Sol dan Luna
OpenAI mengumumkan GPT-6 Sol dan Luna, dua model baru dalam lini GPT-6.
- OpenAI memperkenalkan model baru bernama GPT-6 Sol dan Luna.
- Pengumuman berasal dari kanal resmi OpenAI.
Pengembang AI perlu memantau GPT-6 Sol dan Luna untuk menilai kesesuaiannya dengan aplikasi mereka.
Open TTS Leaderboard: Evaluasi Skalabel untuk Text-to-Speech Multibahasa dan Kloning Suara
Hugging Face meluncurkan Open TTS Leaderboard yang menilai model TTS multibahasa dan kloning suara sumber terbuka dengan metrik objektif: WER/CER melalui Qwen3 ASR, RTFx dan TTFA pada GPU H200, serta kemiripan pembicara (SIM) kosinus dari embedding WavLM.
- Per 30 September 2026, tersedia lebih dari 8K model TTS di Hugging Face Hub.
- Per 30 September 2026, hanya 16 dari 92 model di Artificial Analysis yang berbobot terbuka.
- Mengandalkan metrik objektif memangkas evaluasi satu model dari beberapa minggu pengumpulan suara menjadi beberapa jam.
- Tampilan default memberi peringkat berdasarkan WER rata-rata makro pada split bahasa Inggris Seed TTS Eval dan CV3 Eval (zero shot), dengan hexgrad/Kokoro-82M, Supertone/supertonic-3, dan fishaudio/s2-pro memimpin.
Bagi tim yang membangun produk suara, metrik objektif yang dapat direproduksi ini dapat menyaring banyak model TTS terbuka dalam hitungan jam, tetapi kewajaran dan preferensi pendengar tetap memerlukan pemungutan suara manusia.
Lightricks merilis LTX-2.5, model terbuka video, audio, dan simulasi dunia
Lightricks/LTX-2.5 adalah model berbobot terbuka yang menghasilkan video dan audio tersinkronisasi dari input teks, gambar, dan video serta mendukung self-hosting. Model ini menambahkan pembuatan multishot native, dekoder video difusi, encoder teks Gemma 4 12B, dan prediktor durasi opsional.
- Kartu model melaporkan 1.629.984 unduhan bulan lalu dan 6,12k suka.
- Dirilis sebagai paket terpisah yang selaras dengan Comfy, dengan satu file .safetensors per komponen, termasuk checkpoint DiT 22B terdistilasi dan penuh.
- DiT terdistilasi memakai jadwal tetap 8 langkah dengan CFG=1; num_frames harus memenuhi num_frames % 8 == 1 dan lebar serta tinggi harus habis dibagi 32.
- Dengan pendapatan tahunan di bawah 10 juta USD, penggunaan komersial dan produksi gratis di bawah lisensi komunitas LTX-2.x; di atas 10 juta USD diperlukan perjanjian penggunaan komersial berbayar.
Bagi pengembang, LTX-2.5 menyediakan jalur berbobot terbuka yang dapat di-self-host untuk pembuatan video dan audio tersinkronisasi, dengan checkpoint terpisah dan varian terkuantisasi int8 atau NVFP4 untuk berbagai anggaran VRAM.
Apakah “very likely” berarti “tidak pasti”? Bagaimana LLM menyimpang dari manusia dalam kuantifikasi ketidakpastian linguistik
Makalah ini menyusun korpus penanda ketidakpastian manusia dari literatur psikologi dan ilmu keputusan lalu membandingkan LLM dengannya, dan melaporkan bahwa LLM mengodekan ketidakpastian verbal dengan tingkat numerik yang berbeda secara substansial dari manusia. Penulis memperkenalkan algoritma berbasis optimasi yang ...
- Penulisnya adalah Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu, dan Tianlong Chen; dikirim pada 6 September 2026 dan diterima di ICML 2026.
- Penulis menyusun korpus penanda ketidakpastian manusia dari literatur psikologi dan ilmu keputusan lalu membandingkan LLM dengannya.
- Makalah melaporkan bahwa LLM mengodekan ketidakpastian verbal dengan tingkat numerik yang berbeda secara substansial dari manusia.
- Algoritma yang diusulkan mencocokkan pemetaan penanda-ketidakpastian untuk menjelaskan kebenaran empiris sebaik mungkin alih-alih memperkirakan ketidakpastian melalui pengambilan sampel berulang.
Tim yang membangun sistem sadar ketidakpastian harus memvalidasi bagaimana LLM menafsirkan secara numerik penanda seperti “likely” dan “possible” terhadap penilaian manusia, bukan mengasumsikan keselarasan.
Transendental Polinomial Cepat untuk LLM
Makalah ini menguji penggantian sigmoid, tanh, dan SiLU native dengan program polinomial pendek pada LLM, melaporkan peningkatan throughput langkah pelatihan pada tugas integrasi GB200 dan perbedaan loss mendekati 100 miliar token.
- Dalam sapuan FP16 terisolasi, program FMA terpaket meningkatkan 1,19–2,19x pada working set residen L2 dan 1,00–1,70x pada working set residen HBM.
- Pada empat tugas integrasi GB200, substitusi dense SiLU, tanh-softcapped attention, dan routed-expert SwiGLU meningkatkan throughput langkah pelatihan lengkap masing-masing sebesar 2,7%, 2,9%, dan 8,0%.
- Substitusi sigmoid attention meningkatkan forward attention lengkap sebesar 7,4% dan langkah GPU lengkap sebesar 0,3%.
- Pada horizon umum mendekati 100 miliar token, perbedaan loss pelatihan halus akhir (polinomial dikurangi native) berkisar dari -0,107 hingga +0,079 pada empat tugas.
Bagi pembangun AI, ini menunjukkan bahwa penggantian polinomial BF16 derajat rendah untuk transendental SFU dapat memberi keuntungan throughput pelatihan yang terukur pada GPU kelas Blackwell, tetapi dampak loss harus divalidasi per tugas.
Seberapa Jauh Adam dari Natural Gradient Descent?
Makalah ini memperlakukan aturan pembaruan lengkap Adam, termasuk momentum, sebagai aproksimasi Fisher empiris diagonal yang tunduk pada pemotongan diagonal, substitusi label empiris, dan jeda temporal, serta mengukur deviasi geometris Adam dari NGD sebenarnya menggunakan metrik invarian skala γ(Δθ) pada empat lanskap ...
- Studi ini mencakup empat lanskap loss: regresi linear terkondisi baik, regresi linear terkondisi buruk, regresi logistik, dan jaringan saraf kecil non-konveks.
- Deviasi tetap rendah pada pengaturan terkondisi baik tetapi meningkat signifikan pada kondisi buruk, mencapai ketidakselarasan sekitar 10^3 pada jaringan saraf.
- Drift geometris yang lebih tinggi berkorelasi dengan optimasi awal yang lebih lambat tetapi tidak menurunkan minimalisasi objektif akhir; Adam secara konsisten mencapai loss rendah.
- Fisher empiris yang ditingkatkan (iEF) melacak jalur yang lebih stabil daripada Fisher empiris standar (EF), yang sering berosilasi atau divergen.
Bagi para pembangun, ini menunjukkan bahwa kekuatan optimasi praktis Adam mungkin berasal dari keseimbangan antara kesalahan aproksimasi struktural dan penghalusan momentum, bukan dari pelacakan dekat jalur natural gradient.