AI FRONTIER
Signals worth understanding before they become obvious.
SCION: Komposisi Adegan dengan Primitif Neural Terinstansiasi
SCION memperkenalkan representasi adegan komposisional hierarkis yang menggantikan Gaussian 3D independen dengan kosakata ringkas berisi primitif yang dapat digunakan ulang dan instans ruang dunia yang ringan, lalu mencocokkannya ke tangkapan multi-tampilan melalui optimasi bersama atas parameter adegan diskret dan kon...
- Makalah ini diterima di NeurIPS 2026 dan dikirim pada 1 Oktober 2026.
- SCION menggantikan jutaan Gaussian independen per adegan dengan kosakata primitif yang dapat digunakan ulang dan instans ruang dunia.
- Makalah ini melaporkan kualitas tinggi tetap terjaga bahkan pada 1,2 MB.
- Makalah ini melaporkan rate-distortion yang menguntungkan dibanding metode kompresi Gaussian yang ada dan memungkinkan penyuntingan serta animasi tingkat instans tanpa pelatihan ulang.
Bagi pengembang pipeline adegan 3D, SCION menunjukkan bahwa memodelkan adegan sebagai primitif yang dapat digunakan ulang plus instans dapat menghasilkan kendali tingkat instans yang dapat disunting dan dianimasikan dalam representasi ringk...
DeskForge: Supervisi Padat dari Lingkungan Desktop untuk Agen Pengguna Komputer
DeskForge adalah lingkungan desktop yang dapat dikendalikan yang menyusun dan menjelajahi aplikasi nyata untuk menghasilkan supervisi skala besar, menghasilkan DeskForge-1M, korpus berisi 1,2 juta observasi desktop beranotasi dengan 159,7 juta instans elemen. Makalah ini melaporkan fine-tuning empat model visi-bahasa p...
- DeskForge-1M berisi 1,2 juta observasi desktop beranotasi dengan 159,7 juta instans elemen.
- Makalah ini melakukan fine-tuning empat model visi-bahasa pada 200K contoh grounding yang diambil dari DeskForge-1M.
- Makalah ini melaporkan Qwen3.5-4B mengalami kenaikan akurasi 11,51 poin persentase pada ScreenSpot-Pro dan 10,11 poin pada OSWorld-G.
- Makalah ini melaporkan bahwa dengan planner tetap, Qwen3.5-4B meningkat dari 31 menjadi 50 dari 119 tugas pada WebArena-Infinity dan dari 3 menjadi 15 dari 100 tugas pada OpenApps.
Bagi tim yang membangun agen pengguna komputer, DeskForge menunjukkan bahwa komposisi lingkungan desktop nyata yang dapat dikendalikan dapat menskalakan anotasi elemen padat dan meningkatkan grounding GUI serta penyelesaian tugas jangka pan...
Rank-Aware Speculative Sampling: Aturan Verifikasi untuk Pohon Draf Difusi
Makalah ini memperkenalkan Rank-Aware Speculative Sampling (RASS), aturan verifikasi untuk pohon draf spekulatif berbasis penggandengan daftar sadar peringkat, yang mengurutkan kandidat draf menurut perpindahan rata-rata proposal-target, mengambil sampel peringkat dengan bobot yang dioptimalkan untuk meminimalkan varia...
- RASS meningkatkan D-GRS, yang menghasilkan K kandidat independen secara kondisional per node dan mengujinya secara berurutan sesuai urutan pembuatannya.
- RASS dievaluasi pada target campuran Gaussian, pembuatan ruang piksel tanpa syarat pada FFHQ, pembuatan bersyarat pada CIFAR-10, dan difusi laten dengan Stable Diffusion 3.5 menggunakan prompt COCO2014.
- Koreksi residual menjamin sampling eksak untuk setiap pilihan bobot peringkat.
Bagi pengembang yang mempercepat inferensi difusi, RASS menunjukkan bahwa memanfaatkan peringkat kandidat draf tanpa evaluasi model target tambahan dapat menurunkan jumlah evaluasi model target pada anggaran komputasi yang setara.
Lightricks merilis LTX-2.5, model video dan audio berbobot terbuka
Lightricks/LTX-2.5 adalah model berbobot terbuka yang menghasilkan video dan audio tersinkronisasi dari input teks, gambar, dan video, serta dapat dihosting sendiri. Model ini menambahkan pembuatan multishot native, dekoder video difusi, encoder teks Gemma 4 12B khusus, dan prediktor durasi opsional.
- Kartu model mencantumkan 6,48k suka dan 1.645.444 unduhan pada bulan terakhir.
- Checkpoint DiT berlabel 22b dan tersedia dalam varian bf16, Comfy int8+convrot, dan NVFP4.
- Encoder teksnya adalah Gemma4 12B dengan proyeksi, dan video serta audio memakai VAE terpisah.
- Entitas dengan pendapatan tahunan di bawah 10 juta USD mendapat penggunaan komersial gratis di bawah lisensi komunitas LTX-2.x; di atas itu diperlukan perjanjian komersial berbayar.
Bagi pengembang, LTX-2.5 menawarkan pembuatan audio-video yang dapat dihosting sendiri sebagai paket bobot terpisah yang selaras Comfy dengan transformer dev yang dapat dilatih, tetapi checkpoint int8 hanya untuk ComfyUI.
ReRoute Memungkinkan Prediksi Kontrafaktual pada Emulator Ilmiah Tanpa Eksperimen Terkendali
Makalah ini memperkenalkan ReRoute, kerangka kerja untuk prediksi ilmiah what-if yang tertarget yang menggabungkan data faktual dengan pengetahuan mekanistik parsial dan tidak memerlukan data intervensi terkendali untuk adaptasi. ReRoute menetapkan input yang ditanyakan dari backbone yang telah dilatih sebelumnya ke ni...
- Pada intervensi iklim terkopel yang disisihkan, ReRoute mengurangi kesalahan iklim agregat sebesar 18,2-31,8% di bawah pergeseran distribusi CO2 yang parah sekaligus mempertahankan kinerja pada kondisi standar.
- Makalah melaporkan bahwa ReRoute mencapai prediksi kontrafaktual yang sangat akurat dalam sistem adveksi-difusi terkendali di mana respons eksak tersedia.
- Makalah memberikan hasil identifikasi kausal untuk konstruksi ini di bawah asumsi struktural yang eksplisit, dengan argumen inti diverifikasi mesin di Lean.
Bagi tim yang membangun emulator ilmiah, ReRoute menunjukkan bahwa data faktual ditambah pengetahuan mekanistik parsial dapat meningkatkan prediksi kontrafaktual di bawah pergeseran distribusi tanpa menghasilkan data simulasi terkendali yan...
DeReAct: Penalaran dan Tindakan Terurai untuk Agen AI yang Andal
DeReAct adalah arsitektur agen modular yang mengeksternalisasi dua kebijakan gating: Critic yang memvalidasi tindakan yang diusulkan sebelum eksekusi, dan Context Manager yang merekonstruksi State yang didukung lingkungan serta mensertifikasi penyelesaian tugas. Makalah ini melaporkan bahwa pada GAIA dan SWE-bench Veri...
- Makalah melaporkan peningkatan Pass@1 sebesar 6,5 hingga 7,0 poin untuk Qwen3-Coder-480B.
- Makalah melaporkan peningkatan Pass@1 sebesar 4,2 hingga 5,2 poin untuk Claude Sonnet 4.5.
- Dengan Claude Opus 4.5, Pass@1 tetap sebanding dengan ReAct, sementara DeReAct menghasilkan lintasan yang lebih lengkap bukti dan lebih memenuhi batasan.
- Makalah menyatakan bahwa gating eksternal efektif ketika kegagalan yang ditargetkan cukup umum dan kebijakan gating itu sendiri memadai.
Bagi pembangun agen, memisahkan validasi tindakan dan sertifikasi penyelesaian dari satu kebijakan dapat meningkatkan keandalan model yang lebih lemah tanpa mengganti model Brain yang mendasarinya.
Cloudflare merilis Clef: model keputusan multimodal 27B yang mengembalikan probabilitas terstruktur dalam satu forward pass
Cloudflare merilis Clef, model multimodal yang dilatih pasca dari Qwen/Qwen3.8-27B yang mengubah suatu keadaan dan skema pertanyaan bertipe menjadi keputusan, mengembalikan probabilitas untuk setiap opsi yang diizinkan pada setiap pertanyaan tanpa pembuatan teks bebas atau penguraian keluaran.
- 27B parameter, BF16, disimpan sebagai safetensors terfragmentasi standar, dirilis di bawah lisensi Apache-2.0.
- Menerima teks, JSON, gambar, atau video sebagai keadaan dan menghasilkan satu logit per opsi yang diizinkan per pertanyaan, dengan softmax per pertanyaan yang menghasilkan probabilitas.
- Diuji dengan torch 2.11 dan transformers 5.10.2 pada satu H200; input gambar dan video juga memerlukan pillow.
- Dalam eksekusi internal Decision Index 0.2.1, akurasi tepat kasus BFCL adalah 98,5, makro-F1 BANKING77 adalah 94,2, latensi median adalah 209,3 ms, dan latensi p95 adalah 238,6 ms.
Bagi pengembang AI yang membutuhkan keputusan terstruktur alih-alih teks bebas, Clef menawarkan opsi multimodal 27B dengan API yang kompatibel dengan Jev/SystemOne, meskipun latensinya lebih tinggi daripada varian yang lebih kecil seperti C...
EditHero: Benchmark untuk Pengeditan 3D Tingkat Bagian Jangka Panjang dan Vibe Modeling
Makalah ini memperkenalkan EditHero, yang menurut penulisnya adalah benchmark pertama untuk pengeditan 3D tingkat bagian jangka panjang, dengan instruksi bahasa alami dan gambar target untuk geometri maupun tekstur. Mesin perakitan deterministik menghasilkan target yang tepat setelah setiap pengeditan, dan setiap uruta...
- Makalah ini menyebut EditHero sebagai, menurut pengetahuan penulisnya, benchmark pertama untuk pengeditan 3D tingkat bagian jangka panjang, dengan instruksi bahasa alami dan gambar target untuk geometri dan tekstur.
- Mesin perakitan deterministik menghasilkan target yang tepat setelah setiap pengeditan, dan setiap urutan ditinjau secara manual.
- Metode non-agen bekerja dari atas ke bawah, meregenerasi objek dari representasi 3D yang dipelajari, dan sering melewatkan perubahan yang diminta serta mengganggu area yang seharusnya tetap.
Benchmark ini menggeser evaluasi dari pengeditan tunggal ke apakah revisi multi-langkah hanya mengubah apa yang diminta, memberi pembangun pipeline pengeditan 3D iteratif target perbandingan yang dapat direproduksi.