Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-03
01
watchmodelsincremental

Gemini 4 Argon: era baru kecerdasan frontier Google DeepMind

Google DeepMind mengumumkan Gemini 4 Argon, model frontier untuk alur kerja berhorizon panjang yang menaikkan batas token keluaran dari 64K menjadi 1 juta dan diluncurkan kepada para pembela siber tepercaya melalui Fairwind Program.

  • Batas token keluaran diperluas dari 64K menjadi 1 juta token, yang disebut Google sebagai terdepan di industri.
  • Menetapkan state of the art baru pada DeepSWE v1.1 dengan 77,9%, tolok ukur tugas rekayasa perangkat lunak berhorizon panjang di dunia nyata.
  • Peringkat #1 pada AutomationBench milik Zapier dengan 51,3% dan mencapai state of the art pada LVBench untuk pemahaman video panjang dengan 91,7%.
  • Berbagi peringkat pertama pada CWE-bench v1 dengan 68%; harga perkenalan 2 USD per juta token masukan dan 10 USD per juta token keluaran, dengan masukan yang di-cache diskon 95% dari harga masukan.

Bagi para pembangun, plafon 1 juta token keluaran dan harga 2 USD per juta token masukan membuat lintasan agen berhorizon panjang layak secara ekonomi, tetapi aksesnya saat ini terbatas pada pembela siber tepercaya.

Google DeepMind
02
watchagentsnew architecture

Dari Proposal ke Efek Terverifikasi: Praxa, Harness Terikat Bukti untuk Eksekusi Agen AI yang Diatur

Makalah ini memperkenalkan Praxa, harness agen yang secara eksplisit merepresentasikan proposal, otoritas, pengiriman, efek eksternal terverifikasi, dan promosi penyajian melalui penerimaan deterministik, eksekusi terperantarai, pembacaan ulang eksternal, rekonsiliasi, dan promosi yang ditinjau. Tidak ada dari empat ja...

  • 作者在固定修订版本上运行的仓库本地审计通过1,027/1,027项单元测试和89/89项Workerd测试,覆盖全部363个预期源文件并达到四项覆盖率下限;原始逐测试记录与独立复现不可用。
  • 在Terminal-Bench Core 0.1.1的12项精选任务试点中,基线与可靠性层各通过17/36严格试验;可靠性层多使用37.49%输入token和50.73%输出token,因此该试点不支持优越性结论。
  • 在调试后的两阶协调代理开发对比中,基线与作者自研候选各完成180/180次试验,测量准确率相同,均实现完全封闭式崩溃恢复且零受保护违规。
  • 该候选方案减少37.11%token、33.84%估算端点成本和11.63%步骤数;论文明确表示这不能证明质量、延迟或生产行为改善。

Bagi tim yang membangun agen terkelola, kontribusi Praxa adalah membuat transisi otoritas-ke-efek eksplisit dan dapat diuji, tetapi bukti saat ini hanya mendukung keterverifikasian arsitektural, bukan penerapan produksi atau klaim keamanan.

arXiv cs.AI
03
watchmodelsnew architecture

Model baru OpenRouter: inclusionAI Ling 3.1 Flash

Ling 3.1 Flash adalah model mixture-of-experts penalaran hibrida dari inclusionAI dengan 25B parameter aktif dari total 560B dan jendela konteks 262.144 token.

  • Total 560B parameter dengan 25B parameter aktif.
  • Jendela konteks 262.144 token, mendukung hingga 32.768 token penyelesaian.
  • Menerima tools dan tool_choice untuk pemanggilan fungsi, tetapi tidak mendukung response_format, sehingga keluaran JSON tidak dipaksakan.
  • Terdaftar gratis di OpenRouter, dengan tanggal rilis 2 Oktober 2026.

Bagi pengembang, ini adalah opsi MoE konteks panjang gratis dengan pemanggilan alat, tetapi tidak adanya keluaran terstruktur yang dipaksakan berarti keandalan JSON harus ditangani di lapisan aplikasi.

OpenRouter Models
04
watchcreativenew architecture

DSSR-3D: Penalaran Terpisah untuk Referring Bergantung Sudut Pandang pada Gaussian 3D

DSSR-3D adalah kerangka inferensi untuk segmentasi referring bergantung sudut pandang pada bidang Gaussian 3D kontinu, diformalkan sebagai dua antarmuka, lokalisasi semantik invarian pose dan penalaran spasial terkondisi pose, tanpa pelatihan ulang bidang semantik dasarnya.

  • Instansiasi menggunakan mekanisme lokalisasi softmax dengan suhu yang dipertajam dan fungsi penilaian arah berbasis proyeksi, digabungkan melalui langkah ringan tanpa pelatihan.
  • Penulis mengusulkan ViewRef-GS, tolok ukur yang mengisolasi segmentasi bergantung sudut pandang pada bidang Gaussian 3D, dievaluasi bersama Ref-LERF yang diperkaya.
  • Makalah melaporkan perolehan konsisten dibanding metode referring berbasis 3DGS yang ada, tanpa pelatihan tambahan di luar bidang semantik dasar.

Bagi pembangun AI, ini menunjukkan bahwa referring spasial bergantung sudut pandang dapat dipisahkan saat inferensi dan ditransfer tanpa adaptasi ke bidang semantik yang berbeda secara struktural.

arXiv cs.CV
05
watchresearchcost collapse

FlashDiffusion: Dekomposisi Spektral Kernel Berubin Terfusi

Makalah ini memperkenalkan FlashDiffusion, metode tanpa matriks yang mengevaluasi blok kernel Gaussian padat dalam ubin GPU terfusi dan menggandengkan pemecah eigen dengan β-flow empiris yang memilih skala resolusi sampel terbatas.

  • Makalah melaporkan bahwa mewujudkan kernel Gaussian padat memerlukan memori O(N^2).
  • Metode ini mengevaluasi blok kernel Gaussian padat dalam ubin GPU terfusi, menghindari perwujudan kernel padat.
  • Pemecah eigen digandengkan dengan β-flow empiris yang memilih skala resolusi sampel terbatas.
  • Kelanjutan atas ukuran sampel dan bandwidth melakukan warm-start pada pemecahan spektral yang semakin mahal dari resolusi yang lebih kasar.

Bagi pembangun AI yang menggunakan metode kernel dalam pembelajaran geometris, pendekatan berubin tanpa matriks ini menghilangkan hambatan memori kernel padat O(N^2), sehingga pemecahan spektral yang lebih besar menjadi layak.

arXiv cs.LG
06
watchresearchincremental

ChainLoRA: Penggabungan Vektor Tugas yang Mempertahankan Geometri untuk Pembelajaran Berkelanjutan pada LLM

ChainLoRA adalah kerangka penggabungan berkelanjutan tanpa replay yang dibangun di atas geometri vektor tugas yang diperbarui secara berantai, menggabungkan pelatihan pembaruan berantai dengan penggabungan SVD adaptif pasca-aliran. Makalah ini melaporkan kinerja mutakhir di antara metode tanpa replay yang dievaluasi pa...

  • ChainLoRA menggabungkan pelatihan pembaruan berantai dengan penggabungan SVD adaptif pasca-aliran, di mana inisialisasi dan proksi ortogonalitas satu sisi hanya menggunakan carrier terakhir selama pelatihan.
  • Pada saat penggabungan, SVD adaptif mengekstrak carrier bersama dan menyelaraskannya ke tugas terbaru melalui adaptasi Procrustes.
  • Analisis teoretis menunjukkan bahwa adaptasi Procrustes memfasilitasi pemisahan geometris perkiraan komponen bersama dan komponen spesifik tugas, dan proksi satu sisi lebih lanjut membatasi interferensi antar-tugas.

Bagi pengembang pipeline pembelajaran berkelanjutan, pelatihan pembaruan berantai dan penggabungan SVD adaptif ChainLoRA menawarkan jalur fine-tuning hemat parameter tanpa replay, yang jejak status historis dan overhead regularisasinya teta...

arXiv stat.ML
07
testmodelsopen source unlock

NVIDIA Kumo Tabular Menetapkan Batas Baru Akurasi-Efisiensi untuk Prediksi Tabular

NVIDIA merilis Kumo Tabular, model fondasi terbuka untuk klasifikasi dan regresi tabular yang memprediksi baris baru dalam satu forward pass tanpa pelatihan, penyetelan, atau rekayasa fitur, tersedia dalam tiga ukuran dari 28M hingga 215M parameter di bawah lisensi OpenMDW-1.1.

  • Kumo Tabular tersedia dalam ukuran Small/Medium/Large yang mencakup 28M hingga 215M parameter dan dirilis di bawah lisensi OpenMDW-1.1 untuk penggunaan komersial.
  • Model ini menempati peringkat pertama di papan peringkat TabArena dengan ELO 1950 dan dilaporkan 17 kali lebih cepat daripada LimiX-2 dalam pengaturan evaluasi seragam dengan satu RTX 6000 Pro.
  • Pada BeyondArena, model ini mencapai ELO 1418 dengan skor Improvability 7,78%, menempati peringkat pertama.
  • Pada TALENT, model ini meraih peringkat keseluruhan teratas dalam akurasi klasifikasi, log-loss klasifikasi, dan RMSE regresi, dengan peringkat rata-rata 6,67, 3,98, dan 4,22.

Bagi pembangun AI, Kumo Tabular menawarkan jalur prediksi tabular tanpa pelatihan per tugas, dan angka akurasi-efisiensi yang dilaporkan perlu divalidasi pada data hold-out sebelum penerapan.

Hugging Face Blog