Today’s frontier report
Research Pool → Multi-Scout → Editor → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-10
01
testresearchcapability unlock

Makalah tim Seed ByteDance mengaitkan ‘gangguan’ DeepSeek dengan sensitivitas fase

Menurut laporan Jiemian.com, sebuah makalah tim Seed ByteDance mengaitkan fenomena ‘gangguan’ DeepSeek dengan sensitivitas fase.

  • Sumbernya adalah Jiemian.com.
  • Makalah berasal dari tim Seed ByteDance.
  • Makalah mengaitkan fenomena ‘gangguan’ DeepSeek dengan sensitivitas fase.

Bagi pembangun AI, makalah ini menyarankan memasukkan sensitivitas fase ke dalam daftar diagnosis saat menyelidiki keluaran model besar yang tidak stabil.

Jiemian.com
02
watchresearchnew architecture

Apakah model besar multimodal masih memerlukan encoder visual? Studi hukum penskalaan dari Tencent

Studi hukum penskalaan dari Tencent meneliti apakah model besar multimodal masih memerlukan encoder visual terpisah, mengeksplorasi arah arsitektur baru.

  • Sumbernya adalah 科技行者, dan judulnya menyatakan studi ini berasal dari Tencent.
  • Studi ini menggunakan hukum penskalaan untuk menanyakan apakah model besar multimodal masih memerlukan encoder visual.

Bagi tim yang membangun sistem multimodal, studi ini menandakan bahwa kemungkinan mengganti encoder visual dengan arsitektur terpadu perlu masuk ke evaluasi pemilihan arsitektur.

科技行者
03
watchagentsbenchmark jump

Verifikasi dan Peningkatan Diri dalam AI Agentik: Dasar dan Batas

Makalah ini memperkenalkan verifikasi terbatas dengan keacakan terminal tersembunyi untuk membandingkan peningkatan agen dari pencarian lebih lama, dukungan tambahan, atau perubahan metode pengajuan dan verifikasi, serta membuktikan bahwa amplifikasi mayoritas independen mempertahankan kedua bahasa sementara penerimaan...

  • Makalah membuktikan kelas verifikator teracak memenuhi Σ_k^P ⊆ Σ_k^RV ⊆ Σ_{k+1}^P, dengan pembesaran ketat dan pemisahan kedalaman memerlukan asumsi kompleksitas eksplisit.
  • Makalah menunjukkan bahwa BPP = P menghasilkan kelas pendamping eksak dengan batas yang sama.
  • Makalah menyatakan bahwa modifikasi diri yang terbatas secara seragam di bawah interpreter sehat bersama dan protokol verifikasi tetap tetap berada dalam kelas verifikasi yang sama.
  • Makalah ini terdiri dari 26 halaman dan 5 gambar serta menyertakan bukti dan artefak reproduktibilitas.

Kerangka ini mengikat klaim peningkatan diri pada kewajiban atas kebenaran, bukti yang dapat diterima, sumber daya verifikasi, dan kesalahan seleksi, memberi pembangun cara formal untuk memisahkan keuntungan pencarian dari keuntungan verifi...

arXiv cs.AI
04
opportunityinferencecost collapse

Asana memangkas biaya model 76 kali dalam uji browser dengan GPT-6.1 Sol

Dengan menggunakan GPT-6 Astra di Codex, Asana membuat agen browser-nya 76 kali lebih murah dan 5 kali lebih cepat dalam pengujian, untuk menawarkan model yang lebih mumpuni kepada pelanggan.

  • Asana menggunakan GPT-6 Astra di Codex.
  • Agen browser-nya menjadi 76 kali lebih murah dalam pengujian.
  • Pengujian yang sama menunjukkan peningkatan kecepatan 5 kali.

Bagi tim yang membangun agen browser, perubahan biaya dan kecepatan yang dilaporkan ini menunjukkan bahwa penggunaan GPT-6 Astra di Codex dapat menekan pengeluaran per tugas secara tajam.

OpenAI News
05
testdevelopercapability unlock

OpenAI Decisions API Masuk Beta Publik dengan Jawaban Bertipe 10x Lebih Cepat

OpenAI Decisions API telah masuk beta publik, dan jawaban bertipenya dilaporkan 10x lebih cepat.

  • OpenAI Decisions API telah masuk beta publik.
  • Jawaban bertipe dilaporkan 10x lebih cepat.

Bagi pengembang yang menyambungkan keluaran bertipe ke pipeline mereka, beta publik ini menjadi kesempatan menguji latensi sebelum ketersediaan umum.

MarkTechPost
06
testinferenceincremental

Bekukan Decoder, Pulihkan Encoder: Adaptasi Efisien Parameter untuk Kompresi KV-Cache Berbasis SVD

Makalah ini menunjukkan bahwa membandingkan resep fine-tuning dengan jumlah parameter terlatih yang sangat berbeda di bawah satu learning rate bersama menciptakan keunggulan palsu. Pada kompresi KV-Cache berbasis SVD, setelah setiap varian diberi learning rate yang disetel sendiri, pemulihan hanya encoder mencapai pari...

  • Paritas diverifikasi dengan penyetelan learning rate per varian dan tiga seed per konfigurasi pada model visi-bahasa Qwen2.5-VL-3B-Instruct.
  • Pemulihan hanya encoder menggunakan 3x lebih sedikit parameter terlatih dan 3x lebih sedikit memori status optimizer.
  • Protokol ini mencakup satu rasio kompresi dan direplikasi pada testbed khusus teks di dua backbone.

Bagi pengembang yang menambahkan kompresi KV-Cache peringkat rendah saat pelatihan, pemulihan hanya encoder adalah resep drop-in bermemori lebih rendah, tetapi perbandingan fine-tuning antar varian dengan jumlah parameter terlatih berbeda m...

arXiv cs.LG
07
watchresearchcapability unlock

Claude Science dari Anthropic menyelesaikan peta ultraviolet seluruh langit pertama

Anthropic menggunakan Claude Science untuk menghasilkan peta ultraviolet lengkap pertama seluruh langit, mengisi sekitar sepertiga langit yang sebelumnya tidak memiliki data ultraviolet. Dipimpin oleh Brice Ménard, astrofisikawan Johns Hopkins University sekaligus peneliti Anthropic, proyek ini menjalankan beberapa age...

  • Satelit GALEX milik NASA beroperasi dari 2003 hingga 2013 dan sengaja menghindari pengamatan bidang galaksi serta wilayah di sekitar bintang terang untuk mencegah kerusakan detektor akibat cahaya kuat.
  • Meskipun ada data tambahan dari FIMS/SPEAR Korea Selatan dan Swift milik NASA, sekitar sepertiga dari seluruh langit masih sama sekali tidak memiliki data ultraviolet.
  • Berdasarkan pengukuran cahaya tampak Gaia milik ESA, peta tersebut menyintesis perkiraan emisi ultraviolet untuk lebih dari 119 juta bintang individu dan sekitar 160.000 galaksi eksternal.
  • Dalam validasi, sebagian data pengamatan disembunyikan dan prediksi AI dibandingkan dengan pengukuran sebenarnya, dengan galat dalam kisaran sekitar 10%.

Ini menunjukkan alur kerja AI multi-agen dapat menyelesaikan kalibrasi data skala besar yang lama tertunda, tetapi sepertiga peta merupakan perkiraan statistik dan pengawasan ahli tetap diperlukan untuk menemukan artefak sisa.

AI Times Korea
08
testcreativeopen source unlock

jialinyyzz/humanizer: model penulisan ulang 12B, 95% penulisan ulang bahasa Inggris dinilai manusia oleh Originality.ai pada pengaturan paling ketat

jialinyyzz/humanizer adalah model pembuatan teks 12B yang menulis ulang draf buatan AI (email, esai, laporan, posting forum) agar terbaca seperti ditulis manusia, dalam bahasa Inggris dan Tionghoa, dan berjalan secara lokal. Kartu model melaporkan bahwa 95% penulisan ulang dari 210 draf bahasa Inggris dinilai manusia o...

  • Pada humanizer-12b-Q8_0.gguf, 376 dari 420 penulisan ulang bahasa Inggris tidak menemukan masalah faktual menurut juri LLM yang ketat; ketika masalah ditemukan, lebih dari 9 dari 10 perbaikan adalah satu kata atau frasa.
  • File GGUF berkisar dari 3,9 GB untuk file 2-bit (memori puncak 6,2 GB) hingga 12,7 GB untuk Q8_0 (memori puncak 13,7 GB), dengan kecocokan top-1 terhadap bf16 sebesar 87,4% untuk file 2-bit dan 98,4% untuk Q8_0.
  • Lisensinya apache-2.0; tersedia format GGUF, Safetensors, dan Transformers, dengan dukungan llama.cpp, MLX, transformers, vLLM, dan Ollama, serta aplikasi berjalan offline di Mac (Apple silicon) dan Windows.

Bagi pengembang yang menerbitkan teks berbantuan AI, model ini menawarkan opsi penulisan ulang yang dapat diterapkan secara lokal dengan tingkat kuantisasi sesuai memori, tetapi kartu model secara eksplisit meminta memeriksa angka, tanggal,...

Hugging Face Trending