Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-01
01
watchagentsnew architecture

Google merilis RRSI, yang membuat harness agen memperbaiki diri tanpa melatih ulang model

Peneliti Google Cloud AI Research bersama Stanford University dan University of Washington merilis kerangka RRSI, yang berulang kali merevisi harness di sekitar model, termasuk prompt, penggunaan alat, alur kontrol, pengelolaan memori dan konteks, modul keterampilan, dan sub-agen, tanpa mengubah bobot model.

  • Pada delapan benchmark, Terminal-Bench 2.1 naik dari 74,2% menjadi 80,2%, yaitu kenaikan 6,0 poin persentase, dan SWE-Bench Verified naik dari 82,0% menjadi 83,8%, yaitu kenaikan 1,8 poin persentase.
  • JobBench naik dari 36,0% menjadi 40,7%, kenaikan 4,7 poin persentase; GDPval naik dari 48,8% menjadi 52,3%, kenaikan 3,5 poin persentase; Frontier-Eng naik dari 17,7% menjadi 22,0%, kenaikan 4,3 poin persentase.
  • RRSI dirilis sebagai kerangka penelitian di GitHub, dengan kode tersedia di bawah lisensi Apache 2.0.

Bagi tim yang membangun agen, RRSI menunjukkan bahwa pencarian iteratif yang terkendali pada harness, dengan bobot model tetap, dapat menghasilkan peningkatan benchmark yang terukur dan menurunkan biaya token.

AI Times Korea
02
opportunitymodelscost collapse

OpenAI memperkenalkan GPT-6.1 Sol

OpenAI memperkenalkan GPT-6.1 Sol untuk coding, penggunaan komputer, dan pekerjaan profesional, dengan kecerdasan yang diklaim mendekati Astra pada seperlima harga token input dan output API standar Astra.

  • OpenAI menyatakan GPT-6.1 Sol memberikan kecerdasan yang mendekati Astra.
  • Penggunaan yang disasar adalah coding, penggunaan komputer, dan pekerjaan profesional.
  • Harga token input dan output API standar adalah seperlima dari harga Astra.

Bagi pengembang AI, kecerdasan yang mendekati Astra pada seperlima harga per token menurunkan biaya inferensi per unit pada beban kerja coding dan penggunaan komputer.

OpenAI News
03
testinferenceopen source unlock

prism-ml merilis Ternary-Bonsai-2-27B-gguf: model 27B berbobot ternari yang berjalan dari 5,95 GB

prism-ml menerbitkan Ternary-Bonsai-2-27B-gguf di Hugging Face, mengkuantisasi embeddings, proyeksi attention, proyeksi MLP, dan LM head Qwen3.8-27B menjadi bobot ternari (g128, {−1,0,+1} dengan penskalaan per grup FP16), serta menyediakan dua paket GGUF, PTQ1_0 dan PQ2_0, untuk llama.cpp pada CUDA, Metal, dan CPU.

  • Ukuran model bahasa adalah 5,95 GB (PTQ1_0) atau 7,21 GB (PQ2_0), sekitar 9,0x dan 7,5x lebih kecil dari baseline FP16 sekitar 54 GB; format ternari ideal adalah 1,72 bit/bobot pada 5,8 GB.
  • Makalah melaporkan rata-rata 84,78 pada 14 benchmark mode thinking, yaitu 98,2% dari referensi FP16 (86,32), dibandingkan 72,59 untuk IQ2_XXS (7,27 GB) dan 85,18 untuk UD-Q4_K_XL (17,6 GB).
  • Makalah melaporkan 95,83 pada AIME26 dan 90,07 pada LiveCodeBench, tempat IQ2_XXS mencetak 57,5 dan 56,4; matematika 96,57, coding 89,42, pemanggilan alat BFCL v3 74,92.
  • Panjang konteks 262K token pada backbone hybrid attention dengan sekitar 75% linear attention; vision tower adalah paket mmproj Q8_0 terpisah (0,63 GB) yang dimuat hanya untuk input gambar.

Bagi tim yang menyebarkan penalaran kelas 27B di satu GPU atau laptop, ini menunjukkan kuantisasi ternari menyeluruh dapat mempertahankan skor penalaran dan pemanggilan alat mendekati FP16 pada sekitar 6 GB, tetapi hanya dengan kernel khusu...

Hugging Face Trending
04
watchresearchnew architecture

Menuju Pengambilan Ruang Interaksi untuk Pencarian Agentik: RISE membangun ruang terbatas dengan BM25

Makalah ini mengusulkan RISE (Retrieving Interaction SpacE), yang menggunakan BM25 untuk membangun subset korpus terbatas yang dapat dijelajahi agen dan memproses dokumennya saat pengindeksan untuk navigasi bergaya shell. Pada BrowseComp-Plus, RISE mencapai akurasi 78% dengan gpt-5.4-mini, menyamai baseline DCI shell m...

  • Makalah melaporkan bahwa pada BrowseComp-Plus, RISE mencapai akurasi 78% dengan gpt-5.4-mini, menyamai baseline DCI shell murni dengan sekitar seperempat biaya per kueri.
  • Makalah melaporkan bahwa pada 1 juta dokumen, RISE-BM25 mencapai 81% dengan gpt-5.4-mini.
  • Makalah melaporkan bahwa pada skala 1 juta dokumen yang sama, DCI dengan gpt-5.4-nano turun menjadi 60%, dengan 33 dari 100 kegagalan waktu nyata.
  • Makalah berargumen bahwa interaksi tanpa batas tidak berskala: setiap perintah shell yang luas adalah pemindaian seluruh korpus dan latensi memburuk tajam seiring pertumbuhan korpus.

Bagi tim yang membangun agen pencarian, hasil ini menunjukkan bahwa pengambilan harus membatasi ruang interaksi alih-alih hanya memilih dokumen yang muat di jendela konteks, sehingga biaya dan latensi terkendali saat korpus bertambah besar.

arXiv watchlist
05
watchcreativenew architecture

Diffusion Controller menyatukan dan menyederhanakan pembuatan gambar AI

Google Research memperkenalkan Diffusion Controller, jaringan "steering damper" ringan yang menyesuaikan lintasan denoising secara dinamis sementara model dasar tetap dibekukan, meningkatkan keselarasan prompt dan kualitas gambar.

  • Dievaluasi pada backbone Stable Diffusion v1.4 dalam tiga rezim fine-tuning: SFT, reward-weighted loss (RWL), dan PPO.
  • Pada jalur SFT dan RWL, Diffusion Controller gray-box mengungguli LoRA dalam tingkat kemenangan HPS-v2 sambil memanipulasi jauh lebih sedikit lapisan internal model.
  • Versi white-box yang sepenuhnya terbuka mencapai tingkat kemenangan 90% terhadap model baseline.
  • Satu parameter kekuatan panduan saat inferensi memungkinkan penyesuaian dinamis intensitas batasan kontrol.

Bagi pengembang, ini menawarkan jalur ringan menuju pembuatan gambar yang dapat dikontrol dan personalisasi tanpa mengakses bobot model tertutup.

Google Research
06
watchresearchcapability unlock

Google DeepMind memperkenalkan SynthID Bio untuk memberi watermark pada protein buatan AI

Google DeepMind merilis SynthID Bio, keluarga metode watermark untuk biologi sintetik yang menyematkan tanda terdeteksi pada urutan asam amino dan struktur 3D prediksi AlphaFold 3, sambil mempertahankan fungsi biologis dalam pengujian laboratorium.

  • SynthID Bio melakukan fine-tuning pada sebagian kecil jaringan difusi AlphaFold 3, membangun watermark ke dalam bobot model sehingga koordinat 3D yang diprediksi secara inheren membawa tanda yang dapat dideteksi.
  • Dalam pengujian wet-lab pada tiga target (VEGF-A, RBD protein spike SARS-CoV-2, dan PD-L1), desain berwatermark menyamai tingkat keberhasilan, afinitas pengikatan, dan keragaman urutan alami versi tanpa watermark.
  • Karya ini melaporkan bahwa SynthID Bio mempertahankan akurasi prediksi AlphaFold 3 sekaligus menawarkan detektabilitas hampir sempurna dan bertahan terhadap derau digital atau perubahan koordinat kecil.
  • Google DeepMind menyatakan akan menerbitkan makalah metodenya, membuka kode dan data in vitro sebagai sumber terbuka, serta merilis bobotnya ke komunitas riset.

Bagi pengembang alat desain biologis, menyematkan watermark langsung ke bobot model dan pembuatan urutan menawarkan lapisan verifikasi otomatis untuk penyaringan sintesis DNA dan provenans basis data, meskipun ketahanan terhadap manipulasi ...

Google DeepMind