Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-07
01
testmodelsopen source unlock

EmbeddingGemma 2: model embedding multimodal terbuka dan ringan

Google DeepMind merilis EmbeddingGemma 2, model 740 juta parameter berbasis arsitektur Gemma 4 dengan lisensi Apache 2.0, yang memetakan teks, gambar, audio, dan video secara native ke ruang embedding terpadu.

  • 740 juta parameter, dibangun di atas arsitektur Gemma 4 dan dirilis dengan lisensi Apache 2.0 yang permisif secara komersial.
  • Hanya memerlukan 270M parameter untuk beban kerja teks saja, dengan encoder visi (170M) dan audio (300M) opsional.
  • Melaporkan peningkatan 9,92 poin pada performa kode di MTEB Code, dari 68,76 menjadi 78,68.
  • Matryoshka Representation Learning memungkinkan pemotongan vektor keluaran dari 768 dimensi menjadi 512, 256, atau 128, memberikan pengurangan penyimpanan hingga 6x.

Pengembang dapat menjalankan pencarian lintas modal dan pipeline RAG sepenuhnya di perangkat, menyeimbangkan memori dan penyimpanan melalui encoder modular dan pemotongan MRL.

Google DeepMind
02
watchresearchnew architecture

Menuju Pengambilan Ruang Interaksi untuk Pencarian Agentik: RISE

Makalah ini mengusulkan RISE (Retrieving Interaction SpacE), yang menggunakan BM25 untuk membangun ruang interaksi terbatas dan memproses dokumennya saat pengindeksan untuk navigasi bergaya shell, menggantikan interaksi korpus langsung yang tak terbatas.

  • Pada BrowseComp-Plus, RISE mencapai akurasi 78% dengan gpt-5.4-mini, menyamai baseline DCI shell murni dengan biaya per kueri sekitar seperempatnya.
  • Pada 1 juta dokumen, RISE-BM25 mencapai 81% dengan gpt-5.4-mini.
  • Pada skala yang sama, DCI dengan gpt-5.4-nano turun menjadi 60%, dengan 33 dari 100 kegagalan waktu nyata.
  • Makalah ini berargumen interaksi tak terbatas tidak berskala: setiap perintah shell yang luas adalah pemindaian seluruh korpus, dan latensi memburuk tajam seiring korpus bertambah besar.

Bagi tim yang membangun agen pencarian, peran pengambilan bergeser dari memilih dokumen menjadi menetapkan batas yang dapat dijelajahi, yang langsung menentukan biaya dan keandalan pada korpus besar.

arXiv watchlist
03
testdeveloperopen source unlock

AutoSynthData: Menghasilkan Data Pelatihan untuk Agen Perusahaan

ServiceNow CoreAI merilis AutoSynthData, yang memakai kegagalan model target dan keberhasilan guru yang lebih kuat untuk mengidentifikasi celah kemampuan, lalu menghasilkan dan memvalidasi tugas eksekusi baru untuk pasca-pelatihan.

  • Di domain Hybrid EnterpriseOps Gym, dengan Gemma-4-26B-A4B-it sebagai model target dan Qwen3.8-27B sebagai guru, AutoSynthData menghasilkan 2.000 sampel pelatihan sintetis dalam sekitar 18 jam.
  • Checkpoint Hybrid terbaik adalah epoch 5, meningkatkan Pass@1 rata-rata sebesar 7,2 poin persentase, yaitu perbaikan relatif 35%, dan menaikkan keberhasilan verifier dari 63,01% menjadi 68,55%.
  • Laporan menyatakan ini menutup 59% dari celah Pass@1 awal antara Gemma dan model referensi.
  • Di domain ITSM, juga dengan Gemma-4-26B-A4B-it sebagai model target dan DeepSeek-V4.1-Flash sebagai guru, AutoSynthData menghasilkan 1.994 sampel pelatihan sintetis dalam 66 jam.

Bagi tim yang membangun agen perusahaan, pipeline ini mengubah kegagalan spesifik lingkungan menjadi tugas pelatihan terverifikasi dan menawarkan siklus kalibrasi kesulitan yang dapat dipakai ulang, bukan sekadar menambah data sintetis.

Hugging Face Blog
04
watchresearchbenchmark jump

Open TTS Leaderboard: Evaluasi Skalabel untuk Text-to-Speech Multibahasa dan Kloning Suara

Hugging Face meluncurkan Open TTS Leaderboard yang menilai model TTS multibahasa dan kloning suara open source dengan metrik objektif: WER/CER melalui Qwen3 ASR, RTFx dan TTFA pada GPU H200, serta kemiripan kosinus (SIM) antar embedding pembicara WavLM.

  • Per 30 September 2026, tersedia lebih dari 8K model TTS di Hugging Face Hub.
  • Per 30 September 2026, hanya 16 dari 92 model di Artificial Analysis yang berstatus open-weights.
  • Mengandalkan metrik objektif memangkas evaluasi satu model dari beberapa minggu pengumpulan suara menjadi beberapa jam.
  • Tampilan default memeringkat model berdasarkan WER rata-rata makro pada split bahasa Inggris Seed TTS Eval dan CV3 Eval (zero shot), dengan hexgrad/Kokoro-82M, Supertone/supertonic-3, dan fishaudio/s2-pro memimpin.

Bagi tim yang membangun agen suara, leaderboard ini menyediakan perbandingan model terbuka yang dapat direproduksi pada WER, RTFx, TTFA, dan SIM untuk menimbang latensi, ukuran, dan kualitas multibahasa, meski tidak mengukur kewajaran atau ...

Hugging Face Blog
05
testmodelsopen source unlock

autotrust/JEV-27B-VL: model keputusan multimodal 27,8B yang dapat melihat

autotrust/JEV-27B-VL menambahkan kemampuan visual pada autotrust/JEV-27B dan mengembalikan keputusan System 1 bertipe dengan probabilitas terkalibrasi atas teks dan gambar, sambil mempertahankan Qwen3.8-27B tanpa modifikasi sebagai System 2.

  • 27,8B parameter, pipeline image-text-to-text, lisensi apache-2.0.
  • System 1 mendukung ya/tidak, memilih satu dari 2–256 opsi, dan penilaian 0–5, dengan prompt hingga 256K token.
  • Pick and place lengan robot menyelesaikan 75% dari 20 adegan acak, semua 15 kubus yang digenggam berakhir di baki, sekitar 240 ms per keputusan.
  • Penggunaan komputer menyelesaikan 95% dari 60 tugas multi-langkah acak pada sekitar 0,26 s per klik, turun menjadi 10% bila hanya diberi kotak bernomor.

Bagi pengembang yang membutuhkan keputusan visual berlatensi rendah di dalam loop kendali, JEV-27B-VL mengembalikan probabilitas terkalibrasi dalam satu forward pass, tetapi tugas penggunaan komputer memerlukan teks elemen.

Hugging Face Trending