Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-09-30
01
watchresearchnew architecture

Bagaimana Diffusion Controller menyatukan dan menyederhanakan pembuatan gambar AI

Google Research memperkenalkan Diffusion Controller, jaringan "steering damper" ringan yang merumuskan ulang proses denoising sebagai masalah kontrol kontinu, meningkatkan keselarasan prompt dan kualitas gambar tanpa mengubah model dasar yang dibekukan.

  • Pada jalur SFT dan RWL, jaringan steering damper Diffusion Controller gray-box mengungguli LoRA dalam tingkat kemenangan HPS-v2, sambil memanipulasi jauh lebih sedikit lapisan internal model dibanding LoRA.
  • Makalah melaporkan versi yang sepenuhnya terbuka, dengan akses white-box untuk mengubah bobot internal, mencapai tingkat kemenangan 90% terhadap model baseline.
  • Kerangka ini mengimplementasikan empat struktur jaringan: Diffusion Controller, Diffusion Controller-Naive, Diffusion Controller-J, dan Diffusion Controller-S.
  • Satu parameter kekuatan guidance saat inferensi dapat disesuaikan saat runtime untuk menaikkan atau menurunkan intensitas batasan kontrol.

Bagi para pembangun, ini berarti kontrol halus atas model gambar closed-source tanpa akses white-box, dengan lapisan kontrol yang terpisah dari inti model sehingga dapat diperluas ke personalisasi, keamanan, dan pembuatan video.

Google Research
02
watchagentsnew architecture

Menjembatani Agen LLM dan Data Space: Mediasi Arsitektural melalui Model Context Protocol

Makalah ini menyajikan pendekatan mediasi arsitektural berbasis Model Context Protocol (MCP), yang diimplementasikan melalui Eunomia Agent, untuk memungkinkan interaksi terkendali antara agen LLM dan layanan data space. Prototipe memvalidasi interaksi end-to-end pada penemuan katalog, pengambilan metadata, dan pemanggi...

  • Dikirim ke arXiv pada 24 September 2026 sebagai arXiv:2609.30341, diklasifikasikan dalam cs.AI dan cs.DB.
  • Lapisan mediasi menerjemahkan kemampuan data space menjadi alat terstruktur berbasis skema yang dapat ditemukan dan dipanggil agen AI sambil mempertahankan batasan tata kelola.
  • Implementasi prototipe memvalidasi interaksi end-to-end pada penemuan katalog, pengambilan metadata, dan pemanggilan layanan data tanpa mengubah komponen data space yang ada.
  • Penulisnya adalah Jaime Alonso Ruiz, Carlos Aparicio, Gabriel Huecas, Joaquín Salvachúa, dan Andres Munoz-Arcentales.

Bagi tim yang membangun agen AI, karya ini menunjukkan MCP dapat berfungsi sebagai lapisan mediasi untuk menghubungkan agen ke data space yang diatur tanpa mengubah infrastruktur data yang ada.

arXiv cs.AI
03
watchinferencenew architecture

HybridInfer: Perutean Tingkat Berbasis Reinforcement Learning yang Sadar Termal untuk Inferensi LLM di Perangkat, Edge, dan Cloud

HybridInfer adalah router reinforcement learning yang sadar termal untuk hierarki tiga tingkat (Llama 3.2 3B di perangkat, Llama 3.1 8B di edge dengan retrieval, GPT-4o di cloud) yang menggunakan headroom termal ponsel dan estimasi kompleksitas kueri sebagai state dan memilih tingkat melalui kebijakan Q-learning yang d...

  • Makalah melaporkan bahwa kondisi selalu di perangkat menyamai kualitas per kueri pada kueri yang dapat dilayani tetapi tiga hingga enam kali lebih lambat dan gagal pada kueri panjang.

Untuk penerapan LLM di perangkat, batas termal adalah masalah stabilitas runtime dan bukan sekadar perlambatan, sehingga kebijakan perutean harus mengodekan status termal dan insentif lokalitas alih-alih hanya mengoptimalkan kualitas dan la...

arXiv cs.LG
04
testdocumentsopen source unlock

XingChen-AGI merilis TeleOCR, VLM parsing dokumen 1,2B parameter

TeleOCR adalah model visi-bahasa sumber terbuka dengan sekitar 1,2B parameter yang menyatukan parsing dokumen digital dan dokumen hasil kamera dalam satu kerangka kerja, dengan bobot dan laporan teknis yang telah dirilis.

  • Kartu model mencantumkan sekitar 1,2B parameter, lisensi apache-2.0, dukungan bahasa Mandarin dan Inggris, serta basis qwen2_5_vl.
  • Pada OmniDocBench v1.6, TeleOCR melaporkan Overall 96,87, Text Edit 0,027, Formula CDM 96,36, dan Table TEDS 97,05.
  • Pada Dr.DocBench Challenge, TeleOCR melaporkan Overall 67,96, di atas MinerU 2.5 Pro 62,26 dan PaddleOCR-VL 1.6 55,11.
  • Kartu model menyatakan TeleOCR mem-parsing tata letak dan konten dokumen terdistorsi tanpa praproses dewarping atau model rektifikasi khusus.

Bagi pengembang yang membangun pipeline parsing dokumen, TeleOCR melaporkan hasil terdepan pada beberapa benchmark publik dengan sekitar 1,2B parameter dan menyediakan bobot serta konversi GGUF, sehingga cocok sebagai kandidat parsing self-...

Hugging Face Trending
05
testmodelsopen source unlock

Qwen merilis Qwen-Image-2.1 sebagai open source: model terpadu 7B untuk text-to-image dan penyuntingan gambar

Qwen merilis Qwen-Image-2.1 sebagai open source, model terpadu untuk pembuatan text-to-image dan penyuntingan gambar yang komponen pembuatan visualnya memiliki 7B parameter pada 32 lapisan Single-Stream DiT serta mendukung pembuatan dan penyuntingan transparan (RGBA) secara native.

  • Komponen pembuatan visual memiliki 7B parameter pada 32 lapisan Single-Stream DiT.
  • Model ini mendukung hingga 10 gambar referensi dan penyuntingan lokal yang ditentukan melalui lingkaran, anotasi yang dilukis, atau mask terpisah.
  • Rasio aspek yang didukung meliputi 1:1, 4:3, 3:4, 3:2, 2:3, 16:9, dan 9:16, dengan resolusi contoh hingga 2752×1536.
  • Model ini dilisensikan di bawah Qwen Research License Agreement, dan halaman model melaporkan 64.362 unduhan bulan lalu.

Karena satu model 7B mencakup pembuatan text-to-image, pembuatan lapisan transparan RGBA, dan penyuntingan multi-referensi, pengembang dapat menghindari penerapan model terpisah untuk pembuatan dan penyuntingan.

Hugging Face Trending
06
watchresearchincremental

Panduan awal untuk safety case dalam pelatihan AI frontier

OpenAI menerbitkan panduan awal untuk safety case dalam pelatihan AI frontier, mencakup perlindungan teknis, praktik operasional, dan investigasi insiden misalignment.

  • Panduan ini mencakup perlindungan teknis, praktik operasional, dan investigasi insiden misalignment.
  • Panduan disajikan sebagai pedoman awal, bukan standar final.

Tim yang melatih model frontier dapat memakai ketiga area ini sebagai struktur awal untuk dokumentasi safety case internal mereka.

OpenAI News
07
testmodelsopen source unlock

TaichuAI merilis ZDTaichu5.0-9B, model fondasi multimodal untuk penalaran spasial dan penggunaan alat agentik

ZDTaichu5.0-9B adalah model fondasi multimodal dari TaichuAI yang menggabungkan backbone bahasa Qwen3.5-9B dengan encoder visi C-RADIOv4-H, mendukung teks, gambar, dan video pada resolusi apa pun, serta menyasar pemahaman visual umum, penalaran spasial, penggunaan alat agentik, dan riset AI terwujud.

  • Model ini memiliki 9,8B parameter, tipe tensor BF16, dan panjang konteks hingga 128K tokens.
  • Kartu model melaporkan skor 87,7 pada TAU2-Bench, 71,4 pada Claw-Eval, dan 93,7 pada IFEval.
  • Kartu model melaporkan skor 48 pada ERQA dan 56 pada RoboSpatial.
  • Bobot dirilis di bawah NVIDIA Open Model License Agreement, dengan lisensi Apache-2.0 Qwen3.5 tetap dipertahankan.

Bagi pengembang agen visi atau pipeline AI terwujud, model ini menawarkan penalaran spasial dan pemanggilan alat pada skala 10B, tetapi eksekusi alat tetap harus diimplementasikan, divalidasi, dan diamankan oleh aplikasi di sekitarnya.

Hugging Face Trending