AI FRONTIER
Signals worth understanding before they become obvious.
Studi Harvard: agen AI membuat pull request 49 persen lebih lama
Ringkasan studi Harvard melaporkan bahwa pull request memakan waktu 49 persen lebih lama saat agen AI digunakan.
- Ringkasan studi melaporkan kenaikan 49 persen pada durasi pull request.
- Hasil ini berasal dari studi Harvard, dilaporkan oleh BornCity.
Tim yang membangun agen AI harus melacak waktu siklus pull request sebagai metrik utama, karena studi ini melaporkan kenaikan 49 persen.
Nat. Mach. Intell. | SynCraft: membuat LLM menyunting molekul secara presisi untuk meningkatkan kemampuan sintesis
SynCraft adalah metode yang membuat LLM menyunting molekul secara presisi untuk meningkatkan kemampuan sintesis, diterbitkan di Nature Machine Intelligence.
- Penelitian ini diterbitkan di Nature Machine Intelligence.
- SynCraft membuat LLM menyunting molekul secara presisi.
- Tujuannya adalah meningkatkan kemampuan sintesis molekul.
Bagi pembangun AI, SynCraft menunjukkan arah penggunaan LLM untuk penyuntingan presisi struktur molekul dan peningkatan kemampuan sintesis.
Nano Banana vs GPT Image API: Benchmark AI 13 Langkah [2026]
Abstrak makalah ini mengusulkan atau menggunakan benchmark baru untuk mengukur performa model pada tugas tertentu, dengan membandingkan Nano Banana dan GPT Image API.
- Abstrak makalah berjudul Nano Banana vs GPT Image API: 13-Step AI Benchmark [2026].
- Abstrak menyatakan bahwa benchmark ini mengukur performa model pada tugas tertentu.
- Abstrak membandingkan Nano Banana dengan GPT Image API.
Bagi pembangun AI, sinyalnya adalah kerangka evaluasi khusus yang mempertemukan Nano Banana langsung dengan GPT Image API, sehingga performa model gambar pada tugas tertentu dapat dilacak.
Agen bilang sudah selesai. Basis data tidak setuju.
Microsoft dan Hugging Face merilis ThinkingBox, yang menjalankan 507 alur kerja bisnis berstatus 20 kali masing-masing dan menilai agen berdasarkan status backend terminal serta efek samping yang ditinggalkan, bukan teks yang dihasilkan.
- Dalam ablasi common-set yang mencakup 121.680 uji coba valid pada 12 model LLM, 79.853 percobaan gagal pada pemeriksaan yang dapat dieksekusi.
- Dari kegagalan itu, 67,24% tetap berakhir bersih, memanggil alat yang mengubah status, dan tidak melaporkan kesalahan alat akhir.
- Pemeriksaan yang dapat dieksekusi menemukan nilai bidang yang salah pada 77,61% di antaranya, efek tambahan tak diinginkan pada 43,30%, dan efek wajib yang hilang pada 25,36%.
- Tanda kegagalan adalah penggunaan alat 79,9%, pembaruan status salah 10,3%, penyelesaian pengguna tidak tuntas 7,0%, dan tanpa tindakan pengubah status 2,9%.
Bagi tim yang membangun agen, tingkat konsistensi 20/20 adalah masukan desain yang perlu dipantau, dan status terminal harus diperiksa sebelum commit, bukan ringkasan model.
Model yang tidak ada, jadi Anda membuatnya sendiri
Penulis membangun enam model dengan ML Intern, termasuk penulis ulang prompt 0,8B yang berjalan di CPU, mengembalikan output valid 99,7% dari waktu, dan memakai sekitar seperempat token model guru 9B.
- Model siswa 0,8B tersedia sebagai file GGUF 812 MB untuk dijalankan di CPU.
- Model guru 9B membutuhkan sekitar 20 GB memori dan berpikir ribuan token sebelum menulis satu paragraf.
- Komputasi seluruh proyek, termasuk pelabelan 8.797 contoh permintaan oleh model 9B, menelan biaya 16 USD.
- Total biaya komputasi enam proyek sekitar 103 USD.
ML Intern memungkinkan pengembang individu menyuling dan menerbitkan model kecil khusus dengan biaya puluhan dolar, tanpa membangun infrastruktur pelatihan sendiri.
InnovationEval: Menguji Kemampuan Riset AI
Abstrak makalah memperkenalkan InnovationEval, evaluasi yang bertujuan menguji kemampuan riset AI.
- Sumbernya adalah JournalArta dan judulnya InnovationEval: Uji Kemampuan Riset AI.
- Ringkasan yang tersedia hanya menyatakan bahwa InnovationEval menguji kemampuan riset AI.
Pengembang AI perlu memantau InnovationEval untuk mengetahui dimensi kemampuan riset yang diukurnya, karena belum ada metrik konkret.
Venastine-Research merilis bobot terkuantisasi Xing4.0-29B-A4B-GGUF
Xing4.0-29B-A4B adalah model bahasa besar generasi berikutnya dari seri Xing (sebelumnya TeleChat) dengan total 29B parameter dan hanya 4B yang diaktifkan per token, mendukung panjang konteks 256K secara native dan dapat diperluas hingga 512K, dan repositori ini menyediakan bobot terkuantisasi GGUF.
- Total 29B parameter, 4B diaktifkan per token, 40 lapisan, hidden size 3584.
- Menggunakan atensi MLA dengan 64 expert ter-routing, 4 expert aktif per token, dan 1 expert bersama.
- Panjang konteks native 256K, dapat diperluas hingga 512K.
- Kuantisasi GGUF berkisar dari 9,9 GB untuk IQ2_M 2-bit hingga 62,5 GB untuk F16 16-bit.
Bagi pengembang yang menyebarkan model MoE konteks panjang secara lokal atau dengan VRAM terbatas, repositori ini menawarkan opsi kuantisasi GGUF dari 9,9 GB hingga 62,5 GB.
LegalOn memangkas separuh biaya Codex sambil mempertahankan kecepatan pengembangan
LegalOn memangkas 65% estimasi biaya Codex harian sambil mempertahankan kecepatan pengembangan, dengan mencocokkan Astra, Sol, dan Luna ke tugas-tugas serta mengelola anggaran secara strategis.
- LegalOn memangkas 65% estimasi biaya Codex harian.
- Perusahaan mempertahankan kecepatan pengembangan sambil menekan biaya.
- Perusahaan mencocokkan Astra, Sol, dan Luna ke tugas-tugas dan mengelola anggaran secara strategis.
Bagi pembangun AI, ini menunjukkan bahwa mencocokkan model ke tugas dan mengelola anggaran secara strategis dapat menekan biaya inferensi secara tajam tanpa mengorbankan kecepatan pengembangan.