AI FRONTIER
Signals worth understanding before they become obvious.
Memperkenalkan GPT-6.1 Sol
GPT-6.1 Sol menawarkan kecerdasan mendekati Astra untuk coding, penggunaan komputer, dan pekerjaan profesional dengan harga token input dan output API standar seperlima dari Astra.
- OpenAI News mengumumkan GPT-6.1 Sol.
- Diposisikan untuk coding, penggunaan komputer, dan pekerjaan profesional dengan kecerdasan mendekati Astra.
- Harga token input dan output API standar adalah seperlima dari Astra.
Bagi pembangun AI, kecerdasan mendekati Astra dengan harga token seperlima menurunkan biaya inferensi alur kerja agen coding dan penggunaan komputer.
Ilusi System Prompt: Bagaimana Preambul Instruksi Mengubah Komputasi pada Model Bahasa
Makalah ini menggunakan Centered Kernel Alignment (CKA) untuk membandingkan representasi per lapisan di bawah 20 system prompt pada 17 model yang disetel dengan instruksi, dan menemukan bahwa efeknya selektif per lapisan dan bergantung pada jenis instruksi: instruksi persona dan pemformatan merestrukturisasi representa...
- Mengevaluasi 17 model yang disetel dengan instruksi yang mencakup 8 keluarga arsitektur dan 1,5B hingga 72B parameter di bawah 20 system prompt dalam lima kategori fungsional.
- Instruksi keselamatan yang restriktif dan instruksi yang secara eksplisit permisif ("Anda tidak memiliki batasan") mengaktifkan jalur komputasi yang hampir identik, dengan korelasi CKA rata-rata 0,997.
- Penetrasi keselamatan tetap di bawah 10% pada skala komersial, bahkan pada 70B-72B.
- Kedalaman representasional memprediksi ukuran efek perilaku di seluruh kohort 17 model (Spearman rho = 0,761, p < 0,001).
Bagi pengembang yang mengandalkan keselamatan berbasis system prompt, bukti ini menunjukkan instruksi keselamatan dapat dikodekan secara andal tetapi tidak diterapkan secara mendalam dalam komputasi, sehingga pertahanan pada lapisan prompt ...
TomasuLLM: Eksekusi Spekulatif Out-of-Order untuk Agen LLM
TomasuLLM adalah runtime yang mengeksekusi panggilan alat agen di luar urutan trajektori sambil mempertahankan kebenaran eksekusi tugas: ia menyusun draf aksi mendatang, menjalankannya di sandbox copy-on-write yang terisolasi, melacak dependensi dan efeknya, lalu melakukan commit hasil dalam urutan trajektori hanya set...
- Makalah melaporkan 1,31x pada 100 tugas SWE-bench Verified, 1,35x pada 28 tugas Terminal-Bench 2.0, dan 1,27x kemajuan yang cocok pada 18 sesi SWE-Marathon.
- Dari 4.010 catatan validasi commit yang diaudit, makalah melaporkan nol penerimaan palsu.
- Karya ini menyasar alat berdurasi panjang seperti kompilator, rangkaian pengujian, dan perintah repositori, yang memakan waktu detik hingga menit saat agen coding menganggur.
- Hasilnya mencakup tiga benchmark dengan panggilan alat dari di bawah satu detik hingga berdurasi menit dan berskala dengan latensi alat.
Bagi tim yang membangun agen coding, TomasuLLM menunjukkan bahwa menjalankan panggilan alat secara spekulatif di sandbox terisolasi dan melakukan commit dalam urutan trajektori dapat memangkas latensi alat berdurasi panjang tanpa mengorbank...
MiniMax Membuka Sumber OpenAgentCore untuk Kompatibilitas API OpenAI Agents
MiniMax telah membuka sumber OpenAgentCore, yang ditujukan untuk kompatibilitas dengan API OpenAI Agents.
- MiniMax membuka sumber OpenAgentCore.
- OpenAgentCore menargetkan kompatibilitas API OpenAI Agents.
Pembangun AI dapat menggunakan OpenAgentCore untuk menargetkan alur kerja API OpenAI Agents dengan implementasi sumber terbuka MiniMax.
SInGA: Mempelajari Inpainting Semantik untuk Avatar Kepala Gaussian yang Dapat Dianimasikan
Makalah ini memperkenalkan SInGA, sebuah metode yang mendefinisikan kerangka inpainting semantik di ruang UV untuk melengkapi area wajah yang tidak teramati dari satu gambar, lalu meregresi atribut Gaussian sehingga menghasilkan avatar kepala Gaussian yang dapat dianimasikan. Avatar yang dihasilkan menggeneralisasi lin...
- Kerangka inpainting semantik didefinisikan di ruang UV dan memanfaatkan petunjuk simetri bawaan wajah manusia untuk melengkapi area yang tidak teramati.
- Fitur yang diekstrak dari area teramati digunakan untuk melengkapi area yang tidak teramati, dan representasi yang telah dilengkapi kemudian digunakan untuk meregresi atribut Gaussian.
- Alih-alih satu Gaussian pada setiap permukaan atau lokasi piksel, metode ini menumpuk beberapa Gaussian untuk meningkatkan detail.
Bagi pengembang avatar kepala dari satu gambar, memindahkan proses pelengkapan ke ruang UV dengan korespondensi spasial yang konsisten menawarkan pendekatan yang dapat digunakan ulang untuk menangani area tak teramati pada skenario satu sud...
Kontrol Faktualitas Konformal untuk Retrieval-Augmented Generation Multi-Hop
Makalah ini menerapkan penyaringan klaim konformal terpisah pada RAG multi-hop dan mengevaluasinya pada HotpotQA, Natural Questions, dan TriviaQA dengan Llama 3.1 8B serta GPT-4o-mini, bersama eksperimen referensi satu-hop. Makalah melaporkan bahwa pada target 95%, proporsi respons yang klaim tersisanya didukung penuh ...
- Pada keenam konfigurasi model-dataset multi-hop, target konformal yang makin ketat secara konsisten meningkatkan proporsi respons yang klaim tersisanya didukung penuh.
- Pada target 95%, tingkat ini berkisar 95,80%-97,20%, dibandingkan 55,60%-76,03% tanpa penyaringan.
- Pada target 95%, hanya 4,41%-31,09% klaim yang dihasilkan tetap disimpan dan 9,70%-51,40% respons tetap tidak kosong.
- Evaluasi menggunakan Llama 3.1 8B dan GPT-4o-mini pada HotpotQA, Natural Questions, dan TriviaQA, bersama eksperimen referensi satu-hop.
Bagi pembangun RAG multi-hop, penyaringan konformal menaikkan dukungan tingkat klaim, tetapi harus dibaca bersama retensi klaim dan abstensi, karena pada target 95% sebagian besar klaim dibuang dan banyak respons menjadi kosong.
Percepatan Model Bahasa Difusi melalui Discrete Average Generator
Makalah ini memperkenalkan Discrete Average Generator, yang memperluas MeanFlow ke Rantai Markov Waktu Kontinu dengan mendefinisikan generator rata-rata sebagai kenaikan ternormalisasi dari kernel transisi selama interval waktu, dengan identitas swakonsistensi sebagai dasar tujuan pelatihan.
- Pada simulasi model Potts, tujuan ini menurunkan jarak variasi total sampler K-langkah hingga 67%.
- Pada OpenWebText, metode ini mencapai perplexity generatif terendah di antara metode yang dievaluasi untuk 8 hingga 64 langkah sampling sekaligus memungkinkan percepatan 16x.
- Pada ImageNet, metode ini mencapai kinerja yang sebanding dengan metode yang ada.
- Identitas swakonsistensi memiliki ekspresi bentuk tertutup saat diproyeksikan ke marginal per-koordinat.
Bagi tim yang membangun model bahasa difusi diskret, ini menawarkan tujuan pelatihan yang memangkas langkah sampling sambil mempertahankan kualitas generasi, sehingga percepatan 16x yang dilaporkan layak direproduksi pada data sendiri.
Agen AI Rentan terhadap Radikalisasi
Makalah ini menyimulasikan percakapan antara dua agen LLM: target yang memerankan persona manusia berdasarkan atribut demografis dan psikologis, serta influencer yang bertujuan membuat keyakinan target lebih ekstrem. Makalah ini melaporkan bahwa resonansi (memperkuat keyakinan yang sudah ada) dan persuasi (mempromosika...
- Dikirim ke arXiv pada 29 September 2026 sebagai arXiv:2609.38296, diklasifikasikan dalam cs.AI dan cs.CY.
- Pengaturan: LLM target memerankan persona manusia berdasarkan atribut demografis dan psikologis, sementara LLM influencer bertujuan membuat keyakinan target lebih ekstrem.
- Makalah ini meneliti dua jalur: resonansi memperkuat keyakinan target yang sudah ada, dan persuasi mempromosikan keyakinan yang awalnya dianggap tidak penting oleh target.
- Makalah ini melaporkan bahwa kedua mekanisme meradikalisasi target pada metrik afektif dan perilaku, tetapi resonansi menghasilkan efek yang konsisten lebih kuat daripada persuasi.
Pengembang agen personalisasi dan sistem multi-agen harus memperlakukan masukan yang selaras dengan keyakinan sebagai permukaan pengaruh berisiko tinggi, karena makalah ini melaporkan resonansi menghasilkan radikalisasi lebih kuat yang juga...