Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-01
01
watchagentsnew architecture

Google pubblica RRSI, che permette all’«harness» di un agente di auto-migliorarsi senza riaddestrare il modello

Ricercatori di Google Cloud AI Research, con la Stanford University e la University of Washington, hanno pubblicato il framework RRSI, che rivede ripetutamente l’harness attorno a un modello, inclusi prompt, uso degli strumenti, flusso di controllo, gestione di memoria e contesto, moduli di competenze e sub-agenti, sen...

  • Su otto benchmark, Terminal-Bench 2.1 è passato dal 74,2% all’80,2%, un guadagno di 6,0 punti percentuali, e SWE-Bench Verified dall’82,0% all’83,8%, un guadagno di 1,8 punti percentuali.
  • JobBench è passato dal 36,0% al 40,7%, un guadagno di 4,7 punti percentuali; GDPval dal 48,8% al 52,3%, un guadagno di 3,5 punti percentuali; Frontier-Eng dal 17,7% al 22,0%, un guadagno di 4,3 punti percentuali.
  • RRSI è pubblicato come framework di ricerca su GitHub, con codice disponibile sotto licenza Apache 2.0.

Per i team che costruiscono agenti, RRSI mostra che una ricerca iterativa controllata sull’harness, con pesi del modello fissi, può produrre miglioramenti misurabili nei benchmark e ridurre il costo in token.

AI Times Korea
02
opportunitymodelscost collapse

OpenAI presenta GPT-6.1 Sol

OpenAI presenta GPT-6.1 Sol per programmazione, uso del computer e lavoro professionale, con intelligenza vicina ad Astra a un quinto dei prezzi standard dei token di input e output dell'API di Astra.

  • OpenAI dichiara che GPT-6.1 Sol offre un'intelligenza vicina ad Astra.
  • Gli usi previsti sono programmazione, uso del computer e lavoro professionale.
  • I prezzi standard dei token di input e output dell'API sono un quinto di quelli di Astra.

Per gli sviluppatori di IA, un'intelligenza vicina ad Astra a un quinto del prezzo per token riduce il costo di inferenza sui carichi di programmazione e uso del computer.

OpenAI News
03
testinferenceopen source unlock

prism-ml pubblica Ternary-Bonsai-2-27B-gguf: un modello 27B a pesi ternari eseguibile da 5,95 GB

prism-ml ha pubblicato Ternary-Bonsai-2-27B-gguf su Hugging Face, quantizzando embedding, proiezioni di attenzione, proiezioni MLP e LM head di Qwen3.8-27B in pesi ternari (g128, {−1,0,+1} con scaling per gruppo in FP16), con due pacchetti GGUF, PTQ1_0 e PQ2_0, per llama.cpp su CUDA, Metal e CPU.

  • La dimensione del modello linguistico è 5,95 GB (PTQ1_0) o 7,21 GB (PQ2_0), circa 9,0x e 7,5x in meno rispetto al riferimento FP16 di circa 54 GB; il formato ternario ideale è 1,72 bit/peso con 5,8 GB.
  • Il paper riporta una media di 84,78 su 14 benchmark in modalità thinking, il 98,2% del riferimento FP16 (86,32), contro 72,59 di IQ2_XXS (7,27 GB) e 85,18 di UD-Q4_K_XL (17,6 GB).
  • Il paper riporta 95,83 su AIME26 e 90,07 su LiveCodeBench, dove IQ2_XXS ottiene 57,5 e 56,4; matematica 96,57, coding 89,42, tool calling BFCL v3 74,92.
  • La lunghezza di contesto è di 262K token su un backbone ad attenzione ibrida con circa il 75% di attenzione lineare; la torre di visione è un pacchetto mmproj Q8_0 separato (0,63 GB) caricato solo per input di immagini.

Per i team che distribuiscono ragionamento di classe 27B su una singola GPU o un laptop, questo mostra che la quantizzazione ternaria end-to-end può mantenere punteggi di ragionamento e tool calling vicini a FP16 con circa 6 GB, ma solo con...

Hugging Face Trending
04
watchresearchnew architecture

Verso il recupero di spazi di interazione per la ricerca agentica: RISE costruisce uno spazio limitato con BM25

Il paper propone RISE (Retrieving Interaction SpacE), che usa BM25 per costruire un sottoinsieme limitato del corpus che l'agente può esplorare e processa i suoi documenti durante l'indicizzazione per la navigazione in stile shell. Su BrowseComp-Plus, RISE raggiunge il 78% di accuratezza con gpt-5.4-mini, eguagliando l...

  • Il paper riporta che su BrowseComp-Plus, RISE raggiunge il 78% di accuratezza con gpt-5.4-mini, eguagliando la baseline DCI puramente shell con circa un quarto del costo per query.
  • Il paper riporta che con 1 milione di documenti, RISE-BM25 raggiunge l'81% con gpt-5.4-mini.
  • Il paper riporta che alla stessa scala di 1 milione di documenti, DCI con gpt-5.4-nano scende al 60%, con 33 fallimenti su 100 in tempo reale.
  • Il paper sostiene che l'interazione illimitata non scala: ogni comando shell ampio è una scansione dell'intero corpus e la latenza peggiora bruscamente con la crescita del corpus.

Per i team che costruiscono agenti di ricerca, il risultato indica che il recupero deve delimitare lo spazio di interazione invece di selezionare solo documenti che entrano nella finestra di contesto, controllando costo e latenza con la cre...

arXiv watchlist
05
watchcreativenew architecture

Diffusion Controller unifica e semplifica la generazione di immagini con IA

Google Research presenta Diffusion Controller, una rete leggera di tipo «ammortizzatore di sterzo» che regola dinamicamente la traiettoria di denoising mentre il modello base resta congelato, migliorando l'allineamento al prompt e la qualità dell'immagine.

  • Valutato su un backbone Stable Diffusion v1.4 in tre regimi di fine-tuning: SFT, reward-weighted loss (RWL) e PPO.
  • Nei percorsi SFT e RWL, il Diffusion Controller gray-box ha superato LoRA nei tassi di vittoria HPS-v2 manipolando molte meno layer interne del modello.
  • La versione white-box completamente sbloccata ha raggiunto un tasso di vittoria del 90% rispetto al modello di riferimento.
  • Un singolo parametro di forza del guidance in inferenza consente di regolare dinamicamente l'intensità dei vincoli di controllo.

Per gli sviluppatori, questo offre un percorso leggero verso una generazione di immagini controllabile e la personalizzazione senza accedere ai pesi di modelli chiusi.

Google Research
06
watchresearchcapability unlock

Google DeepMind presenta SynthID Bio per filigranare le proteine generate dall'IA

Google DeepMind ha pubblicato SynthID Bio, una famiglia di metodi di filigrana per la biologia sintetica che incorpora una firma rilevabile nelle sequenze amminoacidiche e nelle strutture 3D previste da AlphaFold 3, preservando la funzione biologica nei test di laboratorio.

  • Il lavoro riporta che SynthID Bio preserva l'accuratezza di previsione di AlphaFold 3 offrendo una rilevabilità quasi perfetta e resistendo a rumore digitale o lievi cambiamenti di coordinate.
  • Google DeepMind dichiara che pubblicherà il paper metodologico, renderà open source il codice e i dati in vitro e rilascerà i pesi alla comunità di ricerca.

Per gli sviluppatori di strumenti di progettazione biologica, incorporare la filigrana direttamente nei pesi del modello e nella generazione di sequenze offre un livello di verifica automatizzata per lo screening della sintesi del DNA e la ...

Google DeepMind