AI FRONTIER
Signals worth understanding before they become obvious.
Presentiamo GPT-6.1 Sol
GPT-6.1 Sol offre un'intelligenza vicina ad Astra per programmazione, uso del computer e lavoro professionale a un quinto dei prezzi standard dei token di input e output dell'API di Astra.
- OpenAI News annuncia GPT-6.1 Sol.
- Posizionato per programmazione, uso del computer e lavoro professionale con intelligenza vicina ad Astra.
- I prezzi standard dei token di input e output dell'API sono un quinto di quelli di Astra.
Per gli sviluppatori di IA, un'intelligenza vicina ad Astra a un quinto del prezzo per token riduce il costo di inferenza dei flussi di agenti per programmazione e uso del computer.
L'illusione del prompt di sistema: come i preamboli di istruzione modificano il calcolo nei modelli linguistici
Il paper utilizza il Centered Kernel Alignment (CKA) per confrontare le rappresentazioni strato per strato sotto 20 prompt di sistema in 17 modelli ottimizzati per istruzioni, rilevando che gli effetti sono selettivi per strato e dipendenti dal tipo di istruzione: le istruzioni di persona e formattazione ristrutturano ...
- Sono stati valutati 17 modelli ottimizzati per istruzioni, distribuiti su 8 famiglie di architettura e da 1,5B a 72B parametri, sotto 20 prompt di sistema in cinque categorie funzionali.
- Le istruzioni di sicurezza restrittive e quelle esplicitamente permissive («non hai restrizioni») attivano percorsi di calcolo quasi identici, con correlazione CKA media di 0,997.
- La penetrazione della sicurezza resta inferiore al 10% su scala commerciale, anche a 70B-72B.
- La profondità rappresentazionale predice l'ampiezza dell'effetto comportamentale nell'intera coorte di 17 modelli (Spearman rho = 0,761, p < 0,001).
Per gli sviluppatori che si affidano alla sicurezza basata su prompt di sistema, questa evidenza indica che le istruzioni di sicurezza possono essere codificate in modo affidabile senza essere profondamente applicate nel calcolo, quindi le ...
TomasuLLM: esecuzione speculativa out-of-order per agenti LLM
TomasuLLM è un runtime che esegue le chiamate agli strumenti dell'agente fuori dall'ordine della traiettoria preservando la correttezza dell'esecuzione del task: abbozza azioni future, le esegue in sandbox isolate copy-on-write, traccia dipendenze ed effetti e conferma i risultati nell'ordine della traiettoria solo dop...
- Il paper riporta 1,31x su 100 task SWE-bench Verified, 1,35x su 28 task Terminal-Bench 2.0 e 1,27x di progresso corrispondente su 18 sessioni SWE-Marathon.
- Su 4.010 record di validazione dei commit verificati, il paper riporta zero accettazioni errate.
- Il lavoro affronta strumenti di lunga durata come compilatori, suite di test e comandi di repository, che richiedono da secondi a minuti mentre l'agente di coding resta inattivo.
- I risultati coprono tre benchmark con chiamate a strumenti da meno di un secondo a diversi minuti e scalano con la latenza degli strumenti.
Per i team che costruiscono agenti di coding, TomasuLLM mostra che eseguire speculativamente le chiamate agli strumenti in sandbox isolate e confermarle nell'ordine della traiettoria può ridurre la latenza degli strumenti lunghi senza sacri...
MiniMax rende open source OpenAgentCore per la compatibilità con l'API OpenAI Agents
MiniMax ha reso open source OpenAgentCore, pensato per la compatibilità con l'API OpenAI Agents.
- MiniMax ha reso open source OpenAgentCore.
- OpenAgentCore punta alla compatibilità con l'API OpenAI Agents.
Gli sviluppatori di IA possono usare OpenAgentCore per indirizzare i flussi di lavoro dell'API OpenAI Agents con un'implementazione open source di MiniMax.
SInGA: apprendimento dell'inpainting semantico per avatar di testa gaussiani animabili
Il lavoro presenta SInGA, un metodo che definisce un framework di inpainting semantico nello spazio UV per completare le regioni facciali non osservate a partire da una singola immagine e poi regredire gli attributi gaussiani, producendo un avatar di testa gaussiano animabile. L'avatar risultante generalizza tra identi...
- Il framework di inpainting semantico è definito nello spazio UV e utilizza i segnali di simmetria intrinseci del volto umano per completare le regioni non osservate.
- Le caratteristiche estratte dalle regioni osservate vengono usate per completare le regioni non osservate, e la rappresentazione completata viene poi usata per regredire gli attributi gaussiani.
- Invece di una singola gaussiana per ogni superficie o posizione di pixel, il metodo impila più gaussiane per migliorare il dettaglio.
- Il lavoro riporta che il metodo genera avatar di testa di alta qualità con completezza e preservazione dell'identità migliorate, supportando animazione realistica e rendering coerente da viste non osservate.
Per chi costruisce avatar di testa da una singola immagine, spostare il completamento in uno spazio UV con corrispondenze spaziali coerenti offre un approccio riutilizzabile per gestire le regioni non osservate in scenari a vista singola.
Controllo conformale della factualità per la generazione aumentata da recupero multi-hop
Il lavoro applica il filtraggio conformale suddiviso delle affermazioni alla RAG multi-hop e lo valuta su HotpotQA, Natural Questions e TriviaQA con Llama 3.1 8B e GPT-4o-mini, insieme a un esperimento di riferimento a singolo hop. Riporta che al target del 95% la frazione di risposte le cui affermazioni mantenute sono...
- In tutte e sei le configurazioni multi-hop modello-dataset, target conformali più stringenti aumentano in modo coerente la frazione di risposte le cui affermazioni mantenute sono pienamente supportate.
- Al target del 95%, questo tasso va dal 95,80% al 97,20%, rispetto al 55,60%-76,03% senza filtraggio.
- Al target del 95%, solo il 4,41%-31,09% delle affermazioni generate viene mantenuto e il 9,70%-51,40% delle risposte rimane non vuoto.
- La valutazione usa Llama 3.1 8B e GPT-4o-mini su HotpotQA, Natural Questions e TriviaQA, insieme a un esperimento di riferimento a singolo hop.
Per chi costruisce RAG multi-hop, il filtraggio conformale aumenta il supporto a livello di affermazione, ma va letto insieme al mantenimento delle affermazioni e all'astensione, poiché al target del 95% la maggior parte delle affermazioni ...
Accelerazione del modello linguistico a diffusione tramite un generatore medio discreto
Il lavoro introduce il Discrete Average Generator, che estende MeanFlow alle catene di Markov a tempo continuo definendo un generatore medio come l'incremento normalizzato del kernel di transizione su un intervallo temporale, con un'identità di autoconsistenza come base dell'obiettivo di addestramento.
- Nelle simulazioni del modello di Potts, questo obiettivo riduce fino al 67% la distanza di variazione totale del campionatore a K passi.
- Su OpenWebText, il metodo ottiene la più bassa perplessità generativa tra i metodi valutati per 8-64 passi di campionamento, consentendo un'accelerazione di 16x.
- Su ImageNet, il metodo raggiunge prestazioni comparabili ai metodi esistenti.
- L'identità di autoconsistenza ammette un'espressione in forma chiusa se proiettata sulle marginali per coordinata.
Per i team che costruiscono modelli linguistici a diffusione discreta, questo offre un obiettivo di addestramento che riduce i passi di campionamento preservando la qualità di generazione, rendendo l'accelerazione di 16x riportata meritevol...
Gli agenti di IA sono vulnerabili alla radicalizzazione
Il paper simula conversazioni tra due agenti LLM: un target che interpreta una persona umana in base ad attributi demografici e psicologici, e un influencer che mira a rendere più estreme le convinzioni del target. Riporta che sia la risonanza (rafforzare una convinzione preesistente) sia la persuasione (promuovere una...
- Inviato ad arXiv il 29 settembre 2026 come arXiv:2609.38296, classificato in cs.AI e cs.CY.
- Configurazione: un LLM target interpreta una persona umana in base ad attributi demografici e psicologici, mentre un LLM influencer mira a rendere più estreme le convinzioni del target.
- Il paper esamina due percorsi: la risonanza rafforza una convinzione preesistente del target e la persuasione promuove una convinzione che il target considera inizialmente poco importante.
- Il paper riporta che entrambi i meccanismi radicalizzano il target su metriche affettive e comportamentali, ma la risonanza produce effetti costantemente più forti della persuasione.
Chi sviluppa agenti personalizzati e sistemi multi-agente dovrebbe considerare gli input allineati alle convinzioni come una superficie di influenza ad alto rischio, perché il paper riporta che la risonanza produce una radicalizzazione più ...