AI FRONTIER
Signals worth understanding before they become obvious.
SCION: composizione di scene con primitive neurali istanziate
SCION introduce una rappresentazione di scena composizionale gerarchica che sostituisce le gaussiane 3D indipendenti con un vocabolario compatto di primitive riutilizzabili e istanze leggere nello spazio mondo, adattata a catture multi-vista tramite ottimizzazione congiunta di parametri di scena discreti e continui. Il...
- Il paper è stato accettato a NeurIPS 2026 e inviato il 1º ottobre 2026.
- SCION sostituisce milioni di gaussiane indipendenti per scena con un vocabolario di primitive riutilizzabili e istanze nello spazio mondo.
- Il paper riporta il mantenimento di alta qualità anche a 1,2 MB.
- Il paper riporta un rate-distortion favorevole ai metodi esistenti di compressione gaussiana e consente editing e animazione a livello di istanza senza riaddestramento.
Per chi costruisce pipeline di scene 3D, SCION mostra che modellare le scene come primitive riutilizzabili più istanze può offrire controlli editabili e animabili a livello di istanza in una rappresentazione compatta di circa 1,2 MB.
DeskForge: supervisione densa da ambienti desktop per agenti di uso del computer
DeskForge è un ambiente desktop controllabile che compone ed esplora applicazioni reali per generare supervisione su larga scala, producendo DeskForge-1M, un corpus di 1,2 milioni di osservazioni desktop annotate contenenti 159,7 milioni di istanze di elementi. Il paper riporta il fine-tuning di quattro modelli visione...
- DeskForge-1M contiene 1,2 milioni di osservazioni desktop annotate con 159,7 milioni di istanze di elementi.
- Il paper esegue il fine-tuning di quattro modelli visione-linguaggio su 200.000 esempi di grounding tratti da DeskForge-1M.
- Il paper riporta per Qwen3.5-4B un aumento di accuratezza di 11,51 punti percentuali su ScreenSpot-Pro e di 10,11 punti su OSWorld-G.
- Il paper riporta che, con un planner fisso, Qwen3.5-4B passa da 31 a 50 di 119 task su WebArena-Infinity e da 3 a 15 di 100 task su OpenApps.
Per i team che costruiscono agenti di uso del computer, DeskForge indica che la composizione controllabile di ambienti desktop reali può scalare annotazioni dense di elementi e migliorare sia il grounding GUI sia il completamento di task a ...
Rank-Aware Speculative Sampling: una regola di verifica per alberi di bozze di diffusione
Il lavoro introduce Rank-Aware Speculative Sampling (RASS), una regola di verifica per alberi di bozze speculative basata su accoppiamento di liste sensibile al rango, che ordina i candidati lungo lo spostamento medio proposta-obiettivo, campiona un rango con pesi ottimizzati per minimizzare la variazione totale tra le...
- RASS migliora D-GRS, che genera K candidati condizionatamente indipendenti per nodo e li verifica in sequenza nel loro ordine di generazione.
- RASS è valutato su un obiettivo a miscela gaussiana, generazione incondizionata nello spazio dei pixel su FFHQ, generazione condizionata su CIFAR-10 e diffusione latente con Stable Diffusion 3.5 usando prompt COCO2014.
- La correzione residua garantisce un campionamento esatto per qualsiasi scelta dei pesi di rango.
Per chi accelera l'inferenza di diffusione, RASS mostra che sfruttare l'ordinamento dei candidati bozza senza ulteriori valutazioni del modello obiettivo può ridurre il numero di valutazioni del modello obiettivo a budget di calcolo equival...
Lightricks pubblica LTX-2.5, modello open-weight per video e audio
Lightricks/LTX-2.5 è un modello a pesi aperti che genera video e audio sincronizzati da input testuali, immagini e video, e può essere auto-ospitato. Aggiunge generazione multi-inquadratura nativa, un decoder video a diffusione, un text encoder Gemma 4 12B personalizzato e un predittore di durata opzionale.
- La model card riporta 6,48k like e 1.645.444 download nell'ultimo mese.
- I checkpoint DiT sono etichettati 22b e disponibili in varianti bf16, Comfy int8+convrot e NVFP4.
- Il text encoder è Gemma4 12B con proiezioni, e video e audio usano VAE separati.
- Le entità con ricavi annui inferiori a 10 milioni di USD hanno uso commerciale gratuito con la licenza community LTX-2.x; oltre tale soglia serve un accordo commerciale a pagamento.
Per gli sviluppatori, LTX-2.5 offre generazione audio-video auto-ospitabile come pacchetto di pesi suddiviso e allineato a Comfy, con transformer dev addestrabile, ma i checkpoint int8 sono solo per ComfyUI.
ReRoute consente previsioni controfattuali negli emulatori scientifici senza esperimenti controllati
Il lavoro presenta ReRoute, un framework per la previsione scientifica mirata di tipo what-if che combina dati fattuali con conoscenza meccanicistica parziale e non richiede dati di intervento controllato per l'adattamento. ReRoute fissa l'input interrogato di un backbone pre-addestrato a un valore di riferimento, rein...
- Su interventi climatici accoppiati tenuti da parte, ReRoute riduce l'errore climatico aggregato del 18,2-31,8% sotto forti spostamenti della distribuzione di CO2, preservando le prestazioni in condizioni standard.
- Il lavoro riporta che ReRoute raggiunge previsioni controfattuali molto accurate in un sistema controllato di avvezione-diffusione in cui sono disponibili risposte esatte.
- Il lavoro fornisce un risultato di identificazione causale per questa costruzione sotto assunzioni strutturali esplicite, con l'argomento centrale verificato automaticamente in Lean.
Per i team che costruiscono emulatori scientifici, ReRoute mostra che dati fattuali più conoscenza meccanicistica parziale possono migliorare la previsione controfattuale sotto spostamento di distribuzione senza generare costosi dati di sim...
DeReAct: ragionamento e azione decomposti per agenti IA affidabili
DeReAct è un'architettura di agente modulare che esternalizza due politiche di controllo: un Critic che valida le azioni proposte prima dell'esecuzione e un Context Manager che ricostruisce uno State supportato dall'ambiente e certifica il completamento del task. L'articolo riporta che su GAIA e SWE-bench Verified DeRe...
- L'articolo riporta miglioramenti del Pass@1 da 6,5 a 7,0 punti per Qwen3-Coder-480B.
- L'articolo riporta miglioramenti del Pass@1 da 4,2 a 5,2 punti per Claude Sonnet 4.5.
- Con Claude Opus 4.5, il Pass@1 resta comparabile a ReAct, mentre DeReAct produce traiettorie più complete in termini di evidenze e più rispettose dei vincoli.
- L'articolo afferma che il controllo esterno è efficace quando i fallimenti target sono sufficientemente frequenti e la politica di controllo è essa stessa sufficiente.
Per chi sviluppa agenti, separare la validazione delle azioni e la certificazione del completamento da un'unica politica può aumentare l'affidabilità dei modelli più deboli senza cambiare il modello Brain sottostante.
Cloudflare pubblica Clef: un modello decisionale multimodale da 27B che restituisce probabilità strutturate in un singolo passaggio in avanti
Cloudflare ha pubblicato Clef, un modello multimodale post-addestrato da Qwen/Qwen3.8-27B che trasforma uno stato e uno schema di domande tipizzate in decisioni, restituendo una probabilità per ogni opzione consentita di ogni domanda, senza generazione di testo libero né analisi dell'output.
- 27B parametri, BF16, memorizzato come safetensors frammentati standard, rilasciato con licenza Apache-2.0.
- Accetta testo, JSON, immagini o video come stato e produce un logit per ogni opzione consentita per domanda, con un softmax per domanda che fornisce le probabilità.
- Testato con torch 2.11 e transformers 5.10.2 su una singola H200; gli input immagine e video richiedono anche pillow.
- Nell'esecuzione interna di Decision Index 0.2.1, l'accuratezza esatta dei casi BFCL è 98,5, il macro-F1 di BANKING77 è 94,2, la latenza mediana è 209,3 ms e la latenza p95 è 238,6 ms.
Per gli sviluppatori di IA che necessitano di decisioni strutturate anziché testo libero, Clef offre un'opzione multimodale da 27B con API compatibile con Jev/SystemOne, sebbene la sua latenza sia superiore a quella di varianti più piccole ...
EditHero: un benchmark per l’editing 3D a lungo orizzonte a livello di parti e il Vibe Modeling
Il paper presenta EditHero, descritto dagli autori come il primo benchmark per l’editing 3D a lungo orizzonte a livello di parti, con istruzioni in linguaggio naturale e immagini target sia per la geometria sia per la texture. Un motore di assemblaggio deterministico produce il target esatto dopo ogni modifica, e ogni ...
- Il paper descrive EditHero come, secondo gli autori, il primo benchmark per l’editing 3D a lungo orizzonte a livello di parti, con istruzioni in linguaggio naturale e immagini target per geometria e texture.
- Un motore di assemblaggio deterministico produce il target esatto dopo ogni modifica, e ogni sequenza è revisionata manualmente.
- I metodi non agentici operano dall’alto verso il basso, rigenerando l’oggetto da una rappresentazione 3D appresa, e spesso mancano la modifica richiesta e alterano regioni che dovrebbero restare fisse.
Il benchmark sposta la valutazione dalla singola modifica alla capacità di cambiare solo ciò che è richiesto in revisioni multi-passo, offrendo a chi costruisce pipeline di editing 3D iterativo un obiettivo di confronto riproducibile.