AI FRONTIER
Signals worth understanding before they become obvious.
Fusione consapevole del formato per pre-addestramento FP4 rapido
Il lavoro presenta la fusione consapevole del formato, che co-progetta ogni produttore di quantizzazione con il suo dominio di scala e il layout del consumatore per mxfp nativo, nvfp globale e nvfp locale all'array di thread cooperativi. Nel pre-addestramento di Llama-3 famiglia 8B fino a 160 miliardi di token, il perc...
- In sonde appaiate sullo stesso acceleratore, bfloat16 e Transformer Engine nvfp raggiungono 18,8K e 27,6K tokens/s/GPU, mentre il percorso personalizzato più veloce raggiunge 37,9K tokens/s/GPU.
- mxfp con arrotondamento stocastico del gradiente di riga e precondizionamento del gradiente dei pesi Hadamard a 32 valori con segno fisso raggiunge 37,2K tokens/s/GPU e l'86,3% di utilizzo FLOP del modello bfloat16.
- Tale configurazione mxfp termina al 2,11% sopra il punto finale di perdita di addestramento del bfloat16 grezzo.
- Una ricetta Transformer Engine con quattro blocchi bfloat16 finali termina allo 0,87% sopra bfloat16 a 27,1K tokens/s/GPU.
I guadagni del pre-addestramento FP4 dipendono congiuntamente dal contratto di scala, dall'operando e dal percorso di esecuzione, non solo dai Tensor Core.
Meta pubblica un SDK per ESP32 che consente a chiunque di costruire dispositivi compatibili con il suo agente IA Muse
Meta ha pubblicato un SDK per ESP32 che consente a chiunque di costruire hardware compatibile con il suo agente IA Muse.
- Meta ha pubblicato un SDK rivolto a ESP32.
- L'SDK intende consentire a chiunque di costruire dispositivi compatibili con l'agente IA Muse.
Gli sviluppatori ESP32 possono ora costruire hardware compatibile con Muse su un SDK ufficiale invece di attendere dispositivi commerciali.
OpenAI presenta GPT-6 Sol e Luna
OpenAI ha annunciato GPT-6 Sol e Luna, due nuovi modelli della sua linea GPT-6.
- OpenAI ha presentato nuovi modelli chiamati GPT-6 Sol e Luna.
- L'annuncio proviene dal canale ufficiale di OpenAI.
Gli sviluppatori di IA dovrebbero seguire GPT-6 Sol e Luna per valutare se sono adatti alle proprie applicazioni.
Open TTS Leaderboard: valutazione scalabile per sintesi vocale multilingue e clonazione della voce
Hugging Face ha lanciato l'Open TTS Leaderboard, che valuta modelli TTS multilingue e di clonazione vocale open source con metriche oggettive: WER/CER tramite Qwen3 ASR, RTFx e TTFA su una GPU H200, e similarità del parlante (SIM) tramite coseno su embedding WavLM.
- Al 30 settembre 2026 sono disponibili più di 8K modelli TTS sull'Hugging Face Hub.
- Al 30 settembre 2026, solo 16 dei 92 modelli su Artificial Analysis sono a pesi aperti.
- Basarsi su metriche oggettive riduce la valutazione di un modello da un paio di settimane di raccolta voti a un paio d'ore.
- La vista predefinita classifica per WER macro-medio sugli split inglesi di Seed TTS Eval e CV3 Eval (zero shot), con hexgrad/Kokoro-82M, Supertone/supertonic-3 e fishaudio/s2-pro in testa.
Per i team che costruiscono prodotti vocali, queste metriche oggettive riproducibili permettono di selezionare molti modelli TTS aperti in poche ore, ma naturalezza e preferenza d'ascolto richiedono ancora il voto umano.
Lightricks pubblica LTX-2.5, modello aperto per video, audio e simulazione
Lightricks/LTX-2.5 è un modello a pesi aperti che genera video e audio sincronizzati da input testuali, immagini e video, e supporta l'auto-hosting. Aggiunge la generazione multi-inquadratura nativa, un decoder video a diffusione, un text encoder Gemma 4 12B e un predittore di durata opzionale.
- La model card riporta 1.629.984 download nell'ultimo mese e 6,12k like.
- È distribuito come pacchetto suddiviso allineato a Comfy, con un file .safetensors per componente, inclusi checkpoint DiT da 22B distillati e completi.
- Il DiT distillato usa una schedulazione fissa a 8 passi con CFG=1; num_frames deve soddisfare num_frames % 8 == 1 e larghezza e altezza devono essere divisibili per 32.
- Con ricavi annui inferiori a 10 milioni di USD, l'uso commerciale e in produzione è gratuito con la licenza community LTX-2.x; oltre 10 milioni di USD è richiesto un accordo commerciale a pagamento.
Per gli sviluppatori, LTX-2.5 offre un percorso a pesi aperti e auto-ospitabile verso la generazione di video e audio sincronizzati, con checkpoint suddivisi e varianti quantizzate int8 o NVFP4 per diversi budget di VRAM.
“very likely” significa “incerto”? Come gli LLM divergono dagli umani nella quantificazione linguistica dell'incertezza
Il lavoro costruisce un corpus di marcatori di incertezza umani dalla letteratura di psicologia e scienza delle decisioni e confronta gli LLM con esso, riportando che gli LLM codificano l'incertezza verbale con livelli numerici che differiscono sostanzialmente da quelli degli umani. Gli autori introducono un algoritmo ...
- Gli autori sono Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu e Tianlong Chen; inviato il 6 settembre 2026 e accettato a ICML 2026.
- Gli autori costruiscono un corpus di marcatori di incertezza umani dalla letteratura di psicologia e scienza delle decisioni e confrontano gli LLM con esso.
- Il lavoro riporta che gli LLM codificano l'incertezza verbale con livelli numerici che differiscono sostanzialmente da quelli degli umani.
- L'algoritmo proposto adatta una mappatura marcatore-incertezza per spiegare al meglio la correttezza empirica invece di stimare l'incertezza tramite campionamento ripetuto.
I team che costruiscono sistemi consapevoli dell'incertezza dovrebbero verificare come gli LLM interpretano numericamente marcatori come “likely” e “possible” rispetto ai giudizi umani invece di presumere allineamento.
Trascendenti polinomiali veloci per LLM
Il paper testa la sostituzione di sigmoid, tanh e SiLU nativi con brevi programmi polinomiali nei LLM, riportando guadagni di throughput per passo di addestramento su attività di integrazione GB200 e differenze di perdita vicino a 100 miliardi di token.
- In uno sweep FP16 isolato, i programmi FMA impacchettati migliorano di 1,19–2,19x su working set residenti in L2 e di 1,00–1,70x su quelli residenti in HBM.
- Su quattro attività di integrazione GB200, le sostituzioni dense SiLU, tanh-softcapped attention e routed-expert SwiGLU migliorano il throughput del passo di addestramento completo rispettivamente del 2,7%, 2,9% e 8,0%.
- La sostituzione sigmoid attention migliora il forward di attenzione completo del 7,4% e il passo GPU completo dello 0,3%.
- A orizzonti comuni vicini a 100 miliardi di token, le differenze finali di perdita di addestramento levigata (polinomiale meno nativa) vanno da -0,107 a +0,079 sulle quattro attività.
Per i costruttori di IA, ciò indica che sostituzioni polinomiali BF16 di basso grado per i trascendenti SFU possono produrre guadagni misurabili di throughput di addestramento su GPU di classe Blackwell, ma l'impatto sulla perdita va valida...
Quanto è lontano Adam dalla discesa del gradiente naturale?
Il lavoro tratta la regola di aggiornamento completa di Adam, incluso il momento, come un'approssimazione diagonale di Fisher empirica soggetta a troncamento diagonale, sostituzione empirica delle etichette e ritardo temporale, e misura la deviazione geometrica di Adam dal vero NGD con la metrica invariante di scala γ(...
- Lo studio copre quattro paesaggi di perdita: regressione lineare ben condizionata, regressione lineare mal condizionata, regressione logistica e una piccola rete neurale non convessa.
- La deviazione rimane bassa in contesti ben condizionati ma aumenta significativamente in condizioni mal condizionate, raggiungendo disallineamenti di circa 10^3 nella rete neurale.
- Una maggiore deriva geometrica è correlata a un'ottimizzazione iniziale più lenta, ma non degrada la minimizzazione finale dell'obiettivo; Adam raggiunge costantemente una perdita bassa.
- Il Fisher empirico migliorato (iEF) segue percorsi più stabili rispetto al Fisher empirico standard (EF), che spesso oscilla o diverge.
Per gli sviluppatori, ciò suggerisce che la potenza di ottimizzazione pratica di Adam possa derivare da un equilibrio tra errori di approssimazione strutturale e smoothing del momento, piuttosto che da un inseguimento ravvicinato del percor...