AI FRONTIER
Signals worth understanding before they become obvious.
Fusion sensible au format pour un pré-entraînement FP4 rapide
L'article présente la fusion sensible au format, qui co-conçoit chaque producteur de quantification avec son domaine d'échelle et la disposition de son consommateur pour mxfp natif, nvfp global et nvfp local au tableau de threads coopératifs. Sur un pré-entraînement Llama-3 8B jusqu'à 160 milliards de tokens, la voie p...
- Dans des sondes appariées sur le même accélérateur, bfloat16 et Transformer Engine nvfp atteignent 18,8K et 27,6K tokens/s/GPU, tandis que la voie personnalisée la plus rapide atteint 37,9K tokens/s/GPU.
- mxfp avec arrondi stochastique du gradient de ligne et préconditionnement du gradient de poids Hadamard à 32 valeurs à signe fixe atteint 37,2K tokens/s/GPU et 86,3 % de l'utilisation FLOP du modèle bfloat16.
- Cette configuration mxfp termine 2,11 % au-dessus du point final de perte d'entraînement du bfloat16 brut.
- Une recette Transformer Engine avec quatre blocs bfloat16 finaux termine 0,87 % au-dessus du bfloat16 à 27,1K tokens/s/GPU.
Les gains du pré-entraînement FP4 dépendent conjointement du contrat d'échelle, de l'opérande et du chemin d'exécution, et non des seuls Tensor Cores.
Meta publie un SDK pour ESP32 permettant à chacun de fabriquer des appareils compatibles avec son agent IA Muse
Meta a publié un SDK destiné à l'ESP32 qui permet à chacun de construire du matériel compatible avec son agent IA Muse.
- Meta a publié un SDK ciblant l'ESP32.
- Ce SDK vise à permettre à chacun de fabriquer des appareils compatibles avec l'agent IA Muse.
Les développeurs ESP32 peuvent désormais construire du matériel compatible Muse sur un SDK officiel au lieu d'attendre des appareils commercialisés.
OpenAI présente GPT-6 Sol et Luna
OpenAI a annoncé GPT-6 Sol et Luna, deux nouveaux modèles de sa gamme GPT-6.
- OpenAI a présenté de nouveaux modèles nommés GPT-6 Sol et Luna.
- L'annonce provient du canal officiel d'OpenAI.
Les développeurs d'IA devraient suivre GPT-6 Sol et Luna pour évaluer leur pertinence pour leurs applications.
Open TTS Leaderboard : une évaluation scalable pour la synthèse vocale multilingue et le clonage de voix
Hugging Face a lancé l'Open TTS Leaderboard, qui évalue les modèles TTS multilingues et de clonage de voix open source avec des métriques objectives : WER/CER via Qwen3 ASR, RTFx et TTFA sur un GPU H200, et similarité de locuteur (SIM) par cosinus sur des embeddings WavLM.
- Au 30 septembre 2026, plus de 8K modèles TTS sont disponibles sur le Hugging Face Hub.
- Au 30 septembre 2026, seuls 16 des 92 modèles d'Artificial Analysis sont à poids ouverts.
- S'appuyer sur des métriques objectives réduit l'évaluation d'un modèle de quelques semaines de collecte de votes à quelques heures.
- La vue par défaut classe selon le WER macro-moyenné sur les splits anglais de Seed TTS Eval et CV3 Eval (zero shot), avec hexgrad/Kokoro-82M, Supertone/supertonic-3 et fishaudio/s2-pro en tête.
Pour les équipes qui construisent des produits vocaux, ces métriques objectives reproductibles permettent de filtrer de nombreux modèles TTS open source en quelques heures, mais le naturel et les préférences d'écoute exigent encore un vote ...
Lightricks publie LTX-2.5, modèle ouvert vidéo, audio et simulation
Lightricks/LTX-2.5 est un modèle à poids ouverts qui génère de la vidéo et de l'audio synchronisés à partir d'entrées texte, image et vidéo, et prend en charge l'auto-hébergement. Il ajoute la génération multi-plans native, un décodeur vidéo par diffusion, un encodeur de texte Gemma 4 12B et un prédicteur de durée opti...
- La fiche du modèle indique 1 629 984 téléchargements le mois dernier et 6,12 k mentions J'aime.
- Il est distribué sous forme de pack éclaté aligné sur Comfy, avec un fichier .safetensors par composant, incluant des points de contrôle DiT 22B distillés et complets.
- Le DiT distillé utilise un calendrier fixe de 8 étapes avec CFG=1 ; num_frames doit satisfaire num_frames % 8 == 1 et la largeur et la hauteur doivent être divisibles par 32.
- En dessous de 10 M$ de revenu annuel, l'usage commercial et en production est gratuit sous la licence communautaire LTX-2.x ; au-dessus de 10 M$, un accord d'usage commercial payant est requis.
Pour les développeurs, LTX-2.5 offre une voie à poids ouverts et auto-hébergeable vers la génération vidéo et audio synchronisée, avec des points de contrôle éclatés et des variantes quantifiées int8 ou NVFP4 adaptées à différents budgets d...
« very likely » signifie-t-il « incertain » ? Comment les LLM divergent des humains dans la quantification linguistique de l'incertitude
L'article construit un corpus de marqueurs d'incertitude humains issu de la littérature en psychologie et en sciences de la décision, puis y confronte des LLM, et rapporte que les LLM encodent l'incertitude verbale avec des niveaux numériques qui diffèrent sensiblement de ceux des humains. Les auteurs introduisent un a...
- Les auteurs sont Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu et Tianlong Chen ; soumis le 6 septembre 2026 et accepté à ICML 2026.
- Les auteurs construisent un corpus de marqueurs d'incertitude humains à partir de la littérature en psychologie et en sciences de la décision et y confrontent des LLM.
- L'article rapporte que les LLM encodent l'incertitude verbale avec des niveaux numériques qui diffèrent sensiblement de ceux des humains.
- L'algorithme proposé ajuste une correspondance marqueur-incertitude pour expliquer au mieux l'exactitude empirique plutôt que d'estimer l'incertitude par échantillonnage répété.
Les équipes qui construisent des systèmes sensibles à l'incertitude doivent vérifier l'interprétation numérique par les LLM de marqueurs comme « likely » et « possible » par rapport aux jugements humains au lieu de supposer un alignement.
Fonctions transcendantes polynomiales rapides pour les LLM
L'article teste le remplacement des fonctions natives sigmoid, tanh et SiLU par de courts programmes polynomiaux dans les LLM, en rapportant des gains de débit par étape d'entraînement sur des tâches d'intégration GB200 et des écarts de perte près de 100 milliards de tokens.
- Dans un balayage FP16 isolé, les programmes FMA compactés améliorent de 1,19–2,19x les jeux de travail résidant en L2 et de 1,00–1,70x ceux résidant en HBM.
- Sur quatre tâches d'intégration GB200, les substitutions dense SiLU, tanh-softcapped attention et routed-expert SwiGLU améliorent le débit de l'étape d'entraînement complète de 2,7 %, 2,9 % et 8,0 % respectivement.
- La substitution sigmoid attention améliore la passe avant d'attention complète de 7,4 % et l'étape GPU complète de 0,3 %.
- À des horizons courants proches de 100 milliards de tokens, les différences finales de perte d'entraînement lissée (polynomiale moins native) vont de -0,107 à +0,079 sur les quatre tâches.
Pour les constructeurs d'IA, cela indique que des remplacements polynomiaux BF16 de bas degré pour les fonctions transcendantes SFU peuvent apporter des gains de débit d'entraînement mesurables sur les GPU de classe Blackwell, mais l'impact...
À quelle distance Adam se situe-t-il de la descente de gradient naturel ?
L'article traite la règle de mise à jour complète d'Adam, momentum inclus, comme une approximation de Fisher empirique diagonale soumise à une troncature diagonale, une substitution empirique des étiquettes et un décalage temporel, et mesure l'écart géométrique d'Adam par rapport à la vraie NGD via la métrique invarian...
- L'étude couvre quatre paysages de perte : régression linéaire bien conditionnée, régression linéaire mal conditionnée, régression logistique et un petit réseau de neurones non convexe.
- L'écart reste faible dans les cas bien conditionnés mais augmente nettement en conditionnement défavorable, atteignant des désalignements d'environ 10^3 dans le réseau de neurones.
- Une dérive géométrique plus élevée est corrélée à une optimisation initiale plus lente, mais ne dégrade pas la minimisation finale de l'objectif ; Adam atteint systématiquement une perte faible.
- Le Fisher empirique amélioré (iEF) suit des trajectoires plus stables que le Fisher empirique standard (EF), qui oscille ou diverge fréquemment.
Pour les développeurs, cela suggère que la puissance d'optimisation pratique d'Adam pourrait provenir d'un équilibre entre erreurs d'approximation structurelles et lissage par momentum, plutôt que d'un suivi étroit de la trajectoire du grad...