AI FRONTIER
Signals worth understanding before they become obvious.
SCION : composition de scènes avec des primitives neuronales instanciées
SCION introduit une représentation de scène compositionnelle hiérarchique qui remplace les gaussiennes 3D indépendantes par un vocabulaire compact de primitives réutilisables et des instances légères en espace monde, ajustée à des captures multi-vues par optimisation conjointe des paramètres de scène discrets et contin...
- L'article a été accepté à NeurIPS 2026 et soumis le 1er octobre 2026.
- SCION remplace des millions de gaussiennes indépendantes par scène par un vocabulaire de primitives réutilisables et des instances en espace monde.
- L'article rapporte le maintien d'une qualité élevée même à 1,2 Mo.
- L'article rapporte un taux-distorsion favorable aux méthodes existantes de compression de gaussiennes et permet l'édition et l'animation au niveau des instances sans réentraînement.
Pour les développeurs de pipelines de scènes 3D, SCION montre que modéliser les scènes comme des primitives réutilisables plus des instances peut offrir des poignées d'édition et d'animation au niveau des instances dans une représentation c...
DeskForge : supervision dense issue d'environnements de bureau pour les agents d'usage informatique
DeskForge est un environnement de bureau contrôlable qui compose et explore de vraies applications pour générer une supervision à grande échelle, produisant DeskForge-1M, un corpus de 1,2 million d'observations de bureau annotées contenant 159,7 millions d'instances d'éléments. L'article rapporte le fine-tuning de quat...
- DeskForge-1M contient 1,2 million d'observations de bureau annotées avec 159,7 millions d'instances d'éléments.
- L'article effectue le fine-tuning de quatre modèles vision-langage sur 200 000 exemples de grounding tirés de DeskForge-1M.
- L'article rapporte pour Qwen3.5-4B une hausse de précision de 11,51 points de pourcentage sur ScreenSpot-Pro et de 10,11 points sur OSWorld-G.
- L'article rapporte qu'avec un planificateur fixe, Qwen3.5-4B passe de 31 à 50 tâches sur 119 sur WebArena-Infinity et de 3 à 15 tâches sur 100 sur OpenApps.
Pour les équipes qui construisent des agents d'usage informatique, DeskForge indique que la composition contrôlable de vrais environnements de bureau peut produire à l'échelle des annotations d'éléments denses et améliorer à la fois le grou...
Rank-Aware Speculative Sampling : une règle de vérification pour les arbres de brouillons de diffusion
L'article introduit Rank-Aware Speculative Sampling (RASS), une règle de vérification pour les arbres de brouillons spéculatifs fondée sur un couplage de listes sensible au rang, qui ordonne les candidats selon le déplacement moyen proposition-cible, échantillonne un rang avec des poids optimisés pour minimiser la vari...
- RASS améliore D-GRS, qui génère K candidats conditionnellement indépendants par nœud et les teste séquentiellement dans leur ordre de génération.
- La correction résiduelle garantit un échantillonnage exact pour tout choix de poids de rang.
Pour les développeurs qui accélèrent l'inférence de diffusion, RASS montre qu'exploiter le classement des candidats brouillons sans évaluations supplémentaires du modèle cible peut réduire le nombre d'évaluations du modèle cible à budget de...
Lightricks publie LTX-2.5, un modèle open-weight vidéo et audio
Lightricks/LTX-2.5 est un modèle à poids ouverts qui génère de la vidéo et de l'audio synchronisés à partir d'entrées texte, image et vidéo, et peut être auto-hébergé. Il ajoute la génération multi-plans native, un décodeur vidéo par diffusion, un encodeur de texte Gemma 4 12B personnalisé et un prédicteur de durée opt...
- La fiche du modèle indique 6,48 k likes et 1 645 444 téléchargements le mois dernier.
- Les checkpoints DiT sont étiquetés 22b et proposés en variantes bf16, Comfy int8+convrot et NVFP4.
- L'encodeur de texte est Gemma4 12B avec projections, et la vidéo et l'audio utilisent des VAE distincts.
- Les entités sous 10 M$ de revenu annuel bénéficient d'un usage commercial gratuit sous la licence communautaire LTX-2.x ; au-delà, un accord commercial payant est requis.
Pour les développeurs, LTX-2.5 offre une génération audio-vidéo auto-hébergeable sous forme de pack de poids scindé aligné sur Comfy, avec un transformer dev entraînable, mais les checkpoints int8 sont réservés à ComfyUI.
ReRoute permet des prédictions contrefactuelles dans les émulateurs scientifiques sans expériences contrôlées
L'article présente ReRoute, un cadre de prédiction scientifique ciblée de type what-if qui combine des données factuelles avec une connaissance mécaniste partielle et ne nécessite aucune donnée d'intervention contrôlée pour l'adaptation. ReRoute fixe l'entrée interrogée d'un backbone pré-entraîné à une valeur de référe...
- L'article rapporte que ReRoute atteint des prédictions contrefactuelles très précises dans un système contrôlé d'advection-diffusion où les réponses exactes sont disponibles.
- L'article fournit un résultat d'identification causale pour cette construction sous des hypothèses structurelles explicites, l'argument central étant vérifié par machine dans Lean.
Pour les équipes qui construisent des émulateurs scientifiques, ReRoute montre que des données factuelles plus une connaissance mécaniste partielle peuvent améliorer la prédiction contrefactuelle sous décalage de distribution sans générer d...
DeReAct : raisonnement et action décomposés pour des agents IA fiables
DeReAct est une architecture d'agent modulaire qui externalise deux politiques de contrôle : un Critic qui valide les actions proposées avant leur exécution, et un Context Manager qui reconstruit un State soutenu par l'environnement et certifie l'achèvement de la tâche. L'article rapporte que sur GAIA et SWE-bench Veri...
- L'article rapporte des gains de Pass@1 de 6,5 à 7,0 points pour Qwen3-Coder-480B.
- L'article rapporte des gains de Pass@1 de 4,2 à 5,2 points pour Claude Sonnet 4.5.
- Avec Claude Opus 4.5, le Pass@1 reste comparable à ReAct, tandis que DeReAct produit des trajectoires plus complètes en preuves et satisfaisant davantage les contraintes.
- L'article indique que le contrôle externe est efficace lorsque les défaillances ciblées sont suffisamment fréquentes et que la politique de contrôle est elle-même suffisante.
Pour les développeurs d'agents, séparer la validation des actions et la certification d'achèvement d'une politique unique peut accroître la fiabilité des modèles plus faibles sans changer le modèle Brain sous-jacent.
Cloudflare publie Clef : un modèle décisionnel multimodal de 27B qui renvoie des probabilités structurées en une seule passe avant
Cloudflare a publié Clef, un modèle multimodal post-entraîné à partir de Qwen/Qwen3.8-27B qui transforme un état et un schéma de questions typées en décisions, en renvoyant une probabilité pour chaque option autorisée de chaque question, sans génération de texte libre ni analyse de sortie.
- 27B paramètres, BF16, stocké en safetensors fragmentés standard, publié sous licence Apache-2.0.
- Accepte du texte, du JSON, des images ou de la vidéo comme état et produit un logit par option autorisée par question, avec un softmax par question donnant les probabilités.
- Testé avec torch 2.11 et transformers 5.10.2 sur un seul H200 ; les entrées image et vidéo nécessitent aussi pillow.
- Dans l'exécution interne Decision Index 0.2.1, l'exactitude exacte des cas BFCL est de 98,5, le macro-F1 BANKING77 est de 94,2, la latence médiane est de 209,3 ms et la latence p95 est de 238,6 ms.
Pour les développeurs d'IA qui ont besoin de décisions structurées plutôt que de texte libre, Clef offre une option multimodale de 27B avec une API compatible Jev/SystemOne, bien que sa latence soit supérieure à celle de variantes plus peti...
EditHero : un benchmark pour l’édition 3D longue durée au niveau des pièces et le Vibe Modeling
L’article présente EditHero, décrit par les auteurs comme le premier benchmark pour l’édition 3D longue durée au niveau des pièces, avec des instructions en langage naturel et des images cibles pour la géométrie et la texture. Un moteur d’assemblage déterministe produit la cible exacte après chaque édition, et chaque s...
- L’article décrit EditHero comme, selon les auteurs, le premier benchmark pour l’édition 3D longue durée au niveau des pièces, avec des instructions en langage naturel et des images cibles pour la géométrie et la texture.
- Un moteur d’assemblage déterministe produit la cible exacte après chaque édition, et chaque séquence est revue manuellement.
- Les méthodes non agentiques opèrent de haut en bas, en régénérant l’objet à partir d’une représentation 3D apprise, et manquent souvent la modification demandée tout en perturbant des régions qui devraient rester fixes.
Ce benchmark déplace l’évaluation de l’édition unique vers la capacité à ne modifier que ce qui est demandé lors de révisions multi-étapes, offrant aux développeurs de pipelines d’édition 3D itérative une cible de comparaison reproductible.