AI FRONTIER
Signals worth understanding before they become obvious.
EmbeddingGemma 2 : un modèle d'embedding multimodal ouvert et léger
Google DeepMind a publié EmbeddingGemma 2, un modèle de 740 millions de paramètres fondé sur l'architecture Gemma 4 sous licence Apache 2.0, qui projette nativement texte, images, audio et vidéo dans un espace d'embedding unifié.
- 740 millions de paramètres, fondé sur l'architecture Gemma 4 et publié sous licence Apache 2.0 à usage commercial permissif.
- Nécessite aussi peu que 270M de paramètres pour les charges de travail texte uniquement, avec encodeurs optionnels vision (170M) et audio (300M).
- Rapporte une amélioration de 9,92 points sur les performances de code dans MTEB Code, de 68,76 à 78,68.
- Matryoshka Representation Learning permet de tronquer les vecteurs de sortie de 768 dimensions à 512, 256 ou 128, offrant jusqu'à 6x de réduction de stockage.
Les développeurs peuvent exécuter entièrement sur appareil des pipelines de recherche cross-modale et de RAG, en arbitrant mémoire et stockage via les encodeurs modulaires et la troncature MRL.
Vers la récupération d'espaces d'interaction pour la recherche agentique : RISE
L'article propose RISE (Retrieving Interaction SpacE), qui utilise BM25 pour construire un espace d'interaction borné et traite ses documents lors de l'indexation pour une navigation de type shell, remplaçant l'interaction directe non bornée avec le corpus.
- Sur BrowseComp-Plus, RISE atteint 78 % de précision avec gpt-5.4-mini, égalant la référence DCI purement shell pour environ un quart du coût par requête.
- À 1 million de documents, RISE-BM25 atteint 81 % avec gpt-5.4-mini.
- À la même échelle, DCI avec gpt-5.4-nano chute à 60 %, avec 33 échecs en temps réel sur 100.
- L'article soutient que l'interaction non bornée ne passe pas à l'échelle : chaque commande shell large balaie tout le corpus et la latence se dégrade fortement à mesure que le corpus grandit.
Pour les équipes qui construisent des agents de recherche, la récupération passe de la sélection de documents à la définition d'une frontière explorable, ce qui détermine directement le coût et la fiabilité à grande échelle de corpus.
AutoSynthData : générer des données d'entraînement pour les agents d'entreprise
ServiceNow CoreAI a publié AutoSynthData, qui utilise les échecs d'un modèle cible et les réussites d'un enseignant plus fort pour identifier les lacunes de capacités, puis génère et valide de nouvelles tâches exécutables pour le post-entraînement.
- Dans le domaine Hybrid d'EnterpriseOps Gym, avec Gemma-4-26B-A4B-it comme modèle cible et Qwen3.8-27B comme enseignant, AutoSynthData a généré 2 000 échantillons d'entraînement synthétiques en environ 18 heures.
- Le rapport indique qu'il comble 59 % de l'écart initial de Pass@1 entre Gemma et le modèle de référence.
- Dans le domaine ITSM, également avec Gemma-4-26B-A4B-it comme modèle cible et DeepSeek-V4.1-Flash comme enseignant, AutoSynthData a généré 1 994 échantillons d'entraînement synthétiques en 66 heures.
Pour les équipes qui construisent des agents d'entreprise, ce pipeline transforme des échecs propres à un environnement en tâches d'entraînement vérifiées et propose une boucle de calibration de difficulté réutilisable, plutôt qu'un simple ...
Open TTS Leaderboard : une évaluation évolutive pour la synthèse vocale multilingue et le clonage de voix
Hugging Face a lancé l'Open TTS Leaderboard, qui évalue les modèles open source de TTS multilingue et de clonage de voix avec des métriques objectives : WER/CER via Qwen3 ASR, RTFx et TTFA sur un GPU H200, et similarité cosinus (SIM) entre embeddings de locuteur WavLM.
- Au 30 septembre 2026, plus de 8K modèles TTS sont disponibles sur le Hugging Face Hub.
- Au 30 septembre 2026, seuls 16 des 92 modèles d'Artificial Analysis sont à poids ouverts.
- Le recours à des métriques objectives réduit l'évaluation d'un modèle de quelques semaines de collecte de votes à quelques heures.
- La vue par défaut classe les modèles selon le WER macro-moyenné sur les splits anglais de Seed TTS Eval et CV3 Eval (zero shot), avec hexgrad/Kokoro-82M, Supertone/supertonic-3 et fishaudio/s2-pro en tête.
Pour les équipes qui construisent des agents vocaux, ce classement fournit des comparaisons reproductibles de modèles ouverts sur le WER, le RTFx, le TTFA et la SIM pour arbitrer latence, taille et qualité multilingue, sans mesurer le natur...
autotrust/JEV-27B-VL : un modèle de décision multimodal de 27,8B capable de voir
autotrust/JEV-27B-VL ajoute la vision à autotrust/JEV-27B et renvoie des décisions System 1 typées avec probabilités calibrées sur texte et images, tout en conservant le Qwen3.8-27B non modifié comme System 2.
- 27,8B paramètres, pipeline image-text-to-text, licence apache-2.0.
- System 1 prend en charge oui/non, le choix parmi 2 à 256 options et les notes de 0 à 5, avec des prompts jusqu'à 256K tokens.
- Le pick and place d'un bras robotisé a terminé 75 % de 20 scènes aléatoires, les 15 cubes saisis finissant tous dans le bac, à environ 240 ms par décision.
- L'usage informatique a terminé 95 % de 60 tâches multi-étapes aléatoires à environ 0,26 s par clic, tombant à 10 % avec les seules cases numérotées.
Pour les développeurs ayant besoin de décisions visuelles à faible latence dans une boucle de contrôle, JEV-27B-VL renvoie des probabilités calibrées en une seule passe, mais les tâches d'usage informatique exigent le texte des éléments.