Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-09-30
01
watchresearchnew architecture

Comment Diffusion Controller unifie et simplifie la génération d'images par IA

Google Research présente Diffusion Controller, un réseau léger de type « amortisseur de direction » qui reformule le processus de débruitage comme un problème de contrôle continu, améliorant l'alignement au prompt et la qualité d'image sans modifier un modèle de base figé.

  • L'article a évalué le cadre sur un backbone Stable Diffusion v1.4 selon trois régimes de fine-tuning : SFT, reward-weighted loss (RWL) et PPO, en mesurant l'alignement aux prompts et aux choix esthétiques via HPS-v2.
  • Dans les volets SFT et RWL, le réseau amortisseur Diffusion Controller en boîte grise a surpassé LoRA en taux de victoire HPS-v2, tout en manipulant nettement moins de couches internes du modèle que LoRA.
  • L'article rapporte que sa version entièrement déverrouillée, avec accès en boîte blanche pour modifier les poids internes, a atteint un taux de victoire de 90 % face au modèle de base.
  • Le cadre implémente quatre structures de réseau : Diffusion Controller, Diffusion Controller-Naive, Diffusion Controller-J et Diffusion Controller-S.

Pour les développeurs, cela signifie un contrôle fin de modèles d'image à code fermé sans accès en boîte blanche, avec une couche de contrôle séparée du cœur du modèle, extensible à la personnalisation, à la sécurité et à la génération vidé...

Google Research
02
watchagentsnew architecture

Relier les agents LLM et les espaces de données : une médiation architecturale via le Model Context Protocol

L'article présente une approche de médiation architecturale fondée sur le Model Context Protocol (MCP), mise en œuvre via l'Eunomia Agent, pour permettre une interaction contrôlée entre les agents LLM et les services d'espaces de données. Un prototype valide l'interaction de bout en bout pour la découverte de catalogue...

  • Soumis à arXiv le 24 septembre 2026 sous la référence arXiv:2609.30341, classé en cs.AI et cs.DB.
  • La couche de médiation traduit les capacités des espaces de données en outils structurés et pilotés par schéma que les agents IA peuvent découvrir et invoquer tout en préservant les contraintes de gouvernance.
  • Les auteurs sont Jaime Alonso Ruiz, Carlos Aparicio, Gabriel Huecas, Joaquín Salvachúa et Andres Munoz-Arcentales.

Pour les équipes qui construisent des agents IA, ce travail montre que MCP peut servir de couche de médiation pour connecter les agents à des espaces de données gouvernés sans modifier l'infrastructure de données existante.

arXiv cs.AI
03
watchinferencenew architecture

HybridInfer : routage par niveaux fondé sur l'apprentissage par renforcement et sensible à la thermique pour l'inférence LLM sur appareil, en périphérie et dans le cloud

HybridInfer est un routeur par apprentissage par renforcement sensible à la thermique pour une hiérarchie à trois niveaux (Llama 3.2 3B sur appareil, Llama 3.1 8B en périphérie avec recherche, GPT-4o dans le cloud) qui utilise la marge thermique du téléphone et une estimation de la complexité de la requête comme état e...

  • L'article rapporte que les conditions toujours sur appareil égalent la qualité par requête sur les requêtes servables mais sont trois à six fois plus lentes et échouent sur les requêtes longues.

Pour le déploiement de LLM sur appareil, les limites thermiques sont un problème de stabilité d'exécution et non un simple ralentissement, de sorte que les politiques de routage doivent encoder l'état thermique et un incitatif de localité p...

arXiv cs.LG
04
testdocumentsopen source unlock

XingChen-AGI publie TeleOCR, un modèle vision-langage de 1,2 B de paramètres pour l'analyse de documents

TeleOCR est un modèle vision-langage open source d'environ 1,2 B de paramètres qui unifie l'analyse de documents numériques et de documents photographiés dans un seul cadre, avec les poids et un rapport technique publiés.

  • La fiche du modèle indique environ 1,2 B de paramètres, une licence apache-2.0, la prise en charge du chinois et de l'anglais, et une base qwen2_5_vl.
  • Sur OmniDocBench v1.6, TeleOCR rapporte Overall 96,87, Text Edit 0,027, Formula CDM 96,36 et Table TEDS 97,05.
  • Sur le Dr.DocBench Challenge, TeleOCR rapporte Overall 67,96, au-dessus de MinerU 2.5 Pro à 62,26 et de PaddleOCR-VL 1.6 à 55,11.
  • La fiche du modèle indique que TeleOCR analyse la mise en page et le contenu de documents déformés sans prétraitement de redressement ni modèle de rectification dédié.

Pour les développeurs qui construisent des pipelines d'analyse documentaire, TeleOCR rapporte des résultats de premier plan sur plusieurs benchmarks publics avec environ 1,2 B de paramètres et fournit les poids ainsi qu'une conversion GGUF,...

Hugging Face Trending
05
testmodelsopen source unlock

Qwen ouvre Qwen-Image-2.1 : un modèle unifié de 7B pour la génération texte-image et l'édition d'images

Qwen a ouvert Qwen-Image-2.1, un modèle unifié de génération texte-image et d'édition d'images dont le composant de génération visuelle compte 7B de paramètres répartis sur 32 couches Single-Stream DiT et prend en charge la génération et l'édition natives transparentes (RGBA).

  • Le composant de génération visuelle compte 7B de paramètres répartis sur 32 couches Single-Stream DiT.
  • Il prend en charge jusqu'à 10 images de référence et des éditions locales spécifiées par des cercles, des annotations peintes ou des masques séparés.
  • Les ratios d'image pris en charge incluent 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 et 9:16, avec des résolutions d'exemple allant jusqu'à 2752×1536.
  • Il est sous licence Qwen Research License Agreement, et la page du modèle indique 64 362 téléchargements le mois dernier.

Comme un seul modèle de 7B couvre la génération texte-image, la génération de calques transparents RGBA et l'édition multi-références, les développeurs peuvent éviter de déployer des modèles distincts pour la génération et l'édition.

Hugging Face Trending
06
watchresearchincremental

Premières lignes directrices pour les dossiers de sécurité dans l'entraînement des IA de frontière

OpenAI a publié des lignes directrices préliminaires sur les dossiers de sécurité dans l'entraînement des IA de frontière, couvrant les protections techniques, les pratiques opérationnelles et l'investigation des incidents de désalignement.

  • Les lignes directrices couvrent les protections techniques, les pratiques opérationnelles et l'investigation des incidents de désalignement.
  • Elles sont présentées comme des lignes directrices préliminaires et non comme une norme finalisée.

Les équipes qui entraînent des modèles de frontière peuvent utiliser ces trois domaines comme structure de départ pour leur propre documentation de dossier de sécurité.

OpenAI News
07
testmodelsopen source unlock

TaichuAI publie ZDTaichu5.0-9B, un modèle de fondation multimodal pour le raisonnement spatial et l'usage d'outils agentiques

ZDTaichu5.0-9B est un modèle de fondation multimodal de TaichuAI qui associe un socle linguistique Qwen3.5-9B à un encodeur visuel C-RADIOv4-H, prend en charge le texte, les images et la vidéo en résolution quelconque, et cible la compréhension visuelle générale, le raisonnement spatial, l'usage d'outils agentiques et ...

  • Le modèle compte 9,8B de paramètres, un type de tenseur BF16 et une longueur de contexte allant jusqu'à 128K tokens.
  • La fiche du modèle rapporte des scores de 87,7 sur TAU2-Bench, 71,4 sur Claw-Eval et 93,7 sur IFEval.
  • La fiche du modèle rapporte des scores de 48 sur ERQA et 56 sur RoboSpatial.
  • Les poids sont publiés sous la NVIDIA Open Model License Agreement, avec la licence Apache-2.0 de Qwen3.5 conservée.

Pour les développeurs de pipelines d'agents visuels ou d'IA incarnée, ce modèle offre raisonnement spatial et appel d'outils à l'échelle 10B, mais l'exécution des outils doit rester implémentée, validée et sécurisée par l'application hôte.

Hugging Face Trending