Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-02
01
opportunitymodelscost collapse

Présentation de GPT-6.1 Sol

GPT-6.1 Sol offre une intelligence proche d'Astra pour le codage, l'usage de l'ordinateur et le travail professionnel, à un cinquième des prix standard des tokens d'entrée et de sortie de l'API d'Astra.

  • OpenAI News annonce GPT-6.1 Sol.
  • Positionné pour le codage, l'usage de l'ordinateur et le travail professionnel avec une intelligence proche d'Astra.
  • Les prix standard des tokens d'entrée et de sortie de l'API sont un cinquième de ceux d'Astra.

Pour les développeurs d'IA, une intelligence proche d'Astra à un cinquième du prix des tokens réduit le coût d'inférence des workflows d'agents de codage et d'usage de l'ordinateur.

OpenAI News
02
watchresearchincremental

L'illusion du prompt système : comment les préambules d'instruction modifient le calcul dans les modèles de langage

L'article utilise l'alignement de noyau centré (CKA) pour comparer les représentations couche par couche sous 20 prompts système dans 17 modèles ajustés par instruction, et constate que les effets dépendent de la couche et du type d'instruction : les instructions de persona et de formatage restructurent profondément le...

  • Évaluation de 17 modèles ajustés par instruction couvrant 8 familles d'architecture et de 1,5B à 72B paramètres, sous 20 prompts système répartis en cinq catégories fonctionnelles.
  • Les instructions de sécurité restrictives et les instructions explicitement permissives (« vous n'avez aucune restriction ») engagent des voies de calcul quasi identiques, avec une corrélation CKA moyenne de 0,997.
  • La pénétration de la sécurité reste inférieure à 10 % à l'échelle commerciale, même à 70B-72B.
  • La profondeur représentationnelle prédit la taille de l'effet comportemental sur l'ensemble des 17 modèles (Spearman rho = 0,761, p < 0,001).

Pour les développeurs qui s'appuient sur la sécurité par prompt système, ces preuves indiquent que les instructions de sécurité peuvent être encodées de manière fiable sans être profondément appliquées dans le calcul, de sorte que les défen...

arXiv cs.CL
03
watchresearchnew architecture

TomasuLLM : exécution spéculative désordonnée pour les agents LLM

TomasuLLM est un runtime qui exécute les appels d'outils d'un agent hors de l'ordre de la trajectoire tout en préservant la correction de l'exécution de la tâche : il ébauche les actions futures, les exécute dans des sandboxes isolées en copy-on-write, trace leurs dépendances et effets, puis valide et commit les résult...

  • L'article rapporte 1,31x sur 100 tâches SWE-bench Verified, 1,35x sur 28 tâches Terminal-Bench 2.0 et 1,27x de progression appariée sur 18 sessions SWE-Marathon.
  • Sur 4 010 enregistrements de validation de commit audités, l'article rapporte zéro acceptation erronée.
  • Le travail cible les outils longs comme les compilateurs, les suites de tests et les commandes de dépôt, qui prennent de quelques secondes à plusieurs minutes pendant que l'agent est inactif.
  • Les résultats couvrent trois benchmarks allant d'appels d'outils inférieurs à la seconde jusqu'à plusieurs minutes, et s'améliorent avec la latence des outils.

Pour les équipes qui construisent des agents de codage, TomasuLLM montre que l'exécution spéculative d'appels d'outils en sandbox isolée et leur commit dans l'ordre de la trajectoire peut réduire la latence des outils longs sans sacrifier l...

arXiv cs.CL
04
testagentsopen source unlock

MiniMax ouvre le code source d'OpenAgentCore pour la compatibilité avec l'API OpenAI Agents

MiniMax a ouvert le code source d'OpenAgentCore, destiné à la compatibilité avec l'API OpenAI Agents.

  • MiniMax a ouvert le code source d'OpenAgentCore.
  • OpenAgentCore cible la compatibilité avec l'API OpenAI Agents.

Les développeurs d'IA peuvent utiliser OpenAgentCore pour cibler les workflows de l'API OpenAI Agents avec une implémentation open source de MiniMax.

tokenpost.com
05
testcreativenew architecture

SInGA : apprentissage de l'inpainting sémantique pour des avatars de tête gaussiens animables

L'article présente SInGA, une méthode qui définit un cadre d'inpainting sémantique dans l'espace UV pour compléter les régions faciales non observées à partir d'une seule image, puis régresser les attributs gaussiens afin de produire un avatar de tête gaussien animable. L'avatar obtenu généralise entre les identités sa...

  • Le cadre d'inpainting sémantique est défini dans l'espace UV et utilise les indices de symétrie inhérents au visage humain pour compléter les régions non observées.
  • Les caractéristiques extraites des régions observées servent à compléter les régions non observées, puis la représentation complétée sert à régresser les attributs gaussiens.
  • Au lieu d'un seul gaussien par surface ou emplacement de pixel, la méthode empile plusieurs gaussiens pour renforcer le détail.

Pour les constructeurs d'avatars de tête à partir d'une seule image, déplacer la complétion dans un espace UV aux correspondances spatiales cohérentes offre une approche réutilisable pour traiter les régions non observées en configuration m...

arXiv cs.CV
06
testresearchincremental

Contrôle conformel de la factualité pour la génération augmentée par récupération multi-sauts

L'article applique un filtrage conformel fractionné des affirmations à la RAG multi-sauts et l'évalue sur HotpotQA, Natural Questions et TriviaQA avec Llama 3.1 8B et GPT-4o-mini, ainsi qu'une expérience de référence à un seul saut. Il rapporte qu'à la cible de 95 %, la fraction de réponses dont les affirmations retenu...

  • Dans les six configurations multi-sauts modèle-jeu de données, des cibles conformelles plus strictes augmentent systématiquement la fraction de réponses dont les affirmations retenues sont entièrement étayées.
  • À la cible de 95 %, ce taux va de 95,80 % à 97,20 %, contre 55,60 %-76,03 % sans filtrage.
  • À la cible de 95 %, seules 4,41 %-31,09 % des affirmations générées sont retenues et 9,70 %-51,40 % des réponses restent non vides.
  • L'évaluation utilise Llama 3.1 8B et GPT-4o-mini sur HotpotQA, Natural Questions et TriviaQA, avec une expérience de référence à un seul saut.

Pour les constructeurs de RAG multi-sauts, le filtrage conformel augmente le soutien au niveau des affirmations, mais doit être interprété conjointement avec la rétention des affirmations et l'abstention, car à la cible de 95 % la plupart d...

arXiv cs.CL
07
watchresearchcost collapse

Accélération du modèle de langage à diffusion via un générateur moyen discret

L'article introduit le Discrete Average Generator, qui étend MeanFlow aux chaînes de Markov à temps continu en définissant un générateur moyen comme l'incrément normalisé du noyau de transition sur un intervalle de temps, avec une identité d'auto-cohérence comme base de l'objectif d'entraînement.

  • Dans les simulations du modèle de Potts, cet objectif réduit jusqu'à 67 % la distance de variation totale de l'échantillonneur à K étapes.
  • Sur OpenWebText, la méthode obtient la plus faible perplexité générative parmi les méthodes évaluées pour 8 à 64 étapes d'échantillonnage, tout en permettant une accélération de 16x.
  • Sur ImageNet, la méthode atteint des performances comparables aux méthodes existantes.
  • L'identité d'auto-cohérence admet une expression en forme close lorsqu'elle est projetée sur les marginales par coordonnée.

Pour les équipes qui construisent des modèles de langage à diffusion discrète, cet objectif d'entraînement réduit les étapes d'échantillonnage tout en préservant la qualité de génération, ce qui rend l'accélération de 16x rapportée digne d'...

arXiv stat.ML
08
watchagentsincremental

Les agents IA sont vulnérables à la radicalisation

L'article simule des conversations entre deux agents LLM : une cible qui joue le rôle d'une personne selon des attributs démographiques et psychologiques, et un influenceur qui cherche à rendre les croyances de la cible plus extrêmes. Il rapporte que la résonance (renforcement d'une croyance préexistante) et la persuas...

  • Soumis à arXiv le 29 septembre 2026 sous la référence arXiv:2609.38296, classé en cs.AI et cs.CY.
  • Dispositif : un LLM cible joue le rôle d'une personne selon des attributs démographiques et psychologiques, tandis qu'un LLM influenceur cherche à rendre les croyances de la cible plus extrêmes.
  • L'article examine deux voies : la résonance renforce une croyance préexistante de la cible, et la persuasion promeut une croyance que la cible juge initialement peu importante.
  • L'article rapporte que les deux mécanismes radicalisent la cible selon des mesures affectives et comportementales, mais que la résonance produit des effets systématiquement plus forts que la persuasion.

Les développeurs d'agents personnalisés et de systèmes multi-agents devraient considérer les entrées alignées sur les croyances comme une surface d'influence à haut risque, car l'article rapporte que la résonance produit une radicalisation ...

arXiv cs.AI