Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-01
01
watchagentsnew architecture

Google publie RRSI, qui permet au « harnais » d’un agent de s’améliorer sans réentraîner le modèle

Des chercheurs de Google Cloud AI Research, avec l’université Stanford et l’université de Washington, ont publié le cadre RRSI, qui révise de façon répétée le harnais entourant un modèle, notamment les prompts, l’usage des outils, le flux de contrôle, la gestion de la mémoire et du contexte, les modules de compétences ...

  • Sur huit benchmarks, Terminal-Bench 2.1 est passé de 74,2 % à 80,2 %, soit un gain de 6,0 points de pourcentage, et SWE-Bench Verified de 82,0 % à 83,8 %, soit un gain de 1,8 point de pourcentage.
  • JobBench est passé de 36,0 % à 40,7 %, soit un gain de 4,7 points de pourcentage ; GDPval de 48,8 % à 52,3 %, soit 3,5 points de pourcentage ; Frontier-Eng de 17,7 % à 22,0 %, soit 4,3 points de pourcentage.
  • RRSI est publié comme cadre de recherche sur GitHub, avec un code disponible sous licence Apache 2.0.

Pour les équipes qui construisent des agents, RRSI montre qu’une recherche itérative contrôlée sur le harnais, à poids de modèle fixes, peut apporter des gains mesurables sur les benchmarks et réduire le coût en tokens.

AI Times Korea
02
opportunitymodelscost collapse

OpenAI présente GPT-6.1 Sol

OpenAI présente GPT-6.1 Sol pour le codage, l'usage de l'ordinateur et le travail professionnel, avec une intelligence proche d'Astra annoncée à un cinquième des prix standard des tokens d'entrée et de sortie de l'API Astra.

  • OpenAI annonce que GPT-6.1 Sol offre une intelligence proche d'Astra.
  • Les usages visés sont le codage, l'usage de l'ordinateur et le travail professionnel.
  • Les prix standard des tokens d'entrée et de sortie de l'API sont le cinquième de ceux d'Astra.

Pour les développeurs d'IA, une intelligence proche d'Astra à un cinquième du prix par token réduit le coût d'inférence sur les charges de codage et d'usage de l'ordinateur.

OpenAI News
03
testinferenceopen source unlock

prism-ml publie Ternary-Bonsai-2-27B-gguf : un modèle 27B à poids ternaires exécutable depuis 5,95 Go

prism-ml a publié Ternary-Bonsai-2-27B-gguf sur Hugging Face, en quantifiant les embeddings, projections d'attention, projections MLP et la tête LM de Qwen3.8-27B en poids ternaires (g128, {−1,0,+1} avec mise à l'échelle par groupe en FP16), avec deux empaquetages GGUF, PTQ1_0 et PQ2_0, pour llama.cpp sur CUDA, Metal e...

  • La taille du modèle de langue est de 5,95 Go (PTQ1_0) ou 7,21 Go (PQ2_0), soit environ 9,0x et 7,5x moins que la référence FP16 d'environ 54 Go ; le format ternaire idéal est de 1,72 bit/poids pour 5,8 Go.
  • L'article rapporte une moyenne de 84,78 sur 14 benchmarks en mode thinking, soit 98,2 % de la référence FP16 (86,32), contre 72,59 pour IQ2_XXS (7,27 Go) et 85,18 pour UD-Q4_K_XL (17,6 Go).
  • L'article rapporte 95,83 sur AIME26 et 90,07 sur LiveCodeBench, où IQ2_XXS obtient 57,5 et 56,4 ; mathématiques 96,57, code 89,42, appel d'outils BFCL v3 74,92.
  • La longueur de contexte est de 262K tokens sur un backbone à attention hybride dont environ 75 % d'attention linéaire ; la tour de vision est un pack mmproj Q8_0 séparé (0,63 Go) chargé uniquement pour l'entrée image.

Pour les équipes déployant un raisonnement de classe 27B sur un seul GPU ou un ordinateur portable, cela montre qu'une quantification ternaire de bout en bout peut maintenir des scores de raisonnement et d'appel d'outils proches du FP16 à e...

Hugging Face Trending
04
watchresearchnew architecture

Vers la récupération d'espaces d'interaction pour la recherche agentique : RISE construit un espace borné avec BM25

L'article propose RISE (Retrieving Interaction SpacE), qui utilise BM25 pour construire un sous-ensemble borné du corpus que l'agent peut explorer et traite ses documents lors de l'indexation pour une navigation de type shell. Sur BrowseComp-Plus, RISE atteint 78 % de précision avec gpt-5.4-mini, égalant la référence D...

  • L'article rapporte que sur BrowseComp-Plus, RISE atteint 78 % de précision avec gpt-5.4-mini, égalant la référence DCI purement shell pour environ un quart du coût par requête.
  • L'article rapporte qu'à 1 million de documents, RISE-BM25 atteint 81 % avec gpt-5.4-mini.
  • L'article rapporte qu'à la même échelle d'un million de documents, DCI avec gpt-5.4-nano chute à 60 %, avec 33 échecs en temps réel sur 100.
  • L'article soutient que l'interaction non bornée ne passe pas à l'échelle : chaque commande shell large balaie tout le corpus et la latence se dégrade fortement à mesure que le corpus grandit.

Pour les équipes qui construisent des agents de recherche, ce résultat indique que la récupération doit borner l'espace d'interaction plutôt que seulement sélectionner des documents tenant dans la fenêtre de contexte, ce qui maîtrise coût e...

arXiv watchlist
05
watchcreativenew architecture

Diffusion Controller unifie et simplifie la génération d'images par IA

Google Research présente Diffusion Controller, un réseau léger de type « amortisseur de direction » qui ajuste dynamiquement la trajectoire de débruitage tandis que le modèle de base reste figé, améliorant l'alignement au prompt et la qualité d'image.

  • Évalué sur un backbone Stable Diffusion v1.4 selon trois régimes de fine-tuning : SFT, reward-weighted loss (RWL) et PPO.
  • Dans les volets SFT et RWL, le Diffusion Controller en boîte grise a surpassé LoRA en taux de victoire HPS-v2 tout en manipulant nettement moins de couches internes du modèle.
  • La version entièrement déverrouillée en boîte blanche a atteint un taux de victoire de 90 % face au modèle de référence.
  • Un unique paramètre de force de guidage à l'inférence permet d'ajuster dynamiquement l'intensité des contraintes de contrôle.

Pour les développeurs, cela offre une voie légère vers une génération d'images contrôlable et une personnalisation sans accéder aux poids de modèles fermés.

Google Research
06
watchresearchcapability unlock

Google DeepMind présente SynthID Bio pour le tatouage des protéines générées par IA

Google DeepMind a publié SynthID Bio, une famille de méthodes de tatouage pour la biologie de synthèse qui intègre une signature détectable dans les séquences d'acides aminés et les structures 3D prédites par AlphaFold 3, tout en préservant la fonction biologique lors des tests en laboratoire.

  • SynthID Bio affine une petite partie du réseau de diffusion d'AlphaFold 3, intégrant le tatouage dans les poids du modèle afin que les coordonnées 3D prédites portent intrinsèquement une signature détectable.
  • Les travaux rapportent que SynthID Bio préserve la précision de prédiction d'AlphaFold 3 tout en offrant une détectabilité quasi parfaite et en résistant au bruit numérique ou à de légères modifications de coordonnées.
  • Google DeepMind indique publier son article méthodologique, ouvrir le code et les données in vitro, et diffuser les poids à la communauté de recherche.

Pour les développeurs d'outils de conception biologique, intégrer le tatouage directement dans les poids du modèle et la génération de séquences offre une couche de vérification automatisée pour le criblage de synthèse d'ADN et la provenanc...

Google DeepMind