Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-01
01
watchagentsnew architecture

Google veröffentlicht RRSI, mit dem sich ein Agenten-Harness ohne Neutraining des Modells selbst verbessert

Forschende von Google Cloud AI Research haben gemeinsam mit der Stanford University und der University of Washington das RRSI-Framework veröffentlicht, das das Harness um ein Modell wiederholt überarbeitet, darunter Prompts, Werkzeugnutzung, Kontrollfluss, Speicher- und Kontextverwaltung, Fähigkeitsmodule und Subagente...

  • Über acht Benchmarks stieg Terminal-Bench 2.1 von 74,2 % auf 80,2 %, ein Zuwachs von 6,0 Prozentpunkten, und SWE-Bench Verified von 82,0 % auf 83,8 %, ein Zuwachs von 1,8 Prozentpunkten.
  • JobBench stieg von 36,0 % auf 40,7 %, ein Zuwachs von 4,7 Prozentpunkten; GDPval von 48,8 % auf 52,3 %, ein Zuwachs von 3,5 Prozentpunkten; Frontier-Eng von 17,7 % auf 22,0 %, ein Zuwachs von 4,3 Prozentpunkten.
  • RRSI ist als Forschungsframework auf GitHub veröffentlicht, der Code steht unter der Apache-2.0-Lizenz.

Für Teams, die Agenten bauen, zeigt RRSI, dass eine kontrollierte iterative Suche über das Harness bei festen Modellgewichten messbare Benchmark-Gewinne und geringere Token-Kosten bringen kann.

AI Times Korea
02
opportunitymodelscost collapse

OpenAI stellt GPT-6.1 Sol vor

OpenAI stellt GPT-6.1 Sol für Coding, Computer-Nutzung und professionelle Arbeit vor und gibt an, dass die Intelligenz nahe an Astra liegt, bei einem Fünftel der Standard-API-Preise von Astra für Eingabe- und Ausgabe-Token.

  • OpenAI gibt an, dass GPT-6.1 Sol eine Intelligenz nahe Astra bietet.
  • Eingesetzt wird es für Coding, Computer-Nutzung und professionelle Arbeit.
  • Die Standard-API-Preise für Eingabe- und Ausgabe-Token liegen bei einem Fünftel von Astra.

Für KI-Entwickler senkt eine Intelligenz nahe Astra zu einem Fünftel des Token-Preises die Inferenzkosten pro Einheit bei Coding- und Computer-Nutzungs-Workloads.

OpenAI News
03
testinferenceopen source unlock

prism-ml veröffentlicht Ternary-Bonsai-2-27B-gguf: 27B-Modell mit ternären Gewichten ab 5,95 GB

prism-ml hat Ternary-Bonsai-2-27B-gguf auf Hugging Face veröffentlicht und dabei Embeddings, Attention-Projektionen, MLP-Projektionen und LM-Head von Qwen3.8-27B auf ternäre Gewichte quantisiert (g128, {−1,0,+1} mit FP16-Gruppenskalierung), mit zwei GGUF-Packungen PTQ1_0 und PQ2_0 für llama.cpp unter CUDA, Metal und CP...

  • Die Sprachmodellgröße beträgt 5,95 GB (PTQ1_0) oder 7,21 GB (PQ2_0), etwa 9,0x bzw. 7,5x kleiner als die FP16-Basis von rund 54 GB; das ideale ternäre Format sind 1,72 Bit/Gewicht bei 5,8 GB.
  • Das Paper berichtet einen Durchschnitt von 84,78 über 14 Thinking-Mode-Benchmarks, 98,2 % der FP16-Referenz (86,32), gegenüber 72,59 für IQ2_XXS (7,27 GB) und 85,18 für UD-Q4_K_XL (17,6 GB).
  • Das Paper berichtet 95,83 auf AIME26 und 90,07 auf LiveCodeBench, wo IQ2_XXS 57,5 und 56,4 erreicht; Mathematik 96,57, Coding 89,42, BFCL-v3-Tool-Calling 74,92.
  • Die Kontextlänge beträgt 262K Tokens auf einem Hybrid-Attention-Backbone mit etwa 75 % linearer Attention; der Vision-Tower ist eine separate Q8_0-mmproj-Packung (0,63 GB), die nur bei Bildeingabe geladen wird.

Für Teams, die 27B-Klasse-Reasoning auf einer einzelnen GPU oder einem Laptop bereitstellen, zeigt dies, dass durchgängige ternäre Quantisierung Reasoning- und Tool-Calling-Werte nahe FP16 bei etwa 6 GB halten kann, aber nur mit den dedizie...

Hugging Face Trending
04
watchresearchnew architecture

Auf dem Weg zur Abfrage von Interaktionsräumen für agentische Suche: RISE baut mit BM25 einen begrenzten Raum auf

Die Arbeit schlägt RISE (Retrieving Interaction SpacE) vor, das mit BM25 eine begrenzte Teilmenge des Korpus für die Exploration durch den Agenten konstruiert und seine Dokumente beim Indexieren für shell-artige Navigation aufbereitet. Auf BrowseComp-Plus erreicht RISE mit gpt-5.4-mini 78 % Genauigkeit und damit das Ni...

  • Die Arbeit berichtet, dass RISE auf BrowseComp-Plus mit gpt-5.4-mini 78 % Genauigkeit erreicht und damit die reine Shell-DCI-Baseline bei etwa einem Viertel der Kosten pro Anfrage einholt.
  • Die Arbeit berichtet, dass RISE-BM25 bei 1 Million Dokumenten mit gpt-5.4-mini 81 % erreicht.
  • Die Arbeit berichtet, dass DCI bei derselben Skala von 1 Million Dokumenten mit gpt-5.4-nano auf 60 % zurückgeht, mit 33 von 100 Echtzeit-Fehlschlägen.
  • Die Arbeit argumentiert, dass unbegrenzte Interaktion nicht skaliert: Jeder breite Shell-Befehl ist ein Scan über den gesamten Korpus, und die Latenz verschlechtert sich stark mit wachsendem Korpus.

Für Teams, die Suchagenten bauen, zeigt das Ergebnis, dass Retrieval den Interaktionsraum begrenzen sollte, statt nur Dokumente auszuwählen, die in das Kontextfenster passen, was Kosten und Latenz bei wachsendem Korpus kontrolliert.

arXiv watchlist
05
watchcreativenew architecture

Diffusion Controller vereinheitlicht und vereinfacht die KI-Bildgenerierung

Google Research stellt Diffusion Controller vor, ein leichtgewichtiges „Lenkungsdämpfer“-Netzwerk, das die Denoising-Trajektorie dynamisch anpasst, während das Basismodell eingefroren bleibt, und so Prompt-Treue und Bildqualität verbessert.

  • Bewertet auf einem Stable Diffusion v1.4-Backbone über drei Fine-Tuning-Regime: SFT, Reward-Weighted Loss (RWL) und PPO.
  • In den SFT- und RWL-Spuren übertraf der Gray-Box Diffusion Controller LoRA bei den HPS-v2-Gewinnraten, während er deutlich weniger interne Modellschichten manipulierte.
  • Die vollständig freigeschaltete White-Box-Version erreichte eine Gewinnrate von 90 % gegenüber dem Basismodell.
  • Ein einzelner Inferenz-Parameter für die Führungsstärke erlaubt die dynamische Anpassung der Kontrollbeschränkungsintensität.

Für Entwickler bietet dies einen leichtgewichtigen Weg zu kontrollierbarer Bildgenerierung und Personalisierung, ohne auf Gewichte geschlossener Modelle zuzugreifen.

Google Research
06
watchresearchcapability unlock

Google DeepMind stellt SynthID Bio zum Wasserzeichen von KI-generierten Proteinen vor

Google DeepMind hat SynthID Bio veröffentlicht, eine Familie von Wasserzeichenmethoden für die synthetische Biologie, die eine nachweisbare Signatur in Aminosäuresequenzen und von AlphaFold 3 vorhergesagte 3D-Strukturen einbettet und dabei die biologische Funktion in Labortests erhält.

  • SynthID Bio fine-tunt einen kleinen Teil des Diffusionsnetzwerks von AlphaFold 3 und baut das Wasserzeichen in die Modellgewichte ein, sodass vorhergesagte 3D-Koordinaten inhärent eine nachweisbare Signatur tragen.
  • Die Arbeit berichtet, dass SynthID Bio die Vorhersagegenauigkeit von AlphaFold 3 bewahrt, eine nahezu perfekte Nachweisbarkeit bietet und gegen digitales Rauschen oder geringfügige Koordinatenänderungen standhält.
  • Google DeepMind gibt an, das Methodenpapier zu veröffentlichen, den Code und die In-vitro-Daten als Open Source bereitzustellen und die Gewichte an die Forschungsgemeinschaft weiterzugeben.

Für Entwickler biologischer Designwerkzeuge bietet die Einbettung von Wasserzeichen direkt in Modellgewichte und Sequenzgenerierung eine automatisierte Verifikationsebene für DNA-Synthese-Screening und Datenbankherkunft, doch die Robustheit...

Google DeepMind