AI FRONTIER
Signals worth understanding before they become obvious.
SCION: Szenenkomposition mit instanziierten neuronalen Primitiven
SCION führt eine hierarchische kompositionelle Szenendarstellung ein, die unabhängige 3D-Gauß-Funktionen durch ein kompaktes Vokabular wiederverwendbarer Primitive und leichte Instanzen im Weltraum ersetzt und über eine gemeinsame Optimierung diskreter und kontinuierlicher Szenenparameter an Mehransichtsaufnahmen angep...
- Die Arbeit wurde bei NeurIPS 2026 angenommen und am 1. Oktober 2026 eingereicht.
- SCION ersetzt Millionen unabhängiger Gauß-Funktionen pro Szene durch ein Vokabular wiederverwendbarer Primitive und Instanzen im Weltraum.
- Die Arbeit berichtet, dass selbst bei 1,2 MB hohe Qualität erhalten bleibt.
- Die Arbeit berichtet von einer für bestehende Gauß-Kompressionsmethoden vorteilhaften Rate-Distortion und ermöglicht Bearbeitung und Animation auf Instanzebene ohne Neutraining.
Für Entwickler von 3D-Szenenpipelines zeigt SCION, dass die Modellierung von Szenen als wiederverwendbare Primitive plus Instanzen bearbeitbare, animierbare Handles auf Instanzebene in einer kompakten Darstellung von etwa 1,2 MB liefern kan...
DeskForge: Dichte Supervision aus Desktop-Umgebungen für Computer-Use-Agenten
DeskForge ist eine steuerbare Desktop-Umgebung, die reale Anwendungen komponiert und erkundet, um Supervision in großem Maßstab zu erzeugen, und daraus DeskForge-1M aufbaut, einen Korpus aus 1,2 Millionen annotierten Desktop-Beobachtungen mit 159,7 Millionen Elementinstanzen. Die Arbeit berichtet vom Fine-Tuning von vi...
- DeskForge-1M enthält 1,2 Millionen annotierte Desktop-Beobachtungen mit 159,7 Millionen Elementinstanzen.
- Die Arbeit fine-tuned vier Vision-Language-Modelle auf 200.000 Grounding-Beispielen aus DeskForge-1M.
- Die Arbeit berichtet für Qwen3.5-4B einen Genauigkeitsanstieg von 11,51 Prozentpunkten auf ScreenSpot-Pro und 10,11 Punkten auf OSWorld-G.
- Die Arbeit berichtet, dass Qwen3.5-4B unter einem festen Planer auf WebArena-Infinity von 31 auf 50 von 119 Aufgaben und auf OpenApps von 3 auf 15 von 100 Aufgaben steigt.
Für Teams, die Computer-Use-Agenten bauen, zeigt DeskForge, dass die steuerbare Komposition realer Desktop-Umgebungen dichte Elementannotationen skalierbar erzeugt und sowohl GUI-Grounding als auch langhorizontige Aufgabenlösung verbessert.
Rank-Aware Speculative Sampling: Eine Verifikationsregel für Diffusions-Draft-Trees
Die Arbeit führt Rank-Aware Speculative Sampling (RASS) ein, eine Verifikationsregel für spekulative Draft-Trees auf Basis rangbewusster Listenkopplung, die Draft-Kandidaten entlang der mittleren Verschiebung zwischen Vorschlag und Ziel ordnet, einen Rang mit Gewichten sampelt, die die Totalvariation zwischen den Geset...
- RASS verbessert D-GRS, das pro Knoten K bedingt unabhängige Kandidaten erzeugt und sie sequenziell in ihrer Erzeugungsreihenfolge testet.
- RASS wird auf einem Gauß-Mischungs-Ziel, unbedingter Pixelraum-Generierung auf FFHQ, bedingter Generierung auf CIFAR-10 und latenter Diffusion mit Stable Diffusion 3.5 unter COCO2014-Prompts evaluiert.
- Die Restkorrektur gewährleistet exaktes Sampling für jede Wahl der Ranggewichte.
Für Entwickler, die Diffusionsinferenz beschleunigen, zeigt RASS, dass die Nutzung der Rangfolge von Draft-Kandidaten ohne zusätzliche Zielmodell-Evaluierungen die Zahl der Zielmodell-Evaluierungen bei gleichem Rechenbudget senken kann.
Lightricks veröffentlicht LTX-2.5 als Open-Weight-Modell für Video und Audio
Lightricks/LTX-2.5 ist ein Open-Weight-Modell, das aus Text-, Bild- und Videoeingaben synchronisiertes Video und Audio erzeugt und selbst gehostet werden kann. Es ergänzt native Multishot-Generierung, einen Diffusions-Videodecoder, einen eigenen Gemma-4-12B-Textencoder und einen optionalen Dauer-Prädiktor.
- Die Modellkarte nennt 6,48k Likes und 1.645.444 Downloads im letzten Monat.
- Die DiT-Checkpoints sind mit 22b bezeichnet und liegen als bf16-, Comfy-int8+convrot- und NVFP4-Varianten vor.
- Der Textencoder ist Gemma4 12B mit Projektionen, Video und Audio nutzen getrennte VAEs.
- Unternehmen unter 10 Mio. USD Jahresumsatz erhalten kostenlose kommerzielle Nutzung unter der LTX-2.x Community License; darüber ist eine kostenpflichtige kommerzielle Vereinbarung nötig.
Für Entwickler bietet LTX-2.5 selbst hostbare Audio-Video-Generierung als geteiltes, Comfy-kompatibles Gewichtspaket mit trainierbarem Dev-Transformer, doch die int8-Checkpoints sind nur für ComfyUI.
ReRoute ermöglicht kontrafaktische Vorhersagen in wissenschaftlichen Emulatoren ohne kontrollierte Experimente
Die Arbeit stellt ReRoute vor, ein Framework für gezielte wissenschaftliche What-if-Vorhersage, das faktische Daten mit partiellem mechanistischem Wissen kombiniert und für die Anpassung keine kontrollierten Interventionsdaten benötigt. ReRoute fixiert die abgefragte Eingabe eines vortrainierten Backbones auf einen Ref...
- Die Arbeit berichtet, dass ReRoute in einem kontrollierten Advektions-Diffusions-System, in dem exakte Antworten verfügbar sind, hochgenaue kontrafaktische Vorhersagen erreicht.
- Die Arbeit liefert ein kausales Identifikationsergebnis für diese Konstruktion unter expliziten strukturellen Annahmen, wobei das Kernargument in Lean maschinell geprüft wurde.
Für Teams, die wissenschaftliche Emulatoren bauen, zeigt ReRoute, dass faktische Daten plus partielles mechanistisches Wissen die kontrafaktische Vorhersage unter Verteilungsverschiebung verbessern können, ohne kostspielige kontrollierte Si...
DeReAct: Zerlegtes Reasoning und Handeln für zuverlässige KI-Agenten
DeReAct ist eine modulare Agentenarchitektur, die zwei Gating-Richtlinien auslagert: einen Critic, der vorgeschlagene Aktionen vor der Ausführung validiert, und einen Context Manager, der einen umgebungsgestützten State rekonstruiert und die Aufgabenerfüllung zertifiziert. Die Arbeit berichtet, dass DeReAct auf GAIA un...
- Die Arbeit berichtet Pass@1-Verbesserungen von 6,5 bis 7,0 Punkten für Qwen3-Coder-480B.
- Die Arbeit berichtet Pass@1-Verbesserungen von 4,2 bis 5,2 Punkten für Claude Sonnet 4.5.
- Mit Claude Opus 4.5 bleibt Pass@1 vergleichbar mit ReAct, während DeReAct stärker evidenzvollständige und constraint-erfüllende Trajektorien erzeugt.
- Die Arbeit stellt fest, dass externes Gating wirksam ist, wenn gezielte Fehler ausreichend häufig auftreten und die Gating-Richtlinie selbst ausreichend ist.
Für Agentenentwickler kann die Trennung von Aktionsvalidierung und Abschlusszertifizierung aus einer einzigen Richtlinie die Zuverlässigkeit schwächerer Modelle erhöhen, ohne das zugrunde liegende Brain-Modell zu ändern.
Cloudflare veröffentlicht Clef: ein multimodales 27B-Entscheidungsmodell, das in einem einzigen Vorwärtsdurchlauf strukturierte Wahrscheinlichkeiten liefert
Cloudflare hat Clef veröffentlicht, ein multimodales, aus Qwen/Qwen3.8-27B nachtrainiertes Modell, das einen Zustand und ein Schema typisierter Fragen in Entscheidungen umwandelt und für jede erlaubte Option jeder Frage eine Wahrscheinlichkeit zurückgibt, ohne Freitextgenerierung oder Ausgabe-Parsing.
- 27B Parameter, BF16, als standardmäßige fragmentierte Safetensors gespeichert, veröffentlicht unter der Apache-2.0-Lizenz.
- Akzeptiert Text, JSON, Bilder oder Video als Zustand und gibt einen Logit pro erlaubter Option pro Frage aus, wobei ein Softmax pro Frage die Wahrscheinlichkeiten liefert.
- Getestet mit torch 2.11 und transformers 5.10.2 auf einer einzelnen H200; Bild- und Videoeingaben benötigen zusätzlich pillow.
- Im internen Decision-Index-0.2.1-Lauf beträgt die exakte Fallgenauigkeit bei BFCL 98,5, der Makro-F1 bei BANKING77 94,2, die mediane Latenz 209,3 ms und die p95-Latenz 238,6 ms.
Für KI-Entwickler, die strukturierte Entscheidungen statt Freitext benötigen, bietet Clef eine multimodale 27B-Option mit Jev/SystemOne-kompatibler API, wobei die Latenz höher liegt als bei kleineren Varianten wie Clef-flash.
EditHero: Ein Benchmark für langfristige 3D-Bearbeitung auf Teilebene und Vibe Modeling
Die Arbeit stellt EditHero vor, laut den Autoren der erste Benchmark für langfristige 3D-Bearbeitung auf Teilebene, mit natürlichsprachlichen Anweisungen und Zielbildern für Geometrie und Textur. Eine deterministische Assemblierungs-Engine erzeugt nach jeder Bearbeitung das exakte Ziel, und jede Sequenz wird manuell üb...
- Die Arbeit beschreibt EditHero nach Kenntnis der Autoren als ersten Benchmark für langfristige 3D-Bearbeitung auf Teilebene, mit natürlichsprachlichen Anweisungen und Zielbildern für Geometrie und Textur.
- Eine deterministische Assemblierungs-Engine erzeugt nach jeder Bearbeitung das exakte Ziel, und jede Sequenz wird manuell überprüft.
Der Benchmark verschiebt die Bewertung von einzelnen Bearbeitungen darauf, ob mehrstufige Revisionen nur das ändern, was verlangt wurde, und gibt Entwicklern iterativer 3D-Bearbeitungspipelines ein reproduzierbares Vergleichsziel.