AI FRONTIER
Signals worth understanding before they become obvious.
Wie Diffusion Controller die KI-Bildgenerierung vereinheitlicht und vereinfacht
Google Research stellt Diffusion Controller vor, ein leichtgewichtiges „Lenkungsdämpfer“-Netzwerk, das den Denoising-Prozess als kontinuierliches Steuerungsproblem neu formuliert und Prompt-Treue sowie Bildqualität verbessert, ohne ein eingefrorenes Basismodell zu verändern.
- In den SFT- und RWL-Varianten übertraf das Gray-Box-Diffusion-Controller-Lenkungsdämpfernetzwerk LoRA bei den HPS-v2-Gewinnraten, während es deutlich weniger interne Modellschichten veränderte als LoRA.
- Die Arbeit berichtet, dass die vollständig entsperrte Version mit White-Box-Zugriff auf interne Modellgewichte eine Gewinnrate von 90 % gegenüber dem Basismodell erreichte.
- Das Framework implementiert vier Netzwerkstrukturen: Diffusion Controller, Diffusion Controller-Naive, Diffusion Controller-J und Diffusion Controller-S.
- Ein einzelner Inferenz-Guidance-Stärkeparameter kann zur Laufzeit angepasst werden, um die Intensität der Steuerungsbeschränkungen zu erhöhen oder zu verringern.
Für Entwickler bedeutet dies feingranulare Kontrolle geschlossener Bildmodelle ohne White-Box-Zugriff, mit einer vom Modellkern getrennten Steuerungsschicht, die auf Personalisierung, Sicherheit und Videogenerierung erweiterbar ist.
LLM-Agenten und Datenräume verbinden: architektonische Mediation über das Model Context Protocol
Die Arbeit stellt einen architektonischen Mediationsansatz auf Basis des Model Context Protocol (MCP) vor, umgesetzt durch den Eunomia Agent, der eine kontrollierte Interaktion zwischen LLM-Agenten und Diensten von Datenräumen ermöglicht. Ein Prototyp validiert die Ende-zu-Ende-Interaktion über Katalogsuche, Metadatena...
- Am 24. September 2026 bei arXiv eingereicht als arXiv:2609.30341, klassifiziert unter cs.AI und cs.DB.
- Die Mediationsschicht übersetzt Fähigkeiten von Datenräumen in strukturierte, schema-gesteuerte Werkzeuge, die KI-Agenten entdecken und aufrufen können, während Governance-Einschränkungen erhalten bleiben.
- Die Prototyp-Implementierung validiert die Ende-zu-Ende-Interaktion über Katalogsuche, Metadatenabruf und Aufruf von Datendiensten, ohne bestehende Komponenten der Datenräume zu verändern.
- Autoren sind Jaime Alonso Ruiz, Carlos Aparicio, Gabriel Huecas, Joaquín Salvachúa und Andres Munoz-Arcentales.
Für Teams, die KI-Agenten entwickeln, zeigt diese Arbeit, dass MCP als Mediationsschicht dienen kann, um Agenten an gouvernierte Datenräume anzubinden, ohne die bestehende Dateninfrastruktur zu verändern.
HybridInfer: Thermisch bewusstes Reinforcement-Learning-Tier-Routing für LLM-Inferenz auf Gerät, Edge und Cloud
HybridInfer ist ein thermisch bewusster Reinforcement-Learning-Router für eine dreistufige Hierarchie (Llama 3.2 3B auf dem Gerät, Llama 3.1 8B am Edge mit Retrieval, GPT-4o in der Cloud), der den thermischen Spielraum des Telefons und eine Query-Komplexitätsschätzung als Zustand nutzt und eine Stufe über eine offline ...
- Die Arbeit berichtet, dass Bedingungen mit ständiger Ausführung auf dem Gerät die Pro-Query-Qualität bei bedienbaren Abfragen erreichen, aber drei- bis sechsmal langsamer sind und bei langen Abfragen fehlschlagen.
Für den Einsatz von LLMs auf dem Gerät sind thermische Grenzen ein Problem der Laufzeitstabilität und nicht nur eine Verlangsamung, weshalb Routing-Policies den thermischen Zustand und einen Lokalitätsanreiz kodieren müssen, statt nur Quali...
XingChen-AGI veröffentlicht TeleOCR, ein Dokumentenanalyse-VLM mit 1,2B Parametern
TeleOCR ist ein quelloffenes Vision-Language-Modell mit rund 1,2B Parametern, das die Analyse digitaler und kameragefasster Dokumente in einem Framework vereint; Gewichte und ein technischer Bericht wurden veröffentlicht.
- Die Modellkarte nennt rund 1,2B Parameter, eine apache-2.0-Lizenz, Unterstützung für Chinesisch und Englisch sowie eine qwen2_5_vl-Basis.
- Auf OmniDocBench v1.6 meldet TeleOCR Overall 96,87, Text Edit 0,027, Formula CDM 96,36 und Table TEDS 97,05.
- In der Dr.DocBench Challenge meldet TeleOCR Overall 67,96 und liegt damit über MinerU 2.5 Pro mit 62,26 und PaddleOCR-VL 1.6 mit 55,11.
- Die Modellkarte gibt an, dass TeleOCR Layout und Inhalt verzerrter Dokumente ohne Entzerrungsvorverarbeitung oder ein spezielles Rektifizierungsmodell analysiert.
Für Entwickler, die Dokumentenanalyse-Pipelines bauen, meldet TeleOCR mit rund 1,2B Parametern führende Ergebnisse auf mehreren öffentlichen Benchmarks und liefert Gewichte sowie eine GGUF-Konvertierung, was es für leichtes Self-Hosting int...
Qwen veröffentlicht Qwen-Image-2.1 als Open Source: einheitliches 7B-Modell für Text-zu-Bild und Bildbearbeitung
Qwen hat Qwen-Image-2.1 als Open Source veröffentlicht, ein einheitliches Modell für Text-zu-Bild-Generierung und Bildbearbeitung, dessen visuelle Generierungskomponente 7B Parameter über 32 Single-Stream-DiT-Schichten umfasst und native transparente (RGBA) Generierung und Bearbeitung unterstützt.
- Die visuelle Generierungskomponente hat 7B Parameter über 32 Single-Stream-DiT-Schichten.
- Es unterstützt bis zu 10 Referenzbilder und lokale Bearbeitungen, die über Kreise, gemalte Anmerkungen oder separate Masken festgelegt werden.
- Unterstützte Seitenverhältnisse sind unter anderem 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 und 9:16, mit Beispielauflösungen bis 2752×1536.
- Es steht unter der Qwen Research License Agreement, und die Modellseite meldet 64.362 Downloads im letzten Monat.
Da ein einzelnes 7B-Modell Text-zu-Bild-Generierung, RGBA-Transparenzebenen und Bearbeitung mit mehreren Referenzen abdeckt, können Entwickler den Betrieb getrennter Modelle für Generierung und Bearbeitung vermeiden.
Erste Leitlinien für Safety Cases beim Training von Frontier-KI
OpenAI hat erste Leitlinien für Safety Cases beim Training von Frontier-KI veröffentlicht, die technische Schutzmaßnahmen, operative Praktiken und die Untersuchung von Fehlausrichtungsvorfällen abdecken.
- Die Leitlinien behandeln technische Schutzmaßnahmen, operative Praktiken und die Untersuchung von Fehlausrichtungsvorfällen.
- Sie werden als erste Leitlinien und nicht als abgeschlossener Standard präsentiert.
Teams, die Frontier-Modelle trainieren, können diese drei Bereiche als Ausgangsstruktur für ihre eigene Safety-Case-Dokumentation nutzen.
TaichuAI veröffentlicht multimodales Grundlagenmodell ZDTaichu5.0-9B für räumliches Schlussfolgern und agentische Werkzeugnutzung
ZDTaichu5.0-9B ist ein multimodales Grundlagenmodell von TaichuAI, das ein Qwen3.5-9B-Sprachbackbone mit einem C-RADIOv4-H-Vision-Encoder kombiniert, Text, Bilder und Videos in beliebiger Auflösung unterstützt und auf allgemeines visuelles Verständnis, räumliches Schlussfolgern, agentische Werkzeugnutzung und Embodied-...
- Das Modell hat 9,8B Parameter, den Tensortyp BF16 und eine Kontextlänge von bis zu 128K tokens.
- Die Modellkarte berichtet Werte von 87,7 auf TAU2-Bench, 71,4 auf Claw-Eval und 93,7 auf IFEval.
- Die Modellkarte berichtet Werte von 48 auf ERQA und 56 auf RoboSpatial.
- Die Gewichte werden unter der NVIDIA Open Model License Agreement veröffentlicht, wobei die Apache-2.0-Lizenz von Qwen3.5 erhalten bleibt.
Für Entwickler von Vision-Agenten oder Embodied-AI-Pipelines bietet dieses Modell räumliches Schlussfolgern und Werkzeugaufrufe in der 10B-Klasse, doch die Werkzeugausführung muss weiterhin von der umgebenden Anwendung implementiert, validi...