Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-09-30
01
watchresearchnew architecture

Cómo Diffusion Controller unifica y simplifica la generación de imágenes con IA

Google Research presenta Diffusion Controller, una red ligera de tipo «amortiguador de dirección» que reformula el proceso de eliminación de ruido como un problema de control continuo, mejorando la alineación con el prompt y la calidad de imagen sin modificar un modelo base congelado.

  • En las variantes SFT y RWL, la red amortiguadora Diffusion Controller de caja gris superó a LoRA en tasas de victoria HPS-v2, manipulando muchas menos capas internas del modelo que LoRA.
  • El artículo informa que su versión totalmente desbloqueada, con acceso de caja blanca para modificar pesos internos, alcanzó una tasa de victoria del 90 % frente al modelo base.
  • El marco implementa cuatro estructuras de red: Diffusion Controller, Diffusion Controller-Naive, Diffusion Controller-J y Diffusion Controller-S.
  • Un único parámetro de intensidad de guía en inferencia puede ajustarse en tiempo de ejecución para subir o bajar la intensidad de las restricciones de control.

Para los desarrolladores, esto significa control fino de modelos de imagen de código cerrado sin acceso de caja blanca, con una capa de control separada del núcleo del modelo que puede extenderse a personalización, seguridad y generación de...

Google Research
02
watchagentsnew architecture

Conectar agentes LLM y espacios de datos: mediación arquitectónica mediante el Model Context Protocol

El artículo presenta un enfoque de mediación arquitectónica basado en el Model Context Protocol (MCP), implementado mediante el Eunomia Agent, para permitir una interacción controlada entre agentes LLM y servicios de espacios de datos. Un prototipo valida la interacción de extremo a extremo en descubrimiento de catálog...

  • Enviado a arXiv el 24 de septiembre de 2026 como arXiv:2609.30341, clasificado en cs.AI y cs.DB.
  • La capa de mediación traduce las capacidades de los espacios de datos en herramientas estructuradas y guiadas por esquemas que los agentes de IA pueden descubrir e invocar, preservando las restricciones de gobernanza.
  • Los autores son Jaime Alonso Ruiz, Carlos Aparicio, Gabriel Huecas, Joaquín Salvachúa y Andres Munoz-Arcentales.

Para los equipos que construyen agentes de IA, este trabajo muestra que MCP puede actuar como capa de mediación para conectar agentes con espacios de datos gobernados sin alterar la infraestructura de datos existente.

arXiv cs.AI
03
watchinferencenew architecture

HybridInfer: enrutamiento por niveles con aprendizaje por refuerzo y conciencia térmica para inferencia LLM en dispositivo, borde y nube

HybridInfer es un enrutador de aprendizaje por refuerzo con conciencia térmica para una jerarquía de tres niveles (Llama 3.2 3B en dispositivo, Llama 3.1 8B en el borde con recuperación, GPT-4o en la nube) que usa el margen térmico del teléfono y una estimación de complejidad de la consulta como estado y selecciona un ...

  • El artículo informa que las condiciones de siempre en dispositivo igualan la calidad por consulta en consultas servibles, pero son de tres a seis veces más lentas y fallan en consultas largas.

Para el despliegue de LLM en dispositivo, los límites térmicos son un problema de estabilidad en tiempo de ejecución y no solo una ralentización, por lo que las políticas de enrutamiento deben codificar el estado térmico y un incentivo de l...

arXiv cs.LG
04
testdocumentsopen source unlock

XingChen-AGI publica TeleOCR, un VLM de análisis de documentos de 1,2B parámetros

TeleOCR es un modelo de visión-lenguaje de código abierto de aproximadamente 1,2B parámetros que unifica el análisis de documentos digitales y capturados con cámara en un solo marco, con pesos e informe técnico publicados.

  • La ficha del modelo indica aproximadamente 1,2B parámetros, licencia apache-2.0, soporte de chino e inglés y una base qwen2_5_vl.
  • En OmniDocBench v1.6, TeleOCR reporta Overall 96,87, Text Edit 0,027, Formula CDM 96,36 y Table TEDS 97,05.
  • En el Dr.DocBench Challenge, TeleOCR reporta Overall 67,96, por encima de MinerU 2.5 Pro con 62,26 y PaddleOCR-VL 1.6 con 55,11.
  • La ficha del modelo afirma que TeleOCR analiza el diseño y el contenido de documentos distorsionados sin preprocesamiento de enderezado ni un modelo de rectificación dedicado.

Para quienes construyen canalizaciones de análisis documental, TeleOCR reporta resultados líderes en varios benchmarks públicos con aproximadamente 1,2B parámetros y ofrece pesos más una conversión GGUF, lo que lo hace candidato para anális...

Hugging Face Trending
05
testmodelsopen source unlock

Qwen publica como código abierto Qwen-Image-2.1: un modelo unificado de 7B para texto a imagen y edición de imágenes

Qwen ha publicado como código abierto Qwen-Image-2.1, un modelo unificado de generación de texto a imagen y edición de imágenes cuyo componente de generación visual tiene 7B de parámetros en 32 capas Single-Stream DiT y admite generación y edición nativas con transparencia (RGBA).

  • El componente de generación visual tiene 7B de parámetros en 32 capas Single-Stream DiT.
  • Admite hasta 10 imágenes de referencia y ediciones locales especificadas mediante círculos, anotaciones pintadas o máscaras separadas.
  • Las relaciones de aspecto admitidas incluyen 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 y 9:16, con resoluciones de ejemplo de hasta 2752×1536.
  • Tiene licencia Qwen Research License Agreement, y la página del modelo informa 64.362 descargas el mes pasado.

Como un solo modelo de 7B cubre la generación de texto a imagen, la generación de capas transparentes RGBA y la edición con múltiples referencias, los desarrolladores pueden evitar desplegar modelos separados para generación y edición.

Hugging Face Trending
06
watchresearchincremental

Primeras directrices para casos de seguridad en el entrenamiento de IA de frontera

OpenAI publicó primeras directrices sobre casos de seguridad en el entrenamiento de IA de frontera, que abarcan salvaguardas técnicas, prácticas operativas y la investigación de incidentes de desalineación.

  • Las directrices abarcan salvaguardas técnicas, prácticas operativas y la investigación de incidentes de desalineación.
  • Se presentan como directrices tempranas y no como un estándar finalizado.

Los equipos que entrenan modelos de frontera pueden usar estas tres áreas como estructura inicial para su propia documentación de casos de seguridad.

OpenAI News
07
testmodelsopen source unlock

TaichuAI publica ZDTaichu5.0-9B, un modelo fundacional multimodal para razonamiento espacial y uso de herramientas agénticas

ZDTaichu5.0-9B es un modelo fundacional multimodal de TaichuAI que combina un backbone de lenguaje Qwen3.5-9B con un codificador visual C-RADIOv4-H, admite texto, imágenes y vídeo con resolución arbitraria, y está orientado a comprensión visual general, razonamiento espacial, uso de herramientas agénticas e investigaci...

  • El modelo tiene 9,8B de parámetros, tipo de tensor BF16 y una longitud de contexto de hasta 128K tokens.
  • La ficha del modelo reporta puntuaciones de 87,7 en TAU2-Bench, 71,4 en Claw-Eval y 93,7 en IFEval.
  • La ficha del modelo reporta puntuaciones de 48 en ERQA y 56 en RoboSpatial.
  • Los pesos se publican bajo la NVIDIA Open Model License Agreement, conservando la licencia Apache-2.0 de Qwen3.5.

Para quienes construyen agentes visuales o pipelines de IA encarnada, este modelo ofrece razonamiento espacial y llamada a herramientas a escala 10B, pero la ejecución de herramientas debe seguir siendo implementada, validada y protegida po...

Hugging Face Trending