Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-06
01
watchresearchnew architecture

SCION: composición de escenas con primitivas neuronales instanciadas

SCION introduce una representación de escena composicional jerárquica que reemplaza las gaussianas 3D independientes por un vocabulario compacto de primitivas reutilizables e instancias ligeras en espacio mundial, ajustada a capturas multivista mediante optimización conjunta de parámetros de escena discretos y continuo...

  • El artículo fue aceptado en NeurIPS 2026 y enviado el 1 de octubre de 2026.
  • SCION reemplaza millones de gaussianas independientes por escena con un vocabulario de primitivas reutilizables e instancias en espacio mundial.
  • El artículo reporta mantener alta calidad incluso a 1,2 MB.
  • El artículo reporta una tasa-distorsión favorable frente a los métodos existentes de compresión de gaussianas y permite edición y animación a nivel de instancia sin reentrenamiento.

Para quienes construyen canalizaciones de escenas 3D, SCION muestra que modelar escenas como primitivas reutilizables más instancias puede ofrecer controles editables y animables a nivel de instancia en una representación compacta de alrede...

arXiv cs.CV
02
watchresearchbenchmark jump

DeskForge: supervisión densa desde entornos de escritorio para agentes de uso informático

DeskForge es un entorno de escritorio controlable que compone y explora aplicaciones reales para generar supervisión a gran escala, dando lugar a DeskForge-1M, un corpus de 1,2 millones de observaciones de escritorio anotadas con 159,7 millones de instancias de elementos. El artículo reporta el ajuste fino de cuatro mo...

  • DeskForge-1M contiene 1,2 millones de observaciones de escritorio anotadas con 159,7 millones de instancias de elementos.
  • El artículo ajusta cuatro modelos de visión-lenguaje sobre 200.000 ejemplos de grounding extraídos de DeskForge-1M.
  • El artículo reporta para Qwen3.5-4B un aumento de precisión de 11,51 puntos porcentuales en ScreenSpot-Pro y de 10,11 puntos en OSWorld-G.
  • El artículo reporta que, con un planificador fijo, Qwen3.5-4B pasa de 31 a 50 de 119 tareas en WebArena-Infinity y de 3 a 15 de 100 tareas en OpenApps.

Para los equipos que construyen agentes de uso informático, DeskForge indica que la composición controlable de entornos de escritorio reales puede escalar anotaciones densas de elementos y mejorar tanto el grounding de GUI como la finalizac...

arXiv cs.CV
03
testresearchincremental

Rank-Aware Speculative Sampling: una regla de verificación para árboles de borradores de difusión

El artículo presenta Rank-Aware Speculative Sampling (RASS), una regla de verificación para árboles de borradores especulativos basada en acoplamiento de listas sensible al rango, que ordena los candidatos según el desplazamiento medio propuesta-objetivo, muestrea un rango con pesos optimizados para minimizar la variac...

  • RASS mejora D-GRS, que genera K candidatos condicionalmente independientes por nodo y los prueba secuencialmente en su orden de generación.
  • RASS se evalúa en un objetivo de mezcla gaussiana, generación incondicional en espacio de píxeles sobre FFHQ, generación condicional en CIFAR-10 y difusión latente con Stable Diffusion 3.5 usando prompts de COCO2014.
  • La corrección residual garantiza un muestreo exacto para cualquier elección de pesos de rango.

Para quienes aceleran la inferencia de difusión, RASS muestra que aprovechar el orden de los candidatos borrador sin evaluaciones adicionales del modelo objetivo puede reducir el recuento de evaluaciones del modelo objetivo con presupuestos...

arXiv cs.LG
04
testcreativeincremental

Lightricks publica LTX-2.5, un modelo de pesos abiertos de vídeo y audio

Lightricks/LTX-2.5 es un modelo de pesos abiertos que genera vídeo y audio sincronizados a partir de entradas de texto, imagen y vídeo, y puede autoalojarse. Añade generación multiplano nativa, un decodificador de vídeo por difusión, un codificador de texto Gemma 4 12B propio y un predictor de duración opcional.

  • La ficha del modelo indica 6,48 k me gusta y 1.645.444 descargas el último mes.
  • Los checkpoints DiT están etiquetados como 22b y se ofrecen en variantes bf16, Comfy int8+convrot y NVFP4.
  • El codificador de texto es Gemma4 12B con proyecciones, y vídeo y audio usan VAE separados.
  • Las entidades con ingresos anuales inferiores a 10 M USD tienen uso comercial gratuito bajo la licencia comunitaria LTX-2.x; por encima se requiere un acuerdo comercial de pago.

Para los desarrolladores, LTX-2.5 ofrece generación de audio y vídeo autoalojable como un paquete de pesos dividido y alineado con Comfy, con un transformer dev entrenable, pero los checkpoints int8 son solo para ComfyUI.

Hugging Face Trending
05
watchresearchincremental

ReRoute permite predicciones contrafactuales en emuladores científicos sin experimentos controlados

El artículo presenta ReRoute, un marco para la predicción científica específica de tipo what-if que combina datos factuales con conocimiento mecanicista parcial y no requiere datos de intervención controlada para la adaptación. ReRoute fija la entrada consultada de un backbone preentrenado a un valor de referencia, rei...

  • En intervenciones climáticas acopladas reservadas, ReRoute reduce el error climático agregado entre un 18,2 y un 31,8 % bajo fuertes cambios de distribución de CO2, preservando el rendimiento en condiciones estándar.
  • El artículo reporta que ReRoute logra predicciones contrafactuales muy precisas en un sistema controlado de advección-difusión donde las respuestas exactas están disponibles.
  • El artículo proporciona un resultado de identificación causal para esta construcción bajo supuestos estructurales explícitos, con el argumento central verificado por máquina en Lean.

Para los equipos que construyen emuladores científicos, ReRoute muestra que los datos factuales más el conocimiento mecanicista parcial pueden mejorar la predicción contrafactual bajo cambio de distribución sin generar costosos datos de sim...

arXiv cs.LG
06
watchagentsnew architecture

DeReAct: razonamiento y actuación descompuestos para agentes de IA fiables

DeReAct es una arquitectura de agente modular que externaliza dos políticas de control: un Critic que valida las acciones propuestas antes de su ejecución y un Context Manager que reconstruye un State respaldado por el entorno y certifica la finalización de la tarea. El artículo informa que en GAIA y SWE-bench Verified...

  • El artículo informa mejoras de Pass@1 de 6,5 a 7,0 puntos para Qwen3-Coder-480B.
  • El artículo informa mejoras de Pass@1 de 4,2 a 5,2 puntos para Claude Sonnet 4.5.
  • Con Claude Opus 4.5, Pass@1 sigue siendo comparable a ReAct, mientras que DeReAct produce trayectorias más completas en evidencia y que satisfacen más restricciones.
  • El artículo indica que el control externo es eficaz cuando los fallos objetivo son suficientemente frecuentes y la política de control es en sí misma suficiente.

Para quienes construyen agentes, separar la validación de acciones y la certificación de finalización de una única política puede aumentar la fiabilidad de los modelos más débiles sin cambiar el modelo Brain subyacente.

arXiv cs.AI
07
testmodelsopen source unlock

Cloudflare publica Clef: un modelo de decisión multimodal de 27B que devuelve probabilidades estructuradas en una sola pasada hacia adelante

Cloudflare publicó Clef, un modelo multimodal post-entrenado a partir de Qwen/Qwen3.8-27B que convierte un estado y un esquema de preguntas tipadas en decisiones, devolviendo una probabilidad para cada opción permitida de cada pregunta, sin generación de texto libre ni análisis de salida.

  • 27B parámetros, BF16, almacenado como safetensors fragmentados estándar, publicado bajo licencia Apache-2.0.
  • Acepta texto, JSON, imágenes o video como estado y produce un logit por opción permitida por pregunta, con un softmax por pregunta que da las probabilidades.
  • Probado con torch 2.11 y transformers 5.10.2 en una sola H200; las entradas de imagen y video también necesitan pillow.
  • En la ejecución interna de Decision Index 0.2.1, la exactitud exacta de casos de BFCL es 98,5, el macro-F1 de BANKING77 es 94,2, la latencia mediana es 209,3 ms y la latencia p95 es 238,6 ms.

Para los desarrolladores de IA que necesitan decisiones estructuradas en lugar de texto libre, Clef ofrece una opción multimodal de 27B con API compatible con Jev/SystemOne, aunque su latencia es mayor que la de variantes más pequeñas como ...

Hugging Face Trending
08
watchresearchbenchmark jump

EditHero: un benchmark para edición 3D de largo horizonte a nivel de partes y Vibe Modeling

El artículo presenta EditHero, descrito por los autores como el primer benchmark para edición 3D de largo horizonte a nivel de partes, con instrucciones en lenguaje natural e imágenes objetivo tanto para geometría como para textura. Un motor de ensamblaje determinista produce el objetivo exacto tras cada edición, y cad...

  • El artículo describe EditHero como, según los autores, el primer benchmark para edición 3D de largo horizonte a nivel de partes, con instrucciones en lenguaje natural e imágenes objetivo para geometría y textura.
  • Un motor de ensamblaje determinista produce el objetivo exacto tras cada edición, y cada secuencia es revisada manualmente.
  • Los métodos no agénticos operan de arriba hacia abajo, regenerando el objeto a partir de una representación 3D aprendida, y a menudo omiten el cambio solicitado y alteran regiones que deberían permanecer fijas.

El benchmark desplaza la evaluación de la edición única a si las revisiones de varios pasos cambian solo lo solicitado, dando a quienes construyen pipelines de edición 3D iterativa un objetivo de comparación reproducible.

arXiv cs.CV