Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-03
01
watchmodelsincremental

Gemini 4 Argon: la nueva era de inteligencia de frontera de Google DeepMind

Google DeepMind anuncia Gemini 4 Argon, un modelo de frontera para flujos de trabajo de largo horizonte que eleva el límite de tokens de salida de 64K a 1 millón y se despliega entre defensores cibernéticos de confianza mediante el Fairwind Program.

  • El límite de tokens de salida se amplía de 64K a 1 millón de tokens, lo que Google describe como líder del sector.
  • Establece un nuevo estado del arte en DeepSWE v1.1 con 77,9 %, un benchmark de tareas reales de ingeniería de software de largo horizonte.
  • Ocupa el puesto n.º 1 en AutomationBench de Zapier con 51,3 % y alcanza el estado del arte en LVBench de comprensión de vídeo largo con 91,7 %.

Para los desarrolladores, el techo de 1 millón de tokens de salida y el precio de 2 USD por millón de tokens de entrada hacen económicamente viable una trayectoria de agente larga, pero el acceso se limita actualmente a defensores cibernéti...

Google DeepMind
02
watchagentsnew architecture

De la propuesta al efecto verificado: Praxa, un arnés vinculado a evidencia para la ejecución gobernada de agentes de IA

El artículo presenta Praxa, un arnés de agente que representa explícitamente la propuesta, la autoridad, el despacho, el efecto externo verificado y la promoción a servicio mediante admisión determinista, ejecución intermediada, relectura externa, reconciliación y promoción revisada. Ninguna de las cuatro vías de evide...

  • El candidato usó 37,11 % menos tokens, 33,84 % menos costo estimado de endpoint y 11,63 % menos pasos; el artículo afirma que esto no establece mejoras de calidad, latencia o comportamiento en producción.

Para los equipos que construyen agentes gobernados, el aporte de Praxa es hacer explícitas y comprobables las transiciones de autoridad a efecto, pero la evidencia actual solo respalda la verificabilidad arquitectónica, no el despliegue en ...

arXiv cs.AI
03
watchmodelsnew architecture

Nuevo modelo de OpenRouter: inclusionAI Ling 3.1 Flash

Ling 3.1 Flash es un modelo mixture-of-experts de razonamiento híbrido de inclusionAI, con 25B de parámetros activos sobre 560B totales y una ventana de contexto de 262.144 tokens.

  • 560B de parámetros totales con 25B de parámetros activos.
  • Ventana de contexto de 262.144 tokens, con soporte para hasta 32.768 tokens de finalización.
  • Acepta tools y tool_choice para llamadas a funciones, pero no admite response_format, por lo que no se fuerza la salida JSON.
  • Listado como gratuito en OpenRouter, con fecha de lanzamiento el 2 de octubre de 2026.

Para los desarrolladores, es una opción MoE gratuita de contexto largo con llamadas a herramientas, pero al no forzar salida estructurada la fiabilidad del JSON debe gestionarse en la capa de aplicación.

OpenRouter Models
04
watchcreativenew architecture

DSSR-3D: razonamiento desacoplado para referencias dependientes de la vista en gaussianas 3D

DSSR-3D es un marco de inferencia para la segmentación de referencias dependiente de la vista sobre campos gaussianos 3D continuos, formalizado como dos interfaces, localización semántica invariante a la pose y razonamiento espacial condicionado por la pose, sin reentrenar el campo semántico subyacente.

  • La instanciación emplea un mecanismo de localización softmax con temperatura agudizada y una función de puntuación direccional basada en proyección, fusionados mediante un paso ligero y sin entrenamiento.
  • Los autores proponen ViewRef-GS, un benchmark que aísla la segmentación dependiente de la vista en campos gaussianos 3D, evaluado junto con un Ref-LERF aumentado.
  • El artículo reporta mejoras consistentes frente a métodos de referencia basados en 3DGS existentes, sin entrenamiento adicional más allá del campo semántico base.

Para los constructores de IA, esto indica que la referencia espacial dependiente de la vista puede desacoplarse en inferencia y transferirse sin adaptación a campos semánticos estructuralmente distintos.

arXiv cs.CV
05
watchresearchcost collapse

FlashDiffusion: descomposición espectral de kernels en mosaicos fusionados

El artículo presenta FlashDiffusion, un método sin matriz que evalúa bloques densos de kernels gaussianos en mosaicos fusionados de GPU y acopla el solucionador de autovalores a un β-flow empírico que selecciona la escala de resolución de muestra finita.

  • El artículo reporta que materializar kernels gaussianos densos requiere O(N^2) de memoria.
  • El método evalúa bloques densos de kernels gaussianos en mosaicos fusionados de GPU, evitando materializar el kernel denso.
  • El solucionador de autovalores se acopla a un β-flow empírico que selecciona la escala de resolución de muestra finita.
  • Una continuación sobre el tamaño de muestra y el ancho de banda inicializa en caliente resoluciones espectrales cada vez más costosas desde resoluciones más gruesas.

Para los desarrolladores de IA que usan métodos de kernel en aprendizaje geométrico, este enfoque en mosaicos sin matriz elimina el cuello de botella de memoria O(N^2) del kernel denso, haciendo factibles resoluciones espectrales mayores.

arXiv cs.LG
06
watchresearchincremental

ChainLoRA: fusión de vectores de tarea que preserva la geometría para el aprendizaje continuo en LLM

ChainLoRA es un marco de fusión continua sin repetición, basado en la geometría de vectores de tarea actualizada en cadena, que combina entrenamiento con actualización en cadena y fusión SVD adaptativa posterior al flujo. El artículo reporta un rendimiento de vanguardia entre los métodos sin repetición evaluados en los...

  • En el momento de la fusión, la SVD adaptativa extrae un portador compartido y lo alinea con la última tarea mediante adaptación de Procrustes.

Para quienes construyen canalizaciones de aprendizaje continuo, el entrenamiento con actualización en cadena y la fusión SVD adaptativa de ChainLoRA ofrecen una vía de ajuste fino eficiente en parámetros y sin repetición, cuyo uso de estado...

arXiv stat.ML
07
testmodelsopen source unlock

NVIDIA Kumo Tabular establece una nueva frontera de precisión y eficiencia para la predicción tabular

NVIDIA publica Kumo Tabular, un modelo fundacional abierto para clasificación y regresión tabulares que predice nuevas filas en una sola pasada hacia adelante, sin entrenamiento, ajuste ni ingeniería de características, en tres tamaños de 28M a 215M parámetros bajo la licencia OpenMDW-1.1.

  • Kumo Tabular está disponible en tamaños Small/Medium/Large que abarcan de 28M a 215M parámetros y se publica bajo la licencia OpenMDW-1.1 para uso comercial.
  • Ocupa el primer puesto en la clasificación de TabArena con un ELO de 1950 y se reporta que es 17 veces más rápido que LimiX-2 en una configuración de evaluación uniforme con una sola RTX 6000 Pro.
  • En BeyondArena alcanza un ELO de 1418 con una puntuación de Improvability del 7,78 %, situándose primero en la clasificación.
  • En TALENT logra el primer puesto general en precisión de clasificación, log-loss de clasificación y RMSE de regresión, con rangos promedio de 6,67, 3,98 y 4,22.

Para los desarrolladores de IA, Kumo Tabular ofrece una vía de predicción tabular sin entrenamiento por tarea, y sus cifras reportadas de precisión y eficiencia deben validarse con datos reservados antes del despliegue.

Hugging Face Blog