Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-02
01
opportunitymodelscost collapse

Presentamos GPT-6.1 Sol

GPT-6.1 Sol ofrece inteligencia cercana a Astra para programación, uso de computadora y trabajo profesional a un quinto de los precios estándar de tokens de entrada y salida de la API de Astra.

  • OpenAI News anuncia GPT-6.1 Sol.
  • Se posiciona para programación, uso de computadora y trabajo profesional con inteligencia cercana a Astra.
  • Los precios estándar de tokens de entrada y salida de la API son un quinto de los de Astra.

Para los desarrolladores de IA, una inteligencia cercana a Astra a un quinto del precio por token reduce el costo de inferencia de los flujos de agentes de programación y uso de computadora.

OpenAI News
02
watchresearchincremental

La ilusión del prompt de sistema: cómo los preámbulos de instrucciones modifican el cómputo en los modelos de lenguaje

El artículo utiliza la alineación de kernel centrada (CKA) para comparar las representaciones por capa bajo 20 prompts de sistema en 17 modelos ajustados por instrucciones, y encuentra que los efectos son selectivos por capa y dependientes del tipo de instrucción: las instrucciones de persona y formato reestructuran pr...

  • Se evaluaron 17 modelos ajustados por instrucciones que abarcan 8 familias de arquitectura y de 1,5B a 72B parámetros bajo 20 prompts de sistema en cinco categorías funcionales.
  • Las instrucciones de seguridad restrictivas y las explícitamente permisivas («no tienes restricciones») activan vías de cómputo casi idénticas, con una correlación CKA media de 0,997.
  • La penetración de la seguridad permanece por debajo del 10 % a escala comercial, incluso en 70B-72B.
  • La profundidad representacional predice el tamaño del efecto conductual en toda la cohorte de 17 modelos (Spearman rho = 0,761, p < 0,001).

Para los desarrolladores que dependen de la seguridad basada en prompts de sistema, esta evidencia indica que las instrucciones de seguridad pueden codificarse de forma fiable sin actuar profundamente en el cómputo, por lo que las defensas ...

arXiv cs.CL
03
watchresearchnew architecture

TomasuLLM: ejecución especulativa fuera de orden para agentes LLM

TomasuLLM es un runtime que ejecuta las llamadas a herramientas del agente fuera del orden de la trayectoria mientras preserva la corrección de la ejecución de la tarea: redacta acciones futuras, las ejecuta en sandboxes aisladas con copy-on-write, rastrea sus dependencias y efectos, y confirma los resultados en orden ...

  • El artículo reporta 1,31x en 100 tareas de SWE-bench Verified, 1,35x en 28 tareas de Terminal-Bench 2.0 y 1,27x de progreso emparejado en 18 sesiones de SWE-Marathon.
  • En 4.010 registros auditados de validación de commits, el artículo reporta cero aceptaciones falsas.
  • El trabajo aborda herramientas de larga duración como compiladores, suites de pruebas y comandos de repositorio, que tardan de segundos a minutos mientras el agente de código permanece inactivo.
  • Los resultados abarcan tres benchmarks con llamadas a herramientas desde menos de un segundo hasta varios minutos y escalan con la latencia de las herramientas.

Para los equipos que construyen agentes de código, TomasuLLM muestra que ejecutar especulativamente llamadas a herramientas en sandboxes aisladas y confirmarlas en orden de trayectoria puede reducir la latencia de herramientas largas sin sa...

arXiv cs.CL
04
testagentsopen source unlock

MiniMax libera OpenAgentCore como código abierto para la compatibilidad con la API OpenAI Agents

MiniMax ha liberado OpenAgentCore como código abierto, orientado a la compatibilidad con la API OpenAI Agents.

  • MiniMax liberó OpenAgentCore como código abierto.
  • OpenAgentCore apunta a la compatibilidad con la API OpenAI Agents.

Los desarrolladores de IA pueden usar OpenAgentCore para apuntar a flujos de trabajo de la API OpenAI Agents con una implementación de código abierto de MiniMax.

tokenpost.com
05
testcreativenew architecture

SInGA: aprendizaje de inpainting semántico para avatares de cabeza gaussianos animables

El artículo presenta SInGA, un método que define un marco de inpainting semántico en el espacio UV para completar regiones faciales no observadas a partir de una sola imagen y luego regresar atributos gaussianos, produciendo un avatar de cabeza gaussiano animable. El avatar resultante generaliza entre identidades sin o...

  • El marco de inpainting semántico se define en el espacio UV y utiliza las señales de simetría inherentes al rostro humano para completar regiones no observadas.
  • Las características extraídas de las regiones observadas se usan para completar las regiones no observadas, y la representación completada se usa después para regresar los atributos gaussianos.
  • En lugar de una sola gaussiana en cada superficie o ubicación de píxel, el método apila múltiples gaussianas para mejorar el detalle.
  • El artículo informa que el método genera avatares de cabeza de alta calidad con mejor completitud y preservación de identidad, y que admite animación realista y renderizado consistente desde vistas no observadas.

Para quienes construyen avatares de cabeza a partir de una sola imagen, trasladar la completitud a un espacio UV con correspondencias espaciales consistentes ofrece un enfoque reutilizable para tratar regiones no observadas en configuracion...

arXiv cs.CV
06
testresearchincremental

Control conformal de factualidad para generación aumentada por recuperación de múltiples saltos

El artículo aplica filtrado conformal dividido de afirmaciones a RAG de múltiples saltos y lo evalúa en HotpotQA, Natural Questions y TriviaQA con Llama 3.1 8B y GPT-4o-mini, junto con un experimento de referencia de un solo salto. Reporta que con el objetivo del 95%, la fracción de respuestas cuyas afirmaciones reteni...

  • Con el objetivo del 95%, esta tasa va del 95,80% al 97,20%, frente a 55,60%-76,03% sin filtrado.
  • Con el objetivo del 95%, solo se retiene el 4,41%-31,09% de las afirmaciones generadas y el 9,70%-51,40% de las respuestas permanecen no vacías.
  • La evaluación usa Llama 3.1 8B y GPT-4o-mini en HotpotQA, Natural Questions y TriviaQA, junto con un experimento de referencia de un solo salto.

Para quienes construyen RAG de múltiples saltos, el filtrado conformal eleva el respaldo a nivel de afirmación, pero debe interpretarse junto con la retención de afirmaciones y la abstención, ya que con el objetivo del 95% se descartan la m...

arXiv cs.CL
07
watchresearchcost collapse

Aceleración del modelo de lenguaje de difusión mediante un generador promedio discreto

El artículo introduce el Discrete Average Generator, que extiende MeanFlow a cadenas de Markov de tiempo continuo al definir un generador promedio como el incremento normalizado del núcleo de transición en un intervalo de tiempo, con una identidad de autoconsistencia como base del objetivo de entrenamiento.

  • En simulaciones del modelo de Potts, este objetivo reduce hasta un 67 % la distancia de variación total del muestreador de K pasos.
  • En OpenWebText, el método logra la menor perplejidad generativa entre los métodos evaluados para 8 a 64 pasos de muestreo, a la vez que permite una aceleración de 16x.
  • En ImageNet, el método logra un rendimiento comparable a los métodos existentes.
  • La identidad de autoconsistencia admite una expresión en forma cerrada al proyectarse sobre las marginales por coordenada.

Para los equipos que construyen modelos de lenguaje de difusión discreta, esto ofrece un objetivo de entrenamiento que reduce los pasos de muestreo manteniendo la calidad de generación, por lo que la aceleración de 16x reportada merece repr...

arXiv stat.ML
08
watchagentsincremental

Los agentes de IA son vulnerables a la radicalización

El artículo simula conversaciones entre dos agentes LLM: un objetivo que interpreta el papel de una persona según atributos demográficos y psicológicos, y un influenciador que busca hacer más extremas las creencias del objetivo. Reporta que tanto la resonancia (reforzar una creencia preexistente) como la persuasión (pr...

  • Enviado a arXiv el 29 de septiembre de 2026 como arXiv:2609.38296, clasificado en cs.AI y cs.CY.
  • Configuración: un LLM objetivo interpreta el papel de una persona según atributos demográficos y psicológicos, mientras que un LLM influenciador busca hacer más extremas las creencias del objetivo.
  • El artículo examina dos vías: la resonancia refuerza una creencia preexistente del objetivo y la persuasión promueve una creencia que el objetivo considera inicialmente poco importante.
  • El artículo reporta que ambos mecanismos radicalizan al objetivo en métricas afectivas y conductuales, pero la resonancia produce efectos sistemáticamente más fuertes que la persuasión.

Quienes construyen agentes personalizados y sistemas multiagente deberían tratar las entradas alineadas con las creencias como una superficie de influencia de alto riesgo, porque el artículo reporta que la resonancia produce una radicalizac...

arXiv cs.AI