AI FRONTIER
Signals worth understanding before they become obvious.
Google publica RRSI, que permite al «arnés» de un agente automejorarse sin reentrenar el modelo
Investigadores de Google Cloud AI Research, junto con la Universidad de Stanford y la Universidad de Washington, publicaron el marco RRSI, que revisa repetidamente el arnés que rodea a un modelo, incluidos prompts, uso de herramientas, flujo de control, gestión de memoria y contexto, módulos de habilidades y subagentes...
- En ocho benchmarks, Terminal-Bench 2.1 pasó de 74,2 % a 80,2 %, una mejora de 6,0 puntos porcentuales, y SWE-Bench Verified de 82,0 % a 83,8 %, una mejora de 1,8 puntos porcentuales.
- JobBench pasó de 36,0 % a 40,7 %, una mejora de 4,7 puntos porcentuales; GDPval de 48,8 % a 52,3 %, una mejora de 3,5 puntos porcentuales; Frontier-Eng de 17,7 % a 22,0 %, una mejora de 4,3 puntos porcentuales.
- RRSI se publicó como marco de investigación en GitHub, con código disponible bajo la licencia Apache 2.0.
Para los equipos que construyen agentes, RRSI muestra que una búsqueda iterativa controlada sobre el arnés, con los pesos del modelo fijos, puede aportar mejoras medibles en benchmarks y reducir el coste en tokens.
OpenAI presenta GPT-6.1 Sol
OpenAI presenta GPT-6.1 Sol para programación, uso del ordenador y trabajo profesional, con una inteligencia cercana a Astra a una quinta parte de los precios estándar de tokens de entrada y salida de la API de Astra.
- OpenAI informa que GPT-6.1 Sol ofrece una inteligencia cercana a Astra.
- Los usos previstos son programación, uso del ordenador y trabajo profesional.
- Los precios estándar de tokens de entrada y salida de la API son una quinta parte de los de Astra.
Para los desarrolladores de IA, una inteligencia cercana a Astra a una quinta parte del precio por token reduce el coste de inferencia en cargas de programación y uso del ordenador.
prism-ml publica Ternary-Bonsai-2-27B-gguf: un modelo 27B de pesos ternarios que se ejecuta desde 5,95 GB
prism-ml publicó Ternary-Bonsai-2-27B-gguf en Hugging Face, cuantizando los embeddings, proyecciones de atención, proyecciones MLP y la cabeza LM de Qwen3.8-27B a pesos ternarios (g128, {−1,0,+1} con escalado por grupo en FP16), con dos empaquetados GGUF, PTQ1_0 y PQ2_0, para llama.cpp en CUDA, Metal y CPU.
- El tamaño del modelo de lenguaje es de 5,95 GB (PTQ1_0) o 7,21 GB (PQ2_0), aproximadamente 9,0x y 7,5x menos que la referencia FP16 de unos 54 GB; el formato ternario ideal es de 1,72 bits/peso con 5,8 GB.
- El artículo reporta un promedio de 84,78 en 14 benchmarks en modo thinking, el 98,2 % de la referencia FP16 (86,32), frente a 72,59 de IQ2_XXS (7,27 GB) y 85,18 de UD-Q4_K_XL (17,6 GB).
- El artículo reporta 95,83 en AIME26 y 90,07 en LiveCodeBench, donde IQ2_XXS obtiene 57,5 y 56,4; matemáticas 96,57, código 89,42, llamada de herramientas BFCL v3 74,92.
- Requiere los kernels ternarios de atención híbrida del fork PrismML-Eng/llama.cpp; el llama.cpp estándar rechaza PQ2_0 y PTQ1_0 y produce silenciosamente resultados incorrectos con Q2_0. Licencia: Apache 2.0.
Para los equipos que despliegan razonamiento de clase 27B en una sola GPU o un portátil, esto muestra que la cuantización ternaria de extremo a extremo puede mantener puntuaciones de razonamiento y llamada de herramientas cercanas a FP16 co...
Hacia la recuperación de espacios de interacción para la búsqueda agéntica: RISE construye un espacio acotado con BM25
El artículo propone RISE (Retrieving Interaction SpacE), que usa BM25 para construir un subconjunto acotado del corpus que el agente puede explorar y procesa sus documentos durante la indexación para navegación estilo shell. En BrowseComp-Plus, RISE alcanza 78 % de precisión con gpt-5.4-mini, igualando la línea base DC...
- El artículo reporta que en BrowseComp-Plus, RISE alcanza 78 % de precisión con gpt-5.4-mini, igualando la línea base DCI de shell puro con aproximadamente un cuarto del costo por consulta.
- El artículo reporta que con 1 millón de documentos, RISE-BM25 alcanza 81 % con gpt-5.4-mini.
- El artículo reporta que en la misma escala de 1 millón de documentos, DCI con gpt-5.4-nano baja a 60 %, con 33 de 100 fallos de tiempo real.
- El artículo sostiene que la interacción sin límites no escala: cada comando shell amplio es un escaneo de todo el corpus y la latencia se degrada bruscamente a medida que el corpus crece.
Para los equipos que construyen agentes de búsqueda, el resultado indica que la recuperación debe acotar el espacio de interacción en lugar de solo seleccionar documentos que quepan en la ventana de contexto, lo que controla costo y latenci...
Diffusion Controller unifica y simplifica la generación de imágenes con IA
Google Research presenta Diffusion Controller, una red ligera de tipo «amortiguador de dirección» que ajusta dinámicamente la trayectoria de eliminación de ruido mientras el modelo base permanece congelado, mejorando la alineación con el prompt y la calidad de imagen.
- Evaluado sobre un backbone Stable Diffusion v1.4 en tres regímenes de ajuste fino: SFT, pérdida ponderada por recompensa (RWL) y PPO.
- En las vías SFT y RWL, el Diffusion Controller de caja gris superó a LoRA en tasas de victoria HPS-v2 mientras manipulaba significativamente menos capas internas del modelo.
- La versión de caja blanca totalmente desbloqueada alcanzó una tasa de victoria del 90 % frente al modelo base.
- Un único parámetro de intensidad de guiado en inferencia permite ajustar dinámicamente la intensidad de las restricciones de control.
Para los desarrolladores, esto ofrece una vía ligera hacia una generación de imágenes controlable y personalización sin acceder a los pesos de modelos cerrados.
Google DeepMind presenta SynthID Bio para marcar con agua proteínas generadas por IA
Google DeepMind publicó SynthID Bio, una familia de métodos de marca de agua para biología sintética que incrusta una firma detectable en secuencias de aminoácidos y en estructuras 3D predichas por AlphaFold 3, preservando la función biológica en pruebas de laboratorio.
- SynthID Bio ajusta finamente una pequeña parte de la red de difusión de AlphaFold 3, incorporando la marca de agua en los pesos del modelo para que las coordenadas 3D predichas lleven inherentemente una firma detectable.
- El trabajo reporta que SynthID Bio preserva la precisión de predicción de AlphaFold 3 y ofrece una detectabilidad casi perfecta, resistiendo ruido digital o cambios menores de coordenadas.
- Google DeepMind afirma que publicará su artículo de métodos, abrirá el código y los datos in vitro, y liberará los pesos a la comunidad investigadora.
Para los desarrolladores de herramientas de diseño biológico, incrustar marcas de agua directamente en los pesos del modelo y en la generación de secuencias ofrece una capa de verificación automatizada para el cribado de síntesis de ADN y l...