AI FRONTIER
Signals worth understanding before they become obvious.
EmbeddingGemma 2: un modelo de embedding multimodal abierto y ligero
Google DeepMind publicó EmbeddingGemma 2, un modelo de 740 millones de parámetros basado en la arquitectura Gemma 4 bajo licencia Apache 2.0, que asigna de forma nativa texto, imágenes, audio y vídeo a un espacio de embedding unificado.
- 740 millones de parámetros, basado en la arquitectura Gemma 4 y publicado bajo la licencia Apache 2.0 comercialmente permisiva.
- Requiere tan solo 270M de parámetros para cargas de trabajo solo de texto, con codificadores opcionales de visión (170M) y audio (300M).
- Reporta una mejora de 9,92 puntos en rendimiento de código en MTEB Code, de 68,76 a 78,68.
- Matryoshka Representation Learning permite truncar dinámicamente los vectores de salida de 768 dimensiones a 512, 256 o 128, ofreciendo hasta 6x de reducción de almacenamiento.
Los desarrolladores pueden ejecutar búsqueda cross-modal y pipelines de RAG completamente en el dispositivo, equilibrando memoria y almacenamiento mediante codificadores modulares y truncamiento MRL.
Hacia la recuperación de espacios de interacción para la búsqueda agéntica: RISE
El artículo propone RISE (Retrieving Interaction SpacE), que usa BM25 para construir un espacio de interacción acotado y procesa sus documentos durante la indexación para navegación estilo shell, reemplazando la interacción directa no acotada con el corpus.
- En BrowseComp-Plus, RISE alcanza 78 % de precisión con gpt-5.4-mini, igualando la línea base DCI de shell puro con aproximadamente un cuarto del costo por consulta.
- Con 1 millón de documentos, RISE-BM25 alcanza 81 % con gpt-5.4-mini.
- A la misma escala, DCI con gpt-5.4-nano cae a 60 %, con 33 de 100 fallos de tiempo real.
- El artículo sostiene que la interacción no acotada no escala: cada comando shell amplio es un escaneo de todo el corpus y la latencia se degrada drásticamente a medida que el corpus crece.
Para los equipos que construyen agentes de búsqueda, la recuperación pasa de seleccionar documentos a definir una frontera explorable, lo que determina directamente el costo y la fiabilidad en corpus grandes.
AutoSynthData: generar datos de entrenamiento para agentes empresariales
ServiceNow CoreAI publicó AutoSynthData, que usa los fallos de un modelo objetivo y los éxitos de un profesor más fuerte para identificar brechas de capacidad, y luego genera y valida nuevas tareas ejecutables para el post-entrenamiento.
- En el dominio Hybrid de EnterpriseOps Gym, con Gemma-4-26B-A4B-it como modelo objetivo y Qwen3.8-27B como profesor, AutoSynthData generó 2.000 muestras de entrenamiento sintéticas en unas 18 horas.
- El mejor checkpoint de Hybrid fue la epoch 5, mejorando el Pass@1 medio en 7,2 puntos porcentuales, una mejora relativa del 35 %, y elevando el éxito del verificador del 63,01 % al 68,55 %.
- El informe afirma que cierra el 59 % de la brecha original de Pass@1 entre Gemma y el modelo de referencia.
- En el dominio ITSM, también con Gemma-4-26B-A4B-it como modelo objetivo y DeepSeek-V4.1-Flash como profesor, AutoSynthData generó 1.994 muestras de entrenamiento sintéticas en 66 horas.
Para los equipos que construyen agentes empresariales, este pipeline convierte fallos específicos del entorno en tareas de entrenamiento verificadas y ofrece un bucle reutilizable de calibración de dificultad, no solo más datos sintéticos.
Open TTS Leaderboard: evaluación escalable para texto a voz multilingüe y clonación de voz
Hugging Face lanzó el Open TTS Leaderboard, que evalúa modelos de código abierto de TTS multilingüe y clonación de voz con métricas objetivas: WER/CER mediante Qwen3 ASR, RTFx y TTFA en una GPU H200, y similitud coseno (SIM) entre embeddings de hablante WavLM.
- A 30 de septiembre de 2026 hay más de 8K modelos TTS disponibles en el Hugging Face Hub.
- A 30 de septiembre de 2026, solo 16 de los 92 modelos de Artificial Analysis son de pesos abiertos.
- Usar métricas objetivas reduce la evaluación de un modelo de un par de semanas de recolección de votos a un par de horas.
- La vista predeterminada clasifica los modelos por WER promedio macro en los splits en inglés de Seed TTS Eval y CV3 Eval (zero shot), con hexgrad/Kokoro-82M, Supertone/supertonic-3 y fishaudio/s2-pro a la cabeza.
Para los equipos que construyen agentes de voz, el leaderboard ofrece comparaciones reproducibles de modelos abiertos en WER, RTFx, TTFA y SIM para decidir entre latencia, tamaño y calidad multilingüe, aunque no mide naturalidad ni preferen...
autotrust/JEV-27B-VL: un modelo de decisión multimodal de 27,8B que puede ver
autotrust/JEV-27B-VL añade visión a autotrust/JEV-27B y devuelve decisiones System 1 tipadas con probabilidades calibradas sobre texto e imágenes, manteniendo el Qwen3.8-27B sin modificar como System 2.
- 27,8B parámetros, pipeline image-text-to-text, licencia apache-2.0.
- System 1 admite sí/no, elegir una de 2–256 opciones y puntuar de 0 a 5, con prompts de hasta 256K tokens.
- El pick and place con brazo robótico completó el 75 % de 20 escenas aleatorias, los 15 cubos agarrados terminaron en la bandeja, a unos 240 ms por decisión.
- El uso de computadora completó el 95 % de 60 tareas multietapa aleatorias a unos 0,26 s por clic, bajando al 10 % con solo cajas numeradas.
Para quienes necesitan decisiones visuales de baja latencia dentro de un bucle de control, JEV-27B-VL devuelve probabilidades calibradas en una sola pasada, pero las tareas de uso de computadora requieren el texto de los elementos.