AI FRONTIER
Signals worth understanding before they become obvious.
Fusión consciente del formato para preentrenamiento FP4 rápido
El artículo presenta la fusión consciente del formato, que codiseña cada productor de cuantización con su dominio de escala y el diseño de su consumidor para mxfp nativo, nvfp global y nvfp local al arreglo de hilos cooperativos. En preentrenamiento de Llama-3 familia 8B hasta 160 mil millones de tokens, la ruta person...
- En pruebas emparejadas en el mismo acelerador, bfloat16 y Transformer Engine nvfp alcanzan 18,8K y 27,6K tokens/s/GPU, mientras que la ruta personalizada más rápida alcanza 37,9K tokens/s/GPU.
- mxfp con redondeo estocástico del gradiente de fila y precondicionamiento del gradiente de pesos Hadamard de 32 valores con signo fijo alcanza 37,2K tokens/s/GPU y 86,3 % de utilización FLOP del modelo bfloat16.
- Esa configuración mxfp termina 2,11 % por encima del punto final de pérdida de entrenamiento del bfloat16 sin procesar.
- Una receta de Transformer Engine con cuatro bloques bfloat16 finales termina 0,87 % por encima de bfloat16 a 27,1K tokens/s/GPU.
Las ganancias del preentrenamiento FP4 dependen conjuntamente del contrato de escala, el operando y la ruta de ejecución, no solo de los Tensor Cores.
Meta publica un SDK para ESP32 que permite a cualquiera fabricar dispositivos compatibles con su agente de IA Muse
Meta ha publicado un SDK para ESP32 que permite a cualquiera construir hardware compatible con su agente de IA Muse.
- Meta ha publicado un SDK dirigido a ESP32.
- El SDK busca que cualquiera pueda construir dispositivos compatibles con el agente de IA Muse.
Los desarrolladores de ESP32 ya pueden construir hardware compatible con Muse sobre un SDK oficial en lugar de esperar dispositivos comerciales.
OpenAI presenta GPT-6 Sol y Luna
OpenAI anunció GPT-6 Sol y Luna, dos nuevos modelos de su línea GPT-6.
- OpenAI presentó nuevos modelos llamados GPT-6 Sol y Luna.
- El anuncio provino del canal oficial de OpenAI.
Los desarrolladores de IA deberían seguir GPT-6 Sol y Luna para evaluar si encajan en sus aplicaciones.
Open TTS Leaderboard: evaluación escalable para texto a voz multilingüe y clonación de voz
Hugging Face lanzó Open TTS Leaderboard, que evalúa modelos de TTS multilingüe y clonación de voz de código abierto con métricas objetivas: WER/CER mediante Qwen3 ASR, RTFx y TTFA en una GPU H200, y similitud de hablante (SIM) por coseno con embeddings WavLM.
- A 30 de septiembre de 2026 hay más de 8K modelos TTS disponibles en Hugging Face Hub.
- A 30 de septiembre de 2026, solo 16 de los 92 modelos de Artificial Analysis son de pesos abiertos.
- Basarse en métricas objetivas reduce la evaluación de un modelo de un par de semanas de recolección de votos a un par de horas.
- La vista predeterminada clasifica por WER macro-promedio en los splits en inglés de Seed TTS Eval y CV3 Eval (zero shot), con hexgrad/Kokoro-82M, Supertone/supertonic-3 y fishaudio/s2-pro a la cabeza.
Para los equipos que construyen productos de voz, estas métricas objetivas reproducibles permiten filtrar muchos modelos TTS abiertos en horas, pero la naturalidad y la preferencia de escucha aún requieren votación humana.
Lightricks publica LTX-2.5, modelo abierto de vídeo, audio y simulación
Lightricks/LTX-2.5 es un modelo de pesos abiertos que genera vídeo y audio sincronizados a partir de entradas de texto, imagen y vídeo, y admite autoalojamiento. Añade generación multiplano nativa, un decodificador de vídeo por difusión, un codificador de texto Gemma 4 12B y un predictor de duración opcional.
- La ficha del modelo indica 1.629.984 descargas el mes pasado y 6,12 k me gusta.
- Se distribuye como un paquete dividido alineado con Comfy, con un archivo .safetensors por componente, incluidos puntos de control DiT de 22B destilados y completos.
- El DiT destilado usa un calendario fijo de 8 pasos con CFG=1; num_frames debe cumplir num_frames % 8 == 1 y el ancho y el alto deben ser divisibles por 32.
- Con ingresos anuales inferiores a 10 millones de USD, el uso comercial y en producción es gratuito bajo la licencia comunitaria LTX-2.x; por encima de 10 millones de USD se requiere un acuerdo comercial de pago.
Para los desarrolladores, LTX-2.5 ofrece una vía de pesos abiertos y autoalojable hacia la generación de vídeo y audio sincronizados, con puntos de control divididos y variantes cuantizadas int8 o NVFP4 para distintos presupuestos de VRAM.
¿«very likely» significa «incierto»? Cómo los LLM se desvían de los humanos en la cuantificación lingüística de la incertidumbre
El artículo elabora un corpus de marcadores de incertidumbre humanos a partir de la literatura de psicología y ciencia de la decisión y compara LLM con él, informando que los LLM codifican la incertidumbre verbal con niveles numéricos que difieren sustancialmente de los de los humanos. Los autores introducen un algorit...
- Los autores son Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu y Tianlong Chen; enviado el 6 de septiembre de 2026 y aceptado en ICML 2026.
- Los autores elaboran un corpus de marcadores de incertidumbre humanos a partir de la literatura de psicología y ciencia de la decisión y comparan LLM con él.
- El artículo informa que los LLM codifican la incertidumbre verbal con niveles numéricos que difieren sustancialmente de los de los humanos.
- El algoritmo propuesto ajusta un mapeo marcador-incertidumbre para explicar mejor la corrección empírica en lugar de estimar la incertidumbre mediante muestreo repetido.
Los equipos que construyen sistemas conscientes de la incertidumbre deben validar cómo los LLM interpretan numéricamente marcadores como «likely» y «possible» frente a los juicios humanos en lugar de asumir alineación.
Trascendentales polinómicas rápidas para LLM
El artículo prueba reemplazar sigmoid, tanh y SiLU nativos por programas polinómicos cortos en LLM, reportando mejoras de rendimiento por paso de entrenamiento en tareas de integración GB200 y diferencias de pérdida cerca de 100 mil millones de tokens.
- En un barrido FP16 aislado, los programas FMA empaquetados mejoran 1,19–2,19x en conjuntos de trabajo residentes en L2 y 1,00–1,70x en residentes en HBM.
- En cuatro tareas de integración GB200, las sustituciones dense SiLU, tanh-softcapped attention y routed-expert SwiGLU mejoran el rendimiento del paso de entrenamiento completo en 2,7 %, 2,9 % y 8,0 %, respectivamente.
- La sustitución sigmoid attention mejora el forward de atención completo en 7,4 % y el paso completo de GPU en 0,3 %.
- En horizontes comunes cercanos a 100 mil millones de tokens, las diferencias finales de pérdida de entrenamiento suavizada (polinómica menos nativa) van de -0,107 a +0,079 en las cuatro tareas.
Para los constructores de IA, esto indica que los reemplazos polinómicos BF16 de bajo grado para trascendentales SFU pueden dar ganancias medibles de rendimiento de entrenamiento en GPU de clase Blackwell, pero el impacto en la pérdida debe...
¿Qué tan lejos está Adam del descenso de gradiente natural?
El artículo trata la regla de actualización completa de Adam, incluido el momento, como una aproximación diagonal de Fisher empírica sujeta a truncamiento diagonal, sustitución empírica de etiquetas y retardo temporal, y mide la desviación geométrica de Adam respecto al NGD verdadero con la métrica invariante de escala...
- El estudio abarca cuatro paisajes de pérdida: regresión lineal bien condicionada, regresión lineal mal condicionada, regresión logística y una red neuronal pequeña no convexa.
- La desviación se mantiene baja en entornos bien condicionados, pero aumenta significativamente bajo mal condicionamiento, alcanzando desalineaciones de aproximadamente 10^3 en la red neuronal.
- Una mayor deriva geométrica se correlaciona con una optimización inicial más lenta, pero no degrada la minimización final del objetivo; Adam alcanza consistentemente una pérdida baja.
- El Fisher empírico mejorado (iEF) sigue trayectorias más estables que el Fisher empírico estándar (EF), que con frecuencia oscila o diverge.
Para los desarrolladores, esto sugiere que el poder de optimización práctico de Adam podría provenir de un equilibrio entre errores de aproximación estructural y suavizado por momento, en lugar de un seguimiento cercano de la trayectoria de...