Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-04
01
watchresearchcost collapse

Fusão sensível ao formato para pré-treinamento FP4 rápido

O artigo apresenta a fusão sensível ao formato, que co-projeta cada produtor de quantização com seu domínio de escala e layout de consumidor para mxfp nativo, nvfp global e nvfp local ao arranjo de threads cooperativos. No pré-treinamento de Llama-3 família 8B até 160 bilhões de tokens, a rota personalizada mais rápida...

  • Em sondagens pareadas no mesmo acelerador, bfloat16 e Transformer Engine nvfp atingem 18,8K e 27,6K tokens/s/GPU, enquanto a rota personalizada mais rápida atinge 37,9K tokens/s/GPU.
  • mxfp com arredondamento estocástico do gradiente de linha e pré-condicionamento do gradiente de pesos Hadamard de 32 valores com sinal fixo atinge 37,2K tokens/s/GPU e 86,3% de utilização FLOP do modelo bfloat16.
  • Essa configuração mxfp termina 2,11% acima do ponto final de perda de treinamento do bfloat16 bruto.
  • Uma receita do Transformer Engine com quatro blocos bfloat16 finais termina 0,87% acima do bfloat16 a 27,1K tokens/s/GPU.

Os ganhos do pré-treinamento FP4 dependem conjuntamente do contrato de escala, do operando e do caminho de execução, não apenas dos Tensor Cores.

arXiv cs.LG
02
testdeveloperopen source unlock

Meta publica SDK para ESP32 que permite a qualquer pessoa montar dispositivos compatíveis com seu agente de IA Muse

A Meta lançou um SDK para ESP32 que permite a qualquer pessoa montar hardware compatível com seu agente de IA Muse.

  • A Meta lançou um SDK voltado ao ESP32.
  • O SDK pretende permitir que qualquer pessoa monte dispositivos compatíveis com o agente de IA Muse.

Desenvolvedores de ESP32 agora podem montar hardware compatível com o Muse usando um SDK oficial, em vez de esperar dispositivos prontos de fabricantes.

ビジネス+IT
03
watchmodelsnew architecture

OpenAI apresenta GPT-6 Sol e Luna

A OpenAI anunciou GPT-6 Sol e Luna, dois novos modelos de sua linha GPT-6.

  • A OpenAI apresentou novos modelos chamados GPT-6 Sol e Luna.
  • O anúncio veio do canal oficial da OpenAI.

Desenvolvedores de IA devem acompanhar GPT-6 Sol e Luna para avaliar se atendem às suas aplicações.

OpenAI
04
testcreativeopen source unlock

Open TTS Leaderboard: avaliação escalável para texto em fala multilíngue e clonagem de voz

A Hugging Face lançou o Open TTS Leaderboard, que avalia modelos de TTS multilíngue e clonagem de voz de código aberto com métricas objetivas: WER/CER via Qwen3 ASR, RTFx e TTFA em uma GPU H200, e similaridade de locutor (SIM) por cosseno com embeddings WavLM.

  • Em 30 de setembro de 2026, há mais de 8K modelos TTS disponíveis no Hugging Face Hub.
  • Em 30 de setembro de 2026, apenas 16 dos 92 modelos do Artificial Analysis são de pesos abertos.
  • Usar métricas objetivas reduz a avaliação de um modelo de algumas semanas de coleta de votos para algumas horas.
  • A visão padrão classifica por WER macro-médio nos splits em inglês do Seed TTS Eval e do CV3 Eval (zero shot), com hexgrad/Kokoro-82M, Supertone/supertonic-3 e fishaudio/s2-pro na liderança.

Para equipes que criam produtos de voz, essas métricas objetivas reproduzíveis permitem filtrar muitos modelos TTS abertos em horas, mas naturalidade e preferência de escuta ainda exigem votação humana.

Hugging Face Blog
05
testcreativeincremental

Lightricks lança LTX-2.5, modelo aberto de vídeo, áudio e simulação

O Lightricks/LTX-2.5 é um modelo de pesos abertos que gera vídeo e áudio sincronizados a partir de entradas de texto, imagem e vídeo, com suporte a auto-hospedagem. Ele adiciona geração multi-plano nativa, decodificador de vídeo por difusão, codificador de texto Gemma 4 12B e preditor de duração opcional.

  • O cartão do modelo informa 1.629.984 downloads no último mês e 6,12 mil curtidas.
  • É distribuído como um pacote dividido alinhado ao Comfy, com um arquivo .safetensors por componente, incluindo checkpoints DiT de 22B destilados e completos.
  • O DiT destilado usa um cronograma fixo de 8 passos com CFG=1; num_frames deve satisfazer num_frames % 8 == 1 e largura e altura devem ser divisíveis por 32.
  • Com receita anual abaixo de US$ 10 milhões, o uso comercial e em produção é gratuito sob a licença comunitária LTX-2.x; acima de US$ 10 milhões é necessário um acordo comercial pago.

Para os desenvolvedores, o LTX-2.5 oferece um caminho de pesos abertos e auto-hospedável para geração de vídeo e áudio sincronizados, com checkpoints divididos e variantes quantizadas int8 ou NVFP4 para diferentes orçamentos de VRAM.

Hugging Face Trending
06
watchresearchincremental

“very likely” significa “incerto”? Como os LLMs divergem dos humanos na quantificação linguística da incerteza

O artigo monta um corpus de marcadores de incerteza humanos a partir da literatura de psicologia e ciência da decisão e compara LLMs com ele, relatando que os LLMs codificam a incerteza verbal com níveis numéricos que diferem substancialmente dos dos humanos. Os autores introduzem um algoritmo baseado em otimização que...

  • Os autores são Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu e Tianlong Chen; submetido em 6 de setembro de 2026 e aceito na ICML 2026.
  • Os autores montam um corpus de marcadores de incerteza humanos a partir da literatura de psicologia e ciência da decisão e comparam LLMs com ele.
  • O artigo relata que os LLMs codificam a incerteza verbal com níveis numéricos que diferem substancialmente dos dos humanos.
  • O algoritmo proposto ajusta um mapeamento marcador-incerteza para explicar melhor a correção empírica em vez de estimar a incerteza por amostragem repetida.

Equipes que constroem sistemas cientes de incerteza devem validar como os LLMs interpretam numericamente marcadores como “likely” e “possible” em relação aos julgamentos humanos, em vez de assumir alinhamento.

arXiv cs.LG
07
watchresearchnew architecture

Transcendentais polinomiais rápidas para LLMs

O artigo testa substituir sigmoid, tanh e SiLU nativos por programas polinomiais curtos em LLMs, relatando ganhos de throughput por passo de treinamento em tarefas de integração GB200 e diferenças de perda perto de 100 bilhões de tokens.

  • Em uma varredura FP16 isolada, programas FMA empacotados melhoram 1,19–2,19x em conjuntos de trabalho residentes em L2 e 1,00–1,70x em residentes em HBM.
  • Em quatro tarefas de integração GB200, as substituições dense SiLU, tanh-softcapped attention e routed-expert SwiGLU melhoram o throughput do passo de treinamento completo em 2,7%, 2,9% e 8,0%, respectivamente.
  • A substituição sigmoid attention melhora o forward de atenção completo em 7,4% e o passo completo de GPU em 0,3%.
  • Em horizontes comuns próximos de 100 bilhões de tokens, as diferenças finais de perda de treinamento suavizada (polinomial menos nativa) variam de -0,107 a +0,079 nas quatro tarefas.

Para construtores de IA, isso indica que substituições polinomiais BF16 de baixo grau para transcendentais SFU podem trazer ganhos mensuráveis de throughput de treinamento em GPUs da classe Blackwell, mas o impacto na perda deve ser validad...

arXiv cs.LG
08
watchresearchincremental

Quão longe está o Adam do descenso de gradiente natural?

O artigo trata a regra de atualização completa do Adam, incluindo o momento, como uma aproximação diagonal de Fisher empírica sujeita a truncamento diagonal, substituição empírica de rótulos e atraso temporal, e mede o desvio geométrico do Adam em relação ao NGD verdadeiro com a métrica invariante de escala γ(Δθ) em qu...

  • O estudo abrange quatro paisagens de perda: regressão linear bem condicionada, regressão linear mal condicionada, regressão logística e uma pequena rede neural não convexa.
  • O desvio permanece baixo em cenários bem condicionados, mas aumenta significativamente sob mau condicionamento, atingindo desalinhamentos de aproximadamente 10^3 na rede neural.
  • Maior deriva geométrica correlaciona-se com otimização inicial mais lenta, mas não degrada a minimização final do objetivo; o Adam atinge consistentemente perda baixa.
  • O Fisher empírico melhorado (iEF) segue trajetórias mais estáveis do que o Fisher empírico padrão (EF), que frequentemente oscila ou diverge.

Para os desenvolvedores, isso sugere que o poder de otimização prático do Adam pode vir de um equilíbrio entre erros de aproximação estrutural e suavização por momento, em vez de um acompanhamento próximo da trajetória do gradiente natural.

arXiv cs.LG