Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-03
01
watchmodelsincremental

Gemini 4 Argon: a nova era de inteligência de fronteira do Google DeepMind

O Google DeepMind anuncia o Gemini 4 Argon, um modelo de fronteira para fluxos de trabalho de longo horizonte que eleva o limite de tokens de saída de 64K para 1 milhão e está sendo distribuído a defensores cibernéticos confiáveis pelo Fairwind Program.

  • O limite de tokens de saída foi ampliado de 64K para 1 milhão de tokens, o que o Google descreve como líder do setor.
  • Estabelece um novo estado da arte no DeepSWE v1.1 com 77,9%, um benchmark de tarefas reais de engenharia de software de longo horizonte.
  • Ocupa o 1.º lugar no AutomationBench da Zapier com 51,3% e alcança o estado da arte no LVBench de compreensão de vídeos longos com 91,7%.
  • Empata em primeiro lugar no CWE-bench v1 com 68%; preço introdutório de US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída, com entrada em cache a 95% de desconto sobre o preço de entrada.

Para os desenvolvedores, o teto de 1 milhão de tokens de saída e o preço de US$ 2 por milhão de tokens de entrada tornam economicamente viável uma trajetória longa de agente, mas o acesso está atualmente restrito a defensores cibernéticos c...

Google DeepMind
02
watchagentsnew architecture

Da proposta ao efeito verificado: Praxa, um harness vinculado a evidências para execução governada de agentes de IA

O artigo apresenta o Praxa, um harness de agente que representa explicitamente proposta, autoridade, despacho, efeito externo verificado e promoção para serviço por meio de admissão determinística, execução intermediada, releitura externa, reconciliação e promoção revisada. Nenhuma das quatro vias de evidência relatada...

  • O candidato usou 37,11% menos tokens, 33,84% menos custo estimado de endpoint e 11,63% menos etapas; o artigo afirma que isso não estabelece melhoria de qualidade, latência ou comportamento em produção.

Para equipes que constroem agentes governados, a contribuição do Praxa é tornar as transições de autoridade para efeito explícitas e testáveis, mas a evidência atual sustenta apenas verificabilidade arquitetural, não implantação em produção...

arXiv cs.AI
03
watchmodelsnew architecture

Novo modelo no OpenRouter: inclusionAI Ling 3.1 Flash

Ling 3.1 Flash é um modelo mixture-of-experts de raciocínio híbrido da inclusionAI, com 25B de parâmetros ativos de 560B no total e janela de contexto de 262.144 tokens.

  • 560B de parâmetros totais com 25B de parâmetros ativos.
  • Janela de contexto de 262.144 tokens, com suporte a até 32.768 tokens de conclusão.
  • Aceita tools e tool_choice para chamadas de função, mas não suporta response_format, portanto a saída JSON não é imposta.
  • Listado como gratuito no OpenRouter, com data de lançamento em 2 de outubro de 2026.

Para desenvolvedores, é uma opção MoE gratuita de contexto longo com chamadas de ferramentas, mas a ausência de saída estruturada imposta significa que a confiabilidade do JSON deve ser tratada na camada de aplicação.

OpenRouter Models
04
watchcreativenew architecture

DSSR-3D: raciocínio desacoplado para referência dependente de visão em gaussianas 3D

DSSR-3D é um framework de inferência para segmentação de referência dependente de visão em campos gaussianos 3D contínuos, formalizado como duas interfaces, localização semântica invariante à pose e raciocínio espacial condicionado pela pose, sem retreinar o campo semântico subjacente.

  • A instanciação usa um mecanismo de localização softmax com temperatura acentuada e uma função de pontuação direcional baseada em projeção, fundidos por uma etapa leve e sem treinamento.
  • Os autores propõem o ViewRef-GS, um benchmark que isola a segmentação dependente de visão em campos gaussianos 3D, avaliado em conjunto com um Ref-LERF aumentado.
  • O artigo relata ganhos consistentes sobre métodos de referência baseados em 3DGS existentes, sem treinamento adicional além do campo semântico base.

Para os construtores de IA, isso indica que a referência espacial dependente de visão pode ser desacoplada na inferência e transferida sem adaptação para campos semânticos estruturalmente distintos.

arXiv cs.CV
05
watchresearchcost collapse

FlashDiffusion: decomposição espectral de kernels em blocos fundidos

O artigo apresenta o FlashDiffusion, um método sem matriz que avalia blocos densos de kernels gaussianos em blocos fundidos de GPU e acopla o solucionador de autovalores a um β-flow empírico que seleciona a escala de resolução de amostra finita.

  • O artigo relata que materializar kernels gaussianos densos exige O(N^2) de memória.
  • O método avalia blocos densos de kernels gaussianos em blocos fundidos de GPU, evitando materializar o kernel denso.
  • O solucionador de autovalores é acoplado a um β-flow empírico que seleciona a escala de resolução de amostra finita.
  • Uma continuação sobre tamanho de amostra e largura de banda inicializa a quente resoluções espectrais cada vez mais caras a partir de resoluções mais grossas.

Para desenvolvedores de IA que usam métodos de kernel em aprendizado geométrico, essa abordagem em blocos sem matriz elimina o gargalo de memória O(N^2) do kernel denso, tornando viáveis resoluções espectrais maiores.

arXiv cs.LG
06
watchresearchincremental

ChainLoRA: fusão de vetores de tarefa que preserva a geometria para aprendizado contínuo em LLMs

ChainLoRA é um framework de fusão contínua sem replay, construído sobre a geometria de vetores de tarefa atualizada em cadeia, combinando treinamento com atualização em cadeia e fusão SVD adaptativa pós-fluxo. O artigo relata desempenho de ponta entre os métodos sem replay avaliados nos benchmarks Large e SuperNI.

  • ChainLoRA combina treinamento com atualização em cadeia e fusão SVD adaptativa pós-fluxo, em que a inicialização e um proxy de ortogonalidade unilateral usam apenas o último portador durante o treinamento.
  • No momento da fusão, a SVD adaptativa extrai um portador compartilhado e o alinha à tarefa mais recente por meio de adaptação de Procrustes.

Para quem constrói pipelines de aprendizado contínuo, o treinamento com atualização em cadeia e a fusão SVD adaptativa do ChainLoRA oferecem um caminho de ajuste fino eficiente em parâmetros e sem replay, cujo uso de estado histórico e sobr...

arXiv stat.ML
07
testmodelsopen source unlock

NVIDIA Kumo Tabular estabelece nova fronteira de precisão e eficiência para previsão tabular

A NVIDIA lança o Kumo Tabular, um modelo de fundação aberto para classificação e regressão tabulares que prevê novas linhas em uma única passagem direta, sem treinamento, ajuste ou engenharia de atributos, em três tamanhos de 28M a 215M parâmetros sob a licença OpenMDW-1.1.

  • O Kumo Tabular está disponível nos tamanhos Small/Medium/Large, de 28M a 215M parâmetros, e é lançado sob a licença OpenMDW-1.1 para uso comercial.
  • Ocupa o primeiro lugar no ranking do TabArena com ELO de 1950 e é relatado como 17 vezes mais rápido que o LimiX-2 em uma configuração de avaliação uniforme com uma única RTX 6000 Pro.
  • No BeyondArena, alcança ELO de 1418 com pontuação de Improvability de 7,78%, ficando em primeiro lugar no ranking.
  • No TALENT, obtém a melhor classificação geral em acurácia de classificação, log-loss de classificação e RMSE de regressão, com rankings médios de 6,67, 3,98 e 4,22.

Para os desenvolvedores de IA, o Kumo Tabular oferece um caminho de previsão tabular sem treinamento por tarefa, e seus números relatados de precisão e eficiência devem ser validados em dados reservados antes da implantação.

Hugging Face Blog