Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-06
01
watchresearchnew architecture

SCION: composição de cenas com primitivas neurais instanciadas

SCION introduz uma representação de cena composicional hierárquica que substitui gaussianas 3D independentes por um vocabulário compacto de primitivas reutilizáveis e instâncias leves no espaço do mundo, ajustada a capturas multivisão por otimização conjunta de parâmetros de cena discretos e contínuos. O artigo relata ...

  • O artigo foi aceito na NeurIPS 2026 e submetido em 1 de outubro de 2026.
  • O SCION substitui milhões de gaussianas independentes por cena por um vocabulário de primitivas reutilizáveis e instâncias no espaço do mundo.
  • O artigo relata manter alta qualidade mesmo em 1,2 MB.
  • O artigo relata taxa-distorção favorável aos métodos existentes de compressão de gaussianas e permite edição e animação no nível de instância sem retreinamento.

Para quem constrói pipelines de cenas 3D, o SCION mostra que modelar cenas como primitivas reutilizáveis mais instâncias pode oferecer controles editáveis e animáveis no nível de instância em uma representação compacta de cerca de 1,2 MB.

arXiv cs.CV
02
watchresearchbenchmark jump

DeskForge: supervisão densa de ambientes de desktop para agentes de uso de computador

DeskForge é um ambiente de desktop controlável que compõe e explora aplicações reais para gerar supervisão em larga escala, produzindo o DeskForge-1M, um corpus de 1,2 milhão de observações de desktop anotadas contendo 159,7 milhões de instâncias de elementos. O artigo relata o ajuste fino de quatro modelos de visão-li...

  • O DeskForge-1M contém 1,2 milhão de observações de desktop anotadas com 159,7 milhões de instâncias de elementos.
  • O artigo ajusta quatro modelos de visão-linguagem em 200 mil exemplos de grounding extraídos do DeskForge-1M.
  • O artigo relata para o Qwen3.5-4B aumento de precisão de 11,51 pontos percentuais no ScreenSpot-Pro e de 10,11 pontos no OSWorld-G.
  • O artigo relata que, sob um planejador fixo, o Qwen3.5-4B passa de 31 para 50 de 119 tarefas no WebArena-Infinity e de 3 para 15 de 100 tarefas no OpenApps.

Para equipes que constroem agentes de uso de computador, o DeskForge indica que a composição controlável de ambientes de desktop reais pode escalar anotações densas de elementos e melhorar tanto o grounding de GUI quanto a conclusão de tare...

arXiv cs.CV
03
testresearchincremental

Rank-Aware Speculative Sampling: uma regra de verificação para árvores de rascunhos de difusão

O artigo apresenta o Rank-Aware Speculative Sampling (RASS), uma regra de verificação para árvores de rascunhos especulativos baseada em acoplamento de listas sensível à ordem, que ordena os candidatos ao longo do deslocamento médio proposta-alvo, amostra uma ordem com pesos otimizados para minimizar a variação total e...

  • O RASS melhora o D-GRS, que gera K candidatos condicionalmente independentes por nó e os testa sequencialmente na ordem de geração.
  • O RASS é avaliado em um alvo de mistura gaussiana, geração incondicional no espaço de pixels no FFHQ, geração condicional no CIFAR-10 e difusão latente com Stable Diffusion 3.5 usando prompts do COCO2014.
  • A correção residual garante amostragem exata para qualquer escolha de pesos de ordem.

Para quem acelera a inferência de difusão, o RASS mostra que explorar a ordenação dos candidatos de rascunho sem avaliações adicionais do modelo alvo pode reduzir a contagem de avaliações do modelo alvo em orçamentos de computação equivalen...

arXiv cs.LG
04
testcreativeincremental

Lightricks lança LTX-2.5, modelo de pesos abertos de vídeo e áudio

O Lightricks/LTX-2.5 é um modelo de pesos abertos que gera vídeo e áudio sincronizados a partir de entradas de texto, imagem e vídeo, e pode ser auto-hospedado. Ele adiciona geração multi-plano nativa, decodificador de vídeo por difusão, codificador de texto Gemma 4 12B próprio e um preditor de duração opcional.

  • O cartão do modelo indica 6,48 mil curtidas e 1.645.444 downloads no último mês.
  • Os checkpoints DiT são rotulados como 22b e vêm em variantes bf16, Comfy int8+convrot e NVFP4.
  • O codificador de texto é Gemma4 12B com projeções, e vídeo e áudio usam VAEs separados.
  • Entidades com receita anual abaixo de US$ 10 milhões têm uso comercial gratuito sob a licença comunitária LTX-2.x; acima disso, é necessário um acordo comercial pago.

Para os desenvolvedores, o LTX-2.5 oferece geração de áudio e vídeo auto-hospedável como um pacote de pesos dividido e alinhado ao Comfy, com transformer dev treinável, mas os checkpoints int8 são exclusivos do ComfyUI.

Hugging Face Trending
05
watchresearchincremental

ReRoute permite previsões contrafactuais em emuladores científicos sem experimentos controlados

O artigo apresenta o ReRoute, uma estrutura para previsão científica direcionada do tipo what-if que combina dados factuais com conhecimento mecanístico parcial e não exige dados de intervenção controlada para adaptação. O ReRoute fixa a entrada consultada de um backbone pré-treinado a um valor de referência, reintrodu...

  • Em intervenções climáticas acopladas reservadas, o ReRoute reduz o erro climático agregado em 18,2-31,8% sob fortes mudanças de distribuição de CO2, preservando o desempenho em condições padrão.
  • O artigo relata que o ReRoute alcança previsões contrafactuais altamente precisas em um sistema controlado de advecção-difusão, no qual respostas exatas estão disponíveis.
  • O artigo fornece um resultado de identificação causal para essa construção sob suposições estruturais explícitas, com o argumento central verificado por máquina em Lean.

Para equipes que constroem emuladores científicos, o ReRoute mostra que dados factuais mais conhecimento mecanístico parcial podem melhorar a previsão contrafactual sob mudança de distribuição sem gerar dados caros de simulação controlada.

arXiv cs.LG
06
watchagentsnew architecture

DeReAct: raciocínio e ação decompostos para agentes de IA confiáveis

DeReAct é uma arquitetura de agente modular que externaliza duas políticas de controle: um Critic que valida as ações propostas antes da execução e um Context Manager que reconstrói um State respaldado pelo ambiente e certifica a conclusão da tarefa. O artigo relata que, no GAIA e no SWE-bench Verified, o DeReAct melho...

  • O artigo relata ganhos de Pass@1 de 6,5 a 7,0 pontos para o Qwen3-Coder-480B.
  • O artigo relata ganhos de Pass@1 de 4,2 a 5,2 pontos para o Claude Sonnet 4.5.
  • Com o Claude Opus 4.5, o Pass@1 permanece comparável ao ReAct, enquanto o DeReAct produz trajetórias mais completas em evidências e que satisfazem mais restrições.
  • O artigo afirma que o controle externo é eficaz quando as falhas alvo são suficientemente frequentes e a própria política de controle é suficiente.

Para quem constrói agentes, separar a validação de ações e a certificação de conclusão de uma única política pode aumentar a confiabilidade de modelos mais fracos sem trocar o modelo Brain subjacente.

arXiv cs.AI
07
testmodelsopen source unlock

Cloudflare lança Clef: um modelo de decisão multimodal de 27B que retorna probabilidades estruturadas em uma única passagem direta

A Cloudflare lançou o Clef, um modelo multimodal pós-treinado a partir do Qwen/Qwen3.8-27B que transforma um estado e um esquema de perguntas tipadas em decisões, retornando uma probabilidade para cada opção permitida de cada pergunta, sem geração de texto livre nem análise de saída.

  • 27B parâmetros, BF16, armazenado como safetensors fragmentados padrão, lançado sob a licença Apache-2.0.
  • Aceita texto, JSON, imagens ou vídeo como estado e produz um logit por opção permitida por pergunta, com um softmax por pergunta que fornece as probabilidades.
  • Testado com torch 2.11 e transformers 5.10.2 em uma única H200; entradas de imagem e vídeo também precisam de pillow.
  • Na execução interna do Decision Index 0.2.1, a exatidão exata de casos do BFCL é 98,5, o macro-F1 do BANKING77 é 94,2, a latência mediana é 209,3 ms e a latência p95 é 238,6 ms.

Para desenvolvedores de IA que precisam de decisões estruturadas em vez de texto livre, o Clef oferece uma opção multimodal de 27B com API compatível com Jev/SystemOne, embora sua latência seja maior que a de variantes menores como o Clef-f...

Hugging Face Trending
08
watchresearchbenchmark jump

EditHero: um benchmark para edição 3D de longo horizonte em nível de partes e Vibe Modeling

O artigo apresenta o EditHero, descrito pelos autores como o primeiro benchmark para edição 3D de longo horizonte em nível de partes, com instruções em linguagem natural e imagens-alvo tanto para geometria quanto para textura. Um motor de montagem determinístico produz o alvo exato após cada edição, e cada sequência é ...

  • O artigo descreve o EditHero como, segundo os autores, o primeiro benchmark para edição 3D de longo horizonte em nível de partes, com instruções em linguagem natural e imagens-alvo para geometria e textura.
  • Um motor de montagem determinístico produz o alvo exato após cada edição, e cada sequência é revisada manualmente.
  • Métodos não agênticos operam de cima para baixo, regenerando o objeto a partir de uma representação 3D aprendida, e frequentemente perdem a mudança solicitada e perturbam regiões que deveriam permanecer fixas.

O benchmark desloca a avaliação da edição única para se revisões em várias etapas alteram apenas o que foi solicitado, oferecendo a quem constrói pipelines de edição 3D iterativa um alvo de comparação reproduzível.

arXiv cs.CV