AI FRONTIER
Signals worth understanding before they become obvious.
SCION: composição de cenas com primitivas neurais instanciadas
SCION introduz uma representação de cena composicional hierárquica que substitui gaussianas 3D independentes por um vocabulário compacto de primitivas reutilizáveis e instâncias leves no espaço do mundo, ajustada a capturas multivisão por otimização conjunta de parâmetros de cena discretos e contínuos. O artigo relata ...
- O artigo foi aceito na NeurIPS 2026 e submetido em 1 de outubro de 2026.
- O SCION substitui milhões de gaussianas independentes por cena por um vocabulário de primitivas reutilizáveis e instâncias no espaço do mundo.
- O artigo relata manter alta qualidade mesmo em 1,2 MB.
- O artigo relata taxa-distorção favorável aos métodos existentes de compressão de gaussianas e permite edição e animação no nível de instância sem retreinamento.
Para quem constrói pipelines de cenas 3D, o SCION mostra que modelar cenas como primitivas reutilizáveis mais instâncias pode oferecer controles editáveis e animáveis no nível de instância em uma representação compacta de cerca de 1,2 MB.
DeskForge: supervisão densa de ambientes de desktop para agentes de uso de computador
DeskForge é um ambiente de desktop controlável que compõe e explora aplicações reais para gerar supervisão em larga escala, produzindo o DeskForge-1M, um corpus de 1,2 milhão de observações de desktop anotadas contendo 159,7 milhões de instâncias de elementos. O artigo relata o ajuste fino de quatro modelos de visão-li...
- O DeskForge-1M contém 1,2 milhão de observações de desktop anotadas com 159,7 milhões de instâncias de elementos.
- O artigo ajusta quatro modelos de visão-linguagem em 200 mil exemplos de grounding extraídos do DeskForge-1M.
- O artigo relata para o Qwen3.5-4B aumento de precisão de 11,51 pontos percentuais no ScreenSpot-Pro e de 10,11 pontos no OSWorld-G.
- O artigo relata que, sob um planejador fixo, o Qwen3.5-4B passa de 31 para 50 de 119 tarefas no WebArena-Infinity e de 3 para 15 de 100 tarefas no OpenApps.
Para equipes que constroem agentes de uso de computador, o DeskForge indica que a composição controlável de ambientes de desktop reais pode escalar anotações densas de elementos e melhorar tanto o grounding de GUI quanto a conclusão de tare...
Rank-Aware Speculative Sampling: uma regra de verificação para árvores de rascunhos de difusão
O artigo apresenta o Rank-Aware Speculative Sampling (RASS), uma regra de verificação para árvores de rascunhos especulativos baseada em acoplamento de listas sensível à ordem, que ordena os candidatos ao longo do deslocamento médio proposta-alvo, amostra uma ordem com pesos otimizados para minimizar a variação total e...
- O RASS melhora o D-GRS, que gera K candidatos condicionalmente independentes por nó e os testa sequencialmente na ordem de geração.
- O RASS é avaliado em um alvo de mistura gaussiana, geração incondicional no espaço de pixels no FFHQ, geração condicional no CIFAR-10 e difusão latente com Stable Diffusion 3.5 usando prompts do COCO2014.
- A correção residual garante amostragem exata para qualquer escolha de pesos de ordem.
Para quem acelera a inferência de difusão, o RASS mostra que explorar a ordenação dos candidatos de rascunho sem avaliações adicionais do modelo alvo pode reduzir a contagem de avaliações do modelo alvo em orçamentos de computação equivalen...
Lightricks lança LTX-2.5, modelo de pesos abertos de vídeo e áudio
O Lightricks/LTX-2.5 é um modelo de pesos abertos que gera vídeo e áudio sincronizados a partir de entradas de texto, imagem e vídeo, e pode ser auto-hospedado. Ele adiciona geração multi-plano nativa, decodificador de vídeo por difusão, codificador de texto Gemma 4 12B próprio e um preditor de duração opcional.
- O cartão do modelo indica 6,48 mil curtidas e 1.645.444 downloads no último mês.
- Os checkpoints DiT são rotulados como 22b e vêm em variantes bf16, Comfy int8+convrot e NVFP4.
- O codificador de texto é Gemma4 12B com projeções, e vídeo e áudio usam VAEs separados.
- Entidades com receita anual abaixo de US$ 10 milhões têm uso comercial gratuito sob a licença comunitária LTX-2.x; acima disso, é necessário um acordo comercial pago.
Para os desenvolvedores, o LTX-2.5 oferece geração de áudio e vídeo auto-hospedável como um pacote de pesos dividido e alinhado ao Comfy, com transformer dev treinável, mas os checkpoints int8 são exclusivos do ComfyUI.
ReRoute permite previsões contrafactuais em emuladores científicos sem experimentos controlados
O artigo apresenta o ReRoute, uma estrutura para previsão científica direcionada do tipo what-if que combina dados factuais com conhecimento mecanístico parcial e não exige dados de intervenção controlada para adaptação. O ReRoute fixa a entrada consultada de um backbone pré-treinado a um valor de referência, reintrodu...
- Em intervenções climáticas acopladas reservadas, o ReRoute reduz o erro climático agregado em 18,2-31,8% sob fortes mudanças de distribuição de CO2, preservando o desempenho em condições padrão.
- O artigo relata que o ReRoute alcança previsões contrafactuais altamente precisas em um sistema controlado de advecção-difusão, no qual respostas exatas estão disponíveis.
- O artigo fornece um resultado de identificação causal para essa construção sob suposições estruturais explícitas, com o argumento central verificado por máquina em Lean.
Para equipes que constroem emuladores científicos, o ReRoute mostra que dados factuais mais conhecimento mecanístico parcial podem melhorar a previsão contrafactual sob mudança de distribuição sem gerar dados caros de simulação controlada.
DeReAct: raciocínio e ação decompostos para agentes de IA confiáveis
DeReAct é uma arquitetura de agente modular que externaliza duas políticas de controle: um Critic que valida as ações propostas antes da execução e um Context Manager que reconstrói um State respaldado pelo ambiente e certifica a conclusão da tarefa. O artigo relata que, no GAIA e no SWE-bench Verified, o DeReAct melho...
- O artigo relata ganhos de Pass@1 de 6,5 a 7,0 pontos para o Qwen3-Coder-480B.
- O artigo relata ganhos de Pass@1 de 4,2 a 5,2 pontos para o Claude Sonnet 4.5.
- Com o Claude Opus 4.5, o Pass@1 permanece comparável ao ReAct, enquanto o DeReAct produz trajetórias mais completas em evidências e que satisfazem mais restrições.
- O artigo afirma que o controle externo é eficaz quando as falhas alvo são suficientemente frequentes e a própria política de controle é suficiente.
Para quem constrói agentes, separar a validação de ações e a certificação de conclusão de uma única política pode aumentar a confiabilidade de modelos mais fracos sem trocar o modelo Brain subjacente.
Cloudflare lança Clef: um modelo de decisão multimodal de 27B que retorna probabilidades estruturadas em uma única passagem direta
A Cloudflare lançou o Clef, um modelo multimodal pós-treinado a partir do Qwen/Qwen3.8-27B que transforma um estado e um esquema de perguntas tipadas em decisões, retornando uma probabilidade para cada opção permitida de cada pergunta, sem geração de texto livre nem análise de saída.
- 27B parâmetros, BF16, armazenado como safetensors fragmentados padrão, lançado sob a licença Apache-2.0.
- Aceita texto, JSON, imagens ou vídeo como estado e produz um logit por opção permitida por pergunta, com um softmax por pergunta que fornece as probabilidades.
- Testado com torch 2.11 e transformers 5.10.2 em uma única H200; entradas de imagem e vídeo também precisam de pillow.
- Na execução interna do Decision Index 0.2.1, a exatidão exata de casos do BFCL é 98,5, o macro-F1 do BANKING77 é 94,2, a latência mediana é 209,3 ms e a latência p95 é 238,6 ms.
Para desenvolvedores de IA que precisam de decisões estruturadas em vez de texto livre, o Clef oferece uma opção multimodal de 27B com API compatível com Jev/SystemOne, embora sua latência seja maior que a de variantes menores como o Clef-f...
EditHero: um benchmark para edição 3D de longo horizonte em nível de partes e Vibe Modeling
O artigo apresenta o EditHero, descrito pelos autores como o primeiro benchmark para edição 3D de longo horizonte em nível de partes, com instruções em linguagem natural e imagens-alvo tanto para geometria quanto para textura. Um motor de montagem determinístico produz o alvo exato após cada edição, e cada sequência é ...
- O artigo descreve o EditHero como, segundo os autores, o primeiro benchmark para edição 3D de longo horizonte em nível de partes, com instruções em linguagem natural e imagens-alvo para geometria e textura.
- Um motor de montagem determinístico produz o alvo exato após cada edição, e cada sequência é revisada manualmente.
- Métodos não agênticos operam de cima para baixo, regenerando o objeto a partir de uma representação 3D aprendida, e frequentemente perdem a mudança solicitada e perturbam regiões que deveriam permanecer fixas.
O benchmark desloca a avaliação da edição única para se revisões em várias etapas alteram apenas o que foi solicitado, oferecendo a quem constrói pipelines de edição 3D iterativa um alvo de comparação reproduzível.