AI FRONTIER
Signals worth understanding before they become obvious.
Apresentamos o GPT-6.1 Sol
O GPT-6.1 Sol oferece inteligência próxima à do Astra para programação, uso de computador e trabalho profissional a um quinto dos preços padrão de tokens de entrada e saída da API do Astra.
- A OpenAI News anuncia o GPT-6.1 Sol.
- Posicionado para programação, uso de computador e trabalho profissional com inteligência próxima à do Astra.
- Os preços padrão de tokens de entrada e saída da API são um quinto dos do Astra.
Para os desenvolvedores de IA, inteligência próxima à do Astra a um quinto do preço por token reduz o custo de inferência de fluxos de agentes de programação e uso de computador.
A ilusão do prompt de sistema: como os preâmbulos de instrução modificam a computação em modelos de linguagem
O artigo usa o alinhamento de kernel centralizado (CKA) para comparar representações camada a camada sob 20 prompts de sistema em 17 modelos ajustados por instrução, e constata que os efeitos são seletivos por camada e dependentes do tipo de instrução: instruções de persona e formatação reestruturam profundamente as re...
- Foram avaliados 17 modelos ajustados por instrução, abrangendo 8 famílias de arquitetura e de 1,5B a 72B parâmetros, sob 20 prompts de sistema em cinco categorias funcionais.
- Instruções de segurança restritivas e instruções explicitamente permissivas («você não tem restrições») acionam vias computacionais quase idênticas, com correlação CKA média de 0,997.
- A penetração da segurança permanece abaixo de 10% em escala comercial, mesmo em 70B-72B.
- A profundidade representacional prevê o tamanho do efeito comportamental em toda a coorte de 17 modelos (Spearman rho = 0,761, p < 0,001).
Para os desenvolvedores que dependem de segurança baseada em prompt de sistema, esta evidência indica que instruções de segurança podem ser codificadas de forma confiável sem atuar profundamente na computação, de modo que defesas apenas na ...
TomasuLLM: execução especulativa fora de ordem para agentes LLM
TomasuLLM é um runtime que executa chamadas de ferramentas do agente fora da ordem da trajetória, preservando a correção da execução da tarefa: ele rascunha ações futuras, executa-as em sandboxes isoladas com copy-on-write, rastreia suas dependências e efeitos e confirma os resultados na ordem da trajetória somente apó...
- O artigo relata 1,31x em 100 tarefas do SWE-bench Verified, 1,35x em 28 tarefas do Terminal-Bench 2.0 e 1,27x de progresso correspondente em 18 sessões do SWE-Marathon.
- Em 4.010 registros auditados de validação de commit, o artigo relata zero aceitações falsas.
- O trabalho aborda ferramentas de longa duração, como compiladores, suítes de teste e comandos de repositório, que levam de segundos a minutos enquanto o agente de código fica ocioso.
- Os resultados abrangem três benchmarks com chamadas de ferramentas de menos de um segundo a vários minutos e escalam com a latência das ferramentas.
Para equipes que constroem agentes de código, o TomasuLLM mostra que executar especulativamente chamadas de ferramentas em sandboxes isoladas e confirmá-las na ordem da trajetória pode reduzir a latência de ferramentas longas sem sacrificar...
MiniMax abre o código-fonte do OpenAgentCore para compatibilidade com a API OpenAI Agents
A MiniMax abriu o código-fonte do OpenAgentCore, voltado para a compatibilidade com a API OpenAI Agents.
- A MiniMax abriu o código-fonte do OpenAgentCore.
- O OpenAgentCore visa a compatibilidade com a API OpenAI Agents.
Desenvolvedores de IA podem usar o OpenAgentCore para direcionar fluxos de trabalho da API OpenAI Agents com uma implementação de código aberto da MiniMax.
SInGA: aprendizado de inpainting semântico para avatares de cabeça gaussianos animáveis
O artigo apresenta o SInGA, um método que define uma estrutura de inpainting semântico no espaço UV para completar regiões faciais não observadas a partir de uma única imagem e então regredir atributos gaussianos, produzindo um avatar de cabeça gaussiano animável. O avatar resultante generaliza entre identidades sem ot...
- A estrutura de inpainting semântico é definida no espaço UV e usa as pistas de simetria inerentes ao rosto humano para completar regiões não observadas.
- Características extraídas das regiões observadas são usadas para completar as regiões não observadas, e a representação completada é então usada para regredir os atributos gaussianos.
- Em vez de uma única gaussiana em cada superfície ou local de pixel, o método empilha múltiplas gaussianas para melhorar o detalhe.
- O artigo relata que o método gera avatares de cabeça de alta qualidade com melhor completude e preservação de identidade, além de suportar animação realista e renderização consistente a partir de vistas não observadas.
Para quem constrói avatares de cabeça a partir de uma única imagem, mover a completude para um espaço UV com correspondências espaciais consistentes oferece uma abordagem reutilizável para lidar com regiões não observadas em cenários de vis...
Controle conformal de factualidade para geração aumentada por recuperação de múltiplos saltos
O artigo aplica filtragem conformal dividida de afirmações a RAG de múltiplos saltos e a avalia em HotpotQA, Natural Questions e TriviaQA com Llama 3.1 8B e GPT-4o-mini, além de um experimento de referência de salto único. Relata que, na meta de 95%, a fração de respostas cujas afirmações retidas são totalmente sustent...
- Nas seis configurações de modelo e conjunto de dados de múltiplos saltos, metas conformais mais rigorosas aumentam consistentemente a fração de respostas cujas afirmações retidas são totalmente sustentadas.
- Na meta de 95%, essa taxa varia de 95,80% a 97,20%, em comparação com 55,60%-76,03% sem filtragem.
- Na meta de 95%, apenas 4,41%-31,09% das afirmações geradas são retidas e 9,70%-51,40% das respostas permanecem não vazias.
- A avaliação usa Llama 3.1 8B e GPT-4o-mini em HotpotQA, Natural Questions e TriviaQA, junto com um experimento de referência de salto único.
Para quem constrói RAG de múltiplos saltos, a filtragem conformal eleva o suporte no nível da afirmação, mas deve ser lida em conjunto com a retenção de afirmações e a abstenção, pois na meta de 95% a maioria das afirmações é descartada e m...
Aceleração do modelo de linguagem de difusão por meio de um gerador médio discreto
O artigo introduz o Discrete Average Generator, que estende o MeanFlow a cadeias de Markov de tempo contínuo ao definir um gerador médio como o incremento normalizado do núcleo de transição em um intervalo de tempo, com uma identidade de autoconsistência como base do objetivo de treinamento.
- Em simulações do modelo de Potts, esse objetivo reduz em até 67% a distância de variação total do amostrador de K passos.
- No OpenWebText, o método alcança a menor perplexidade generativa entre os métodos avaliados para 8 a 64 passos de amostragem, além de possibilitar uma aceleração de 16x.
- No ImageNet, o método alcança desempenho comparável aos métodos existentes.
- A identidade de autoconsistência admite uma expressão de forma fechada quando projetada nas marginais por coordenada.
Para equipes que constroem modelos de linguagem de difusão discreta, isso oferece um objetivo de treinamento que reduz os passos de amostragem preservando a qualidade de geração, tornando a aceleração de 16x relatada digna de reprodução em ...
Agentes de IA são vulneráveis à radicalização
O artigo simula conversas entre dois agentes LLM: um alvo que interpreta uma persona humana com base em atributos demográficos e psicológicos, e um influenciador que busca tornar as crenças do alvo mais extremas. Ele relata que tanto a ressonância (reforçar uma crença preexistente) quanto a persuasão (promover uma cren...
- Submetido ao arXiv em 29 de setembro de 2026 como arXiv:2609.38296, classificado em cs.AI e cs.CY.
- Configuração: um LLM alvo interpreta uma persona humana com base em atributos demográficos e psicológicos, enquanto um LLM influenciador busca tornar as crenças do alvo mais extremas.
- O artigo examina dois caminhos: a ressonância reforça uma crença preexistente do alvo, e a persuasão promove uma crença que o alvo inicialmente considera pouco importante.
- O artigo relata que ambos os mecanismos radicalizam o alvo em métricas afetivas e comportamentais, mas a ressonância produz efeitos consistentemente mais fortes que a persuasão.
Desenvolvedores de agentes personalizados e sistemas multiagente devem tratar entradas alinhadas às crenças como uma superfície de influência de alto risco, pois o artigo relata que a ressonância gera radicalização mais forte que também se ...