AI FRONTIER
Signals worth understanding before they become obvious.
Google publica RRSI, que permite ao «harness» de um agente autoaperfeiçoar-se sem retreinar o modelo
Pesquisadores do Google Cloud AI Research, com a Universidade Stanford e a Universidade de Washington, publicaram o framework RRSI, que revisa repetidamente o harness em torno de um modelo, incluindo prompts, uso de ferramentas, fluxo de controle, gestão de memória e contexto, módulos de habilidades e subagentes, sem a...
- Em oito benchmarks, o Terminal-Bench 2.1 subiu de 74,2% para 80,2%, um ganho de 6,0 pontos percentuais, e o SWE-Bench Verified de 82,0% para 83,8%, um ganho de 1,8 ponto percentual.
- O JobBench subiu de 36,0% para 40,7%, um ganho de 4,7 pontos percentuais; o GDPval de 48,8% para 52,3%, um ganho de 3,5 pontos percentuais; o Frontier-Eng de 17,7% para 22,0%, um ganho de 4,3 pontos percentuais.
- O RRSI foi publicado como framework de pesquisa no GitHub, com código disponível sob a licença Apache 2.0.
Para equipes que constroem agentes, o RRSI mostra que uma busca iterativa controlada sobre o harness, com os pesos do modelo fixos, pode trazer ganhos mensuráveis em benchmarks e reduzir o custo em tokens.
OpenAI apresenta o GPT-6.1 Sol
A OpenAI apresenta o GPT-6.1 Sol para programação, uso do computador e trabalho profissional, com inteligência próxima da Astra a um quinto dos preços padrão de tokens de entrada e saída da API da Astra.
- A OpenAI informa que o GPT-6.1 Sol oferece inteligência próxima da Astra.
- Os usos previstos são programação, uso do computador e trabalho profissional.
- Os preços padrão de tokens de entrada e saída da API são um quinto dos da Astra.
Para os desenvolvedores de IA, inteligência próxima da Astra a um quinto do preço por token reduz o custo de inferência em cargas de programação e uso do computador.
prism-ml lança Ternary-Bonsai-2-27B-gguf: modelo 27B de pesos ternários executável a partir de 5,95 GB
A prism-ml publicou o Ternary-Bonsai-2-27B-gguf no Hugging Face, quantizando os embeddings, projeções de atenção, projeções MLP e o LM head do Qwen3.8-27B para pesos ternários (g128, {−1,0,+1} com escala por grupo em FP16), com dois empacotamentos GGUF, PTQ1_0 e PQ2_0, para llama.cpp em CUDA, Metal e CPU.
- O tamanho do modelo de linguagem é 5,95 GB (PTQ1_0) ou 7,21 GB (PQ2_0), cerca de 9,0x e 7,5x menor que a referência FP16 de aproximadamente 54 GB; o formato ternário ideal é 1,72 bits/peso com 5,8 GB.
- O artigo relata média de 84,78 em 14 benchmarks no modo thinking, 98,2% da referência FP16 (86,32), contra 72,59 do IQ2_XXS (7,27 GB) e 85,18 do UD-Q4_K_XL (17,6 GB).
- O artigo relata 95,83 no AIME26 e 90,07 no LiveCodeBench, onde o IQ2_XXS obtém 57,5 e 56,4; matemática 96,57, código 89,42, chamada de ferramentas BFCL v3 74,92.
- O comprimento de contexto é de 262K tokens em um backbone de atenção híbrida com cerca de 75% de atenção linear; a torre de visão é um pacote mmproj Q8_0 separado (0,63 GB) carregado apenas para entrada de imagem.
Para equipes que implantam raciocínio de classe 27B em uma única GPU ou notebook, isso mostra que a quantização ternária de ponta a ponta pode manter pontuações de raciocínio e chamada de ferramentas próximas do FP16 com cerca de 6 GB, mas ...
Rumo à recuperação de espaços de interação para busca agêntica: RISE constrói um espaço limitado com BM25
O artigo propõe o RISE (Retrieving Interaction SpacE), que usa BM25 para construir um subconjunto limitado do corpus que o agente pode explorar e processa seus documentos durante a indexação para navegação no estilo shell. No BrowseComp-Plus, o RISE alcança 78% de precisão com gpt-5.4-mini, igualando a linha de base DC...
- O artigo relata que, no BrowseComp-Plus, o RISE alcança 78% de precisão com gpt-5.4-mini, igualando a linha de base DCI de shell puro com cerca de um quarto do custo por consulta.
- O artigo relata que, com 1 milhão de documentos, o RISE-BM25 alcança 81% com gpt-5.4-mini.
- O artigo relata que, na mesma escala de 1 milhão de documentos, o DCI com gpt-5.4-nano cai para 60%, com 33 de 100 falhas de tempo real.
- O artigo argumenta que a interação sem limites não escala: cada comando shell amplo é uma varredura de todo o corpus e a latência se degrada acentuadamente à medida que o corpus cresce.
Para equipes que constroem agentes de busca, o resultado indica que a recuperação deve limitar o espaço de interação em vez de apenas selecionar documentos que cabem na janela de contexto, o que controla custo e latência conforme o corpus c...
Diffusion Controller unifica e simplifica a geração de imagens por IA
O Google Research apresenta o Diffusion Controller, uma rede leve do tipo «amortecedor de direção» que ajusta dinamicamente a trajetória de desruído enquanto o modelo base permanece congelado, melhorando o alinhamento ao prompt e a qualidade da imagem.
- Avaliado sobre um backbone Stable Diffusion v1.4 em três regimes de ajuste fino: SFT, perda ponderada por recompensa (RWL) e PPO.
- Nas trilhas SFT e RWL, o Diffusion Controller de caixa cinza superou o LoRA em taxas de vitória HPS-v2 enquanto manipulava significativamente menos camadas internas do modelo.
- A versão de caixa branca totalmente desbloqueada alcançou uma taxa de vitória de 90% sobre o modelo base.
- Um único parâmetro de intensidade de orientação na inferência permite ajustar dinamicamente a intensidade das restrições de controle.
Para os desenvolvedores, isso oferece um caminho leve para geração de imagens controlável e personalização sem acessar os pesos de modelos fechados.
Google DeepMind apresenta o SynthID Bio para marcar proteínas geradas por IA
O Google DeepMind lançou o SynthID Bio, uma família de métodos de marca d'água para biologia sintética que insere uma assinatura detectável em sequências de aminoácidos e em estruturas 3D previstas pelo AlphaFold 3, preservando a função biológica em testes de laboratório.
- O trabalho relata que o SynthID Bio preserva a precisão de previsão do AlphaFold 3 e oferece detectabilidade quase perfeita, resistindo a ruído digital ou pequenas mudanças de coordenadas.
- O Google DeepMind afirma que publicará seu artigo de métodos, abrirá o código e os dados in vitro e liberará os pesos para a comunidade de pesquisa.
Para desenvolvedores de ferramentas de design biológico, incorporar marcas d'água diretamente nos pesos do modelo e na geração de sequências oferece uma camada de verificação automatizada para triagem de síntese de DNA e procedência em banc...