Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-05
01
watchresearchnew architecture

Diffusion Controller do Google Research unifica e simplifica o controle da geração de imagens por IA

O Google Research apresenta o Diffusion Controller, uma rede leve do tipo «amortecedor de direção» que trata o processo de remoção de ruído da difusão como um problema de controle contínuo, melhorando o alinhamento ao prompt e a qualidade da imagem sem modificar o modelo base.

  • Nas trilhas SFT e RWL, a rede amortecedora Diffusion Controller em modo gray-box superou o LoRA nas taxas de vitória HPS-v2, manipulando ainda muito menos camadas internas do modelo.
  • O artigo relata que sua versão totalmente desbloqueada (white-box, com acesso irrestrito para alterar pesos internos) alcançou 90% de taxa de vitória sobre o modelo base.
  • A rede se acopla a modelos fechados de acesso restrito e permite ajustar um único parâmetro de intensidade de orientação na inferência para aumentar ou reduzir as restrições de controle.

Para quem constrói, isso significa que um modelo de imagem fechado pode ser direcionado a novas preferências com um complemento leve de intensidade ajustável, sem acesso white-box aos pesos.

Google Research
02
testmodelsopen source unlock

Cloudflare/clef-flash: um modelo de decisão multimodal de 9B que retorna probabilidades estruturadas em uma única passagem direta

A Cloudflare lançou o clef-flash, um modelo multimodal de 9B pós-treinado a partir do Qwen/Qwen3.5-9B que transforma um estado e um esquema de perguntas tipadas em decisões, retornando uma probabilidade para cada opção permitida de cada pergunta em uma única passagem direta, sem geração de texto livre.

  • Pós-treinado a partir do Qwen/Qwen3.5-9B com seu codificador de visão, armazenado como safetensors fragmentados padrão.
  • Lê o estado como texto, JSON, imagens ou vídeo e retorna um logit por opção permitida de cada pergunta, com um softmax por pergunta para obter as probabilidades.
  • Lançado sob a licença Apache-2.0, seguindo o modelo base Qwen/Qwen3.5-9B.
  • Testado com torch 2.11 e transformers 5.10.2 em uma única H200; entradas de imagem e vídeo também precisam do pillow.

Para desenvolvedores de IA que precisam de decisões estruturadas em vez de geração livre, o clef-flash oferece uma saída de probabilidade de 9B em uma única passagem direta que se conecta diretamente à API Jev/SystemOne.

Hugging Face Trending
03
testcreativeincremental

Qwen abre o Qwen-Image-2.1: modelo unificado de 7B para texto-imagem e edição

A Qwen tornou open source o Qwen-Image-2.1, um modelo unificado de geração texto-imagem e edição de imagens cujo componente de geração visual tem 7B de parâmetros em 32 camadas Single-Stream DiT.

  • O componente de geração visual tem 7B de parâmetros em 32 camadas Single-Stream DiT.
  • Suporta até 10 imagens de referência e edições locais especificadas por círculos, anotações pintadas ou máscaras separadas.
  • As proporções suportadas incluem 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 e 9:16, com exemplos de até 2752×1536.
  • Está sob a licença Qwen Research License Agreement e registrou 90.003 downloads no mês passado.

Como um único modelo cobre texto-imagem, geração de camadas transparentes e edição com múltiplas referências, as equipes podem reduzir o número de modelos em um pipeline criativo.

Hugging Face Trending