Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-07
01
testmodelsopen source unlock

EmbeddingGemma 2: um modelo de embedding multimodal aberto e leve

O Google DeepMind lançou o EmbeddingGemma 2, um modelo de 740 milhões de parâmetros baseado na arquitetura Gemma 4 sob licença Apache 2.0, que mapeia nativamente texto, imagens, áudio e vídeo em um espaço de embedding unificado.

  • 740 milhões de parâmetros, baseado na arquitetura Gemma 4 e lançado sob a licença Apache 2.0 comercialmente permissiva.
  • Requer apenas 270M de parâmetros para cargas de trabalho somente de texto, com codificadores opcionais de visão (170M) e áudio (300M).
  • Relata uma melhoria de 9,92 pontos no desempenho de código no MTEB Code, de 68,76 para 78,68.
  • O Matryoshka Representation Learning permite truncar dinamicamente os vetores de saída de 768 dimensões para 512, 256 ou 128, oferecendo até 6x de redução de armazenamento.

Desenvolvedores podem executar busca cross-modal e pipelines de RAG totalmente no dispositivo, equilibrando memória e armazenamento por meio de codificadores modulares e truncamento MRL.

Google DeepMind
02
watchresearchnew architecture

Rumo à recuperação de espaços de interação para busca agêntica: RISE

O artigo propõe o RISE (Retrieving Interaction SpacE), que usa BM25 para construir um espaço de interação limitado e processa seus documentos durante a indexação para navegação no estilo shell, substituindo a interação direta irrestrita com o corpus.

  • No BrowseComp-Plus, o RISE atinge 78% de precisão com gpt-5.4-mini, igualando a linha de base DCI de shell puro com cerca de um quarto do custo por consulta.
  • Com 1 milhão de documentos, o RISE-BM25 alcança 81% com gpt-5.4-mini.
  • Na mesma escala, o DCI com gpt-5.4-nano cai para 60%, com 33 de 100 falhas de tempo real.
  • O artigo argumenta que a interação irrestrita não escala: cada comando shell amplo é uma varredura de todo o corpus e a latência se degrada acentuadamente conforme o corpus cresce.

Para equipes que constroem agentes de busca, a recuperação passa de selecionar documentos para definir uma fronteira explorável, o que determina diretamente custo e confiabilidade em corpora grandes.

arXiv watchlist
03
testdeveloperopen source unlock

AutoSynthData: gerar dados de treinamento para agentes empresariais

A ServiceNow CoreAI publicou o AutoSynthData, que usa falhas de um modelo alvo e sucessos de um professor mais forte para identificar lacunas de capacidade, e então gera e valida novas tarefas executáveis para o pós-treinamento.

  • No domínio Hybrid do EnterpriseOps Gym, com Gemma-4-26B-A4B-it como modelo alvo e Qwen3.8-27B como professor, o AutoSynthData gerou 2.000 amostras de treinamento sintéticas em cerca de 18 horas.
  • O melhor checkpoint do Hybrid foi a epoch 5, melhorando o Pass@1 médio em 7,2 pontos percentuais, uma melhoria relativa de 35%, e elevando o sucesso do verificador de 63,01% para 68,55%.
  • O relatório afirma que fecha 59% da lacuna original de Pass@1 entre o Gemma e o modelo de referência.
  • No domínio ITSM, também com Gemma-4-26B-A4B-it como modelo alvo e DeepSeek-V4.1-Flash como professor, o AutoSynthData gerou 1.994 amostras de treinamento sintéticas em 66 horas.

Para equipes que constroem agentes empresariais, este pipeline transforma falhas específicas do ambiente em tarefas de treinamento verificadas e oferece um ciclo reutilizável de calibração de dificuldade, em vez de apenas mais dados sintéti...

Hugging Face Blog
04
watchresearchbenchmark jump

Open TTS Leaderboard: avaliação escalável para texto em fala multilíngue e clonagem de voz

A Hugging Face lançou o Open TTS Leaderboard, que avalia modelos de código aberto de TTS multilíngue e clonagem de voz com métricas objetivas: WER/CER via Qwen3 ASR, RTFx e TTFA em uma GPU H200, e similaridade de cosseno (SIM) entre embeddings de locutor WavLM.

  • Em 30 de setembro de 2026, há mais de 8K modelos TTS disponíveis no Hugging Face Hub.
  • Em 30 de setembro de 2026, apenas 16 dos 92 modelos do Artificial Analysis são de pesos abertos.
  • Usar métricas objetivas reduz a avaliação de um modelo de algumas semanas de coleta de votos para algumas horas.
  • A visão padrão classifica os modelos por WER médio macro nos splits em inglês do Seed TTS Eval e do CV3 Eval (zero shot), com hexgrad/Kokoro-82M, Supertone/supertonic-3 e fishaudio/s2-pro na liderança.

Para equipes que criam agentes de voz, o leaderboard oferece comparações reproduzíveis de modelos abertos em WER, RTFx, TTFA e SIM para decidir entre latência, tamanho e qualidade multilíngue, mas não mede naturalidade nem preferência dos o...

Hugging Face Blog
05
testmodelsopen source unlock

autotrust/JEV-27B-VL: um modelo de decisão multimodal de 27,8B que enxerga

autotrust/JEV-27B-VL adiciona visão ao autotrust/JEV-27B e retorna decisões System 1 tipadas com probabilidades calibradas sobre texto e imagens, mantendo o Qwen3.8-27B sem modificações como System 2.

  • 27,8B parâmetros, pipeline image-text-to-text, licença apache-2.0.
  • O System 1 suporta sim/não, escolher uma entre 2–256 opções e avaliar de 0 a 5, com prompts de até 256K tokens.
  • O pick and place com braço robótico concluiu 75% de 20 cenas aleatórias, os 15 cubos agarrados terminaram na bandeja, a cerca de 240 ms por decisão.
  • O uso de computador concluiu 95% de 60 tarefas multietapas aleatórias a cerca de 0,26 s por clique, caindo para 10% com apenas caixas numeradas.

Para quem precisa de decisões visuais de baixa latência dentro de um loop de controle, o JEV-27B-VL retorna probabilidades calibradas em uma única passada, mas tarefas de uso de computador exigem o texto dos elementos.

Hugging Face Trending