Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-07
01
testmodelsopen source unlock

EmbeddingGemma 2: 공개된 경량 멀티모달 임베딩 모델

Google DeepMind가 Gemma 4 아키텍처 기반의 7억 4천만 파라미터 EmbeddingGemma 2를 Apache 2.0 라이선스로 공개했습니다. 텍스트, 이미지, 오디오, 비디오를 네이티브로 통합 임베딩 공간에 매핑합니다.

  • 7억 4천만 파라미터로 Gemma 4 아키텍처 기반이며 상업적으로 허용되는 Apache 2.0 라이선스로 공개.
  • 텍스트 전용 워크로드는 최소 2억 7천만 파라미터, 선택적 비전 인코더는 1억 7천만, 오디오 인코더는 3억 파라미터.
  • MTEB Code에서 코드 성능이 68.76에서 78.68로 9.92포인트 향상.
  • MRL을 통해 출력 벡터를 768차원에서 512, 256, 128차원으로 동적 절단 가능하며 최대 6배 저장 공간 절감.

개발자는 모듈형 인코더와 MRL 절단을 활용해 온디바이스에서 메모리와 저장 공간 제약 내에 크로스모달 검색 및 RAG 파이프라인을 구축할 수 있습니다.

Google DeepMind
02
watchresearchnew architecture

에이전트 검색을 위한 상호작용 공간 검색: RISE

논문은 RISE(Retrieving Interaction SpacE)를 제안한다. BM25로 경계가 있는 상호작용 공간을 구성하고, 색인 단계에서 문서를 셸 스타일 탐색용으로 처리하여 무제한 직접 코퍼스 상호작용을 대체한다.

  • BrowseComp-Plus에서 RISE는 gpt-5.4-mini로 78% 정확도를 달성해 순수 셸 DCI 기준선과 동등하면서 쿼리당 비용은 약 4분의 1이다.
  • 100만 문서 규모에서 RISE-BM25는 gpt-5.4-mini로 81%에 도달한다.
  • 같은 규모에서 DCI는 gpt-5.4-nano로 60%까지 저하되고 100회 중 33회의 실시간 실패가 발생한다.
  • 논문은 무제한 상호작용이 확장되지 않는다고 지적한다. 모든 광범위한 셸 명령은 전체 코퍼스 스캔이며 코퍼스가 커질수록 지연이 급격히 악화된다.

검색 에이전트를 만드는 팀에게 검색 계층의 역할은 '문서 선택'에서 '탐색 가능한 경계 설정'으로 이동하며, 이는 대규모 코퍼스에서 비용과 안정성을 좌우한다.

arXiv watchlist
03
testdeveloperopen source unlock

AutoSynthData: 엔터프라이즈 에이전트를 위한 훈련 데이터 생성

ServiceNow CoreAI는 대상 모델의 실패와 더 강한 교사 모델의 성공을 활용해 역량 격차를 파악하고, 검증된 새 실행 가능 과제를 생성해 후속 학습에 사용하는 AutoSynthData를 공개했다.

  • EnterpriseOps Gym의 Hybrid 영역에서 대상 모델 Gemma-4-26B-A4B-it와 교사 Qwen3.8-27B를 사용해 약 18시간 동안 합성 훈련 샘플 2,000개를 생성했다.
  • Hybrid의 최고 체크포인트는 epoch 5였으며, 평균 Pass@1이 7.2포인트(상대 35%) 향상되고 검증기 성공률이 63.01%에서 68.55%로 올랐다.
  • 보고에 따르면 Gemma와 참조 모델 사이의 원래 Pass@1 격차 중 59%를 줄였다.
  • ITSM 영역에서도 대상 모델 Gemma-4-26B-A4B-it와 교사 DeepSeek-V4.1-Flash를 사용해 66시간 동안 합성 훈련 샘플 1,994개를 생성했다.

엔터프라이즈 에이전트를 만드는 팀에게 이 파이프라인은 환경별 실패를 검증된 훈련 과제로 바꾸고 합성 데이터의 양이 아니라 난이도 보정에 집중하게 한다.

Hugging Face Blog
04
watchresearchbenchmark jump

Open TTS Leaderboard: 다국어 텍스트 음성 변환과 음성 복제를 위한 확장 가능한 평가

Hugging Face가 Open TTS Leaderboard를 공개해 오픈소스 다국어 TTS와 음성 복제 모델을 객관적 지표로 평가한다. Qwen3 ASR 기반 WER/CER, H200 GPU의 RTFx와 TTFA, WavLM 화자 임베딩 코사인 유사도(SIM)를 사용한다.

  • 2026년 9월 30일 기준 Hugging Face Hub에는 8K개 이상의 TTS 모델이 있다.
  • 2026년 9월 30일 기준 Artificial Analysis의 92개 모델 중 오픈 웨이트는 16개뿐이다.
  • 객관적 지표를 사용하면 모델 한 개 평가에 드는 시간이 투표 수집의 몇 주에서 몇 시간으로 줄어든다.
  • 기본 화면은 Seed TTS Eval 영어 분할과 CV3 Eval(zero shot)의 매크로 평균 WER로 순위를 매기며 hexgrad/Kokoro-82M, Supertone/supertonic-3, fishaudio/s2-pro가 앞선다.

음성 에이전트를 만드는 팀은 이 리더보드로 오픈 모델의 WER, RTFx, TTFA, SIM을 재현 가능하게 비교해 지연·크기·다국어 품질 간의 절충을 판단할 수 있지만, 자연스러움이나 청취 선호도는 측정하지 않는다.

Hugging Face Blog
05
testmodelsopen source unlock

autotrust/JEV-27B-VL: 시각 기능을 갖춘 27.8B 멀티모달 의사결정 모델

autotrust/JEV-27B-VL은 autotrust/JEV-27B에 시각을 추가한 모델로, 텍스트와 이미지에 대해 보정된 확률을 포함한 유형화된 System 1 결정을 출력하며 수정되지 않은 Qwen3.8-27B를 System 2로 유지한다.

  • 파라미터 수 27.8B, Pipeline은 image-text-to-text, 라이선스는 apache-2.0.
  • System 1은 yes/no, 2~256개 선택지 중 선택, 0~5 평가를 지원하며 프롬프트는 최대 256K 토큰.
  • 로봇 팔 픽 앤 플레이스에서 무작위 20개 장면 중 75%를 완료했고, 파지에 성공한 15개 모두 트레이에 들어갔으며 결정당 약 240 ms.
  • 브라우저 작업에서 무작위 다단계 과제 60개 중 95%를 완료했고 클릭당 약 0.26초이며, 번호 상자만 주면 10%로 떨어진다.

제어 루프 안에서 저지연 시각 판단이 필요한 개발자에게 JEV-27B-VL은 단일 순전파로 보정된 확률을 제공하지만, 컴퓨터 사용에서는 요소 텍스트를 반드시 제공해야 한다.

Hugging Face Trending