AI FRONTIER
Signals worth understanding before they become obvious.
EmbeddingGemma 2: 공개된 경량 멀티모달 임베딩 모델
Google DeepMind가 Gemma 4 아키텍처 기반의 7억 4천만 파라미터 EmbeddingGemma 2를 Apache 2.0 라이선스로 공개했습니다. 텍스트, 이미지, 오디오, 비디오를 네이티브로 통합 임베딩 공간에 매핑합니다.
- 7억 4천만 파라미터로 Gemma 4 아키텍처 기반이며 상업적으로 허용되는 Apache 2.0 라이선스로 공개.
- 텍스트 전용 워크로드는 최소 2억 7천만 파라미터, 선택적 비전 인코더는 1억 7천만, 오디오 인코더는 3억 파라미터.
- MTEB Code에서 코드 성능이 68.76에서 78.68로 9.92포인트 향상.
- MRL을 통해 출력 벡터를 768차원에서 512, 256, 128차원으로 동적 절단 가능하며 최대 6배 저장 공간 절감.
개발자는 모듈형 인코더와 MRL 절단을 활용해 온디바이스에서 메모리와 저장 공간 제약 내에 크로스모달 검색 및 RAG 파이프라인을 구축할 수 있습니다.
에이전트 검색을 위한 상호작용 공간 검색: RISE
논문은 RISE(Retrieving Interaction SpacE)를 제안한다. BM25로 경계가 있는 상호작용 공간을 구성하고, 색인 단계에서 문서를 셸 스타일 탐색용으로 처리하여 무제한 직접 코퍼스 상호작용을 대체한다.
- BrowseComp-Plus에서 RISE는 gpt-5.4-mini로 78% 정확도를 달성해 순수 셸 DCI 기준선과 동등하면서 쿼리당 비용은 약 4분의 1이다.
- 100만 문서 규모에서 RISE-BM25는 gpt-5.4-mini로 81%에 도달한다.
- 같은 규모에서 DCI는 gpt-5.4-nano로 60%까지 저하되고 100회 중 33회의 실시간 실패가 발생한다.
- 논문은 무제한 상호작용이 확장되지 않는다고 지적한다. 모든 광범위한 셸 명령은 전체 코퍼스 스캔이며 코퍼스가 커질수록 지연이 급격히 악화된다.
검색 에이전트를 만드는 팀에게 검색 계층의 역할은 '문서 선택'에서 '탐색 가능한 경계 설정'으로 이동하며, 이는 대규모 코퍼스에서 비용과 안정성을 좌우한다.
AutoSynthData: 엔터프라이즈 에이전트를 위한 훈련 데이터 생성
ServiceNow CoreAI는 대상 모델의 실패와 더 강한 교사 모델의 성공을 활용해 역량 격차를 파악하고, 검증된 새 실행 가능 과제를 생성해 후속 학습에 사용하는 AutoSynthData를 공개했다.
- EnterpriseOps Gym의 Hybrid 영역에서 대상 모델 Gemma-4-26B-A4B-it와 교사 Qwen3.8-27B를 사용해 약 18시간 동안 합성 훈련 샘플 2,000개를 생성했다.
- Hybrid의 최고 체크포인트는 epoch 5였으며, 평균 Pass@1이 7.2포인트(상대 35%) 향상되고 검증기 성공률이 63.01%에서 68.55%로 올랐다.
- 보고에 따르면 Gemma와 참조 모델 사이의 원래 Pass@1 격차 중 59%를 줄였다.
- ITSM 영역에서도 대상 모델 Gemma-4-26B-A4B-it와 교사 DeepSeek-V4.1-Flash를 사용해 66시간 동안 합성 훈련 샘플 1,994개를 생성했다.
엔터프라이즈 에이전트를 만드는 팀에게 이 파이프라인은 환경별 실패를 검증된 훈련 과제로 바꾸고 합성 데이터의 양이 아니라 난이도 보정에 집중하게 한다.
Open TTS Leaderboard: 다국어 텍스트 음성 변환과 음성 복제를 위한 확장 가능한 평가
Hugging Face가 Open TTS Leaderboard를 공개해 오픈소스 다국어 TTS와 음성 복제 모델을 객관적 지표로 평가한다. Qwen3 ASR 기반 WER/CER, H200 GPU의 RTFx와 TTFA, WavLM 화자 임베딩 코사인 유사도(SIM)를 사용한다.
- 2026년 9월 30일 기준 Hugging Face Hub에는 8K개 이상의 TTS 모델이 있다.
- 2026년 9월 30일 기준 Artificial Analysis의 92개 모델 중 오픈 웨이트는 16개뿐이다.
- 객관적 지표를 사용하면 모델 한 개 평가에 드는 시간이 투표 수집의 몇 주에서 몇 시간으로 줄어든다.
- 기본 화면은 Seed TTS Eval 영어 분할과 CV3 Eval(zero shot)의 매크로 평균 WER로 순위를 매기며 hexgrad/Kokoro-82M, Supertone/supertonic-3, fishaudio/s2-pro가 앞선다.
음성 에이전트를 만드는 팀은 이 리더보드로 오픈 모델의 WER, RTFx, TTFA, SIM을 재현 가능하게 비교해 지연·크기·다국어 품질 간의 절충을 판단할 수 있지만, 자연스러움이나 청취 선호도는 측정하지 않는다.
autotrust/JEV-27B-VL: 시각 기능을 갖춘 27.8B 멀티모달 의사결정 모델
autotrust/JEV-27B-VL은 autotrust/JEV-27B에 시각을 추가한 모델로, 텍스트와 이미지에 대해 보정된 확률을 포함한 유형화된 System 1 결정을 출력하며 수정되지 않은 Qwen3.8-27B를 System 2로 유지한다.
- 파라미터 수 27.8B, Pipeline은 image-text-to-text, 라이선스는 apache-2.0.
- System 1은 yes/no, 2~256개 선택지 중 선택, 0~5 평가를 지원하며 프롬프트는 최대 256K 토큰.
- 로봇 팔 픽 앤 플레이스에서 무작위 20개 장면 중 75%를 완료했고, 파지에 성공한 15개 모두 트레이에 들어갔으며 결정당 약 240 ms.
- 브라우저 작업에서 무작위 다단계 과제 60개 중 95%를 완료했고 클릭당 약 0.26초이며, 번호 상자만 주면 10%로 떨어진다.
제어 루프 안에서 저지연 시각 판단이 필요한 개발자에게 JEV-27B-VL은 단일 순전파로 보정된 확률을 제공하지만, 컴퓨터 사용에서는 요소 텍스트를 반드시 제공해야 한다.