Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-04
01
watchresearchcost collapse

빠른 FP4 사전학습을 위한 포맷 인식 융합

이 논문은 각 양자화 생산자를 스케일 도메인 및 소비자 레이아웃과 공동 설계하는 포맷 인식 융합을 제안하며, 네이티브 mxfp, 전역 nvfp, 협력 스레드 배열 로컬 nvfp를 대상으로 한다. Llama-3 계열 8B를 1600억 토큰까지 사전학습한 평가에서 가장 빠른 사용자 정의 경로는 37.9K tokens/s/GPU에 도달했다.

  • 동일 가속기 비교에서 bfloat16과 Transformer Engine nvfp는 각각 18.8K와 27.6K tokens/s/GPU, 가장 빠른 사용자 정의 경로는 37.9K tokens/s/GPU를 기록했다.
  • 행 그래디언트 확률적 반올림과 고정 부호 32값 Hadamard 가중치 그래디언트 전처리를 적용한 mxfp는 37.2K tokens/s/GPU, bfloat16 모델 FLOP 활용률 86.3%를 기록했다.
  • 이 mxfp 구성의 학습 손실 종점은 원시 bfloat16보다 2.11% 높다.
  • 마지막 4개 블록을 bfloat16으로 둔 Transformer Engine 레시피는 27.1K tokens/s/GPU에서 bfloat16보다 0.87% 높다.

FP4 사전학습의 실질적 이득은 Tensor Core 자체가 아니라 스케일 계약, 오퍼랜드, 실행 경로의 공동 설계에 달려 있다.

arXiv cs.LG
02
testdeveloperopen source unlock

메타, AI 에이전트 'Muse' 지원 기기를 누구나 직접 제작 가능하도록 ESP32용 SDK 공개

메타가 ESP32용 SDK를 공개해 누구나 AI 에이전트 'Muse'를 지원하는 기기를 직접 만들 수 있게 했다.

  • 메타가 ESP32용 SDK를 공개했다.
  • 이 SDK로 누구나 Muse 지원 기기를 직접 제작할 수 있다.

ESP32 개발자는 공식 SDK로 Muse 지원 하드웨어를 직접 만들 수 있어 완제품 출시를 기다릴 필요가 없다.

ビジネス+IT
03
watchmodelsnew architecture

OpenAI, GPT-6 Sol과 Luna 공개

OpenAI가 GPT-6 시리즈의 새 모델인 GPT-6 Sol과 Luna를 발표했다.

  • OpenAI가 GPT-6 Sol과 Luna라는 새 모델을 발표했다.
  • 이 발표는 OpenAI 공식 채널을 통해 이루어졌다.

AI 빌더는 GPT-6 Sol과 Luna의 등장을 고려해 자사 애플리케이션 적용 가능성을 검토해야 한다.

OpenAI
04
testcreativeopen source unlock

Open TTS Leaderboard: 다국어 텍스트 음성 변환과 음성 복제를 위한 확장 가능한 평가

Hugging Face가 Open TTS Leaderboard를 공개해 오픈소스 다국어 TTS와 음성 복제 모델을 객관적 지표로 평가한다. Qwen3 ASR 기반 WER/CER, H200 GPU의 RTFx와 TTFA, WavLM 화자 임베딩 코사인 유사도(SIM)를 사용한다.

  • 2026년 9월 30일 기준 Hugging Face Hub에는 8K개 이상의 TTS 모델이 있다.
  • 2026년 9월 30일 기준 Artificial Analysis의 92개 모델 중 오픈 웨이트는 16개뿐이다.
  • 객관적 지표를 쓰면 모델 한 개 평가가 투표 수집의 몇 주에서 몇 시간으로 줄어든다.
  • 기본 화면은 Seed TTS Eval 영어 분할과 CV3 Eval(zero shot)의 매크로 평균 WER로 순위를 매기며 hexgrad/Kokoro-82M, Supertone/supertonic-3, fishaudio/s2-pro가 앞선다.

음성 제품을 만드는 팀에게 재현 가능한 객관 지표는 수많은 오픈 TTS 모델을 몇 시간 만에 추려낼 수 있게 하지만, 자연스러움과 청감 선호는 사람 투표로 보완해야 한다.

Hugging Face Blog
05
testcreativeincremental

Lightricks, LTX-2.5 오픈 웨이트 오디오·비디오 월드 모델 공개

Lightricks/LTX-2.5는 텍스트, 이미지, 비디오 입력에서 동기화된 비디오와 오디오를 생성하는 오픈 웨이트 모델로 자체 호스팅을 지원합니다. 네이티브 멀티샷 생성, 확산 비디오 디코더, Gemma 4 12B 텍스트 인코더, 선택적 길이 예측기를 추가했습니다.

  • 모델 카드에는 지난달 다운로드 수가 1,629,984회, 좋아요가 6.12k로 표시됩니다.
  • 컴포넌트당 하나의 .safetensors 파일을 두는 분할형 Comfy 정렬 팩으로 공개되며 22B 증류 및 전체 DiT 체크포인트를 포함합니다.
  • 증류 DiT는 고정 8스텝 스케줄과 CFG=1을 사용하며, num_frames % 8 == 1을 만족해야 하고 너비와 높이는 32로 나누어져야 합니다.
  • 연 매출 1,000만 달러 미만은 LTX-2.x 커뮤니티 라이선스로 무료 상업 사용이 가능하고, 1,000만 달러 초과 시 유료 상업 사용 계약이 필요합니다.

빌더에게 LTX-2.5는 자체 호스팅 가능한 오픈 웨이트 오디오·비디오 생성 경로이며, 분할 체크포인트와 int8·NVFP4 양자화 버전으로 VRAM 예산에 맞춘 배포가 가능합니다.

Hugging Face Trending
06
watchresearchincremental

“very likely”가 “불확실”을 뜻한다? LLM이 언어적 불확실성 정량화에서 인간과 어떻게 갈라지는가

이 논문은 심리학 및 의사결정과학 문헌에서 인간의 불확실성 표지 코퍼스를 구축하고 LLM과 비교한 결과, LLM이 언어적 불확실성을 인간과 크게 다른 수치 수준으로 인코딩한다고 보고한다. 저자들은 LLM 출력에서 불확실성 표지의 최적 불확실성 프로파일을 직접 학습하는 최적화 기반 알고리즘을 제안한다.

  • 저자는 Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu, Tianlong Chen이며, 2026년 9월 6일 제출되어 ICML 2026에 채택되었다.
  • 저자들은 심리학 및 의사결정과학 문헌에서 인간 불확실성 표지 코퍼스를 정리하고 이에 대해 LLM을 벤치마크했다.
  • 논문은 LLM이 언어적 불확실성을 인간의 수치 수준과 크게 다른 수치 수준으로 인코딩한다고 보고한다.
  • 제안된 알고리즘은 반복 샘플링으로 불확실성을 추정하는 대신 경험적 정확성을 가장 잘 설명하는 표지-불확실성 매핑을 피팅한다.

불확실성 인식 시스템을 구축하는 팀은 'likely'나 'possible' 같은 표지에 대한 LLM의 수치적 해석이 인간 판단과 일치한다고 가정하지 말고 검증해야 한다.

arXiv cs.LG
07
watchresearchnew architecture

LLM을 위한 고속 다항식 초월 함수

이 논문은 LLM의 네이티브 sigmoid, tanh, SiLU를 짧은 다항식 프로그램으로 대체하는 방법을 검증하고, GB200 통합 작업에서 학습 스텝 처리량 향상과 약 1000억 토큰 시점의 손실 차이를 보고한다.

  • 격리된 FP16 스윕에서 패킹된 FMA 프로그램은 L2 상주 작업 집합에서 1.19–2.19배, HBM 상주 작업 집합에서 1.00–1.70배 개선되었다.
  • 네 가지 GB200 통합 작업 중 dense SiLU, tanh-softcapped attention, routed-expert SwiGLU 대체는 전체 학습 스텝 처리량을 각각 2.7%, 2.9%, 8.0% 향상시켰다.
  • sigmoid attention 대체는 전체 attention 순전파를 7.4%, 전체 GPU 스텝을 0.3% 향상시켰다.
  • 약 1000억 토큰의 일반적 학습 구간에서 네 작업의 최종 평활화 학습 손실 차이(다항식-네이티브)는 -0.107에서 +0.079 범위였다.

AI 빌더에게 이는 저차 BF16 다항식으로 SFU 초월 함수를 대체하면 Blackwell급 GPU에서 측정 가능한 학습 처리량 이득을 얻을 수 있지만 작업별 손실 검증이 필요함을 시사한다.

arXiv cs.LG
08
watchresearchincremental

Adam은 자연 경사 하강법에서 얼마나 멀리 떨어져 있는가?

이 논문은 모멘텀을 포함한 Adam의 전체 업데이트 규칙을 대각 절단, 경험적 레이블 대체, 시간 지연이 적용된 대각 경험적 Fisher 근사로 보고, 스케일 불변 γ(Δθ) 지표로 네 가지 손실 지형에서 Adam과 실제 NGD의 기하학적 편차를 측정한다.

  • 연구는 양호 조건 선형 회귀, 불량 조건 선형 회귀, 로지스틱 회귀, 비볼록 소형 신경망의 네 가지 손실 지형을 다룬다.
  • 기하학적 편차는 양호 조건에서 낮게 유지되지만 불량 조건에서 크게 증가하며, 신경망에서는 약 10^3의 오정렬에 도달한다.
  • 더 큰 기하학적 드리프트는 더 느린 초기 최적화와 상관되지만 최종 목적 함수 최소화를 저하시키지는 않으며, Adam은 일관되게 낮은 손실에 도달한다.
  • 개선된 경험적 Fisher(iEF)는 표준 경험적 Fisher(EF)보다 더 안정적인 경로를 추적하며, EF는 자주 진동하거나 발산한다.

빌더에게 이 결과는 Adam의 실용적 최적화 성능이 자연 경사 경로 추적이 아니라 구조적 근사 오차와 모멘텀 평활화의 균형에서 비롯될 수 있음을 시사한다.

arXiv cs.LG