Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-06
01
watchresearchnew architecture

SCION: 인스턴스화된 신경 프리미티브를 이용한 장면 합성

SCION은 독립적인 3D 가우시안을 재사용 가능한 프리미티브의 압축된 어휘와 경량 월드 공간 인스턴스로 대체하는 계층적 합성 장면 표현을 제안하며, 이산 및 연속 장면 파라미터에 대한 공동 최적화로 다시점 캡처에 피팅한다. 논문은 1.2 MB에서도 높은 품질을 유지하고 재학습 없이 인스턴스 수준 편집과 애니메이션을 가능하게 한다고 보고한다.

  • 이 논문은 NeurIPS 2026에 채택되었으며 2026년 10월 1일에 제출되었다.
  • SCION은 장면당 수백만 개의 독립 가우시안을 재사용 가능한 프리미티브 어휘와 월드 공간 인스턴스로 대체한다.
  • 논문은 1.2 MB에서도 높은 품질을 유지한다고 보고한다.
  • 논문은 기존 가우시안 압축 방법보다 유리한 레이트-왜곡 성능을 보이며 재학습 없이 인스턴스 수준 편집과 애니메이션을 가능하게 한다고 보고한다.

3D 장면 파이프라인을 구축하는 개발자에게 SCION은 장면을 재사용 가능한 프리미티브와 인스턴스로 모델링하면 약 1.2 MB의 압축 표현으로 편집 및 애니메이션이 가능한 인스턴스 수준 조작을 얻을 수 있음을 보여준다.

arXiv cs.CV
02
watchresearchbenchmark jump

DeskForge: 컴퓨터 사용 에이전트를 위한 데스크톱 환경 기반 밀집 감독

DeskForge는 실제 애플리케이션을 구성하고 탐색하는 제어 가능한 데스크톱 환경으로, 120만 개의 주석이 달린 데스크톱 관측과 1억 5,970만 개의 요소 인스턴스를 포함하는 DeskForge-1M을 구축했다. 논문은 DeskForge-1M에서 추출한 20만 개의 grounding 예제로 네 개의 비전-언어 모델을 미세조정했으며, 모두 홀드아웃 데스크톱 조건과 다섯 개 외부 GUI grounding 벤치마크에서 향상되었다고 보고한다.

  • DeskForge-1M은 120만 개의 주석이 달린 데스크톱 관측과 1억 5,970만 개의 요소 인스턴스를 포함한다.
  • 논문은 DeskForge-1M에서 추출한 20만 개의 grounding 예제로 네 개의 비전-언어 모델을 미세조정했다.
  • 논문은 Qwen3.5-4B가 ScreenSpot-Pro에서 11.51%포인트, OSWorld-G에서 10.11%포인트 정확도가 향상되었다고 보고한다.
  • 논문은 고정 플래너 아래에서 Qwen3.5-4B가 WebArena-Infinity에서 119개 중 31개에서 50개로, OpenApps에서 100개 중 3개에서 15개로 해결 수가 증가했다고 보고한다.

컴퓨터 사용 에이전트를 만드는 팀에게 DeskForge는 실제 데스크톱 환경의 제어 가능한 구성이 밀집 요소 주석을 대규모로 생성해 GUI grounding과 장기 작업 완료를 모두 개선할 수 있음을 보여준다.

arXiv cs.CV
03
testresearchincremental

Rank-Aware Speculative Sampling: 확산 드래프트 트리를 위한 순위 인식 검증 규칙

논문은 순위 인식 리스트 결합에 기반한 확산 드래프트 트리 검증 규칙인 Rank-Aware Speculative Sampling(RASS)을 제안한다. RASS는 제안-목표 평균 변위를 따라 후보를 정렬하고 선택 제안과 목표 분포 사이의 총변동을 최소화하도록 최적화된 가중치로 순위를 샘플링하며, 선택된 후보를 목표와 최대 결합한다.

  • RASS는 D-GRS를 개선한다. D-GRS는 각 노드에서 K개의 조건부 독립 후보를 생성하고 생성 순서대로 순차 검증한다.
  • 평가는 가우시안 혼합 타깃, FFHQ 무조건 픽셀 공간 생성, CIFAR-10 조건부 생성, COCO2014 프롬프트를 사용한 Stable Diffusion 3.5 잠재 확산에서 수행되었다.
  • 표준 샘플링 대비 추측 샘플링의 목표 모델 평가 횟수 비율로 측정했을 때, 논문은 평가된 모든 설정에서 RASS가 D-GRS를 능가하며 동일 계산 예산의 CIFAR-10에서 약 20% 향상에 도달한다고 보고한다.
  • 잔차 보정은 모든 순위 가중치 선택에 대해 정확한 샘플링을 보장한다.

확산 추론 가속을 다루는 개발자에게 RASS는 목표 모델 평가를 추가하지 않고 드래프트 후보의 순위 정보를 활용해 동일 계산 예산에서 목표 모델 평가 횟수를 줄일 수 있음을 보여준다.

arXiv cs.LG
04
testcreativeincremental

Lightricks, LTX-2.5 오픈 웨이트 오디오·비디오 월드 모델 공개

Lightricks/LTX-2.5는 텍스트, 이미지, 비디오 입력에서 동기화된 비디오와 오디오를 생성하는 오픈 웨이트 모델로 자체 인프라에 셀프 호스팅할 수 있습니다. 네이티브 멀티샷 생성, 확산 비디오 디코더, 자체 Gemma 4 12B 텍스트 인코더, 선택적 길이 예측기를 추가했습니다.

  • 모델 카드에 좋아요 6.48k, 지난달 다운로드 1,645,444로 표시됨.
  • DiT 체크포인트는 22b로 표기되며 bf16, Comfy int8+convrot, NVFP4 버전을 제공.
  • 텍스트 인코더는 Gemma4 12B와 프로젝션, 비디오와 오디오는 각각 별도 VAE 사용.
  • 연 매출 1,000만 달러 미만은 LTX-2.x 커뮤니티 라이선스로 무료 상업 사용, 초과 시 유료 상업 계약 필요.

빌더에게 LTX-2.5는 분할된 Comfy 정렬 가중치 팩으로 셀프 호스팅 가능한 오디오·비디오 생성을 제공하고 dev transformer 파인튜닝을 허용하지만, int8 체크포인트는 ComfyUI 전용입니다.

Hugging Face Trending
05
watchresearchincremental

통제 실험 없이 과학 에뮬레이터의 반사실 예측을 수행하는 ReRoute

논문은 사실 데이터와 부분적 메커니즘 지식을 결합한 표적 과학 what-if 예측 프레임워크 ReRoute를 제안하며, 적응에 통제 개입 데이터가 필요하지 않다. 사전 학습된 백본의 질의 입력을 참조 값으로 고정하고, 알려진 메커니즘 경로를 통해 그 변동을 재도입한 뒤 원래 사실 데이터로 미세 조정한다.

  • 홀드아웃 결합 기후 개입에서 ReRoute는 심각한 CO2 분포 이동 하에 총 기후 오차를 18.2-31.8% 감소시키면서 표준 조건에서의 성능을 유지했다.
  • 논문은 정확한 응답을 얻을 수 있는 통제된 이류-확산 시스템에서 ReRoute가 높은 정확도의 반사실 예측을 달성했다고 보고한다.
  • 논문은 명시적 구조 가정 하에 이 구성에 대한 인과 식별 결과를 제시하며, 핵심 논증은 Lean에서 기계 검증되었다.
  • 역사적 ERA5 재분석으로 학습된 에뮬레이터에서 반사실 참조가 존재하지 않음에도, ReRoute는 고정 CO2 반사실 하에 관측 경계 조건이 함의하는 지표 온난화를 상당히 더 많이 보존했다.

과학 에뮬레이터를 구축하는 팀에게 ReRoute는 값비싼 통제 시뮬레이션 데이터를 생성하지 않고도 사실 데이터와 부분적 메커니즘 지식만으로 분포 이동 하의 반사실 예측을 개선할 수 있음을 보여준다.

arXiv cs.LG
06
watchagentsnew architecture

DeReAct: 분해된 추론과 행동으로 신뢰할 수 있는 AI 에이전트 구현

DeReAct는 두 개의 게이팅 정책을 외부화한 모듈형 에이전트 아키텍처로, Critic이 실행 전 제안된 행동을 검증하고 Context Manager가 환경이 뒷받침하는 State를 재구성해 작업 완료를 인증한다. 논문은 GAIA와 SWE-bench Verified에서 이 구조가 약한 Brain 모델의 Pass@1을 가장 크게 향상시킨다고 보고한다.

  • 논문은 Qwen3-Coder-480B의 Pass@1이 6.5~7.0포인트 향상되었다고 보고한다.
  • 논문은 Claude Sonnet 4.5의 Pass@1이 4.2~5.2포인트 향상되었다고 보고한다.
  • Claude Opus 4.5에서는 Pass@1이 ReAct와 비슷하지만 DeReAct가 더 증거가 완전하고 제약을 충족하는 궤적을 생성한다.
  • 논문은 외부 게이팅이 대상 실패가 충분히 빈번하고 게이팅 정책 자체가 충분할 때 효과적이라고 밝힌다.

에이전트 개발자에게 행동 검증과 완료 인증을 단일 정책에서 분리하는 것은 기반 모델을 바꾸지 않고도 약한 모델의 신뢰성을 높이는 방법이다.

arXiv cs.AI
07
testmodelsopen source unlock

Cloudflare, Clef 공개: 27B 멀티모달 의사결정 모델, 단일 순전파로 구조화 확률 출력

Cloudflare가 Qwen/Qwen3.8-27B에서 후속 학습한 멀티모달 모델 Clef를 공개했다. 상태와 타입이 지정된 질문 스키마를 의사결정으로 변환하며, 각 질문의 모든 허용 선택지에 확률을 반환하므로 자유 형식 텍스트 생성이나 출력 파싱이 필요 없다.

  • 파라미터 수 27B, BF16, 표준 샤딩 safetensors로 저장, 라이선스는 Apache-2.0.
  • 입력은 텍스트, JSON, 이미지, 비디오를 지원하고 출력은 각 질문의 각 허용 선택지당 하나의 logit이며 질문별 softmax로 확률을 얻는다.
  • 단일 H200에서 torch 2.11과 transformers 5.10.2로 테스트되었고 이미지와 비디오 입력에는 pillow도 필요하다.
  • 내부 Decision Index 0.2.1 실행에서 BFCL 사례 완전 일치 정확도 98.5, BANKING77 매크로 F1 94.2, 중앙값 지연 209.3밀리초, p95 지연 238.6밀리초를 기록했다.

자유 형식 텍스트 대신 구조화된 의사결정이 필요한 AI 빌더에게 Clef는 Jev/SystemOne API에 바로 연결할 수 있는 27B 멀티모달 선택지이지만, 지연 시간이 Clef-flash 같은 더 작은 변형보다 높다는 점을 고려해야 한다.

Hugging Face Trending
08
watchresearchbenchmark jump

EditHero: 장기 파트 단위 3D 편집과 Vibe 모델링을 위한 벤치마크

논문은 EditHero를 제안하며, 저자들에 따르면 장기적이고 파트 단위의 3D 편집을 위한 최초의 벤치마크로 자연어 지시와 기하 및 텍스처 목표 이미지를 제공한다. 결정론적 조립 엔진이 각 편집 후 정확한 목표를 생성하고 모든 시퀀스는 수작업으로 검토된다.

  • 논문은 EditHero를 저자들이 아는 한 장기적이고 파트 단위의 3D 편집을 위한 최초의 벤치마크로 제시하며, 자연어 지시와 기하 및 텍스처 목표 이미지를 포함한다.
  • 결정론적 조립 엔진이 각 편집 후 정확한 목표를 생성하고 모든 시퀀스는 수작업으로 검토된다.
  • 비에이전트 방식은 학습된 3D 표현에서 하향식으로 객체를 재생성하며, 요청된 변경을 놓치고 고정되어야 할 영역을 교란하는 경우가 많다.
  • LLM/VLM 에이전트는 메시를 검사하는 코드를 통해 상향식으로 편집하고 지시가 요구하는 부분만 다시 작성한다. 대부분의 LLM이 지시를 더 잘 따르고 편집되지 않은 부분도 모든 방식 중 더 잘 보존하지만, 각 편집에 수 분이 걸린다.

이 벤치마크는 평가 초점을 단일 편집에서 다단계 수정의 '필요한 부분만 바꾸기'로 옮겨, 신뢰할 수 있는 반복적 3D 편집을 구축하려는 개발자에게 재현 가능한 비교 기준을 제공한다.

arXiv cs.CV