AI FRONTIER
Signals worth understanding before they become obvious.
Gemini 4 Argon: Google DeepMind의 새로운 프런티어 지능 모델
Google DeepMind가 Gemini 4 Argon을 발표했으며, 장기 복잡 워크플로를 위해 출력 토큰 한도를 64K에서 100만으로 확대하고 Fairwind Program을 통해 신뢰된 사이버 방어자에게 순차 배포한다.
- 출력 토큰 한도가 64K에서 100만으로 확대되었으며 Google은 이를 업계 최고라고 밝혔다.
- 실제 장기 소프트웨어 엔지니어링 작업을 측정하는 DeepSWE v1.1에서 77.9%로 새로운 최고 성능을 기록했다.
- Zapier의 AutomationBench에서 51.3%로 1위, LVBench 장시간 비디오 이해에서 91.7%로 최고 성능을 기록했다.
- CWE-bench v1에서 68%로 공동 1위. 도입 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러이며 캐시 입력은 입력 가격에서 95% 할인된다.
100만 출력 토큰 한도와 입력 100만 토큰당 2달러 가격은 장기 에이전트 궤적을 경제적으로 실행 가능하게 하지만, 현재는 신뢰된 방어자에게만 제한적으로 제공된다.
제안에서 검증된 효과로: Praxa, 거버넌스된 AI 에이전트 실행을 위한 증거 기반 하네스
이 논문은 결정론적 승인, 중개 실행, 외부 재확인, 조정, 검토 기반 승격을 통해 제안·권한·디스패치·검증된 외부 효과·서빙 승격 상태를 명시적으로 구분하는 Praxa 에이전트 하네스를 제안한다. 저자가 보고한 네 가지 증거 경로는 모두 프로덕션 성과나 일반적 우위를 입증하지 않는다.
- 저자가 고정 리비전에서 수행한 저장소 로컬 감사는 1,027/1,027 단위 테스트와 89/89 Workerd 테스트를 통과했고, 예상된 363개 소스 파일을 모두 계측해 네 가지 커버리지 하한을 충족했으나, 테스트별 원시 기록과 독립 재현은 제공되지 않는다.
- Terminal-Bench Core 0.1.1의 12개 선별 과제 공급자 기반 파일럿에서 베이스라인과 신뢰성 계층은 각각 17/36 엄격 시행을 통과했다. 신뢰성 계층은 입력 토큰을 37.49%, 출력 토큰을 50.73% 더 사용했으므로 이 파일럿은 우위를 뒷받침하지 않는다.
- 디버깅 이후 2차 조정 프록시 개발 비교에서 베이스라인과 저자 작성 후보는 각각 180/180 시행을 완료했고 측정 정확도가 동일했으며, 완전한 밀폐형 크래시 복구와 보호 위반 0건을 달성했다.
- 후보는 토큰을 37.11% 줄이고 추정 엔드포인트 비용을 33.84% 낮추고 단계 수를 11.63% 줄였다. 논문은 이것이 품질, 지연 시간, 프로덕션 동작의 개선을 입증하지 않는다고 명시한다.
거버넌스된 에이전트를 구축하는 팀에게 Praxa의 의미는 권한에서 외부 효과로의 전환을 테스트 가능한 명시적 상태로 만든 점이지만, 현재 증거는 아키텍처 검증 가능성에 그쳐 프로덕션 배포나 안전성 주장을 뒷받침하기에는 부족하다.
OpenRouter 신규 모델: inclusionAI Ling 3.1 Flash
inclusionAI의 Ling 3.1 Flash는 전체 파라미터 560B 중 25B를 활성화하는 하이브리드 추론 Mixture-of-Experts 모델이며 컨텍스트 창은 262,144 토큰입니다.
- 전체 파라미터 560B, 활성 파라미터 25B.
- 컨텍스트 창 262,144 토큰, 최대 32,768개 완성 토큰 지원.
- tools와 tool_choice를 통한 함수 호출은 지원하지만 response_format은 지원하지 않아 JSON 출력이 강제되지 않음.
- OpenRouter 페이지에서 무료로 표시되며 공개일은 2026년 10월 2일.
빌더에게는 무료 장문맥 MoE이자 도구 호출 지원 옵션이지만, 구조화 출력 강제가 없어 JSON 신뢰성은 애플리케이션 계층에서 보완해야 한다.
DSSR-3D: 3D 가우시안에서 시점 의존 지시를 위한 분리 추론
DSSR-3D는 연속 3D 가우시안 필드에서 시점 의존 지시 분할을 위한 추론 시점 프레임워크로, 자세 불변 의미 위치화와 자세 조건부 공간 추론의 두 인터페이스로 정식화되며 기반 의미 필드의 재학습이 필요 없다.
- 논문은 프레임워크를 자세 불변 의미 위치화와 자세 조건부 공간 추론의 두 인터페이스로 정식화하며, 제약을 만족하는 임의의 함수 쌍이 유효한 구현이 된다.
- 구현은 온도 첨예화 softmax 위치화 메커니즘과 투영 기반 방향 점수 함수를 경량의 학습 불필요 단계로 융합한다.
- 저자들은 3D 가우시안 필드에서 시점 의존 분할을 분리하는 ViewRef-GS 벤치마크를 제안하고 증강된 Ref-LERF와 함께 평가한다.
- 논문은 기존 3DGS 기반 지시 방법 대비 일관된 향상을 보고하며, 기반 의미 필드 외 추가 학습이 필요하지 않다.
AI 빌더에게 이는 시점 의존 공간 지시를 추론 시점에 분리해 처리할 수 있고, 의미 필드를 재학습하지 않고 구조가 다른 필드로 전이할 수 있음을 보여준다.
FlashDiffusion: 융합 타일 커널 스펙트럴 분해
이 논문은 융합 GPU 타일에서 조밀 가우시안 커널 블록을 평가하는 행렬 없는 방법인 FlashDiffusion을 제안하며, 고유값 솔버를 경험적 β-flow와 결합해 유한 표본 해상도 스케일을 선택한다.
- 논문은 조밀 가우시안 커널이 O(N^2) 메모리를 필요로 한다고 보고한다.
- 이 방법은 융합 GPU 타일에서 조밀 가우시안 커널 블록을 평가하여 조밀 커널의 물질화를 피한다.
- 고유값 솔버는 경험적 β-flow와 결합되어 유한 표본 해상도 스케일을 선택한다.
- 표본 크기와 대역폭에 대한 연속은 더 거친 해상도에서 점점 더 비싼 스펙트럴 해를 웜스타트한다.
기하 학습에서 커널 방법을 사용하는 AI 빌더에게 이 행렬 없는 타일 접근은 O(N^2) 조밀 커널 메모리 병목을 제거해 더 큰 스펙트럴 해를 실행 가능하게 만든다.
ChainLoRA: LLM 지속 학습을 위한 기하 보존 작업 벡터 병합
ChainLoRA는 체인 업데이트된 작업 벡터 기하를 기반으로 하는 리플레이 없는 지속적 병합 프레임워크로, 체인 업데이트 학습과 스트림 후 적응형 SVD 병합을 결합한다. 논문은 Large 및 SuperNI 벤치마크에서 평가된 리플레이 없는 방법 중 최첨단 성능을 달성했다고 보고한다.
- ChainLoRA는 체인 업데이트 학습과 스트림 후 적응형 SVD 병합을 결합하며, 학습 중 초기화와 단측 직교성 프록시는 마지막 캐리어만 사용한다.
- 병합 시점에 적응형 SVD가 공유 캐리어를 추출하고 Procrustes 적응을 통해 최신 작업에 정렬한다.
- 이론적 분석은 Procrustes 적응이 공유 구성 요소와 작업별 구성 요소의 기하학적 근사 분리를 촉진하고, 단측 프록시가 작업 간 간섭을 추가로 제한함을 보여준다.
- 논문은 Large 및 SuperNI 벤치마크에서 ChainLoRA가 평가된 리플레이 없는 방법 중 최첨단 성능을 달성하고, 세 벤치마크 모두에서 평가된 리플레이 기반 방법에 거의 가장 근접한 평균 점수를 얻었다고 보고한다.
지속 학습 파이프라인을 구축하는 개발자에게 ChainLoRA의 체인 업데이트와 적응형 SVD 병합은 작업 스트림이 커져도 과거 상태와 정규화 오버헤드가 일정하게 유지되는 리플레이 없는 파라미터 효율적 미세 조정 경로를 제공한다.
NVIDIA Kumo Tabular, 표 형식 예측의 새로운 정확도-효율 프런티어 제시
NVIDIA가 표 형식 데이터용 오픈 파운데이션 모델 Kumo Tabular를 공개했다. 학습, 튜닝, 피처 엔지니어링 없이 단일 순전파로 분류와 회귀를 수행하며, 28M에서 215M 파라미터까지 세 가지 크기로 제공되고 OpenMDW-1.1 라이선스로 배포된다.
- 모델은 Small/Medium/Large 세 가지 크기, 28M에서 215M 파라미터로 제공되며 OpenMDW-1.1 라이선스로 상업적 사용이 가능하다.
- TabArena 리더보드에서 ELO 1950으로 종합 1위를 기록했고, 단일 RTX 6000 Pro 통일 평가 환경에서 LimiX-2보다 17배 빠르다고 보고되었다.
- BeyondArena에서 ELO 1418, Improvability 점수 7.78%로 1위를 기록했다.
- TALENT에서 분류 정확도, 분류 로그 손실, 회귀 RMSE 전 부문 종합 1위를 달성했으며 평균 순위는 각각 6.67, 3.98, 4.22이다.
AI 빌더에게 Kumo Tabular는 작업별 학습 없이 표 형식 예측을 수행할 수 있는 경로를 제공하며, 공개된 정확도-효율 수치는 자체 홀드아웃 데이터로 검증한 뒤 배포해야 한다.