AI FRONTIER
Signals worth understanding before they become obvious.
구글, AI 모델 재학습 없이 ‘하네스’ 스스로 개선하는 ‘RRSI’ 공개
구글 클라우드 AI 리서치 연구진이 스탠퍼드대학교, 워싱턴대학교 등과 함께 모델 가중치를 바꾸지 않고 프롬프트, 도구 사용 방식, 제어 흐름, 메모리와 컨텍스트 관리, 기술 모듈, 하위 에이전트 등 모델을 둘러싼 ‘하네스’를 반복적으로 수정하는 RRSI 프레임워크를 공개했다.
- 8개 벤치마크에서 RRSI를 테스트한 결과 터미널-벤치 2.1 점수는 74.2%에서 80.2%로 6.0%P 상승했고, SWE-벤치 베리파이드는 82.0%에서 83.8%로 1.8%p 개선됐다.
- 잡벤치는 36.0%에서 40.7%로 4.7%p, GDPval은 48.8%에서 52.3%로 3.5%p, 프런티어-Eng은 17.7%에서 22.0%로 4.3%p 상승했다.
- RRSI가 직접 최적화에 사용하지 않은 5개 외부 평가 세트에서 최대 4.7%p의 성능 향상이 확인됐고, 미학습(OOD) 평가 환경에서는 기존 하네스 진화 방식 대비 최대 22.9% 뛰어난 성능을 기록했다.
- 제미나이 3.5 플래시를 기반 모델로 사용한 별도 실험에서도 터미널-벤치 2.1 성능이 64.6%에서 78.7%로 14.1%p, SWE-벤치 베리파이드는 76.8%에서 79.0%로 2.2%p 높아졌다.
에이전트를 만드는 팀에게 RRSI는 모델 가중치를 고정한 상태에서도 하네스에 대한 통제된 반복 탐색이 측정 가능한 성능 향상과 토큰 비용 절감을 가져올 수 있음을 보여준다.
OpenAI, GPT-6.1 Sol 공개
OpenAI가 GPT-6.1 Sol을 발표했으며, 코딩, 컴퓨터 사용, 전문 업무에서 Astra에 근접한 지능을 Astra 표준 API 입력 및 출력 토큰 가격의 5분의 1로 제공한다고 밝혔다.
- OpenAI는 GPT-6.1 Sol의 지능이 Astra에 근접한다고 밝혔다.
- 코딩, 컴퓨터 사용, 전문 업무를 대상으로 한다.
- 표준 API 입력 및 출력 토큰 가격은 Astra의 5분의 1이다.
AI 빌더에게 Astra에 근접한 지능을 5분의 1 토큰 단가로 쓸 수 있다는 점은 코딩과 컴퓨터 사용 워크로드의 추론 비용을 크게 낮출 수 있음을 의미한다.
prism-ml, Ternary-Bonsai-2-27B-gguf 공개: 삼진 가중치 27B 모델을 5.95 GB로 노트북에서 실행
prism-ml이 Hugging Face에 Ternary-Bonsai-2-27B-gguf를 공개했다. Qwen3.8-27B의 임베딩, 어텐션 투영, MLP 투영, LM head를 삼진 가중치(g128, {−1,0,+1}과 FP16 그룹 스케일링)로 양자화하고, PTQ1_0과 PQ2_0 두 가지 GGUF 패킹으로 llama.cpp의 CUDA, Metal, CPU 백엔드에 제공한다.
- 언어 모델 크기는 PTQ1_0 5.95 GB, PQ2_0 7.21 GB로 FP16 약 54 GB 대비 각각 약 9.0배, 7.5배 축소이며, 이상적 삼진 형식은 1.72 bits/weight, 5.8 GB다.
- 논문은 14개 thinking 모드 벤치마크에서 평균 84.78을 보고했으며 이는 FP16 기준(86.32)의 98.2%다. IQ2_XXS는 72.59(7.27 GB), UD-Q4_K_XL은 85.18(17.6 GB)이다.
- 논문은 AIME26 95.83, LiveCodeBench 90.07을 보고했고 IQ2_XXS는 각각 57.5와 56.4였다. 수학 96.57, 코딩 89.42, BFCL v3 도구 호출 74.92다.
- 컨텍스트 길이는 262K 토큰이며 약 75%가 선형 어텐션인 하이브리드 어텐션 백본을 사용한다. 비전 타워는 별도 Q8_0 mmproj 팩(0.63 GB)으로 이미지 입력 시에만 로드된다.
단일 GPU나 노트북에서 27B급 추론을 배포하려는 팀에게 이 모델은 전 계층 삼진 양자화가 약 6 GB로 FP16에 근접한 추론과 도구 호출 성능을 유지할 수 있음을 보여주지만, 전용 커널과 포크 런타임이 필수임을 시사한다.
에이전트 검색을 위한 상호작용 공간 검색: RISE가 BM25로 경계 있는 탐색 공간을 구축
논문은 RISE(Retrieving Interaction SpacE)를 제안하며, BM25로 에이전트가 탐색할 수 있는 경계 있는 코퍼스 부분집합을 구성하고 색인 단계에서 셸 방식 탐색을 위한 문서 처리를 수행한다. BrowseComp-Plus에서 RISE는 순수 셸 DCI 기준선과 동일한 78% 정확도를 쿼리당 약 4분의 1 비용으로 달성했다.
- 논문 보고: BrowseComp-Plus에서 RISE는 gpt-5.4-mini로 78% 정확도에 도달해 순수 셸 DCI 기준선과 동등했고, 쿼리당 비용은 약 4분의 1이었다.
- 논문 보고: 100만 문서 규모에서 RISE-BM25는 gpt-5.4-mini로 81%에 도달했다.
- 논문 보고: 같은 100만 문서 규모에서 DCI는 gpt-5.4-nano로 60%로 저하되었고 100회 중 33회의 실시간 실패가 발생했다.
- 논문 주장: 무제한 상호작용은 확장되지 않으며, 광범위한 셸 명령은 매번 전체 코퍼스 스캔이고 코퍼스가 커질수록 지연이 급격히 악화된다.
검색 에이전트를 만드는 팀에게 이 결과는 검색 계층의 역할이 컨텍스트 창에 맞는 문서 선택이 아니라 경계 있는 상호작용 공간을 정하는 것임을 보여주며, 코퍼스 확장 시 비용과 지연을 억제할 수 있다.
Diffusion Controller가 AI 이미지 생성을 통합하고 단순화
Google Research는 기본 모델을 동결한 상태에서 디노이징 과정을 동적으로 조정하는 경량 '스티어링 댐퍼' 네트워크 Diffusion Controller를 제안했다.
- Stable Diffusion v1.4 백본에서 SFT, RWL, PPO 세 가지 미세조정 방식으로 평가했다.
- SFT와 RWL에서 그레이박스 Diffusion Controller의 HPS-v2 승률이 LoRA를 능가했으며 조작하는 내부 모델 레이어 수도 훨씬 적었다.
- 완전히 개방된 화이트박스 버전은 기준 모델 대비 90% 승률을 기록했다.
- 단일 추론 시점 가이던스 강도 파라미터를 조정해 제어 제약 강도를 동적으로 변경할 수 있다.
빌더에게는 폐쇄형 모델 가중치에 접근하지 않고도 제어 가능한 이미지 생성과 개인화를 구현할 수 있는 경량 방안을 제공한다.
Google DeepMind, AI 생성 단백질에 검증 가능한 워터마크를 넣는 SynthID Bio 공개
Google DeepMind가 합성생물학용 워터마킹 기법 모음인 SynthID Bio를 발표했다. 아미노산 서열과 AlphaFold 3가 예측한 3D 구조에 검출 가능한 신호를 삽입하며, 실험실 테스트에서 단백질의 생물학적 기능을 유지했다.
- SynthID Bio는 AlphaFold 3 확산 네트워크의 일부를 미세 조정해 워터마크 기능을 모델 가중치에 내장함으로써 예측된 3D 좌표 자체가 검출 가능한 신호를 갖도록 한다.
- VEGF-A, SARS-CoV-2 스파이크 단백질 RBD, PD-L1 세 표적에 대한 습식 실험에서 워터마크된 설계는 미적용 버전과 동등한 적중률, 결합 친화도, 자연 서열 다양성을 보였다.
- AlphaFold 3의 예측 정확도를 유지하면서 거의 완벽한 검출성을 제공하고 디지털 노이즈나 경미한 좌표 변화에도 견딘다고 보고됐다.
- Google DeepMind는 방법론 논문을 발표하고 코드와 in vitro 데이터를 오픈소스로 공개하며 연구 커뮤니티에 가중치를 배포할 예정이다.
생물 설계 도구 개발자에게 워터마크를 모델 가중치와 서열 생성 과정에 직접 내장할 수 있다는 점은 DNA 합성 스크리닝과 데이터베이스 출처 추적의 자동 검증 계층으로 유용하지만, 의도적 변조에 대한 견고성은 남은 과제다.