AI FRONTIER
Signals worth understanding before they become obvious.
Qwen, Qwen-Image-2.1-Turbo 공개: 8단계 디노이징 텍스트-이미지 생성 및 이미지 편집 가속 체크포인트
Qwen-Image-2.1-Turbo는 Qwen-Image-2.1의 가속 체크포인트로, 8단계 디노이징으로 텍스트-이미지 생성과 이미지 편집을 수행하며 동일한 7B 시각 생성 아키텍처를 사용하고 Diffusers의 QwenImage21Pipeline으로 바로 로드됩니다.
- 권장 8단계 샘플링 스케줄이 체크포인트에 저장되어 자동으로 로드되며, num_inference_steps만 설정해서는 이를 덮어쓸 수 없다.
- 생성은 기본적으로 CFG=1을 사용하고, prefix KV caching으로 텍스트와 참조 이미지 컨텍스트를 디노이징 단계 간에 재사용한다.
- 모델 카드에는 모델 크기 7B 파라미터, 텐서 타입 BF16, 라이선스 Qwen Research License Agreement로 표기되어 있다.
- pipeline 구성 샘플링 sigmas를 지원하는 Diffusers(PR #14950)가 필요하며, CUDA 호환 PyTorch, transformers>=5.17.0, accelerate, pillow 설치가 요구된다.
8단계 스케줄이 체크포인트에 포함되어 빌더는 추론 단계를 줄여 지연을 낮출 수 있지만, 이 스케줄이 기본 적용되고 다른 스케줄은 이 체크포인트에서 평가되지 않았다는 점을 유의해야 한다.
MS, 에이전트 의사결정 특화 모델 ‘Microsoft-Decision-1’ 공개…오픈AI도 Decisions API 정식 출시
마이크로소프트가 구조화된 의사결정 작업에 특화한 AI 모델 ‘Microsoft-Decision-1’을 공개했다. 초기 버전은 Qwen3.5-9B를 기반으로 구축됐으며, 앞으로 마이크로소프트의 MAI와 오픈AI의 다른 모델 기반으로도 확장할 계획이다.
- 초기 버전은 Qwen3.5-9B를 기반으로 구축됐고, 향후 마이크로소프트 MAI와 오픈AI의 다른 모델로 확장할 계획이다.
- 한 번의 추론으로 최대 3만2000 토큰의 긴 입력 컨텍스트를 처리할 수 있다.
- 8가지 방식으로 입력을 변형했을 때 판단이 바뀌는 비율은 평균 1.3%였고, 선택지 설명 변경이나 순서 반전·혼합에서는 판단이 바뀌지 않았다.
- 약 15만개 질문과 36개 벤치마크에서 검증해 비교 대상 가운데 가장 높은 정확도를 기록했고, 속도는 Quyet-1.0-Large보다 4.5배, GPT-6 Sol보다 최대 35배 빨랐다고 MS는 밝혔다.
에이전트 개발자에게 Decision-1은 의사결정을 한 번의 추론으로 보정된 확률 점수로 반환하므로, 확신도 기반 자동 처리와 사람 검토로의 전환을 제어하는 레이어로 바로 쓸 수 있다.
LegalOn, 개발 속도를 유지하면서 Codex 비용 절반으로 감축
LegalOn은 개발 속도를 유지하면서 일일 Codex 추정 비용을 65% 절감했다. Astra, Sol, Luna를 작업에 맞게 배치하고 예산을 전략적으로 관리했다.
- LegalOn은 일일 Codex 추정 비용을 65% 절감했다.
- 비용 절감 후에도 개발 속도를 유지했다.
- Astra, Sol, Luna를 작업에 맞게 배치하고 예산을 전략적으로 관리했다.
AI 빌더에게 이는 작업별 모델 배치와 전략적 예산 관리가 개발 속도를 희생하지 않고 코딩 에이전트 비용을 크게 낮출 수 있음을 보여준다.
Google Research, 에이전트 프라이버시·보안 공개 문제 보고서 발표…Contextual Integrity 기반 제안
Google Research는 50명 이상의 학계 및 산업계 관계자가 참여한 워크숍 보고서를 공개하고, 자율 AI 에이전트의 프라이버시와 보안에서의 기초적 과제를 정리하며 Contextual Integrity 이론에 기반한 시스템·모델·사용자·생태계 차원의 다층적 방어를 제안했다.
- 이 보고서는 2025년 말 뉴욕에서 열린 Google Contextual Agent Privacy and Security (CAPS) Workshop의 결과물로, 50명 이상의 연구자와 산업계 리더가 참여했다.
- 보고서는 에이전트가 전통적 결정론적 소프트웨어와 다른 세 가지 차원으로 비구조적 인터페이스와 입력 모호성(프롬프트 인젝션 등), 확률적 제어 흐름, 자율성과 위임을 제시한다.
- 보고서는 정보가 사용자 작업 공간을 떠나기 전에 데이터 흐름의 적절성을 평가하는 감독 계층의 일부로서 상황 정책 엔진을 제안한다.
- 보고서는 장시간의 복잡하고 연쇄적인 상호작용을 안전하게 시뮬레이션할 수 있는 동적 'Agent Gym' 환경 등 표준화된 다중 에이전트 벤치마크의 필요성을 강조한다.
AI 빌더에게 이 보고서는 Contextual Integrity를 감독 계층과 정책 엔진으로 구현 가능한 설계 방향으로 전환하고, 다중 에이전트 안전 평가의 공유 기준이 부재함을 지적한다.
IROS 논문 1933편을 분석해 본 로보틱스의 6가지 새로운 변화
레이펑왕이 IROS 논문 1933편을 분석해 로보틱스 분야의 6가지 새로운 변화를 정리했다.
- 분석 대상은 IROS 논문 1933편이다.
- 레이펑왕의 분석에서 6가지 새로운 변화가 제시됐다.
로보틱스 연구자에게 IROS 연구 동향을 파악할 수 있는 대규모 문헌 분석 참고 자료가 된다.
Ant×저장대 신연구: AI가 스트리밍 대화에서 감정을 '읽는다' | EMNLP'26
Ant와 저장대의 신연구가 스트리밍 대화 중 AI가 감정을 인식하는 방법을 제안했으며, EMNLP'26에 채택되었다.
- 연구는 Ant와 저장대가 공동으로 수행했다.
- 성과는 EMNLP'26에 채택되었다.
- 연구는 스트리밍 대화에서의 감정 이해에 초점을 맞춘다.
실시간 대화 시스템을 구축하는 개발자에게 스트리밍 환경의 감정 인식은 평가와 설계에 포함할 가치가 있다.
즈둥타이추 오픈소스 대규모 모델, 9개 국제 권위 벤치마크 중 8개 1위
후베이성 경제정보화청에 따르면 즈둥타이추 오픈소스 대규모 모델이 9개 국제 권위 벤치마크 가운데 8개에서 1위를 차지했다.
- 후베이성 경제정보화청에 따르면 즈둥타이추 오픈소스 대규모 모델이 9개 국제 권위 벤치마크 가운데 8개에서 1위를 차지했다.
AI 개발자에게 즈둥타이추가 9개 국제 권위 벤치마크 중 8개에서 1위를 차지했다는 점은 오픈소스 모델 평가에서 새로운 강력한 비교 기준이 된다는 의미다.
수율 개선은 “LLM만으로는 불충분”…미국 AI 신생기업, 전통 AI와 결합해 답변 검증
EE Times Japan에 따르면 미국 AI 신생기업은 수율 개선에 LLM만으로는 불충분하다고 보고, LLM을 전통 AI와 결합해 답변을 검증하는 접근을 시도한다.
- EE Times Japan은 수율 개선이 “LLM만으로는 불충분”하다고 보도했다.
- 해당 미국 AI 신생기업은 LLM과 전통 AI를 결합해 답변을 검증한다.
AI 빌더에게 이 신호는 수율 개선에 LLM 단독이 아니라 전통 AI 결합과 답변 검증이 필요함을 시사한다.