AI FRONTIER
Signals worth understanding before they become obvious.
Diffusion Controller가 AI 이미지 생성을 통합하고 단순화하는 방법
Google Research는 확산 디노이징 과정을 연속 제어 문제로 재정식화하는 경량 "스티어링 댐퍼" 네트워크 Diffusion Controller를 제안했다. 동결된 기반 모델을 변경하지 않고 프롬프트 정렬과 이미지 품질을 높인다.
- 논문은 Stable Diffusion v1.4 기반에서 SFT, RWL, PPO 세 가지 미세조정 방식을 평가했고, HPS-v2로 사용자 프롬프트 및 미적 선호와의 정렬을 측정했다.
- SFT와 RWL 실험에서 그레이박스 Diffusion Controller 스티어링 댐퍼 네트워크는 HPS-v2 승률에서 LoRA를 앞섰으며, 변경한 내부 모델 레이어 수는 LoRA보다 훨씬 적었다.
- 논문은 완전 개방 버전(화이트박스, 내부 가중치 변경 가능)이 기준 모델 대비 90% 승률을 달성했다고 보고한다.
- 프레임워크는 Diffusion Controller, Diffusion Controller-Naive, Diffusion Controller-J, Diffusion Controller-S 네 가지 네트워크 구조를 포함한다.
빌더에게 이는 화이트박스 접근 없이 폐쇄형 이미지 모델을 세밀하게 제어할 수 있고, 제어 계층이 모델 핵심과 분리되어 개인화, 안전, 비디오 생성으로 확장하기 쉽다는 것을 의미한다.
Model Context Protocol을 활용한 LLM 에이전트와 데이터 스페이스의 아키텍처 중재
이 논문은 Model Context Protocol (MCP) 기반의 아키텍처 중재 방식을 제안하고 Eunomia Agent로 구현하여, LLM 에이전트가 거버넌스 제약을 유지하면서 데이터 스페이스 서비스와 상호작용할 수 있게 한다. 프로토타입은 기존 데이터 스페이스 구성 요소를 수정하지 않고 카탈로그 탐색, 메타데이터 조회, 데이터 서비스 호출의 종단 간 상호작용을 검증했다.
- 논문은 2026년 9월 24일 arXiv에 제출되었으며 arXiv:2609.30341, cs.AI 및 cs.DB로 분류된다.
- 중재 계층은 데이터 스페이스 기능을 구조화된 스키마 기반 도구로 변환하여 AI 에이전트가 발견하고 호출할 수 있게 하면서 거버넌스 제약을 보존한다.
- 프로토타입 구현은 기존 데이터 스페이스 구성 요소를 수정하지 않고 카탈로그 탐색, 메타데이터 조회, 데이터 서비스 호출에 걸친 종단 간 상호작용을 검증했다.
- 저자는 Jaime Alonso Ruiz, Carlos Aparicio, Gabriel Huecas, Joaquín Salvachúa, Andres Munoz-Arcentales이다.
AI 에이전트를 만드는 팀에게 이 연구는 MCP를 중재 계층으로 사용해 기존 데이터 인프라를 바꾸지 않고 거버넌스가 적용된 데이터 스페이스에 연결할 수 있음을 시사한다.
HybridInfer: 온디바이스·엣지·클라우드 LLM 추론을 위한 열 인식 강화학습 계층 라우팅
HybridInfer는 온디바이스 Llama 3.2 3B, 검색을 결합한 엣지 Llama 3.1 8B, 클라우드 GPT-4o의 3계층 구조에서 스마트폰의 열 여유와 쿼리 복잡도 추정을 상태로 사용하고, 오프라인으로 학습된 Q-learning 정책으로 추론 계층을 선택하는 열 인식 강화학습 라우터를 제안한다.
- 실제 Android 하드웨어(Samsung Galaxy S25+, Snapdragon 8 Elite)에서 210개 프롬프트로 평가한 결과, 학습된 라우터는 두 개의 수동 튜닝 휴리스틱보다 유의하게 높은 품질을 달성했고(대응 Wilcoxon, p < 0.02), 모든 적응형 조건 중 가장 낮은 비용을 기록했다.
- 논문 보고: 플래그십 Snapdragon 기기에서 지속적인 온디바이스 생성은 GPU 추론 런타임을 불안정하게 만들어 연속 몇 번의 쿼리 후 충돌하거나 조용히 멈춘다. 원인은 OpenCL 커널 컴파일과 모바일 GPU의 긴 프롬프트 프리필이다.
- 논문 보고: 항상 온디바이스 조건은 서비스 가능한 쿼리에서 쿼리당 품질은 비슷하지만 3~6배 느리고 긴 쿼리에서 실패한다.
- 보상은 품질과 지연, 비용, 열 페널티를 절충하며 온디바이스 실행을 보상하는 지역성 보너스를 포함한다. 논문은 이 보너스가 없으면 최적 정책이 모든 쿼리를 오프로드한다고 밝힌다.
온디바이스 LLM 배포에서 열 제약은 단순한 속도 저하가 아니라 런타임 안정성 문제이므로, 라우팅 설계는 품질과 지연뿐 아니라 열 상태와 지역성 인센티브를 정책에 포함해야 한다.
XingChen-AGI, 1.2B 파라미터 문서 파싱 VLM TeleOCR 공개
TeleOCR는 약 1.2B 파라미터의 오픈소스 비전-언어 모델로, 디지털 문서와 카메라 촬영 문서 파싱을 하나의 프레임워크로 통합하며 가중치와 기술 보고서가 공개되었습니다.
- 모델 카드에 따르면 파라미터 수는 약 1.2B이고 라이선스는 apache-2.0이며 중국어와 영어를 지원하고 qwen2_5_vl 기반입니다.
- OmniDocBench v1.6에서 TeleOCR는 Overall 96.87, Text Edit 0.027, Formula CDM 96.36, Table TEDS 97.05를 보고했습니다.
- Dr.DocBench Challenge에서 TeleOCR는 Overall 67.96을 보고해 MinerU 2.5 Pro의 62.26, PaddleOCR-VL 1.6의 55.11보다 높았습니다.
- 모델 카드는 TeleOCR가 왜곡 보정 전처리나 전용 교정 모델 없이 왜곡된 문서의 레이아웃과 내용을 파싱한다고 설명합니다.
문서 파싱 파이프라인을 만드는 개발자에게 TeleOCR는 약 1.2B 파라미터로 여러 공개 벤치마크 선두를 보고하고 가중치와 GGUF 변환을 제공하므로 경량 자체 호스팅 파싱 후보가 됩니다.
Qwen, Qwen-Image-2.1 오픈소스 공개: 7B 파라미터로 텍스트-이미지 생성과 이미지 편집 통합
Qwen이 텍스트-이미지 생성과 이미지 편집을 통합한 Qwen-Image-2.1을 오픈소스로 공개했습니다. 시각 생성 구성 요소는 7B 파라미터, 32개 Single-Stream DiT 레이어이며 네이티브 투명(RGBA) 이미지 생성과 편집을 지원합니다.
- 시각 생성 구성 요소는 7B 파라미터이며 32개 Single-Stream DiT 레이어를 포함한다.
- 최대 10장의 참조 이미지를 지원하고 원, 페인트 주석 또는 별도 마스크로 국소 편집을 지정할 수 있다.
- 1:1, 4:3, 3:4, 3:2, 2:3, 16:9, 9:16 화면 비율을 지원하며 예시 해상도는 최대 2752×1536이다.
- 라이선스는 Qwen Research License Agreement이며 모델 페이지에는 지난달 다운로드 수 64,362가 표시된다.
단일 7B 모델이 텍스트-이미지 생성, RGBA 투명 레이어 생성, 다중 참조 이미지 편집을 함께 처리하므로 생성용과 편집용 모델을 따로 배포할 필요를 줄일 수 있습니다.
프런티어 AI 훈련을 위한 안전 사례 초기 지침
OpenAI가 프런티어 AI 훈련의 안전 사례에 관한 초기 지침을 공개했으며, 여기에는 기술적 보호 조치, 운영 관행, 정렬 오류 사건 조사가 포함된다.
- 지침은 기술적 보호 조치, 운영 관행, 정렬 오류 사건 조사를 다룬다.
- 초기 단계 지침으로 제시되었다.
프런티어 모델 훈련을 담당하는 팀은 이 세 영역을 내부 안전 사례 문서의 출발점으로 삼을 수 있다.
TaichuAI, 공간 추론과 에이전트 도구 사용을 지원하는 ZDTaichu5.0-9B 멀티모달 파운데이션 모델 공개
ZDTaichu5.0-9B는 TaichuAI가 공개한 멀티모달 파운데이션 모델로, Qwen3.5-9B 언어 백본과 C-RADIOv4-H 비전 인코더를 결합해 텍스트, 이미지, 비디오의 임의 해상도 입력을 지원하며 일반 시각 이해, 공간 추론, 에이전트 도구 사용, 임바디드 AI 연구를 대상으로 합니다.
- 파라미터 수는 9.8B, 텐서 유형은 BF16, 컨텍스트 길이는 최대 128K tokens입니다.
- 모델 카드는 TAU2-Bench에서 87.7, Claw-Eval에서 71.4, IFEval에서 93.7 점수를 보고합니다.
- 모델 카드는 ERQA에서 48, RoboSpatial에서 56 점수를 보고합니다.
- 가중치는 NVIDIA Open Model License Agreement에 따라 제공되며 Qwen3.5의 Apache-2.0 라이선스가 유지됩니다.
비전 에이전트나 임바디드 AI 파이프라인을 구축하는 개발자에게 이 모델은 10B 규모에서 공간 추론과 도구 호출을 함께 제공하지만, 도구 실행은 주변 애플리케이션이 구현하고 검증하고 보호해야 합니다.