3qk7 · AI LOCAL LABS
TECHNICAL SCOUTING
AI FRONTIER
Signals worth understanding before they become obvious.
2026-10-05
01
watchresearchnew architecture
Google Research의 Diffusion Controller, AI 이미지 생성 제어를 통합하고 단순화
Google Research는 확산 모델의 디노이징 과정을 연속 제어 문제로 다루는 경량 '스티어링 댐퍼' 네트워크 Diffusion Controller를 제안했다. 기반 모델을 수정하지 않고도 프롬프트 정렬과 이미지 품질을 높일 수 있다.
- Stable Diffusion v1.4 백본에서 SFT, RWL, PPO 세 가지 미세조정 방식으로 평가했고, HPS-v2로 사용자 프롬프트 및 심미적 선택과의 정렬도를 측정했다.
- SFT와 RWL에서 그레이박스 Diffusion Controller 스티어링 댐퍼 네트워크는 HPS-v2 승률에서 LoRA를 앞섰으며, 변경한 내부 모델 레이어 수는 훨씬 적었다.
- 논문은 완전 개방 버전(화이트박스, 내부 가중치 변경 가능)이 기준 모델 대비 90% 승률을 기록했다고 보고한다.
- 이 네트워크는 접근이 제한된 클로즈드소스 모델에도 부착할 수 있고, 추론 시 단일 가이던스 강도 파라미터로 제약 강도를 동적으로 조절할 수 있다.
빌더에게 이는 화이트박스 가중치 없이도 클로즈드소스 이미지 모델의 동작을 경량으로, 강도 조절 가능하게 유도해 맞춤화와 정렬 비용을 낮출 수 있음을 뜻한다.
02
testmodelsopen source unlock
Cloudflare/clef-flash: 단일 순전파로 구조화 확률을 출력하는 9B 멀티모달 의사결정 모델
Cloudflare가 Qwen/Qwen3.5-9B에서 후속 학습된 9B 멀티모달 모델 clef-flash를 공개했다. 이 모델은 상태와 타입화된 질문 스키마를 의사결정으로 변환하고, 단일 순전파에서 각 질문의 모든 허용 옵션에 대한 확률을 반환하며 자유 형식 텍스트 생성은 하지 않는다.
- Qwen/Qwen3.5-9B와 그 비전 인코더에서 후속 학습되었으며 표준 샤딩 safetensors로 저장된다.
- 입력은 텍스트, JSON, 이미지, 비디오를 지원하고 출력은 각 질문의 각 허용 옵션당 하나의 logit이며 질문별 softmax로 확률을 얻는다.
- 라이선스는 Apache-2.0이며 기본 모델 Qwen/Qwen3.5-9B를 따른다.
- 단일 H200에서 torch 2.11과 transformers 5.10.2로 테스트되었고 이미지 및 비디오 입력에는 pillow도 필요하다.
자유 형식 생성 대신 구조화된 의사결정이 필요한 AI 빌더에게 clef-flash는 Jev/SystemOne API에 바로 연결할 수 있는 9B 단일 순전파 확률 출력 솔루션을 제공한다.
03
testcreativeincremental
Qwen, Qwen-Image-2.1 공개: 7B 통합 텍스트-이미지 생성 및 편집 모델
Qwen이 텍스트-이미지 생성과 이미지 편집을 통합한 Qwen-Image-2.1을 오픈소스로 공개했다. 시각 생성 구성 요소는 7B 파라미터와 32개 Single-Stream DiT 레이어로 이루어진다.
- 시각 생성 구성 요소는 7B 파라미터이며 32개 Single-Stream DiT 레이어를 포함한다.
- 최대 10장의 참조 이미지를 지원하고 원, 페인트 주석, 별도 마스크로 국소 편집을 지정할 수 있다.
- 1:1, 4:3, 3:4, 3:2, 2:3, 16:9, 9:16 비율을 지원하며 예시 해상도는 최대 2752×1536이다.
- 라이선스는 Qwen Research License Agreement이며 지난달 다운로드 수는 90,003이다.
하나의 모델로 텍스트 생성, 투명 레이어 생성, 다중 참조 이미지 편집을 처리할 수 있어 크리에이티브 파이프라인의 모델 구성을 줄일 수 있다.