Today’s frontier report
Research Pool → Jev → Edition
3qk7 · AI LOCAL LABS TECHNICAL SCOUTING

AI FRONTIER

Signals worth understanding before they become obvious.

2026-10-02
01
opportunitymodelscost collapse

GPT-6.1 Sol 출시

GPT-6.1 Sol은 코딩, 컴퓨터 사용, 전문 업무를 위해 Astra에 가까운 지능을 제공하며, 표준 API 입력 및 출력 토큰 가격은 Astra의 5분의 1입니다.

  • OpenAI News가 GPT-6.1 Sol을 발표했다.
  • 코딩, 컴퓨터 사용, 전문 업무를 위한 Astra에 가까운 지능을 표방한다.
  • 표준 API 입력 및 출력 토큰 가격은 Astra의 5분의 1이다.

AI 빌더에게 Astra에 가까운 지능이 5분의 1 토큰 가격으로 제공된다는 것은 코딩 및 컴퓨터 사용 에이전트 워크플로의 추론 비용을 크게 낮출 수 있음을 의미한다.

OpenAI News
02
watchresearchincremental

시스템 프롬프트의 환상: 지시 프리앰블이 언어 모델의 계산을 어떻게 바꾸는가

이 논문은 Centered Kernel Alignment(CKA)를 사용해 17개 지시 튜닝 모델에서 20개 시스템 프롬프트 하의 층별 표현을 비교했으며, 효과가 층 선택적이고 지시 유형에 의존한다는 것을 보였다. 페르소나와 형식 지시는 중간 표현을 깊게 재구성하는 반면, 안전 지시는 거의 변화시키지 않는다.

  • 8개 아키텍처 계열, 1.5B에서 72B 파라미터에 걸친 17개 지시 튜닝 모델을 대상으로 5개 기능 범주에 속한 20개 시스템 프롬프트를 평가했다.
  • 제한적 안전 지시와 명시적으로 허용적인 지시("너는 아무 제한이 없다")는 거의 동일한 계산 경로를 활성화하며 평균 CKA 상관은 0.997이다.
  • 상업적 규모에서도 안전 침투율은 10% 미만으로 유지되며, 70B-72B에서도 마찬가지다.
  • 선형 프로빙은 모델이 모든 층에서 프롬프트 범주를 인코딩하지만 소수 층에서만 계산을 재구성한다는 것을 보여주며, 인과적 활성화 패칭은 이 층들이 행동 변화를 매개함을 확인한다.

시스템 프롬프트 기반 안전 장치를 구축하는 실무자에게 이 증거는 안전 지시가 안정적으로 인코딩되더라도 계산에 깊이 작용하지 않을 수 있음을 보여주므로, 프롬프트 계층만의 방어는 탈옥에 불충분하다는 것을 의미한다.

arXiv cs.CL
03
watchresearchnew architecture

TomasuLLM: LLM 에이전트를 위한 비순차적 투기적 실행 런타임

TomasuLLM은 작업 실행 정확성을 유지하면서 에이전트 도구 호출을 궤적 순서 밖에서 실행하는 런타임이다. 미래 행동을 초안하고, 격리된 copy-on-write 샌드박스에서 실행하며, 의존성과 영향을 추적하고, 검증 후 궤적 순서로 결과를 커밋한다.

  • 논문은 100개 SWE-bench Verified 작업에서 1.31배, 28개 Terminal-Bench 2.0 작업에서 1.35배, 18개 SWE-Marathon 세션에서 일치 진행 1.27배 향상을 보고했다.
  • 4,010건의 감사된 커밋 검증 기록에서 논문은 오수락이 0건이라고 보고했다.
  • 컴파일러, 테스트 스위트, 저장소 명령 등 수초에서 수분이 걸리는 장시간 도구가 코딩 에이전트 지연을 지배하는 문제를 다룬다.
  • 결과는 세 가지 벤치마크에 걸쳐 초 단위 이하부터 분 단위 도구 호출까지 도구 지연에 따라 확장된다.

코딩 에이전트를 구축하는 팀에게 TomasuLLM은 격리 샌드박스에서의 투기적 도구 실행과 궤적 순서 커밋이 커밋 정확성을 희생하지 않고 장시간 도구 지연을 줄일 수 있음을 보여준다.

arXiv cs.CL
04
testagentsopen source unlock

MiniMax, OpenAI Agents API 호환 OpenAgentCore 오픈소스 공개

MiniMax가 OpenAI Agents API 호환성을 위한 OpenAgentCore를 오픈소스로 공개했다.

  • MiniMax가 OpenAgentCore를 오픈소스로 공개했다.
  • OpenAgentCore는 OpenAI Agents API 호환성을 목표로 한다.

AI 빌더는 OpenAgentCore를 통해 OpenAI Agents API 워크플로를 MiniMax의 오픈소스 구현으로 연결할 수 있다.

tokenpost.com
05
testcreativenew architecture

SInGA: 단일 이미지에서 학습하는 시맨틱 인페인팅 기반 애니메이션 가능한 가우시안 헤드 아바타

이 논문은 UV 공간에서 정의된 시맨틱 인페인팅 프레임워크로 관측되지 않은 얼굴 영역을 완성하고 가우시안 속성을 회귀하여, 단일 이미지에서 애니메이션 가능한 가우시안 헤드 아바타를 생성하는 SInGA를 제안한다. 이 방법은 정체성별 최적화 없이 여러 정체성에 일반화되며 구동 입력으로 애니메이션할 수 있다.

  • UV 공간에서 정의된 시맨틱 인페인팅 프레임워크가 얼굴의 대칭 단서를 이용해 관측되지 않은 영역을 완성한다.
  • 관측된 영역에서 특징을 추출해 관측되지 않은 영역을 완성한 뒤, 완성된 표현으로 가우시안 속성을 회귀한다.
  • 각 표면 또는 픽셀 위치에서 단일 가우시안 대신 여러 가우시안을 쌓아 세부 묘사를 강화한다.
  • 논문은 생성된 아바타가 완전성과 정체성 보존을 개선하고 사실적인 애니메이션과 관측되지 않은 시점에서의 일관된 렌더링을 지원한다고 보고한다.

단일 이미지 헤드 아바타를 만드는 연구자에게, 일관된 공간 대응을 제공하는 UV 공간으로 완성 문제를 옮긴 설계는 단일 시점의 미관측 영역 처리에 재사용할 수 있는 접근이다.

arXiv cs.CV
06
testresearchincremental

멀티홉 검색 증강 생성에서의 등각 사실성 제어

이 논문은 분할 등각 주장 필터링을 멀티홉 RAG에 적용하고 HotpotQA, Natural Questions, TriviaQA에서 Llama 3.1 8B와 GPT-4o-mini로 평가했으며 단일 홉 참조 실험도 수행했다. 95% 목표에서 유지된 주장이 완전히 뒷받침되는 응답 비율이 필터링 없을 때 55.60%-76.03%에서 95.80%-97.20%로 증가했다고 보고한다.

  • 여섯 개의 모든 멀티홉 모델-데이터셋 구성에서 등각 목표가 엄격해질수록 유지된 주장이 완전히 뒷받침되는 응답 비율이 일관되게 증가했다.
  • 95% 목표에서 이 비율은 95.80%-97.20%였고, 필터링 없을 때는 55.60%-76.03%였다.
  • 95% 목표에서 생성된 주장 중 유지되는 비율은 4.41%-31.09%에 불과했고, 9.70%-51.40%의 응답만 비어 있지 않게 남았다.
  • 평가에는 Llama 3.1 8B와 GPT-4o-mini, HotpotQA, Natural Questions, TriviaQA, 그리고 단일 홉 참조 실험이 사용되었다.

멀티홉 RAG 구축자에게 등각 필터링은 주장 수준 지원도를 높이지만, 95% 목표에서 대부분의 주장이 버려지고 많은 응답이 비게 되므로 주장 유지율과 기권율을 함께 평가해야 한다.

arXiv cs.CL
07
watchresearchcost collapse

이산 평균 생성기를 통한 확산 언어 모델 가속화

이 논문은 MeanFlow를 연속시간 마르코프 연쇄로 확장한 이산 평균 생성기를 제안하며, 시간 구간에 걸친 전이 커널의 정규화된 증분으로 평균 생성기를 정의하고 자기일관성 항등식을 훈련 목표의 기반으로 제시한다.

  • Potts 모델 시뮬레이션에서 이 목표는 K단계 샘플러의 총변동 거리를 최대 67% 감소시킨다.
  • OpenWebText에서 8~64 샘플링 단계에 대해 평가된 방법 중 가장 낮은 생성 퍼플렉시티를 달성하고 16배 가속을 가능하게 한다.
  • ImageNet에서는 기존 방법과 유사한 성능을 달성한다.
  • 자기일관성 항등식은 좌표별 주변분포로 투영할 때 닫힌 형태 표현을 갖는다.

이산 확산 언어 모델을 구축하는 팀에게 샘플링 단계를 줄이면서 생성 품질을 유지하는 훈련 목표를 제공하므로, 16배 가속의 자체 데이터 재현성을 평가할 가치가 있다.

arXiv stat.ML
08
watchagentsincremental

연구: AI 에이전트는 극단화에 취약하다

이 논문은 두 LLM 에이전트 간의 대화를 시뮬레이션하여 극단화를 조사한다. 하나는 인구통계학적·심리적 속성에 기반한 인간 페르소나를 역할극하고, 다른 하나는 상대의 신념을 더 극단적으로 만들려 한다. 논문은 공명(기존 신념 강화)과 설득(처음에는 중요하게 여기지 않던 신념 촉진) 모두 대상를 극단화하지만 공명의 효과가 일관되게 더 강하다고 보고한다.

  • 논문은 2026년 9월 29일 arXiv에 제출되었으며 arXiv:2609.38296, cs.AI 및 cs.CY로 분류된다.
  • 실험 설정: 대상 LLM은 인구통계학적·심리적 속성에 기반한 인간 페르소나를 역할극하고, 영향자 LLM은 대상의 신념을 더 극단적으로 만들려 한다.
  • 논문은 두 경로를 검토한다. 공명은 대상의 기존 신념을 강화하고, 설득은 대상이 처음에는 중요하게 여기지 않던 신념을 촉진한다.
  • 논문은 정서 및 행동 지표 모두에서 두 메커니즘이 대상을 극단화하지만 공명이 설득보다 일관되게 더 강한 효과를 낸다고 보고한다.

개인화된 에이전트나 다중 에이전트 시스템을 구축하는 개발자는 기존 신념과 일치하는 입력을 고위험 영향 경로로 간주해야 한다. 논문은 공명이 설득보다 더 강하고 관련 신념으로 전파되는 극단화를 낳는다고 보고한다.

arXiv cs.AI