📕 이 사이트를 굴린 428커밋의 기록이 상품이 됐습니다 — 전자책·스타터 키트 보기 →
agenwiki

AI 연구

영상 생성 모델도 추론할 수 있을까: OpenCoF 프레임 연쇄 기법

영상 생성 AI가 프레임을 시간 순서로 이어가며 추론하는 Chain-of-Frame 방식을 다룬 OpenCoF 프레임워크와 데이터셋, 모델을 정리한다.

프레임 연쇄(Chain-of-Frame, CoF)는 텍스트 사고 사슬을 영상 생성으로 옮겨, 시간순으로 이어지는 프레임 자체가 중간 추론 단계를 대신하게 하는 방식이다. OpenCoF는 이를 위한 프레임워크로, 11개 과제 계열의 추론 영상 데이터셋 OpenCoF-17K와 미세조정 모델 Wan-CoF를 포함한다. Wan-CoF는 네 개 영상 추론 벤치마크에서 기준 모델 Wan2.2-I2V-A14B 대비 눈에 띄는 향상을 보였다.

대형 모델에서 추론 능력은 이제 핵심 요소로 자리 잡았다. 특히 어떤 판단이 논리적으로 어떤 결과를 낳는지 이해해야 신뢰할 만한 결정을 내릴 수 있는 상황에서 그렇다. 이 글에서 다루는 연구는 텍스트 위주의 사고 사슬(Chain-of-Thought)과는 다른 경로, 즉 시간적으로 연결된 프레임을 따라 추론이 전개되는 방식에 주목한다. 저자들은 이를 프레임 연쇄(Chain-of-Frame, CoF) 추론이라 부른다.

일반적으로 사고 사슬이 텍스트 모델에서 "중간 풀이 과정을 말로 풀어내는 것"이라면, 프레임 연쇄는 이 아이디어를 멀티모달 영역, 그중에서도 영상 생성으로 옮긴 것에 가깝다. 텍스트가 아니라 연속된 장면 자체가 중간 추론 단계를 대신하는 셈이다.

CoF 추론에 왜 전용 설계가 필요한가?

최근의 영상 생성 모델은 이론적으로 프레임을 하나씩 이어가며 추론 과정을 화면 위에 펼칠 수 있다. 그러나 현재 모델 대부분은 일반적인 영상 모음으로만 학습되어 있어, CoF 방식에 맞춘 다양한 감독 신호나 전용 구조가 부족하다. 다시 말해 영상 생성기가 시간축을 따라 논리를 전개하도록 명시적으로 훈련되어 있지 않다는 것이 이 연구가 지목하는 빈틈이다.

이 공백을 메우기 위해 저자들은 OpenCoF라는 프레임워크를 제안한다. 여기에는 11개 과제 계열에 걸친 추론 영상 데이터셋인 OpenCoF-17K와, 다양한 시간적 감독이 CoF 행동을 실제로 개선하는지 살펴보기 위해 미세조정한 영상 모델 Wan-CoF가 포함된다. 네 개의 영상 추론 벤치마크에서 Wan-CoF는 기준 모델인 Wan2.2-I2V-A14B 대비 눈에 띄는 향상을 보였다고 한다.

추론 토큰은 어떻게 작동하나?

저자들은 여기서 한 걸음 더 나아가 CoF 능력을 끌어올리는 더 정교한 설계를 실험한다. 핵심은 모델에 시각 추론 토큰과 텍스트 추론 토큰을 함께 부여하는 것이다. 시각 토큰은 저수준의 시각적 단서를, 텍스트 토큰은 고수준의 의미적 사전 지식을 각각 담당하며, 이렇게 나뉜 역할이 공간적·시간적 추론에 기여한다.

이 토큰들이 실제로 어떤 방식으로 작동하는지는 성능 비교와 어텐션 분석을 통해 검토된다. 저자들은 모델의 깊이, 노이즈 제거 단계, 공간, 시간이라는 여러 축에 걸쳐 각 토큰이 어떻게 관여하는지를 들여다본다. 종합하면, 더 강한 영상 추론을 위해서는 넓은 범위의 시간적 감독과 함께, 중간 추론 상태를 명시적으로 정리해 주는 장치가 둘 다 필요하다는 것이 이들의 결론이다. 연구진은 후속 연구를 돕기 위해 데이터셋, 모델, 코드를 모두 공개했다고 밝힌다.

실무에서 무엇을 고려해야 하나?

텍스트 모델에서 사고 사슬이 그랬듯, 중간 추론 과정을 명시적으로 드러내는 설계는 결과의 신뢰도와 설명 가능성을 함께 높이는 경향이 있다. 영상 생성·이해 제품을 다루는 실무자라면, 최종 결과물만 평가하기보다 그 결과가 어떤 중간 단계를 거쳐 나왔는지를 들여다볼 수 있는 구조를 미리 고려해두는 편이 문제 상황을 진단하기 쉽다. 다만 이런 중간 표현을 추가하면 계산 비용과 데이터 준비 부담도 함께 늘어나므로, 실제 도입 여부는 과제의 요구 수준에 맞춰 판단할 필요가 있다.

또한 텍스트 기반 추론 기법을 다른 모달리티로 옮겨 적용하는 시도 자체가 눈여겨볼 만한 흐름이다. 한 모달리티에서 효과가 검증된 아이디어(여기서는 사고 사슬)를 그대로 이식하기보다, 대상 모달리티의 특성(영상의 경우 시간적 연속성)에 맞춰 다시 설계해야 한다는 점은 멀티모달 제품을 기획할 때 참고할 만한 원칙이다.

자주 묻는 질문

  • Q. 프레임 연쇄와 사고 사슬은 무엇이 다른가?
    • A. 사고 사슬은 텍스트로 중간 풀이를 드러내지만, 프레임 연쇄는 시간순으로 이어진 프레임 자체가 중간 추론 단계를 대신한다.
  • Q. Wan-CoF는 어떻게 학습됐나?
    • A. 11개 과제 계열의 추론 영상 데이터셋 OpenCoF-17K로 미세조정됐고, 네 개 벤치마크에서 기준 모델 Wan2.2-I2V-A14B보다 향상을 보였다.
  • Q. 시각 토큰과 텍스트 토큰의 역할 차이는?
    • A. 시각 토큰은 저수준의 시각적 단서를, 텍스트 토큰은 고수준의 의미적 사전 지식을 담당한다.

함께 보면 좋은 글

출처: arXiv:2607.08763v1 https://arxiv.org/abs/2607.08763v1

관련 글

용어

멀티모달

텍스트뿐 아니라 이미지·영상·음성 등 여러 종류의 데이터를 함께 입력받거나 생성할 수 있는 AI 모델의 특성이다. 하나의 모델이 여러 형태의 정보를 함께 이해하고 연결한다.