본문 바로가기
AI·테크

Ovi 멀티모달 AI (크로스모달 융합, 립싱크, AV 동기화)

by insight46013 2026. 9. 23.

지금까지 AI 영상 제작은 보통 영상을 먼저 만들고, 음악이나 효과음을 따로 얹는 방식이었습니다. Character AI와 Yale University가 공동 개발한 Ovi 모델은 이 전제를 바꿉니다. 오디오와 영상을 처음부터 함께 생성하기 때문입니다. 이 글에서는 Ovi의 구조와 립싱크 성능, 실제 콘텐츠 제작에서의 의미를 정리했습니다.

크로스모달 융합, 두 신경망이 함께 학습하는 구조

일반적으로 "멀티모달 AI"라고 하면 여러 형식의 데이터를 다룰 수 있다는 정도로만 알고 있는 분들이 많습니다. 하지만 Ovi가 채택한 트윈 백본 크로스모달 융합(Twin Backbone Cross-Modal Fusion) 구조는 그보다 훨씬 구체적인 이야기입니다. 쉽게 말하면, 비디오와 오디오를 각각 전담하는 두 개의 신경망 백본(Backbone)이 동시에 학습하면서 중간 레이어에서 서로 정보를 주고받는 구조입니다. 각자 처리하되 완전히 따로 놀지는 않는, 일종의 "공조 체계"라고 보면 됩니다.

이 설계가 중요한 이유는 시간적 동기화(Temporal Synchronization), 즉 소리와 영상이 시간축 위에서 정확히 맞물리는 것을 모델 내부에서 자동으로 처리하기 때문입니다. 기존의 Text-to-Video 모델인 Runway Gen-2나 Pika Labs는 영상을 먼저 만들고 오디오를 후처리(Post-processing) 방식으로 붙입니다. 후처리란 영상 완성 후 별도 단계에서 음향을 추가하는 방식으로, 립싱크 오차나 감정 불일치가 생기기 쉬운 구조입니다. 이런 방식에서는 인물이 말하는 장면에서 입 모양과 목소리가 미세하게 어긋나는 문제가 자주 생깁니다.

Ovi는 이 문제를 구조 차원에서 접근합니다. 오디오 브랜치는 5B 파라미터 규모로 처음부터 새롭게 학습(Pretrain from Scratch)했고, 비디오 브랜치는 Wan 2.2 기반으로 강화했습니다. 여기에 두 브랜치를 잇는 1B 규모의 퓨전 네트워크(Fusion Network)가 오디오와 영상 간 미세한 상호작용을 통합합니다. 전체 파라미터는 약 11B로, 결코 가볍지 않은 모델입니다. 논문은 arXiv에 공개되어 있으며(출처: arXiv:2510.01284), Hugging Face에서도 모델 가중치를 직접 받아볼 수 있습니다.

립싱크 정밀도, 기대와 현실 사이

Ovi에서 가장 주목할 부분은 립싱크(Lip-sync) 정밀도입니다. 립싱크란 인물의 입 모양이 발화되는 음성과 정확히 일치하는 것을 의미합니다. 이 기술은 딥페이크 탐지 연구에서도 핵심 변수로 다뤄질 만큼, 실제감에 직결되는 요소입니다. Ovi 연구팀은 이 동기화를 별도의 얼굴 인식(Face Bounding Box) 알고리즘 없이 순수하게 데이터 기반 학습만으로 구현했다고 밝혔습니다.

프로젝트 홈페이지에 공개된 예시 영상들을 보면, 실제로 인물의 대사와 입 움직임이 상당히 자연스럽게 맞아떨어집니다. 특히 "Enjoy this moment"나 "And I need you to trust them" 같은 짧은 문장 대사에서는 감정 톤과 억양, 배경의 환경음이 한 덩어리로 느껴질 정도입니다. 야외 소음이나 극적인 배경음악이 영상 분위기와 녹아드는 방식도 후처리 방식보다 훨씬 덜 인공적입니다.

다만 한계도 분명히 있습니다. 다화자 대화(Multi-Person Dialogue), 즉 여러 인물이 동시에 대화하는 장면은 이론상 지원하지만, 프롬프트를 정밀하게 짜지 않으면 타이밍이 미묘하게 어긋납니다. 세밀한 템포 변화나 감정 강도를 프롬프트 한 줄로 통제하는 건 여전히 어려운 일입니다. Ovi가 그 간격을 상당히 좁힌 것은 사실이지만, 완전히 없앴다고 보기는 아직 이릅니다.

Ovi가 기존 모델들과 구체적으로 어떻게 다른지 정리하면 다음과 같습니다.

  1. 기존 T2V 모델(Wan 2.2, Runway Gen-2 등): 영상 생성 후 오디오를 별도 후처리 단계에서 합성 → 립싱크 오차 발생 가능성 높음
  2. Ovi: 오디오·비디오 브랜치를 동시에 학습, 중간 레이어에서 퓨전 → 시간적 동기화와 의미적 일관성을 구조적으로 확보
  3. 입력 형식: T2AV(텍스트→오디오+비디오), I2AV(이미지→오디오+비디오), T2I2V(텍스트→이미지→비디오) 세 가지 모드 지원
  4. 출력 해상도: 기본 720×720(24FPS, 5초), 960×960 이상 고해상도로도 자연스럽게 확장 가능
  5. 하드웨어 요구사항: fp8/qint8 양자화 적용 시 24GB VRAM 단일 GPU에서도 구동 가능

AV 동기화가 실제 콘텐츠 제작에 주는 의미

멀티모달 생성 도구의 가장 큰 벽은 기술적 오류보다 "연출의 통제권" 문제입니다. 배경음악이 너무 강해서 대사가 묻히거나, 효과음이 장면의 감정선과 맞지 않는 경우가 대표적입니다. 이런 문제는 프롬프트를 아무리 수정해도 완전히 해결되지 않아, 결국 후가공 편집 단계에서 사람이 개입해야 했습니다.

Ovi는 <S>…<E> 태그로 대사를 명시하고, <AUDCAP>…<ENDAUDCAP> 태그로 사운드 분위기를 지정하는 방식으로 이 통제권을 프롬프트 수준에서 일부 가져옵니다. 맥락 기반 사운드 생성(Contextual Sound Generation)이라는 개념으로, 텍스트에 묘사된 상황에 맞춰 사운드 효과(SFX)나 배경 음악(BGM)을 자동으로 넣습니다. "창문을 닫았다"는 서술이 들어가면 창문 닫는 소리가, "스튜디오에서 마이크에 말하는 장면"이라고 묘사하면 마이크 특유의 낮은 배경 잡음과 울림이 자연스럽게 얹히는 식입니다.

방향 자체는 긍정적이지만, 짚고 넘어갈 점이 있습니다. 오디오-비디오 동기화(AV Synchronization), 즉 소리와 화면이 자동으로 맞물리는 기술이 정밀해질수록 딥페이크 생성의 진입 장벽도 함께 낮아진다는 점입니다. 특히 인체 중심 AV 생성(Human-Centric AV Generation), 즉 실제 인물의 대사·감정·표정을 정교하게 재현하는 데 최적화된 모델이라면 더욱 그렇습니다. Ovi 프로젝트가 Apache License 2.0으로 상업적 사용까지 허용하고 있다는 점을 감안하면, 이 기술이 어떤 맥락에서 쓰일지에 대한 사회적 논의가 기술 발전 속도를 따라가야 할 것으로 보입니다. 딥페이크 탐지 연구 현황은 한국인터넷진흥원(KISA)을 비롯한 기관에서도 지속적으로 업데이트되고 있으니 관심 있으신 분은 참고하시면 좋겠습니다.

이런 종류의 AI 도구는 "이게 나를 대신해줄 수 있을까"를 먼저 따지기보다 "이게 내 작업의 어느 단계에서 쓸모 있을까"를 먼저 따져야 오래 씁니다. Ovi는 서사를 설계하거나 감정선을 구성하는 역할을 대체하지 않습니다. 하지만 그 서사를 빠르게 시청각화하고 초안 수준의 장면 감을 잡는 용도로는, 지금까지 나온 것들 중 가장 완성도 있는 선택지 중 하나가 될 수 있다고 봅니다.

자주 묻는 질문

Q. Ovi 모델은 일반 PC에서도 실행할 수 있나요?

A. fp8 또는 qint8 양자화 버전과 CPU Offload 설정을 조합하면 24GB VRAM 환경, 즉 RTX 4090 단일 GPU에서도 구동이 가능합니다. 다만 그 경우 처리 시간이 약 140초 수준으로 길어집니다. 일반적으로 상용 AI 영상 도구보다 하드웨어 요구 사항이 높은 편이므로, 로컬 실행보다는 클라우드 GPU 환경을 먼저 고려하시는 편이 현실적입니다.

Q. Ovi와 기존 Text-to-Video 모델의 가장 큰 차이가 뭔가요?

A. 핵심 차이는 오디오를 "나중에 붙이느냐, 처음부터 함께 만드느냐"입니다. Runway Gen-2나 Pika Labs 같은 기존 모델은 영상을 먼저 생성하고 오디오를 후처리 단계에서 합성합니다. 반면 Ovi는 트윈 백본 구조로 두 모달리티를 동시에 학습하기 때문에 립싱크 정밀도와 감정 일치도가 구조적으로 더 높습니다. 공개된 예시를 보면 이 차이는 짧은 대사 클립에서 특히 두드러집니다.

Q. Ovi로 만든 영상을 상업적으로 사용해도 되나요?

A. Ovi 프로젝트 자체는 Apache License 2.0으로 공개되어 상업적 사용과 수정·배포가 허용됩니다. 그러나 비디오 브랜치가 Wan 2.2 기반으로 학습되었기 때문에, Wan 2.2의 별도 라이선스 조건을 반드시 확인해야 합니다. 라이선스 조건은 변경될 수 있으므로 사용 전 Hugging Face 모델 페이지에서 최신 내용을 직접 확인하시길 권장합니다.

Q. 프롬프트 작성 시 <S>, <AUDCAP> 태그는 꼭 써야 하나요?

A. 필수는 아니지만, 써야 원하는 결과에 가까워집니다. <S>…<E> 태그는 대사 구간을 명시하고, <AUDCAP>…<ENDAUDCAP> 태그는 배경음 분위기를 지정하는 역할입니다. 태그 없이 일반 텍스트만 입력하면 모델이 자체 판단으로 오디오를 생성하므로 의도와 다른 결과가 나올 가능성이 높습니다. 세밀한 연출을 원한다면 두 태그를 함께 활용하는 방식이 훨씬 효과적입니다.

Q. Ovi는 한국어 대사도 자연스럽게 생성하나요?

A. 현재 공개된 정보 기준으로, Ovi의 학습 데이터는 Character AI가 자체 구축한 고품질 오디오 데이터셋 중심으로 구성되어 있어 영어 대사에서 가장 안정적인 결과를 보입니다. 한국어를 포함한 비영어권 언어에서의 립싱크 정밀도는 아직 충분히 검증된 정보가 없으며, 일반적으로 언어별 데이터 분포가 다화자 대화 품질에 직접 영향을 미치는 경향이 있습니다.

결국 Ovi가 보여주는 것은 "AI가 영상을 만든다"는 차원을 넘어 "AI가 장면을 재현한다"는 방향으로 기술이 이동하고 있다는 신호입니다. 이 기술을 무조건 환영하기보다는, 어디에 쓸 수 있고 어디에는 여전히 인간의 손이 필요한지를 따져보는 쪽이 더 생산적입니다. 관심 있으신 분은 arXiv 논문과 Hugging Face 모델 페이지를 직접 확인해보시길 권합니다. 기술 문서를 읽는 것 자체가 이 도구를 어떻게 써야 할지 감을 잡는 가장 빠른 방법이기도 합니다.


참고: https://discuss.pytorch.kr/t/ovi-ai-feat-character-ai/8009
https://arxiv.org/abs/2510.01284