크로스모달융합1 Ovi 멀티모달 AI (크로스모달 융합, 립싱크, AV 동기화) 지금까지 AI 영상 제작은 보통 영상을 먼저 만들고, 음악이나 효과음을 따로 얹는 방식이었습니다. Character AI와 Yale University가 공동 개발한 Ovi 모델은 이 전제를 바꿉니다. 오디오와 영상을 처음부터 함께 생성하기 때문입니다. 이 글에서는 Ovi의 구조와 립싱크 성능, 실제 콘텐츠 제작에서의 의미를 정리했습니다.크로스모달 융합, 두 신경망이 함께 학습하는 구조일반적으로 "멀티모달 AI"라고 하면 여러 형식의 데이터를 다룰 수 있다는 정도로만 알고 있는 분들이 많습니다. 하지만 Ovi가 채택한 트윈 백본 크로스모달 융합(Twin Backbone Cross-Modal Fusion) 구조는 그보다 훨씬 구체적인 이야기입니다. 쉽게 말하면, 비디오와 오디오를 각각 전담하는 두 개의 신.. 2026. 9. 23. 이전 1 다음