AI 학습용 데이터에 하나하나 정답(레이블)을 붙이는 라벨링 작업은 지루하고 비용이 많이 드는 일입니다. 자기지도학습(SSL, Self-Supervised Learning)은 이 문제를 다른 방향에서 풉니다. 데이터가 스스로 정답을 만들어내도록 설계하는 것입니다. 이 글에서는 지도학습과의 차이, 사전텍스트 작업과 대조학습의 원리, 그리고 한계까지 정리했습니다.

지도학습 비교: 정답을 직접 만드는 일의 고통
기존 AI 학습의 기본은 지도학습(Supervised Learning), 즉 정답 레이블이 붙은 데이터로 모델을 훈련시키는 방식이었습니다. 지도학습이란 모델의 예측값과 사람이 직접 붙인 정답(기준값, Ground Truth)을 비교해 오차를 줄여가는 학습 방식을 뜻합니다. 결과가 명확하고 정확도가 높은 것이 장점입니다.
문제는 그 정답을 만드는 과정입니다. 이미지 한 장에서 각 객체의 경계를 픽셀 수준으로 구분하는 인스턴스 분할(Instance Segmentation) 작업은 전문가가 하루 종일 매달려도 몇백 장을 넘기기 어렵습니다. 이 방식으로는 대규모 AI 모델을 훈련하는 데 구조적인 한계가 있을 수밖에 없습니다.
실제로 지도학습이 높은 성능을 내는 건 사실이지만, 고품질 레이블 데이터를 확보하는 비용과 시간은 대부분의 기업과 연구자가 감당하기 어려운 수준입니다. 특히 의료 영상처럼 전문 자격을 갖춘 사람만 주석을 달 수 있는 분야에서는 이 병목이 훨씬 심각하게 나타납니다. 그래서 자기지도학습이 주목받기 시작했습니다.
사전텍스트 작업: 데이터가 스스로 문제를 내는 방식
자기지도학습의 핵심은 사전텍스트 작업(Pretext Task)에 있습니다. 사전텍스트 작업이란 레이블이 없는 데이터에서 모델이 스스로 의미 있는 표현을 학습하도록 설계된 훈련 과제를 뜻합니다. 쉽게 말해, 데이터 자체에서 문제와 정답을 동시에 뽑아내는 구조입니다.
가장 대표적인 방식은 마스킹(Masking) 기법입니다. 문장에서 단어 몇 개를 지우고, 모델에게 그 빈칸을 채우게 합니다. 정답은 원본 문장 그 자체입니다. 사람이 아무것도 추가하지 않아도 됩니다. BERT가 바로 이 방식으로 사전 학습됩니다. BERT란 구글이 2018년 공개한 양방향 트랜스포머 기반 언어 모델로, 마스킹된 단어를 앞뒤 문맥을 모두 참고해 예측하도록 훈련됩니다.
또 다른 방식은 자기회귀(Autoregressive) 모델링입니다. 자기회귀란 과거의 데이터를 바탕으로 다음 데이터를 예측하는 방식으로, GPT 계열 모델이 대표적입니다. 문장의 앞부분을 주고 다음 단어를 맞히는 식입니다. 원본 문장이 정답 역할을 하니 레이블이 필요 없습니다. 이런 사전텍스트 작업들을 통해 모델은 나중에 번역, 요약, 질의응답 같은 다운스트림 작업(Downstream Task), 즉 실제 목적 과제에 바로 활용할 수 있는 언어 표현을 배우게 됩니다.
오토인코더(Autoencoder)도 같은 철학을 공유합니다. 오토인코더란 입력 데이터를 압축했다가 다시 원본에 가깝게 복원하도록 훈련된 신경망입니다. 이 과정에서 모델은 데이터의 핵심 패턴만 추려내는 법을 배웁니다. 이를 변형한 변이형 오토인코더(VAE, Variational Autoencoder)는 잠재 공간을 확률 분포로 표현해 새로운 이미지를 생성하는 데 쓰이며, OpenAI의 초기 DALL-E 모델에도 활용된 기술입니다.
세 가지 대표적인 사전텍스트 작업 방식을 정리하면 이렇습니다.
- 마스킹(Masking): 데이터 일부를 가리고 원본을 기준값으로 예측 — BERT 계열 언어 모델에 활용
- 자기회귀(Autoregressive): 이전 시퀀스를 바탕으로 다음 값을 예측 — GPT, LLaMA, Claude 계열 언어 모델에 활용
- 오토인코딩(Autoencoding): 입력을 압축·복원하며 핵심 표현 학습 — 이미지 합성, 노이즈 제거, VAE 등에 활용
대조학습: 비슷한 것과 다른 것을 구분하는 눈
사전텍스트 작업이 "빈칸을 채우는" 방식이라면, 대조학습(Contrastive Learning)은 "무엇이 같고 무엇이 다른가"를 배우는 방식입니다. 이는 사람이 세상을 배우는 방식과도 꽤 닮았습니다.
대조학습이란 여러 데이터 샘플을 묶어 유사한 쌍(양성 쌍)과 다른 쌍(음성 쌍)을 구분하도록 모델을 훈련시키는 방식입니다. 예를 들어 같은 이미지를 무작위로 회전하거나 색상을 바꾸거나 일부를 잘라낸 두 버전을 양성 쌍으로 묶고, 전혀 다른 이미지는 음성 쌍으로 처리합니다. 이 과정에서 데이터 증강(Data Augmentation), 즉 원본 데이터에 다양한 변형을 가해 새로운 학습 샘플을 만드는 기법이 핵심 역할을 합니다.
SimCLR이나 MoCo 같은 모델이 이 방식을 씁니다. 이 모델들이 주목받는 이유는 레이블 데이터가 극소량이어도 강력한 성능을 내기 때문입니다. 실제로 전체 학습 데이터의 1%만 레이블링한 상태에서 미세 조정했을 때 ImageNet 데이터셋 기준 80% 이상의 정확도를 달성했다는 결과는, 지도학습 방식의 대표 모델인 ResNet50과 비교해도 뒤지지 않는 수치입니다(출처: SimCLR 논문, arXiv).
대조학습의 변형인 비대조학습(Non-Contrastive Learning)도 있습니다. 비대조학습이란 음성 쌍 없이 양성 쌍만으로 모델을 훈련시키는 방식으로, BYOL이나 Barlow Twins 같은 모델이 여기에 속합니다. 음성 샘플을 따로 관리할 메모리 뱅크가 필요 없어 계산 비용이 줄어든다는 실용적인 장점이 있습니다. 또한 대조학습은 멀티 모달 학습(Multimodal Learning)으로도 확장됩니다. CLIP이 대표적인데, 이미지와 텍스트 쌍을 수백만 개 학습해 "이 이미지에 어떤 캡션이 맞는가"를 배웁니다. 사람이 레이블을 붙이지 않아도 인터넷에 널린 이미지-텍스트 쌍이 그대로 학습 데이터가 됩니다.
편향 흡수의 위험, 그리고 인간 개입의 역할
자기지도학습은 레이블도 필요 없고 대규모 데이터도 알아서 소화하니 완벽한 방식처럼 보일 수 있습니다. 하지만 모델이 예상치 못한 패턴을 정답처럼 학습하는 문제가 있습니다.
자기지도학습의 핵심 전제는 "데이터 안에 의미 있는 구조가 있다"는 것입니다. 그런데 인터넷에서 긁어온 수십억 개의 텍스트와 이미지에는 편향(Bias), 즉 특정 집단이나 관점에 치우친 왜곡된 패턴도 고스란히 담겨 있습니다. 모델은 유용한 언어 표현과 해로운 편향을 구분하지 않고 함께 학습합니다. 이 문제는 GPT-3처럼 주로 자기지도학습으로 훈련된 모델이 왜 이후에 인간 피드백 기반 강화학습(RLHF, Reinforcement Learning from Human Feedback), 즉 인간 평가자의 선호를 반영해 모델의 출력을 정제하는 추가 훈련을 거쳐야 했는지를 설명합니다(출처: OpenAI InstructGPT 연구).
이는 기술의 한계라기보다 설계의 문제에 가깝습니다. 데이터가 많다고 학습이 좋아지는 게 아니라, 어떤 데이터를 어떤 구조로 학습시키느냐가 결정적입니다. 자기지도학습이 아무리 정교해져도, 그 방향을 잡아주는 인간의 개입은 여전히 핵심입니다. 의료 영상 분야에서 SSL 활용 사례가 2019년에서 2021년 사이 1,000% 이상 늘었다는 연구 결과가 있을 만큼 이 기술의 확산 속도는 빠릅니다. 하지만 정확도와 함께 데이터 윤리에 대한 검증이 뒤따라야 합니다.
결국 세 가지 학습 패러다임의 트레이드오프는 이렇게 요약됩니다. 지도학습은 정확하지만 비용이 크고, 비지도학습은 자유롭지만 결과 해석이 어렵고, 자기지도학습은 효율적이지만 편향 통제가 관건입니다. 어느 하나가 완벽한 방식이 아니라, 목적에 맞게 선택하고 조합하는 판단이 중요합니다.
자주 묻는 질문
Q. 자기지도학습과 비지도학습은 어떻게 다른가요?
A. 두 방식 모두 레이블이 없는 데이터를 씁니다. 차이는 기준값의 유무입니다. 비지도학습은 클러스터링처럼 정해진 정답 없이 데이터 구조를 파악하고, 자기지도학습은 데이터 자체에서 기준값을 만들어내 손실 함수로 성능을 최적화합니다. 자기지도학습은 비지도학습의 하위 집합이지만, 학습 방식은 지도학습에 가깝습니다.
Q. BERT와 GPT는 자기지도학습 방식에서 어떻게 다른가요?
A. BERT는 마스킹 방식을 씁니다. 문장의 임의 단어를 가리고 앞뒤 문맥을 모두 참고해 맞히도록 훈련합니다. GPT는 자기회귀 방식으로, 앞의 단어들만 보고 다음 단어를 예측합니다. BERT는 양방향성 덕분에 번역·검색에 강하고, GPT는 텍스트 생성 과제에서 강점을 보입니다.
Q. 자기지도학습 모델도 결국엔 레이블 데이터가 필요한가요?
A. 사전 학습 단계에서는 레이블이 전혀 필요 없습니다. 다만 특정 다운스트림 작업에 맞게 미세 조정(Fine-tuning)할 때는 소량의 레이블 데이터가 사용되는 경우가 많습니다. 그래도 지도학습 단독 훈련에 필요한 데이터 양에 비하면 극히 적은 수준으로도 경쟁력 있는 성능을 낼 수 있습니다.
Q. 자기지도학습이 의료 이미지 분석에 쓰이는 이유가 뭔가요?
A. 의료 영상은 전문 자격을 가진 사람만 주석을 달 수 있어 레이블 데이터 확보가 매우 어렵습니다. 자기지도학습은 주석 없이도 대량의 의료 이미지로 모델을 사전 훈련할 수 있어 이 병목을 해소해 줍니다. 실제로 관련 논문 수가 2019~2021년 사이 1,000% 이상 증가할 만큼 의료 AI 분야에서 주목받고 있습니다.
Q. 대조학습과 비대조학습 중 어떤 것이 더 좋은가요?
A. 우열을 단순 비교하기는 어렵습니다. 대조학습은 양성·음성 쌍을 모두 활용해 표현력이 높지만 대용량 배치와 메모리 뱅크가 필요합니다. 비대조학습은 양성 쌍만 쓰기 때문에 계산 비용이 적고 구현이 단순합니다. BYOL이나 Barlow Twins처럼 비대조 방식도 대조학습에 필적하는 성능을 내고 있어, 자원 상황에 맞게 선택하는 것이 현실적입니다.
자기지도학습이 매력적인 건 "데이터가 더 많으면 AI가 더 똑똑해진다"는 명제를 레이블 비용 없이도 실현할 수 있게 해준다는 점입니다. 하지만 그 데이터 안에 무엇이 담겨 있는지를 들여다보는 일은 여전히 사람의 몫입니다. 이 기술에 관심이 생기셨다면, BERT나 GPT 계열 모델의 사전 학습 과정을 직접 살펴보는 것이 가장 빠른 이해의 길입니다.
참고: https://www.ibm.com/kr-ko/think/topics/self-supervised-learning
https://arxiv.org/abs/2002.05709
https://openai.com/research/instruction-following
'AI·테크' 카테고리의 다른 글
| 연합 학습 (데이터 프라이버시, 분산 학습, 보안 한계) (0) | 2026.09.23 |
|---|---|
| 합성 데이터 (데이터 부족, 모델 붕괴, 실전 적용) (0) | 2026.09.23 |
| NLP와 LLM (개념 차이, 한계와 편향, 활용법) (0) | 2026.09.23 |
| AGI란 무엇인가 (튜링테스트, 강인공지능, LLM한계) (0) | 2026.09.23 |
| [IT/테크 트렌드] AI가 스스로 행동하는 시대, '에이전트 AI 거버넌스'가 기업의 필수 과제로 떠오른 이유 (2026 글로벌 규제 분석) (0) | 2026.09.09 |