모델 붕괴는 피할 수 없는가 — 원본 데이터를 대체하면 무너지고, 쌓으면 상한이 생긴다

붕괴 논문 속 원본 10% 실험, 누적의 상한, 그리고 1%만 섞여도 개선이 멈출 수 있다는 반대 결과

2024년 7월 Nature에 실린 논문 한 편이 '모델 붕괴(model collapse)'라는 말을 널리 알렸다. Ilia Shumailov 등 연구진 6명은 초록에 이렇게 썼다. "모델이 생성한 콘텐츠를 무분별하게(indiscriminate) 학습에 사용하면 결과 모델에 되돌릴 수 없는 결함이 생기고, 원래 콘텐츠 분포의 꼬리가 사라진다." 분포의 꼬리는 드물게 나타나는 표현과 정보를 말한다.

널리 퍼진 버전은 더 짧다. AI가 만든 글이 학습 데이터에 섞이면 모델은 결국 무너진다. 이 문장에는 형용사 하나가 없다. '무분별하게'다. 그 단어가 무엇을 뜻하는지는 같은 논문의 실험과 뒤이은 연구들이 보여 준다.

이 블로그의 앞선 두 글, 디지털 암흑기를 다룬 글과 학습 데이터 고갈을 다룬 글도 같은 논문을 근거로 삼았다.

붕괴 논문 안의 두 번째 실험

연구진은 메타가 공개한 OPT-125m 언어 모델을 위키텍스트2(wikitext2) 데이터로 미세조정(이미 학습된 모델을 특정 데이터로 추가 학습하는 것)한 뒤, 그 모델이 생성한 텍스트로 다음 세대를 학습시키는 과정을 반복했다. 설정은 두 가지였다.

첫째 설정은 원본 데이터를 전혀 남기지 않고 세대마다 5에폭(1에폭은 학습 데이터 전체를 한 번 완독하는 단위)을 학습했다. 이때 퍼플렉서티(perplexity)는 20에서 28로 나빠졌다. 퍼플렉서티는 모델이 다음 단어를 얼마나 확신 없이 예측하는지를 나타내는 지표로, 낮을수록 좋다. 둘째 설정은 10에폭을 학습하면서 매 세대 원본 데이터의 10%를 무작위로 다시 넣었다. 논문은 이 결과를 "원본 데이터를 보존하면 성능 저하가 경미한 수준에 그친다(only minor degradation)"고 적었다.

두 설정은 세대마다 학습한 에폭 수도 다르다. 원본 보존의 효과만 떼어 낸 비교는 아니다. 그래도 붕괴를 대표하는 논문이 원본이 남아 있으면 결과가 달라진다는 관찰을 함께 싣고 있다는 점은 분명하다.

버리면 쌓이고, 쌓으면 멈춘다

같은 해 Gerstgrasser 등 연구진 14명은 질문을 바꿨다. 기존 연구는 대체로 새 데이터가 옛 데이터를 대체한다고 가정했다. 연구진은 데이터가 누적된다는 가정이 더 현실적이라고 보았다. 누적하면 어떻게 되는가.

결과는 조건에 따라 갈렸다. 동화 수준의 짧은 이야기 데이터(TinyStories)로 언어 모델을 학습시켰더니, 세대마다 데이터를 대체하면 시험 오차(학습에 쓰지 않은 원래 데이터로 잰 오차)가 올라갔다. 원본에 각 세대의 생성 데이터(AI가 만든 데이터, 합성 데이터라고도 한다)를 쌓아 가면 붕괴가 일어나지 않았다. 선형 모델(입력과 출력을 직선 관계로 놓는 단순한 모델)에서는 증명까지 했다. 대체하면 오차가 세대 수에 비례해 늘고, 누적하면 오차는 세대 수와 무관하게 1세대 오차의 π²/6배, 약 1.64배를 넘지 않는다.

이 선형 모델 틀을 그대로 재현해 직접 실행했다. 입력 차원 10, 세대당 표본 50개, 4,000회 반복의 평균이다.

10세대 뒤의 시험 오차: 대체와 누적
선형 회귀의 평균 제곱 오차(MSE). 절대값보다 1세대(기준) 대비 오차가 몇 배로 커지는지가 핵심이다. (시뮬레이션 재현 실행, 4,000회 평균)
1세대 (원본 데이터 학습) · 0.256 (기준 1.0배)
10세대, 누적 · 0.401 (1세대의 1.6배 · 이론 상한 1.64배)
10세대, 대체 · 2.568 (1세대의 10.0배)

실행값은 논문의 이론값과 모든 세대에서 2% 이내로 일치했다. 다만 누적한 경우에도 오차는 1세대보다 약 1.6배 크다. 이 차이는 다음 절에서 다시 중요해진다.

세 번째 조건은 선별이다. 같은 해 Feng 등 연구진 5명은 생성 데이터를 검증기(생성물의 품질을 판별해 거르는 장치)로 걸러 학습에 쓰는 방식을 시험했다. 트랜스포머(현재 언어 모델의 기본 구조)의 행렬 고유값 계산과 언어 모델의 뉴스 요약, 두 과제 모두 생성 데이터로 학습하면 붕괴가 나타났지만, 불완전한 검증기로도 이를 막을 수 있었다. 저자들은 검증기가 효과를 내는 조건을 이론으로 따로 제시했다. 아무 검증이나 통한다는 결론은 아니다.

상한이 있어도 개선은 멈출 수 있다: 1%의 반대 결과

여기서 연구마다 '붕괴'로 부르는 상태가 다르다는 점을 짚어야 한다.

Shumailov 등은 붕괴를 두 단계로 정의했다. 초기에는 분포의 꼬리, 곧 드문 표현과 정보가 사라지기 시작한다. 후기에는 모델이 원래와 거의 닮지 않은 분포, 다양성의 폭(분산)이 크게 줄어든 분포로 수렴한다. 생성 텍스트에 반복 구절이 많아지는 현상도 관찰됐지만, 연구진은 반복을 억제한 추가 실험으로 반복이 붕괴의 원인이 아님을 따로 확인했다.

Gerstgrasser 등이 붕괴를 피했다고 할 때의 기준은 세대를 거듭하며 오차가 계속 커지느냐다. 언어 모델 실험에서 누적 조건은 이 의미의 붕괴를 피했고, 선형 모델에서는 오차의 상한이 증명됐다.

Dohmatob 등 연구진 4명은 머신러닝 국제 학회 ICLR 2025에 발표한 「강한 모델 붕괴(Strong Model Collapse)」에서 다른 기준을 썼다. 같은 양의 실제 데이터만으로 학습한 모델과 비교해, 데이터를 늘리는 만큼 계속 좋아지느냐다. 이 기준에서 붕괴는 "학습 데이터를 늘리고 또 늘려도 성능이 좋아지지 않는" 정체다. 생성 데이터를 세대를 거듭해 만든 것이 아니라 일정 비율로 섞은 설정에서, 그 비율이 전체의 1%만 되어도 이런 붕괴가 일어날 수 있다고 보고했다. 저자들은 Shumailov 등의 기존 결과가 "예상보다 심각하다"고 쓰고, 데이터 가중치 조정 같은 단순한 방법으로는 생성 데이터를 사실상 다 덜어 내지 않는 한 일반적으로 완화되지 않는다고 결론지었다.

두 결과는 충돌하지 않는다. 묻는 것이 다르다. 오차가 끝없이 커지지 않는다는 것과, 깨끗한 데이터만 썼을 때만큼 계속 좋아진다는 것은 다른 말이다. 앞의 실행에서도 누적 조건의 오차는 상한 아래에 머물렀지만 원본만으로 학습한 1세대보다는 컸다. 다만 이 실행은 세대를 거듭하는 설정이어서, Dohmatob 등의 고정 비율 혼합과 같은 실험은 아니다. 두 연구를 함께 놓고 말할 수 있는 것은 여기까지다. 누적은 악화를 막는 조건이지, 생성 데이터가 섞이지 않은 것과 같은 결과를 보장하는 조건은 아니다.

붕괴는 '일어나는가'가 아니라 '어떤 조건에서'의 문제다

통제된 실험이 보여 준 것을 정리하면 이렇다. 원본을 버리고 생성 데이터로 대체하면 세대마다 나빠진다. 원본을 남기고 쌓으면 악화에 상한이 생긴다. 검증으로 거르면 막을 수 있는 경우가 있다. 그러나 생성 데이터가 일정 비율로 섞이면, 그 비율이 1%여도 데이터를 늘려 얻는 개선이 멈출 수 있다.

이 결과를 지금 쓰이는 상용 모델에 곧바로 옮길 수는 없다. 실험실에서는 깨끗한 데이터만으로 학습한 비교 모델을 같은 크기로 직접 만들 수 있다. 생성 텍스트가 이미 웹에 섞인 뒤에 수집한 데이터로 학습하는 모델에는 그런 비교 대상이 없다. 그래서 상용 모델이 지금 붕괴 중인지는 공개된 자료만으로 측정하기 어렵다고 판단한다.

측정할 수 없는 대신 물어야 할 질문은 분명해졌다. 원본 데이터가 남아 있는가, 쌓이는가 대체되는가, 걸러지는가, 몇 퍼센트가 섞이는가. Shumailov 등도 초록을 경고만으로 끝내지 않았다. 그들은 생성 콘텐츠가 섞인 인터넷에서 실제 사람과 시스템의 상호작용에서 수집한 데이터의 가치가 점점 커질 것이라고 썼다. 붕괴 논문이 남긴 것은 종말의 예고라기보다 원본 데이터의 값을 매기는 기준에 가깝다.

참고 자료

  1. Shumailov, I., Shumaylov, Z., Zhao, Y., Papernot, N., Anderson, R. & Gal, Y. (2024). AI models collapse when trained on recursively generated data. Nature, 631, 755–759. https://doi.org/10.1038/s41586-024-07566-y
  2. Gerstgrasser, M. et al. (2024). Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data. arXiv:2404.01413. https://arxiv.org/abs/2404.01413
  3. Feng, Y., Dohmatob, E., Yang, P., Charton, F. & Kempe, J. (2024). Beyond Model Collapse: Scaling Up with Synthesized Data Requires Verification. arXiv:2406.07515. https://arxiv.org/abs/2406.07515
  4. Dohmatob, E., Feng, Y., Subramonian, A. & Kempe, J. (2025). Strong Model Collapse. ICLR 2025. arXiv:2410.04840. https://arxiv.org/abs/2410.04840

출처 4건: 원문 확인 4건(본문 전체 3건, 초록 1건), 2차 인용 0건. 시뮬레이션: Python, 난수 시드 2024.

댓글

이 블로그의 인기 게시물

지식의 범람과 모델 붕괴: 인공지능 시대에 진짜 디지털 암흑기가 찾아오는 방식

인공지능 학습 데이터의 고갈: 데이터 장벽과 인간 원천 지식의 가치