AI 발전 속도는 정말 기하급수적인가 — '7개월마다 2배'가 재는 것과 재지 않는 것
AI 과제 시간 지평의 측정 조건, 성공률 50%와 80% 사이의 간격, 그리고 체감과 측정이 어긋난 실험
이 블로그 운영자가 진행 중인 개인 소프트웨어 프로젝트 5개의 작업 기록을 다시 열었다. 코드는 AI 코딩 에이전트(코드를 직접 읽고 고치고 실행하는 AI 도구)가 작성했고, 운영자는 작업을 지시하고 결과를 검토했다. 2026년 9월 20일부터 10월 4일까지의 실행 지시 18건을 골라, 운영자가 직접 했다면 걸렸을 시간을 네 구간으로 추정하고 추가 지시 없이 한 번에 끝났는지를 셌다.
| 운영자가 직접 했다면 (사후 추정) | 과제 수 | 한 번에 성공 | AI 작업 시간 |
|---|---|---|---|
| 30분 이하 | 3 | 3 | 4~5분 |
| 30분~2시간 | 4 | 4 | 1~6분 |
| 2시간~하루 | 7 | 6 | 1~9분 |
| 하루 초과 | 4 | 2 | 4~15분 |
사람 기준 하루가 넘는 과제에서도 AI가 작업한 시간은 15분을 넘지 않았다. 다만 다시 시켜야 했던 3건 중 2건이 가장 긴 구간에서 나왔다.
이 표는 곡선이 아니라 한 사례다. 지시한 사람은 운영자 1명이고, 사람 기준 시간은 운영자가 사후에 추정한 구간이다. 성공 여부는 다음 지시가 수정 요청이었는지로 판정했고, 가장 긴 구간 4건만 운영자가 직접 확정했다. 무엇보다 모든 과제가 이미 작게 나뉘고 범위가 정해진 상태로 맡겨졌다. 그래도 과제가 길수록 실패가 늘어난다는 방향은, AI 발전 속도를 말할 때 가장 자주 인용되는 수치의 측정 원리와 같다.
'7개월마다 2배'는 무엇을 잰 수치인가
2025년 3월 AI 평가 기관 METR의 Kwa 등 연구진은 '50% 과제 시간 지평'이라는 지표를 제안했다. AI가 50% 확률로 해내는 과제를 관련 분야 전문가가 하면 보통 얼마나 걸리는지로 AI의 능력을 나타낸다. 연구진은 이 값이 2019년 이후 약 7개월마다 2배로, 지수적으로 늘었다고 보고했다. 논문 본문의 배가 기간은 207일이다.
같은 논문이 든 과제 예시와 모델별 값을 나란히 놓으면 수치의 감각이 잡힌다.
| 모델 | 50% 시간 지평 | 비슷한 길이의 과제 예 (사람 기준) |
|---|---|---|
| GPT-2 (2019) | 약 2초 | 파일 이름 4개 중 셸 스크립트 고르기 (3초) |
| o1 | 약 39분 | 예시 파일에서 변환 규칙을 찾아 JSON 변환 스크립트 작성 (56분) |
| o3 | 약 110분 | 위 과제의 약 2배 길이 |
| 2026년 2~3월 공개 모델 중 최상위 | 약 12시간 (추정 범위 5~61시간) | 매매 백테스트 도구를 GPU 전용 코드로 30배 가속 (8시간)보다 긴 과제 |
'o1의 시간 지평이 39분'이라는 말은 o1이 39분짜리 과제를 해낸다는 뜻이 아니다. 사람이 39분쯤 걸리는 과제들에서 성공 확률이 절반이라는 뜻이다.
마지막 행은 METR이 2026년 5월에 낸 보고서의 값이다. 과제 묶음을 개편한 1.1판으로 쟀으므로 논문 값과 같은 기준으로 잰 것은 아니다. 두 값으로 배가 기간을 다시 계산할 수는 없다. 다만 논문이 보고한 추세 자체가 시간 축의 지수 증가이므로, '빠르게 늘어난다'는 통념은 이 지표에서는 맞다.
무엇으로, 누구를 기준으로 쟀나
과제는 169개로 소프트웨어 공학, 머신러닝, 사이버 보안, 일반 추론 분야다. 사람 기준 시간은 평균 경력 약 5년의 전문가들이 실제로 풀며 잰 800여 회, 총 2,529시간의 기록에서 나왔다. 169개 중 21개는 실측 대신 연구자 추정을 썼다.
두 가지 조건이 수치를 좌우한다. 첫째, 과제가 깔끔하다. 연구진은 실제 업무의 '지저분함'(분명한 피드백이 없거나 필요한 정보를 스스로 찾아야 하는 것 등)을 16개 요인으로 점수화했다. 과제들의 평균은 16점 만점에 3.2점이었고 8점을 넘는 과제는 없었다. '좋은 연구 논문 쓰기' 같은 일은 9~15점이다. 지저분한 과제일수록 AI 성공률은 길이만으로 예측한 것보다 낮았다.
둘째, 잴 수 있는 범위에 상한이 있다. 2026년 보고서는 1.1판 과제 묶음이 16시간을 넘는 지평을 신뢰성 있게 재지 못한다고 적었다. 가장 앞선 모델이 풀지 못한 과제는 8시간 넘는 과제 몇 개뿐이었고, 연구진은 그 때문에 추정값의 불확실성이 커지고 있다고 밝혔다. 최신 값일수록 오차가 크다.
흔한 오독: 절반, 생산성, 모든 면
'절반 성공'을 '맡길 수 있다'로 읽는 것
50%는 두 번에 한 번 실패한다는 뜻이다. 사람에게 짧은 과제일수록 AI의 성공 확률은 높고, 길어질수록 낮아진다. 그래서 성공률 기준을 80%로 올리면 지평이 짧아진다. 논문에서는 4~6배 짧아졌고, 2026년 보고서의 공개 모델 80% 지평은 약 1.5시간으로 50% 지평 약 12시간의 8분의 1이었다. 긴 과제에 가끔 성공하는 모델이라도 그보다 짧은 과제를 믿고 맡길 만큼 꾸준히 해내지는 못한다는 뜻이다. 95% 같은 높은 성공률의 지평은 데이터가 부족해 재지 못했다.
비교 기준인 사람도 늘 성공하지는 않았다. 긴 과제 묶음에서 전문가의 시도 558회 중 성공은 286회였다. 이 전문가들은 그 과제를 처음 접한 사람들이다.
앞의 기록에서 긴 과제도 대부분 한 번에 성공한 것은 운영자가 미리 과제를 작게 쪼개고 범위를 정해 맡겼기 때문이라고 판단한다. 같은 기준으로 잰 값이 아니므로 그 비율을 METR 수치와 맞대 비교할 수는 없다.
시간 지평을 생산성으로 읽는 것
AI가 긴 과제를 해낼수록 사람의 일도 그만큼 빨라질까. 같은 기관의 Becker 등 연구진 4명은 2025년 2~6월 수준의 AI 도구로 무작위 대조 실험을 했다. 숙련 오픈소스 개발자 16명이 평균 5년간 참여해 온 저장소에서 실제 과제 246개를 풀었고, 과제마다 AI 사용 허용 여부를 무작위로 정했다. AI를 허용하자 완료 시간이 오히려 19% 늘었다. 개발자들은 시작 전에 24% 단축을 예상했고, 실험이 끝난 뒤에도 20% 단축되었다고 추정했다. 경제학 전문가는 39%, 머신러닝 전문가는 38% 단축을 예측했다.
저자들은 속도 저하에 기여했을 가능성이 높은 요인으로 다섯 가지를 들었다. AI의 효용에 대한 과잉 낙관, 개발자가 저장소를 이미 너무 잘 안다는 점, 크고 복잡한 저장소, AI가 활용하지 못하는 저장소의 암묵적 맥락, 그리고 AI 결과물의 낮은 신뢰성이다. 마지막 요인에 대해 개발자들은 AI가 생성한 결과의 44%만 받아들였고, 대다수가 AI 코드를 정리하느라 크게 고쳤다고 답했으며, 작업 시간의 9%를 AI 결과물을 검토하고 정리하는 데 썼다. 저자들은 이 요인 분석이 추정적 근거라고 밝혔다. 또한 실험 설계의 영향을 완전히 배제할 수는 없지만, 여러 분석에서 결과가 유지되어 설계 탓일 가능성은 낮다고 썼다. 이 결과는 2025년 상반기 도구와, 개발자가 이미 잘 아는 대형 저장소라는 조건에서 나왔으므로 지금 도구에 그대로 옮길 수는 없다. 다만 '빨라졌다'는 체감만으로 실제 속도를 알 수 없다는 점은 이 실험이 직접 보여 준다. 앞의 기록도 AI가 일한 시간만 쟀다. 사람이 지시를 쓰고 결과를 읽은 시간은 들어 있지 않다.
한 곡선을 '모든 면'으로 읽는 것
'규모만 키우면'이라는 말의 근거로 흔히 드는 것은 스케일링 법칙이다. 2020년 Kaplan 등 연구진은 언어 모델의 손실(다음 단어를 얼마나 잘못 예측하는지 나타내는 값)이 모델 크기, 데이터 양, 학습 연산량에 대해 거듭제곱 법칙을 따라 줄어든다고 보고했다. 투입을 10배 늘릴 때마다 손실이 일정한 비율로 줄어드는 관계이고, 일부 추세는 7자릿수 넘는 범위에서 이어졌다. 이 법칙이 직접 말하는 대상은 손실 하나다.
다른 능력은 다른 곡선을 따른다. Lin 등 연구진이 ACL 2022에서 발표한 TruthfulQA는 사람들이 흔히 잘못 믿는 내용을 묻는 질문 817개로 모델의 진실성을 쟀다. GPT-3 등 당시 모델 가운데 가장 큰 모델이 대체로 가장 덜 진실했다. 연구진은 오답이 학습 데이터 속 흔한 오해를 모방한 결과라면 예상되는 일이라고 보고, 규모를 키우는 것만으로는 진실성 개선의 전망이 밝지 않다고 썼다. 지금 모델이 세대마다 덜 지어내는 것처럼 느껴진다면, 규모가 아닌 다른 학습 방법의 곡선일 수 있다. 연구진의 제안과 같은 방향의 해석이지만 이 글에서 직접 확인한 것은 아니다.
작은 모델에는 없다가 큰 모델에서 갑자기 나타나는 능력을 '창발 능력(emergent abilities)'이라고 부른다. Schaeffer 등 연구진은 이 갑작스러움이 모델의 근본적 변화가 아니라 연구자가 고른 지표의 산물일 수 있다고 반박했다. 비선형이거나 불연속적인 지표는 갑작스러운 도약처럼 보이게 하고, 선형·연속적인 지표로 다시 재면 변화가 매끄럽고 예측 가능해진다는 것이다. 걷잡을 수 없는 도약처럼 보이는 그래프의 일부는 지표 선택이 만든 모양일 수 있다.
빠른 곡선은 있다, 다만 하나가 아니다
반대 방향의 사례도 있다. METR의 2026년 보고서에 따르면, 기존 소프트웨어를 다시 구현하는 과제 묶음에서는 같은 시기 공개 모델의 시간 지평이 1.1판 과제 묶음보다 몇 배 길었다. 보고서는 진척을 싸게 확인할 수 있고 여러 접근을 싸게 시도할 수 있는 문제에서 에이전트가 특히 강했다고 적었다. 어떤 과제에서는 곡선이 더 가파르다.
정리하면 '규모만 키우면 AI는 모든 면에서 걷잡을 수 없이 빠르게 좋아진다'는 통념은 절반만 맞다. 빠르게 늘어나는 곡선은 실재한다. 그러나 그 곡선은 특정 과제 묶음에서, 성공률 50%를 기준으로, 전문가의 작업 시간을 기준으로 잰 것이다. 진실성, 실무 속도, 체감은 각자 다른 곡선을 그린다.
'AI가 7개월마다 2배 좋아진다'는 문장을 다시 만나면 세 가지를 물어볼 수 있다. 어떤 과제인가. 몇 퍼센트 성공을 기준으로 했는가. 그 결과를 누가, 얼마의 시간을 들여 확인하는가. 앞의 18건에서는 운영자가 과제를 쪼개고 결과를 확인하는 데 시간을 썼고, 그 시간은 표에 없다. 그 시간까지 넣었을 때 곡선이 어떤 모양이 될지는 이 기록으로는 답할 수 없다.
참고 자료
- Kwa, T., West, B., Becker, J. et al. (2025). Measuring AI Ability to Complete Long Software Tasks. arXiv:2503.14499 (v4, 2026-07-10). https://arxiv.org/abs/2503.14499
- METR (2026). Frontier Risk Report (February to March 2026). https://metr.org/blog/2026-05-19-frontier-risk-report/
- Becker, J., Rush, N., Barnes, E. & Rein, D. (2025). Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity. arXiv:2507.09089. https://arxiv.org/abs/2507.09089
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361. https://arxiv.org/abs/2001.08361
- Lin, S., Hilton, J. & Evans, O. (2022). TruthfulQA: Measuring How Models Mimic Human Falsehoods. ACL 2022. arXiv:2109.07958. https://arxiv.org/abs/2109.07958
- Schaeffer, R., Miranda, B. & Koyejo, S. (2023). Are Emergent Abilities of Large Language Models a Mirage? arXiv:2304.15004. https://arxiv.org/abs/2304.15004
출처 6건: 원문 확인 6건(본문 2건, 초록 4건), 2차 인용 0건. 직접 측정: 운영자 프로젝트의 AI 코딩 에이전트 세션 기록 18건(2026-09-20~10-04). 그림 1·2는 원본 그대로 실었다.
댓글
댓글 쓰기