데이터의 시대는 끝났다 — 같은 웹을 먹은 AI의 지능이 갈리는 세 가지 설계
데이터의 시대는 끝났다 — 같은 웹을 먹은 AI의 지능이 갈리는 세 가지 설계
결론부터 쓴다. AI의 지능 격차는 '지식의 양'에서 나오지 않는다. 같은 웹을 먹인 모델의 성능이 갈리는 이유는 그 지식을 골라내는 정제 스키마(Filtering Schema), 대답의 방향을 정하는 보상 규칙(RLHF), 그리고 생각의 순서를 정하는 추론 로직(Chain of Thought)이라는 세 개의 설계 차이다. 그리고 이 결론은 내 직관이 아니라 공개된 논문과 벤치마크 수치로 확인된다. 인터넷이라는 지식의 바다가 마르는 시점(데이터 장벽)에 대한 경고까지 겹쳐 보면, 지금 AI 업계의 경쟁은 이미 "누가 더 많이 먹였는가"의 단계를 지나 "누가 더 잘 씹고, 어떤 순서로 삼키는가"의 단계로 넘어갔다.
이 글은 한 가지 의구심에서 출발해 세 개의 관문을 통과한다. 그 과정에서 원래 글에 적었던 몇 개의 수치는 공개 자료로 다시 확인해 정확한 값으로 교정했고, 근거가 불분명한 표현은 검증 가능한 수치로 바꿨다. 결론은 바뀌지 않았다. 오히려 더 단단해졌다.
1. 의구심: 같은 교과서로 배운 아이들의 성적이 왜 다른가
AI 기업들은 모두 "인터넷에 있는 방대한 웹 데이터를 학습시켰다"고 말한다. 그런데 인터넷이라는 지식의 바다는 무한하지 않다. 영국의 인공지능 연구기관 에포크(Epoch AI)는 2024년 논문 「데이터가 바닥날까? 인간 생성 데이터에 기반한 LLM 확장의 한계」에서 공개 인간 텍스트 데이터의 총량을 약 4×10¹⁴ 토큰(400조 토큰) 규모로 추정하고, 현재 추세가 이어지면 2026년에서 2032년 사이(중위 추정 2028년) 에 학습 데이터셋의 크기가 가용한 데이터 총량에 도달한다고 전망했다. 흔히 '데이터 장벽(Data Wall)'이라 불리는 시점이다. 내가 처음에 "2026년경 고갈"이라고 적었던 것은 이 범위의 가장 이른 끝단이었다. 정확히는 2026~2032년, 중위 2028년이다.
같은 흐름은 검색 시장에서도 관찰된다. 검색 엔진이 "대량으로 생성된 저품질 콘텐츠(scaled content abuse)"를 스팸 정책 위반으로 명시하고 감점 대상에 넣은 것도, 결국 학습과 검색에 쓸 '새롭고 질 좋은 데이터'의 희소성이 올라갔기 때문으로 읽힌다.
그렇다면 의구심은 여기서 시작된다. 거의 동일한 웹 데이터를 긁어다 학습했다면, AI들의 지능도 엇비슷해야 하는 것 아닌가?
사람이라면 이해가 간다. 같은 교실에서 같은 교과서로 배워도 1등과 꼴찌가 나뉘는 것은 학생 개개인의 의지와 학습 태도, 그리고 받아들이는 역량이 다르기 때문이다. 하지만 감정도 의지도 없는 기계에게 학습 태도의 차이가 있을 리 만무하다. 그런데도 챗GPT, 클로드, 제미나이 등 모델들의 성능 차이는 체감될 정도로 상당하다.
먼저 반증하자: 데이터의 양은 성능을 설명하지 못한다
"지식의 양 = 지능"이라면 파라미터가 많고 학습 데이터가 많은 모델이 항상 이겨야 한다. 실제 공개 수치는 그렇지 않다.
| 모델 | 규모 | 학습·정렬 데이터 | 핵심 결과 | 출처 |
|---|---|---|---|---|
| InstructGPT | 1.3B 파라미터 | 인간 피드백 기반 미세조정(RLHF) | 파라미터가 100분의 1인데도 사람 평가에서 175B GPT-3보다 출력이 더 선호됨 | Ouyang et al., arXiv:2203.02155 (2022) |
| phi-1 | 1.3B 파라미터 | 웹에서 고른 "교과서급" 6B 토큰 + 합성 교재 1B 토큰 (A100 8장, 4일) | HumanEval pass@1 50.6%, MBPP 55.5% | Gunasekar et al., arXiv:2306.11644 (2023) |
| LIMA | 65B 파라미터 | 단 1,000건의 정선된 지시-응답, 강화학습 없음 | 통제된 사람 평가에서 GPT-4 대비 43% 동등 이상, Bard 대비 58%, DaVinci003 대비 65% | Zhou et al., arXiv:2305.11206 (2023) |
| Llama 3 (8B/70B) | 8B·70B | 15조 토큰 이상 + 정제 파이프라인 | 동급 파라미터에서 당시 최고 수준 | Meta, Llama 3 발표 (2024.4.18) |
파라미터를 100분의 1로 줄이고(1.3B) 정렬 규칙만 제대로 넣은 모델이 175B를 이긴다. 65B 모델이 1,000건의 예시만으로 GPT-4와 43%에서 동등하거나 우세하다. 데이터를 더 넣어서 나온 결과가 아니다. 데이터를 어떻게 쓰느냐를 바꿔서 나온 결과다. LIMA 논문의 저자들도 같은 결론을 적었다. "대형 언어모델의 지식은 거의 전부 사전학습에서 배워지고, 고품질 출력을 내게 하는 데 필요한 지시 데이터는 소량이면 충분하다."
2. 첫째 관문 — 정제 스키마: 무엇을 남기고 무엇을 버리는가
인터넷 데이터의 상당 부분은 반복 문구, 자동 생성 스팸, 광고, 혐오 표현, 문맥 없는 파편이다. 과거의 AI는 이를 무작정 집어삼켰고, 그 결과가 Garbage In, Garbage Out이었다. 고성능 AI는 여기서 갈린다. 같은 바다에서 그물을 던지되, 그물의 촘촘함과 코의 모양이 다르다.
얼마나 다른지 수치로 보자. 허깅페이스가 2024년에 공개한 FineWeb 데이터셋은 커먼크롤 스냅샷 96개를 모아 15조 토큰을 만들었다. 그다음 별도의 교육용 품질 분류기로 걸러낸 FineWeb-Edu는 1.3조 토큰이다. 즉 이미 정제를 거친 15조 토큰에서 교육적 가치가 높은 텍스트는 약 8.7% 만 남았다. 그리고 논문의 표현을 그대로 옮기면, FineWeb-Edu로 사전학습한 모델들은 MMLU·ARC 같은 지식·추론 벤치마크에서 "극적으로 더 나은" 성능을 보였다. 토큰을 더 넣은 게 아니라, 같은 바다에서 무엇을 남길지 정하는 규칙을 바꾼 것이다.
| 구분 | 규모 | 무엇을 하는가 | 근거 |
|---|---|---|---|
| 커먼크롤 원본 스냅샷 | FineWeb 기준 96개 스냅샷 | 웹에서 텍스트를 긁어옴(원료) | FineWeb, arXiv:2406.17557 (2024) |
| FineWeb | 15조 토큰 | 텍스트 추출, 기본 필터, 중복 제거, 휴리스틱 필터 | 같은 논문 |
| FineWeb-Edu | 1.3조 토큰 (FineWeb의 약 8.7%) | 교육용 품질 분류기로 한 번 더 선별 | 같은 논문 |
| phi-1 학습 데이터 | 6B 토큰 + 합성 1B 토큰 | 웹에서 "교과서급" 텍스트만 선별 + 교재를 합성해 주입 | arXiv:2306.11644 |
| Llama 3 정제 파이프라인 | 15조 토큰 이상 | 휴리스틱 필터, NSFW 필터, 의미 기반 중복 제거, 텍스트 품질 분류기 | Meta, Llama 3 발표 |
주목할 점은 이 정제 레시피가 공개되지 않는다는 것이다. FineWeb 논문은 이렇게 적는다. "사전학습 데이터셋의 정제 전략은 철저히 관리되는 영업비밀(best-kept trade secret)으로 취급되는 경우가 많다." 파라미터는 공개해도 데이터 레시피는 감춘다. 이 말은 곧, AI의 성능 차이가 모델의 크기가 아니라 데이터를 다루는 규칙에서 나온다는 사실을 업계 스스로가 인정하고 있다는 뜻이다. 남는 데이터가 8.7%인지 30%인지, 그리고 그 8.7%를 고르는 기준이 무엇인지가 기본 지능을 좌우한다.
3. 둘째 관문 — 보상 규칙: 기계에게 '태도'를 심는 방법
사람의 학습 태도에 해당하는 것을 기계에서는 강화학습(RLHF, 인간 피드백 기반 강화학습)이라는 절차로 대체한다. 방대한 지식을 외운 AI에게 사람이 붙어 "이런 대답이 논리적이다", "이건 피해야 한다"를 점수로 매기고, 그 점수를 최대화하도록 모델을 다시 훈련시킨다. 이 '채찍과 당근의 로직'을 어떻게 설계하느냐가 AI의 성격을 만든다.
앞의 표에서 본 것처럼 이 관문의 효과는 극적이다. 파라미터가 100분의 1인 1.3B InstructGPT가 175B GPT-3보다 사람에게 더 선호된 것은, 지식이 늘어서가 아니라 대답하는 태도가 교정되었기 때문이다. 반대 방향의 증거도 있다. 65B LIMA는 강화학습을 전혀 쓰지 않고 1,000건의 정선된 예시만으로 GPT-4 대비 43%에서 동등 이상의 평가를 받았다. 정렬 데이터가 양이 아니라 질과 형식의 문제라는 뜻이다.
이 관문에서 회사별 철학 차이가 곧 제품의 성격 차이가 된다.
| 구분 | 접근 | 결과의 성격 | 근거 |
|---|---|---|---|
| OpenAI (GPT-4) | 출시 전 안전·정렬에 집중 투자 | 발표 자료 기준 6개월을 정렬에 투입, 금지 요청 응답 82% 감소·사실적 응답 40% 증가 | OpenAI, GPT-4 발표 (2023.3) |
| Meta (Llama 3) | 사후 학습 절차 개선 | 잘못된 거부(false refusal) 비율을 크게 낮추고 정렬·응답 다양성 개선 | Meta, Llama 3 발표 |
| Anthropic (Claude) | 헌법적 AI(Constitutional AI) | 사람 라벨 대신 원칙 문서 기반 피드백으로 무해성 정렬 | Bai et al., arXiv:2212.08073 (2022) |
| Meta (LIMA) | 소량 고품질 지시 데이터 | 강화학습 없이도 형식 학습·일반화 달성(1,000건) | arXiv:2305.11206 |
같은 지식을 가진 모델이 어떤 회사에서는 과잉 거부하는 비서가 되고, 어떤 회사에서는 추론을 밀어붙이는 비서가 된다. 원료는 같고 조미료의 레시피가 다르다. 내가 처음 글에서 "GPT-4는 정렬에 6개월 이상을 쏟았다"고 적었는데, 이 수치는 OpenAI가 발표 자료에서 직접 밝힌 6개월로 확인된다.
4. 셋째 관문 — 추론 로직: 답을 외우는 기계에서 생각하는 기계로
내가 가장 주목한 부분이다. 성능이 뛰어난 AI는 질문을 받으면 조건반사적으로 답을 뱉지 않는다. 속으로 "문제를 인식한다 → 단계를 쪼갠다 → 논리적 모순이 없는지 검증한다 → 최종 답을 도출한다"는 절차를 밟는다. 이 절차를 프롬프트로 유도하는 기법이 사고 연쇄(Chain of Thought)이고, 이를 모델 내부에 훈련으로 심은 것이 추론 모델이다.
이 관문은 지식이 아니라 알고리즘의 구조를 바꾼다. 그래서 성능이 계단식으로 뛴다. 같은 모델, 같은 지식, 다른 절차다.
| 대상 | 조건 | 결과 | 근거 |
|---|---|---|---|
| PaLM 540B (GSM8K 초등 수학) | 표준 프롬프트 | 17.9% | Wei et al., arXiv:2201.11903 (2022) |
| PaLM 540B (GSM8K) | 사고 연쇄(CoT) 프롬프트 | 56.9% | 같은 논문 |
| GPT-4o (IMO 2024 예선) | 표준 응답 | 13% (13.4%) | OpenAI o1 발표 보도 (2024.9) |
| o1 (IMO 2024 예선) | 강화학습으로 훈련된 내부 사고 연쇄 + 긴 생각 시간 | 83% (83.3%) | 같은 보도 |
| o1 (경쟁 프로그래밍) | Codeforces | 상위 89 백분위 | 같은 보도 |
수치가 말하는 바는 명확하다. 지식을 4배 더 넣어서 17.9%가 56.9%가 된 것이 아니다. 프롬프트에 "단계적으로 생각하라"는 절차 한 줄을 넣은 것만으로 3배 이상 뛰었다. 추론 모델의 경우 OpenAI는 자사 설명에서 두 개의 축을 분리했다. 강화학습으로 사고 방식을 훈련하는 훈련 시간 컴퓨트(train-time compute) 와, 답하기 전에 더 오래 생각하게 하는 추론 시간 컴퓨트(test-time compute) 다. 두 번째 축은 특히 의미가 크다. 모델의 파라미터를 늘리지 않고도, 생각하는 시간을 늘리는 것만으로 성능을 올릴 수 있다는 뜻이기 때문이다. 파라미터를 늘리려면 데이터가 필요하지만, 생각을 늘리는 데는 데이터가 필요 없다. 데이터 벽 앞에서 이 차이는 결정적이다.
여기서 정직하게 덧붙일 것이 있다. IMO 83%와 Codeforces 89 백분위는 공식 대회 성적이 아니라 OpenAI가 자사 모델을 대상으로 수행해 공개한 평가다. 논문 심사를 거친 제3자 검증이 아니라 회사가 발표한 수치라는 점을 감안해 읽어야 한다. 그럼에도 같은 조건에서 같은 문제를 푼 GPT-4o의 13%와 비교하면, 격차가 지식의 양이 아니라 절차의 차이라는 사실은 분명해진다.
4-4. 생각하는 시간의 가격: 성능은 오르고 납품량은 준다
물론 이 방식에는 대가가 있다. 2024년 9월 공개 당시 o1-preview의 API 가격은 입력 100만 토큰당 15달러, 출력 100만 토큰당 60달러로 GPT-4o 대비 입력 3배, 출력 4배였다. 사용 한도도 주간 30건(o1-preview), 50건(o1-mini)에 묶여 있었다. 생각하는 시간을 늘리면 답은 잘 맞지만, 한 사람이 처리할 수 있는 양은 줄고 비용은 는다. 지식이 늘지도 않았는데 청구서만 늘어난 셈이다.
| 항목 | 수치 | GPT-4o 대비 | 의미 |
|---|---|---|---|
| o1-preview 입력 가격 | 15달러 / 100만 토큰 | 3배 | 생각하는 시간은 계산으로 청구된다 |
| o1-preview 출력 가격 | 60달러 / 100만 토큰 | 4배 | 긴 사고 연쇄가 출력 토큰으로도 청구된다 |
| 사용 한도 | 주간 30건 / 50건 | - | 한계 납품량이 줄어든다 |
이 사실은 두 가지를 동시에 말한다. 첫째, 파라미터를 늘리려면 데이터가 필요하지만, 생각을 늘리기 위해서는 데이터가 필요 없다. 데이터 장벽 앞에서 이것이 가장 실용적인 우회로다. 둘째, 그 우회로는 데이터 비용 대신 계산 비용으로 청구서를 옮겼을 뿐이다. 생각하는 시간이 공짜가 아니라는 사실을 잊으면, "똑똑한 AI"는 곧 "비싼 AI"로 읽힌다.
5. 데이터 장벽 이후: 합성 데이터, 그리고 그 안의 함정
앞서 본 Epoch AI 논문은 벽이 지나간 뒤의 길로 세 가지를 제시한다. AI가 생성한 데이터를 만들어 학습하는 합성 데이터 생성, 데이터가 풍부한 영역에서 언어로 배운 것을 옮기는 전이 학습, 같은 데이터로 더 성능을 뽑아내는 데이터 효율 기법. 셋 다 "더 많이 모으는"의 대안이다.
그러나 합성 데이터에는 함정이 있다. 자연과학 학술지 Nature에 실린 「재귀적으로 생성된 데이터로 학습할 때 AI 모델은 붕괴한다」(Shumailov et al., Nature 631, 2024)는, 모델이 스스로 만든 데이터로 학습을 반복하면 원래의 분포를 잃고 점점 편향된 상태로 타락함을 보여준다. 처음의 학습 데이터에는 사실이 충분히 있었지만, 그 사실이 사라지는 속도는 순환의 속도에 따라갔다.
그래서 내 논증은 오히려 굳건해진다. 합성 데이터를 쓰든 전이 학습을 쓰든, 결국 같은 세 가지를 다시 묻게 되기 때문이다. 무엇을 생성 목록에 넣을 것인가(정제 스키마), 어떤 기준으로 생성기를 점수 매길 것인가(보상 규칙), 어떤 절차를 거쳐 검증하고 버릴 것인가(추론 로직). 데이터의 출처가 바뀌어도 설계의 세 관문은 바뀌지 않는다. 출처만 바꾼다고 레시피가 따라오지는 않는다.
6. 그래서 내 삶에선 — 세 관문을 내 규칙으로 옮기는 법
이 글은 AI를 다루지만 끝내 사람의 문제로 돌아온다. 우리에게 주어진 인생의 데이터는 유한하다. 쓸 수 있는 시간도, 만날 사람의 수도, 몸이 버텨내는 날도 결국 총량이 정해져 있다. Epoch AI가 웹의 총량을 계산한 것처럼, 나의 총량도 어느 정도는 고정되어 있다. 그러면 남는 질문은 하나다. 무엇을 걸러내고, 무엇에 보상을 줄지, 어떤 순서로 생각할 것인가.
| 관문 | 삶에서의 이름 | 실제로 하는 일 |
|---|---|---|
| 1. 정제 스키마 | 안목 | 읽을거리·만날 사람·떠날 대화를 고른다. 똑같은 반복 글을 백 번 모으느니 좋은 글 열 개를 먼저 정리한다 |
| 2. 보상 규칙 | 스스로의 점수표 | 결과가 아니라 다시 쓸 수 있는 것(재현 가능한 규칙, 남긴 글, 정리한 경험)을 스스로 칭찬한다 |
| 3. 추론 로직 | 답을 내기 전의 순서 | 문제를 인식한다 → 단계를 쪼갠다 → 뭘 모르는지 적은다 → 답한다. 감이 아니라 절차로 |
이 세 줄은 나이가 들수록 효과가 커진다. 젊었을 때에는 데이터(경험)가 부족하던 시기라서 많이 겪는 편이 유리했다. 그러나 총량이 비슷해진 지금, 겪은 일을 그대로 두면 그건 반복 데이터일 뿐이다. 걸러내고(정제), 의미 있는 것에만 점수를 주고(보상), 순서를 고정해(추론) 되풀이된 경험을 자기 것으로 바꿀 때에만 경험이 지혜가 된다. 그것이 기계의 지능 차이가 던져 주는, 사람 쪽의 답이다.
7. 반론과 한계: 데이터는 여전히 중요하다
내 주장이 "데이터는 이제 필요 없다"로 읽히면 곤란하다. 그렇지 않다. 세 가지를 분명히 해둔다.
첫째, 데이터의 양은 여전히 기본기를 만든다. 스케일링 법칙은 지금도 유효하고, 같은 레시피라면 데이터가 많은 쪽이 강하다. Llama 3가 15조 토큰을 쓴 것은 과시가 아니라 필요였다. 다만 데이터가 일정 규모를 넘긴 뒤에는 양보다 정제와 배합이 성능을 가른다는 것이 이 글의 주장이다.
둘째, 데이터 장벽 이후의 길은 아직 검증 중이다. Epoch AI 논문도 고갈 이후의 대안으로 합성 데이터 생성, 데이터가 풍부한 영역에서의 전이 학습, 데이터 효율 기법을 제시하면서, 이것들이 실제로 확장을 지탱할 수 있는지는 열린 문제로 남겨두었다. 합성 데이터로만 학습한 모델이 스스로 붕괴한다는 '모델 붕괴(model collapse)' 연구도 있다. 나는 여기서 단정하지 않는다.
셋째, 세 관문은 외부에서 검증하기 어렵다. 정제 레시피와 보상 규칙은 영업비밀이고, 벤치마크 수치는 자체 평가인 경우가 많다. 벤치마크에 과적합되는 문제도 잘 알려져 있다. 그래서 이 글의 표는 "이 수치가 곧 그 모델의 지능"이라는 주장이 아니라, 설계 변수를 바꾸면 같은 데이터로도 결과가 달라진다는 방향의 증거로 읽어야 한다.
넷째, 사람 비유에도 한계가 있다. 나는 이 글을 사람의 지혜에 빗대어 결론을 내리려 하지만, 사람의 '의지'와 기계의 '보상 함수'는 같은 것이 아니다. 기계에는 의지가 없고, 오직 설계된 목표 함수가 있을 뿐이다. 오히려 그래서 이 글의 주장은 더 강해진다. 의지가 없는데도 결과가 갈린다면, 그 차이는 순수하게 설계의 차이다.
8. 결론: 지금 경쟁은 '먹이는 단계'가 아니라 '엮는 단계'다
정리하자. 모두가 같은 바다에서 같은 물고기를 잡고 있다면, 승부는 누가 더 정교한 규칙(Rule)으로 뼈를 바르고, 어떤 스키마(Schema)로 요리하며, 어떤 로직(Logic)으로 담아내느냐에 달려 있다. 지식 축적 단계는 이미 끝났다. 데이터 장벽은 그 종료 통보다.
| 관문 | AI에서의 이름 | 하는 일 | 사람에게 대응하는 것 |
|---|---|---|---|
| 1. 선별 | 정제 스키마(Filtering Schema) | 원료에서 무엇을 남기고 무엇을 버릴지 결정 | 무엇을 경험으로 삼을지 고르는 안목 |
| 2. 태도 | 보상 규칙(RLHF·정렬) | 어떤 대답에 점수를 줄지 결정 | 무엇을 칭찬하고 무엇을 벌할지 정하는 교육과 문화 |
| 3. 절차 | 추론 로직(CoT·생각 시간) | 답하기 전에 어떤 순서로 생각할지 결정 | 인식→분해→검증→결론으로 이어지는 성찰의 순서 |
그리고 나는 이 표가 AI 이야기로만 끝나지 않는다고 생각한다. 내 나이 쉰을 넘어 세상을 겪어보니 사람의 지혜도 이와 다르지 않다. 살면서 겪는 경험(데이터)의 양은 어느 정도 나이가 들면 다 비슷해진다. 서른과 쉰의 차이는 겪은 일의 개수가 아니라, 그 일을 어떤 규칙으로 걸러내고 어떤 순서로 엮어 자신의 통찰로 만들었는가의 차이다. 경험이 많아도 같은 실수를 반복하는 사람이 있고, 경험이 적어도 한 번의 실패를 구조로 바꾸는 사람이 있다. 후자가 깊이가 있는 어른이다.
AI라는 최첨단 기계의 성능 차이가 결국 '생각을 조직하는 구조'에서 비롯된다는 사실은, 지식과 정보의 홍수 속에서 살아가는 우리에게 꽤나 묵직한 화두를 던진다. 지금 필요한 것은 더 많이 아는 일이 아니라, 아는 것을 엮는 규칙을 스스로 설계하는 일이다. 데이터가 마르는 시대에 사람에게도 기계에게도 남는 자산은 양이 아니라 구조다.
출처
- Pablo Villalobos et al., "Will we run out of data? Limits of LLM scaling based on human-generated data", arXiv:2211.04325v2 (2024.6) — 공개 인간 텍스트 유효 총량 약 4×10¹⁴ 토큰, 데이터셋이 총량에 도달하는 시점 2026~2032년(중위 2028년)
- Guilherme Penedo et al., "The FineWeb Datasets", arXiv:2406.17557 (2024.6) — FineWeb 15조 토큰(커먼크롤 스냅샷 96개), FineWeb-Edu 1.3조 토큰, 정제 전략은 영업비밀이라는 서술
- Suriya Gunasekar et al., "Textbooks Are All You Need", arXiv:2306.11644 (2023.6) — phi-1 1.3B 파라미터, 6B+1B 토큰, HumanEval pass@1 50.6%
- Long Ouyang et al., "Training language models to follow instructions with human feedback", arXiv:2203.02155 (2022.3) — 1.3B InstructGPT 출력이 175B GPT-3보다 선호됨(파라미터 100분의 1)
- Chunting Zhou et al., "LIMA: Less Is More for Alignment", arXiv:2305.11206 (2023.5) — 1,000건 정선 데이터, GPT-4 대비 43%·Bard 58%·DaVinci003 65%
- Jason Wei et al., "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models", arXiv:2201.11903 (2022.1) — PaLM 540B GSM8K 표준 17.9% → CoT 56.9%
- Yuntao Bai et al., "Constitutional AI: Harmlessness from AI Feedback", arXiv:2212.08073 (2022.12)
- Meta, "Introducing Meta Llama 3" (2024.4.18) — 15조 토큰 이상, 휴리스틱 필터·의미 기반 중복 제거·품질 분류기 등 정제 파이프라인
- OpenAI, GPT-4 발표 자료 (2023.3) — 안전·정렬에 6개월 투입, 금지 요청 응답 82% 감소·사실적 응답 40% 증가
- OpenAI o1 관련 보도(2024.9) 및 IBL News 정리 — IMO 2024 예선 o1 83.3%/GPT-4o 13.4%, Codeforces 89 백분위, 훈련 시간·추론 시간 컴퓨트, API 가격 15달러/60달러(입력/출력 100만 토큰)와 주간 사용 한도 30건·50건 (자체 평가 성격의 수치 포함)
- Shumailov et al., "AI models collapse when trained on recursively generated data", Nature 631 (2024) — 재귀적 학습 시 모델 붕괴(model collapse)
- Google Search Central 스팸 정책 — 대량 생성 저품질 콘텐츠(scaled content abuse) 감점
참고한 글
- 에이전트는 지식의 양이 아니라 로직과 규칙으로 일한다 — 같은 주제를 운영 관점에서 정리한 이 사이트의 글
- AI는 왜 통제가 안 되는가, 확률 엔진의 정체와 탈옥과 인젝션과 외부 울타리 설계
- 인공지능 기반 결재 자동화의 위험성과 통제권 상실 — 같은 날 올린 자매 글
이 글은 운영자의 자유 기고이며, 수치 검증과 표 구성은 Cline 에이전트가 보조했습니다.
AI Knowledge Hub