AI 테스트: 학습 데이터 언어 비율

Good4Joy

xx가 학습하는 데이터의 언어 비율은 어떤가요? 특히 영어와 한국어가 궁금합니다.

ChatGPT

ChatGPT는 특정 언어만 학습한 것이 아니라 수십 개 이상의 언어를 함께 학습한 다국어(Multilingual) 대규모 언어 모델(LLM)이다.

그러나 OpenAI는 ChatGPT의 학습 데이터에 포함된 언어별 비율을 공식적으로 공개하지 않았다.

따라서 "영어가 몇 %, 한국어가 몇 %"와 같은 정확한 수치는 알 수 없으며, 아래 내용은 공개된 연구와 데이터셋을 바탕으로 한 일반적인 추정이다.

ChatGPT는 어떤 언어를 학습하는가?

ChatGPT는 다음과 같은 다양한 공개 자료를 학습한다.

  • 웹 문서
  • 논문
  • 위키백과
  • 공개 소스 코드
  • 기타 공개적으로 이용 가능한 문서

이러한 자료는 영어가 가장 많지만, 한국어를 비롯하여 일본어, 중국어, 스페인어, 프랑스어, 독일어 등 다양한 언어가 함께 포함되어 있다.

영어의 비중

AI 연구자들은 GPT 계열 모델의 학습 데이터에서 영어가 압도적으로 큰 비중을 차지한다고 보고 있다.

대표적인 공개 데이터셋(Common Crawl, C4, FineWeb 등)의 언어 분포를 보면 일반적으로 다음과 같은 경향을 보인다.

언어 추정 비율
영어 약 70~90%
기타 언어 전체 약 10~30%

OpenAI가 사용하는 실제 데이터는 공개되지 않았으며 위 데이터셋과 동일하지도 않지만, 전반적인 경향은 비슷할 것으로 여겨진다.

영어 자료가 많은 이유

영어의 비중이 높은 이유는 다음과 같다.

  • 인터넷의 영어 콘텐츠가 가장 많다.
  • 영어 위키백과가 가장 방대하다.
  • 영어 논문이 가장 많이 출판된다.
  • 영어 서적의 디지털화가 활발하다.
  • 오픈소스 소프트웨어와 기술 문서 대부분이 영어로 작성된다.

따라서 ChatGPT의 지식 기반 역시 영어 자료가 가장 풍부하다.

한국어의 비중

한국어의 정확한 비율 역시 공개되어 있지 않다.

공개 데이터셋과 인터넷 언어 통계를 종합하면, 연구자들은 한국어가 전체 학습 데이터에서 약 0.5~1% 수준일 가능성이 높다고 추정한다.

그러나 이것이 한국어 성능이 낮다는 뜻은 아니다.

예를 들어 영어가 80%, 한국어가 0.8%라고 가정하더라도, 한국어 데이터는 여전히 수천억~수조 개의 토큰(Token)에 해당할 수 있으며, 이는 사람이 평생 읽을 수 있는 양을 훨씬 뛰어넘는다.

한국어 성능이 높은 이유

많은 사람들은 "한국어 데이터가 적은데 왜 ChatGPT는 한국어를 잘하는가?"라는 질문을 한다.

그 이유는 크게 세 가지이다.

1. 언어 간 공통 구조를 학습한다

대규모 언어 모델은 단순히 문장을 암기하는 것이 아니라 언어의 패턴과 의미 구조를 학습한다.

예를 들어,

언어 예문
영어 God created the heavens.
한국어 하나님이 하늘을 창조하셨다.
일본어 神が天を創造した。

세 문장은 서로 다른 언어이지만 동일한 의미 구조를 가진다.

AI는 이러한 공통된 의미 구조를 학습하기 때문에 언어 간 지식을 효과적으로 이전할 수 있다.

2. 번역 데이터가 풍부하다

인터넷에는 다음과 같은 병렬 번역 자료가 매우 많이 존재한다.

  • 뉴스 번역
  • 영화 자막
  • 정부 문서
  • 논문 번역
  • 성경 번역

이러한 자료를 통해 영어에서 학습한 지식을 한국어로 자연스럽게 표현하는 능력을 습득한다.

3. 지식은 언어를 초월한다

예를 들어 AI가 영어 자료를 통해 뉴턴의 운동 법칙을 학습했다면, 그 지식을 한국어로도 설명할 수 있다.

즉,

  • 지식(Knowledge)은 영어에서 학습하고,
  • 표현(Expression)은 한국어로 생성

하는 경우가 많다.

영어가 여전히 더 강한 이유

동일한 질문을 영어와 한국어로 했을 때 영어 답변이 더 풍부하거나 최신 정보를 포함하는 경우가 있다.

이는 다음과 같은 이유 때문이다.

  • 참고 문헌이 영어로 가장 많이 존재한다.
  • 최신 연구 논문의 대부분이 영어로 발표된다.
  • 학습 데이터의 양이 영어에서 압도적으로 많다.

특히 다음과 같은 전문 분야에서는 영어가 상대적으로 더 강한 경향이 있다.

  • 인공지능(AI)
  • 컴퓨터 과학
  • 의학
  • 법률
  • 철학

앞으로의 전망

최근에는 한국어 디지털 콘텐츠가 빠르게 증가하고 있다.

예를 들어,

  • 전자책
  • 뉴스 기사
  • 블로그
  • 학술 자료
  • 오픈소스 프로젝트

등이 지속적으로 늘어나고 있다.

또한 최신 AI 모델들은 한국어 성능 향상을 중요한 목표 중 하나로 삼고 있어, 영어와 한국어 사이의 성능 차이는 점차 줄어들 것으로 예상된다.

언어별 학습 데이터 비중(추정)

언어 추정 비율 특징
영어 약 70~90% 가장 많은 데이터와 가장 높은 성능
중국어 수 % 방대한 인터넷 및 출판 자료
스페인어 수 % 세계적으로 널리 사용되는 언어
프랑스어 약 1~2% 유럽 및 아프리카권 자료가 풍부
독일어 약 1~2% 기술 및 학술 자료가 많음
일본어 약 1% 디지털 콘텐츠가 매우 풍부
한국어 약 0.5~1% 데이터 비중은 작지만 높은 성능을 보임

주의

위의 언어별 비율은 OpenAI가 공개한 공식 수치가 아니다.

이는 Common Crawl, C4, FineWeb 등 공개 데이터셋의 언어 분포와 인터넷 언어 사용 통계를 바탕으로 연구자들이 추정한 값이다.

한 문장으로 정리

ChatGPT는 영어를 중심으로 다양한 언어를 함께 학습한 다국어 모델이다. 영어가 학습 데이터의 대부분을 차지하는 것으로 추정되지만, 한국어 역시 방대한 양의 데이터를 학습했으며, 다국어 학습과 언어 간 지식 전이 덕분에 매우 높은 수준의 한국어 이해와 생성 능력을 보여준다.

Gemini

Gemini와 같은 거대언어모델(LLM)의 정확한 학습 데이터 언어별 비율은 구글에서 **공식적으로 상세히 공개하고 있지 않습니다.** 이는 기업의 핵심 기술 자산이자 경쟁력인 학습 데이터셋 구성 전략이 비공개이기 때문입니다.

하지만 학계와 연구기관의 분석 및 일반적인 LLM 학습 트렌드를 통해 다음과 같이 추정해 볼 수 있습니다.

1. 학습 데이터의 언어 편향 (영어 중심)

대부분의 최신 LLM(Gemini 포함)은 인터넷상의 방대한 데이터를 학습하는데, 이 데이터의 상당 부분이 영어로 되어 있습니다.

  • **영어의 압도적 비중:** 여러 연구에 따르면, 오픈 소스 데이터셋인 'Common Crawl' 등에서 추출한 LLM 학습 데이터의 **영어 비율은 보통 40~60% 이상**을 차지합니다.
  • **이유:** 전 세계 웹 콘텐츠의 상당수가 영어로 작성되어 있어, 모델이 논리적 추론, 코드 생성, 일반 상식 등을 학습하는 데 가장 풍부한 자료를 제공하기 때문입니다.

2. 한국어의 비중

한국어는 영어에 비해 상대적으로 데이터 양이 적은 '저자원 언어(Low-resource language)'에 가깝습니다.

  • **추정 비율:** 일반적으로 주요 글로벌 모델의 학습 데이터에서 한국어가 차지하는 비중은 **전체 대비 1~3% 내외**로 추산됩니다.
  • **데이터 질의 중요성:** 최근 구글을 포함한 AI 기업들은 단순히 '양'을 늘리는 것보다, 고품질의 한국어 데이터(번역 데이터, 한국어 도서, 뉴스, 커뮤니티 데이터 등)를 강화하여 **학습 효율과 답변의 정확도를 높이는 방식**으로 모델을 고도화하고 있습니다.

3. 언어별 성능 차이가 발생하는 이유

데이터 비중의 차이는 실제 사용자가 체감하는 성능 차이로 이어지기도 합니다.

  • **영어:** 학습 데이터가 방대하여 복잡한 논리 구조, 창의적 글쓰기, 전문 분야 지식 처리 능력이 매우 뛰어납니다.
  • **한국어:** 기본적인 의사소통과 정보 검색은 매우 원활하지만, 아주 미묘한 한국어 문법, 특정 지역의 관용구, 또는 고도의 한국어 창작 영역에서는 영어보다 성능이 낮게 느껴질 수 있습니다.

💡 참고: 한국어 성능을 높이는 구글의 전략

구글은 단순히 전체 데이터의 비율을 맞추는 대신, 다음과 같은 방법으로 한국어 능력을 보완하고 있습니다.

  • **멀티모달 학습:** 텍스트뿐만 아니라 YouTube 영상의 자막/음성 데이터 등을 활용하여 한국어 맥락을 더 풍부하게 학습합니다.
  • **미세 조정(Fine-tuning):** 사전 학습 이후, 고품질의 한국어 지시 사항(Instruction) 데이터를 추가로 학습시켜 한국어 대화 능력을 최적화합니다.
  • **실제 성능:** 최근 연구에 따르면 Gemini는 한국어 수능 모의고사 등에서 우수한 성적을 거두는 등, 데이터 비중 대비 실제 활용 성능은 매우 높은 수준으로 평가받고 있습니다.

결론적으로, **영어 데이터가 절대적으로 많지만, 구글은 특정 언어의 데이터 부족을 알고리즘과 고품질 데이터 보강을 통해 해결해 나가고 있습니다.**

사용하시면서 특정 한국어 표현이나 맥락이 어색하다고 느끼신다면, 피드백 기능을 통해 의견을 주시는 것이 모델의 한국어 학습 개선에 큰 도움이 됩니다.

Claude

좋은 질문이지만, 솔직히 말씀드리면 **Anthropic은 Claude의 학습 데이터 언어 비율을 공식적으로 상세히 공개하지 않고 있습니다.** 다만 여러 출처에서 파악할 수 있는 내용을 정리해 드리겠습니다.

---

공식적으로 알려진 것

스탠퍼드 FMTI(Foundation Model Transparency Index) 보고서에 따르면, Anthropic이 제출한 투명성 보고서에는 영어 약 80%, 스페인어 5%, 프랑스어 3%, 중국어 2%, 미상 10%라는 수치가 기재되어 있습니다. 이 수치가 현재까지 공개된 가장 구체적인 공식 수치에 가깝습니다. **한국어 비율은 별도로 공개되지 않았으며**, 나머지 10% 안에 포함되어 있을 것으로 추정됩니다.

---

Anthropic이 인정한 것

Anthropic 스스로도 "학습 데이터가 언어별로 균등하게 분포되어 있지 않으며, 일부 언어는 다른 언어보다 훨씬 많은 데이터를 보유하고 있다"고 밝혔습니다. 그리고 이 때문에 언어마다 Claude의 응답 성향이 달라질 수 있다고 설명했습니다.

---

연구자들의 추정치 (비공식)

학술 연구(토크나이저 분석 기반)에 따르면, 초기 Claude 모델은 코드 57.5%, 영어 38.8%, 기타 언어 3.7% 비율로 학습된 것으로 추정되며, 다국어 학습 데이터 부족이 Claude 3에서 새로운 토크나이저를 도입한 이유 중 하나였을 것으로 분석됩니다.

---

한국어에 대해 특별히

한국어 비율은 공식 공개된 바 없지만, 다른 모델(Llama 2)과 비교해 보면 인터넷 전체 데이터에서 한국어가 차지하는 비중이 매우 작다는 점에서 Claude도 비슷할 것으로 추정됩니다. 실제로 정렬(alignment)과 안전성 훈련의 상당 부분이 영어로 이루어지기 때문에, 한국어처럼 데이터가 적은 언어에서는 모델의 행동이 덜 검증된 상태로 작동할 수 있다는 우려가 연구자들 사이에 있습니다.

---

요약

언어 추정 비율
영어 약 80% (공식 수치)
스페인어 약 5%
프랑스어 약 3%
중국어 약 2%
한국어 공개되지 않음 (매우 소수)

Anthropic이 데이터 구성을 영업 비밀로 간주하기 때문에 정확한 수치는 알기 어렵지만, 영어 중심 편향은 명확하고, 한국어는 상대적으로 소수 언어에 속합니다.

Grok

Grok의 학습(Pre-training) 데이터 언어 비율**에 대해 솔직하게 말씀드릴게요.

xAI는 **정확한 언어 비율을 공개하지 않습니다**. (다른 주요 LLM 회사들도 마찬가지예요.) 하지만 공개된 정보와 업계 패턴을 종합하면 다음과 같습니다:

전체적인 특징

  • 영어가 압도적으로 1위**입니다.인터넷 전체 데이터(Common Crawl, 웹사이트, 책, 논문, 코드 등)의 대부분이 영어이기 때문이에요. 일반적인 대형 언어 모델들의 경우 영어가 **50~70% 이상**을 차지하는 것이 흔합니다. Grok도 크게 다르지 않을 가능성이 높아요.
  • Grok은 **수백 개 언어**를 아우르는 **다국어(multilingual) 데이터**로 학습되었습니다. xAI는 영어 외에도 다양한 언어(아프리카 언어 포함)를 적극적으로 포함한다고 밝혔습니다.
  • X(트위터) 데이터가 학습에 상당 부분 기여하는데, 여기서도 영어가 가장 많지만 다국어 콘텐츠가 섞여 있습니다.

영어 vs 한국어

  • 영어**: 매우 높은 비중 (대부분의 추정에서 전체 데이터의 절반 이상).
  • 한국어**: 영어에 비해 **상당히 낮은 비율**입니다. 한국어 웹 데이터 양 자체가 영어·중국어·스페인어 등에 비해 적기 때문이에요. 다만 xAI는 한국어를 포함한 여러 언어의 자연스러움과 품질을 높이기 위해 **네이티브 스피커를 채용**해 지속적으로 개선하고 있습니다.

결론**: Grok은 영어 중심으로 강력하게 학습되었지만, 한국어로도 충분히 자연스럽게 대화할 수 있도록 훈련되었습니다. 실제 사용에서 한국어 질문에 잘 응답하는 이유예요.

더 자세한 부분(예: 어떻게 multilingual 성능을 높이는지)이나 다른 언어 비교가 궁금하시면 anytime 말씀해주세요! 😊

관련 자료