한국어 성능이 개선된 초거대AI 언어모델 개발 및 데이터
korean-corpus · 공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.
약 20억 어절·310만 건의 한국어 말뭉치와 SFT·보상모델·PPO용 RLHF 데이터 7만7천 건으로 구성된 초거대 언어모델 학습 데이터셋이다.
- 구축 조직
- 한국지능정보사회진흥원
- 언어
- ko
- URL
- https://www.aihub.or.kr/aihubdata/data/view.do?aihubDataSe=data&currMenu=115&dataSetSn=71748&srchDataRealmCode=REALM002&topMenu=100
출처 및 검증
마지막 검증일: 2026-07-23