국가기록물 대상 초거대 AI 학습을 위한 말뭉치 데이터

korean-corpus · 공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

국가기록물과 정부간행물에서 구축한 3억여 토큰의 말뭉치, 질의응답 5만 건, 유해 질의 10,560건을 포함하는 한국어 LLM 학습 데이터셋이다.

구축 조직
한국지능정보사회진흥원
언어
ko
URL
https://www.aihub.or.kr/aihubdata/data/view.do?aihubDataSe=data&currMenu=115&dataSetSn=71788&srchDataRealmCode=REALM002&topMenu=100

출처 및 검증

마지막 검증일: 2026-07-23

✎ 정보 수정 제안