데이터셋 110

한국어 AI 학습·평가 데이터.

AI 허브 데이터 활용을 위한 기계 번역앱 구축과 번역기 평가 및 신규 말뭉치 구축

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

AI Hub 공개 데이터를 정제한 번역 메모리와 한·영·일·중 신규 병렬 말뭉치 및 번역기 비교 평가 데이터로 총 1,090,000문장을 제공한…

AI-Hub 한국어 데이터

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

한국지능정보사회진흥원(NIA)이 운영하는 국가 AI 학습용 데이터 개방 포털. 한국어 텍스트·음성·영상·멀티모달 등 다양한 분야의 대규모 학습용…

AI응답 결과에 대한 품질 평가 데이터

qa
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

요약·질의응답·대화 시스템의 생성 결과를 평가하기 위한 지표와 56,819개 대화 세션, 1,001,428개 라벨 발화로 구성된 한국어 평가 데…

AI허브 데이터 활용을 위한 기계 번역앱 구축과 번역기 평가 및 신규 말뭉치 구축 (2023)

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

AI Hub 공개 말뭉치를 정제한 번역 메모리와 한·중·일·영 신규 병렬 말뭉치, 번역기 평가 데이터를 합쳐 1,400,000문장으로 구축한 기…

APEACH

safety
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

크라우드소싱으로 생성한 한국어 혐오표현 탐지 평가용 데이터셋이다.…

BEEP! Korean HateSpeech

safety
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

연예 뉴스 댓글 9,381건에 성별편향·혐오/공격성을 라벨링하고 대규모 비라벨 댓글을 함께 제공하는 독성 표현 데이터셋이다.…

CC-100 Korean

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

CommonCrawl 스냅샷을 CCNet 파이프라인으로 정제해 구축한 단일언어 한국어 웹 말뭉치이다.…

CLIcK (Cultural and Linguistic Intelligence in Korean)

qa
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

수능·TOPIK·KIIP 등 공식 시험에서 추출한 한국 문화·언어 지식 평가용 객관식 약 2,000문항 데이터셋이다.…

ClovaCall

speech
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

식당 예약 도메인 콜센터 상황의 한국어 발화 약 11만 쌍으로 구성된 음성인식 데이터셋이다.…

GSM8K-Ko

qa
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

초등 수학 문장제 GSM8K를 한국어로 번역한 수학 추론 데이터셋으로 8,792행을 포함한다.…

HRM8K (HAE-RAE Math 8K)

qa
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어·영어 수학 추론 벤치마크로 한국 수학올림피아드·수능 등 원본 문제와 GSM8K·MATH 번역 문제 8,011건을 포함한다.…

K-Culture 관광 콘텐츠 특화 일본어 말뭉치 데이터

multimodal
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

한국 관광 6개 분야의 한국어·일본어 텍스트와 일본어 질의응답을 담은 텍스트·이미지 데이터셋으로, 원천 464,932건·약 1억7,767만 어절…

KatFish

safety
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

에세이·시·논문 초록에서 사람 작성 한국어와 4개 LLM 생성 한국어를 구분하기 위한 벤치마크 데이터셋.…

KcBERT Corpus

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

네이버 뉴스 댓글·대댓글을 수집·정제한 대규모 구어체 한국어 사전학습 코퍼스다.…

KLAID (Korean Legal AI Datasets)

domain-specific
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국 법률 AI용 데이터셋으로 법적 판단 예측(LJP) 태스크 161,192건과 177개 법조문 라벨을 제공한다.…

Ko UltraFeedback Binarized

qa
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

UltraFeedback 선호(binarized) 데이터를 한국어로 번역한 DPO/선호학습용 데이터셋으로 약 6만 건을 포함한다.…

Ko Wikidata QA

qa
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

Wikidata 기반으로 생성한 한국어 질의응답 데이터셋으로 약 137,505건을 포함한다.…

KoAlpaca Dataset

korean-corpus
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

Stanford Alpaca 방식을 한국어에 적용한 한국어 instruction-following 데이터셋. v1.1a는 약 2만1천여 건의 i…

KOLD

safety
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

네이버 뉴스·유튜브 댓글에 공격성·대상·스팬을 세밀하게 라벨링한 한국어 혐오·공격 표현 데이터셋이다.…

KoLIMA

qa
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

Meta LIMA 정렬용 instruction 데이터를 한국어로 번역한 소규모 고품질 데이터셋(train 1,030·test 300)이다.…

KoLLaVA-Instruct-150k

multimodal
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

LLaVA 시각 지시(instruction) 데이터를 한국어로 번역한 약 15만 건의 멀티모달 이미지-대화 데이터셋이다.…

Korean Ethical Question Answer

safety
검토 필요 검토 필요정보 재검토가 필요합니다. 일부 값이 공식 출처로 확인되지 않았습니다.

성·차별·불법·폭력 등 윤리 이슈에 대한 한국어 질문-답변 약 29,000쌍에 윤리/비윤리 라벨을 부여한 안전성 데이터셋이다.…

Korean RLHF Dataset

qa
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

KoAlpaca·Alpaca·Dolly·OpenAssistant 등 5개 출처를 통합·정제한 약 107,000건의 한국어 instruction …

Korean UnSmile Dataset

safety
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

여성·인종·종교 등 10개 범주로 라벨링한 약 1만8천 문장 규모의 한국어 혐오표현 멀티라벨 데이터셋이다.…

KorFin-ASC

domain-specific
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

금융 애널리스트 리포트 등에서 구축한 한국어 금융 개체수준 감성분석 데이터셋으로 8,818개 샘플을 포함한다.…

KorMedMCQA

domain-specific
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

의사·간호사·약사·치과의사 국가시험 기반 7,469개 문항으로 구성된 한국어 의료 객관식 QA 데이터셋이다.…

KorNLI

qa
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

SNLI·MNLI·XNLI를 한국어로 옮긴 자연어추론 데이터셋으로 함의·중립·모순 3범주 라벨을 제공한다.…

KorQuAD

qa
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 기계독해(MRC) 데이터셋. KorQuAD 1.0은 한국어 위키백과 문서 기반 7만여 개의 사람이 생성한 질문-답변 쌍(추출형)으로 구성…

KorQuAD 2.0

qa
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

HTML 문서 기반으로 확장한 한국어 기계독해 데이터셋으로 표·리스트 등 복잡한 문서 구조에서 10만여 개 질의응답을 제공한다.…

KorSTS

qa
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

영어 STS-B를 번역·구축한 한국어 의미 유사도(STS) 데이터셋으로 문장쌍에 0~5 유사도 점수를 부여한다.…

KoWikiText

korean-corpus
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 위키백과 덤프에서 추출한 약 133만 문서 규모의 한국어 코퍼스다.…

KsponSpeech

speech
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

약 1,000시간 규모의 한국어 자유발화 음성과 전사문으로 구성된 대규모 ASR 데이터셋이다.…

KSS (Korean Single Speaker Speech Dataset)

speech
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

전문 성우 여성 화자의 한국어 음성 12,853개 파일(약 12시간)과 정렬된 텍스트로 구성된 TTS용 데이터셋이다.…

KULLM-v2 (instruction)

qa
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

GPT4ALL·Dolly·Vicuna 데이터를 한국어로 번역한 152,630건의 instruction 튜닝 데이터셋이다.…

KVQA

multimodal
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

시각장애인 대상 이미지·질문·답변으로 구성된 한국어 시각질의응답(VQA) 데이터셋이다.…

LBox Open

domain-specific
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

판례 15만 건 기반의 사건명 분류·법령 분류·형량/민사 판결 예측·요약 등 한국어 법률 NLP 벤치마크 데이터셋이다.…

Namuwiki Corpus

korean-corpus
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

나무위키 데이터베이스 덤프(2022-03-01) 기반 867,024건의 한국어 문서 말뭉치이다.…

NSMC (Naver Sentiment Movie Corpus)

korean-corpus
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

네이버 영화 리뷰 20만 건에 긍/부정 라벨을 부여한 한국어 감성 분석 코퍼스다.…

OpenAssistant Guanaco Ko

qa
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

OpenAssistant Guanaco 대화 데이터를 한국어로 번역한 약 1만 건의 instruction 데이터셋이다.…

OpenOrca-KO

qa
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

OpenOrca에서 약 2만 건을 표본 추출해 번역한 단계적 추론 기반 한국어 instruction 데이터셋이다.…

OSCAR-2301 Korean

korean-corpus
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

Common Crawl에서 추출·필터링한 한국어 웹 말뭉치로 약 1,514만 문서·38GB 규모이다.…

ShareGPT DeepL 한국어 (KoVicuna)

korean-corpus
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

ShareGPT 대화 약 62만 건을 한국어로 번역한 멀티턴 대화·instruction 데이터셋이다.…

SQuARe

safety
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

민감한 질문과 수용 가능한 응답을 인간-기계 협업으로 구축한 대규모 한국어 안전성 데이터셋이다.…

UltraFineWeb-ko-synth

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

KAIST MLP Lab의 KORMo 프로젝트에서 공개한 대규모 한국어 합성 사전학습 코퍼스. 완전 공개 한국어 학습 데이터의 일부로 배포됐다.…

Zeroth-Korean

speech
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

105명 화자의 약 51.6시간 한국어 발화와 전사문으로 구성된 오픈 음성인식(ASR) 코퍼스다.…

감정이 태깅된 자유대화 (성인)

speech
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

성인 2인의 비대본 자유대화 음성을 전사하고 감정 상태·유형·정도·대상을 태깅한 데이터다. 공식 메타데이터는 6,000시간, 상세 통계는 성인 …

고령자 근현대 경험 기반 스토리 구술 데이터

speech
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

60세 이상 고령자가 50개 단어를 바탕으로 구술한 기억의 음성·텍스트 각 143,630건에 구체성·감정·감각 요소와 화자 메타정보를 태깅한 데…

공공 민원 상담 LLM 사전학습 및 Instruction Tuning 데이터

qa
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

공공기관 민원 상담 원천 10,182건을 분류·요약·질의응답 지시 데이터 124,717건으로 가공한 한국어 LLM 학습 데이터셋이다.…

공공행정문서 OCR

multimodal
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

김해시 공공행정문서 90만 장과 2,500만 단어 라벨을 포함해 수기·타자체·인쇄체가 혼합된 행정문서 OCR 학습을 지원한다.…

국가기록물 대상 초거대 AI 학습을 위한 말뭉치 데이터

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

국가기록물과 정부간행물에서 구축한 3억여 토큰의 말뭉치, 질의응답 5만 건, 유해 질의 10,560건을 포함하는 한국어 LLM 학습 데이터셋이다…

국회 회의록 기반 지식 검색 데이터

qa
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

국회 회의록 11,827건의 발언을 질문과 답변으로 분리해 구축한 44,033쌍의 한국어 입법 분야 질의응답 데이터셋이다.…

글로벌 규범·문화 평가 데이터

safety
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

베트남 문화 이해·언어 추론·상식 생성·환각 방지·사회적 가치 정렬·멀티모달 이해 등 10개 태스크 26,299건으로 구성된 LLM 평가 데이터…

기계번역 품질 검증 데이터

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

한국어-영어 양방향 기계번역 결과를 사후 교정하고 어절·문장·문서 수준으로 품질을 주석한 분류·교정 데이터 620,002건이다.…

낚시성 기사 탐지 데이터

safety
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

제목-본문 불일치와 본문 도메인 일관성 부족 유형을 포함하도록 신문기사를 가공한 한국어 낚시성 기사 탐지 학습 데이터 733,427건이다.…

뉴스 기사 기계독해 데이터

qa
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

국내 종합일간지와 지역신문 기사 지문에 네 가지 유형의 질문·답변을 연결한 400,056건 규모의 한국어 기계독해 데이터셋이다.…

다양한 문화콘텐츠 스토리 데이터

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

영화·드라마·소설·만화의 서사 단위별 줄거리와 설정·모티프·인물·서사 단계·감정·장소를 라벨링한 한국어 스토리 생성 학습 데이터 100,000건…

다양한 소음원에서의 Ground Truth 지식 정보 데이터

speech
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

다양한 소음 환경의 목적 지향 대화 음성 2,024.9시간·41,503건과 이상소리 감지를 위한 환경 소리 509.9시간·61,258건으로 구성…

다양한 형태의 한글 문자 OCR

multimodal
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

50종 서식의 인쇄체 75,000장과 필기체 글자·단어 1,101,225장 등 총 1,176,225장의 한글 문자 이미지 데이터셋이다.…

대규모 구매도서 기반 한국어 말뭉치 데이터

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

구매 도서에서 수집·검증한 10억 어절 규모의 한국어 텍스트를 문장 단위로 가공한 2021년 구축 말뭉치다.…

대규모 웹데이터 기반 한국어 말뭉치 데이터

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

웹사이트에서 수집한 10억 어절의 한국어 텍스트를 제목·단락·본문으로 구조화하고 개체명과 신조어를 태깅한 대규모 말뭉치다.…

동아시아 고전 스토리 데이터

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

한국·중국·일본 고전 891작품의 원문·번역문·요약문과 내용 분류·주제어·주제문을 붙인 라벨링 데이터 14,197건으로 구성된 LLM 스토리 생…

멀티모달 영상

multimodal
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

국내 상황의 영상 6,000개 약 110시간에 오디오·대본·감정·인물·개체 관계·발화 의도·질의응답 라벨을 결합한 멀티모달 데이터셋이다.…

모두의 말뭉치 (NIKL Corpus)

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

국립국어원이 구축·공개하는 대규모 한국어 말뭉치 모음. 문어·구어·웹·메신저·대화·병렬·수어 등 다양한 유형의 말뭉치를 포함하며, 이용 약관에 …

문서요약 텍스트

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

신문·기고문·잡지·법원 판결문 원문 40만 건과 추출·생성 요약문 80만 건으로 구성된 대규모 한국어 문서요약 데이터셋이다.…

문화, 게임 콘텐츠 분야 용어 말뭉치

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

인터넷 커뮤니티의 문화·게임 제품명, 서비스명, 축약어와 신조어를 수집해 용어 90,433건과 용례 428,298건을 라벨링한 한국어 말뭉치다.…

민간 민원 상담 LLM 사전학습 및 Instruction Tuning 데이터

qa
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

금융·통신 등 민간 민원 상담 원천 12,303건을 분류·요약·질의응답 지시 데이터 132,401건으로 가공한 한국어 LLM 학습 데이터셋이다.…

발화유형(문어, 구어, 채팅)별 기계번역 병렬 말뭉치

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

문어·구어·채팅의 어투와 도메인 차이를 반영해 한국어-영어·중국어·일본어 기계번역 성능을 평가하도록 구축한 병렬 말뭉치 90,003건이다.…

방송 콘텐츠 대화체 음성인식 데이터

speech
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

TV·라디오의 실제 잡음 환경을 포함한 2인 이상 방송 대화 10,000시간을 억양구 경계와 화자 정보와 함께 전사한 한국어 음성인식 데이터셋이…

방송콘텐츠 한국어-아시아어 번역 말뭉치

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

방송 콘텐츠의 신조어·약어·은어와 관용 표현을 반영한 한국어-아시아어 NMT 학습 말뭉치로 북경어·일본어·대만어·몽골어·힌디어 번역 2,503,…

방송콘텐츠 한국어-유럽어 번역 말뭉치

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

방송 콘텐츠의 신조어·약어·은어와 관용 표현을 반영한 한국어-독일어·프랑스어·이탈리아어 양방향 NMT 말뭉치 1,960,139문장이다.…

법률안 검토 보고서 요약 데이터

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

제19대부터 제21대 국회의 법률안 검토보고서 3만 건을 쟁점 단위로 가공한 한국어 법률 문서 요약 학습 데이터셋이다.…

서베이 문항 생성 데이터

qa
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

전문 리서처가 설계한 한국어 설문 원천 11,372건을 질문 관계와 다음 문항 생성에 활용하도록 가공한 라벨링 데이터 97,957건으로 구성된다…

속성기반 감정분석 데이터

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

상품 리뷰에서 평가 대상 속성과 사용자 감정을 추출·태깅한 한국어 속성 기반 감정분석 데이터 250,312건이다.…

시간 표현 탐지 데이터

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

뉴스·대화·역사·스포츠 문서에서 시간 표현, 사건, 시간 관계를 TIMEX3·EVENT·TLINK로 태깅한 한국어 학습 데이터 41,111건이다…

야외 실제 촬영 한글 이미지

multimodal
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

야외 간판 45만 장과 책표지 5만 장에 한글 단어 바운딩박스와 전사 정보를 붙인 총 50만 장의 실환경 OCR 데이터셋이다.…

옛한글 문자인식(OCR) 인공지능 학습용 데이터

multimodal
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

15세기부터 20세기 초까지의 고문헌·고문서 이미지에서 추출한 옛한글 12,003,864글자를 제공하는 OCR 학습 데이터셋이다.…

온라인 구어체 말뭉치 데이터

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

온라인 게시판과 댓글에서 수집한 구어체 10억 어절에 개체명·신조어·형태소를 태깅해 상호작용 표현과 감정 학습에 활용하도록 구축한 말뭉치다.…

외부 지식 기반 멀티모달 질의응답 데이터

multimodal
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

Wikimedia Commons 이미지 60,084장에 질의응답 120,168건, 바운딩 박스 60,084건, 외부 지식 284,565건을 연결…

요약문 및 레포트 생성 데이터

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

신문·보도자료·간행물·문학·연설문 등 다양한 문서 약 20만 건에 추출요약과 생성요약을 제공하는 한국어 문서요약 데이터셋이다.…

음성인식에 의한 영상 요약 데이터

multimodal
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

음성 발화가 포함된 방송 영상 5,958건·3,000시간 이상과 하이라이트 검색용 음성·전사 질의 약 20만 건 및 대응 영상 구간 라벨로 구성…

인공지능 학습을 위한 외국인 한국어 발화 음성 데이터

speech
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

외국어 모어 화자의 한국어 낭독·자유발화와 전사·메타데이터를 4,302시간 규모로 구축한 외국인 한국어 음성인식 데이터셋이다.…

인도네시아어 말뭉치 데이터

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

한국·인도네시아 관련 맥락을 포함한 인도네시아어 13,781,860문장·200,113,484토큰과 개체명 인식 라벨을 제공하는 초거대 AI 학습…

인터뷰 진행 멀티턴 데이터

qa
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

인터뷰 목적과 이전 문답을 바탕으로 후속 질문을 생성하도록 구성한 3,040건의 한국어 멀티턴 학습 데이터셋이다.…

일반상식 문장 생성 데이터

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

508,120개 개념 집합마다 일반상식에 부합하는 한국어 문장 2개를 생성해 총 1,016,240문장으로 구축한 자연어 생성 학습 데이터셋이다.…

일반상식 문장 생성 평가 데이터

qa
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

사람과 AI가 생성한 한국어 일반상식 문장 1,071,345개를 문법성·사실성·유창성·다양성 등의 기준으로 평가한 생성 품질 검증 데이터셋이다.…

일상대화 한국어 멀티세션 데이터

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

이전 대화 이력과 참조 문서·검색어·세션 요약을 포함한 61,553건의 한국어 멀티세션 대화로 장기 문맥 기반 챗봇 학습에 적합하다.…

전문분야(기술과학) 한국어 멀티세션 데이터

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

자연·생명·인공물 16개 기술과학 분야의 전문문서 106,718건과 근거 검색 정보가 태깅된 멀티세션 질의응답 60,414건으로 구성된다.…

주제별 텍스트 일상 대화 데이터

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

식음료·주거·교통·교육·가족 등 20여 개 주제의 자유로운 일상 대화에 화자 정보와 문장별 화행을 라벨링한 한국어 대화 텍스트 데이터셋이다.…

지식그래프-투-텍스트 데이터

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

역사·의료·사회·경제·국제·문화·IT 분야의 지식그래프 원천 237,294건과 자연어 가공 데이터 300,178건으로 구성된 한국어 생성 학습 …

초거대 AI 헬스케어 질의응답 데이터

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

의료 전문 지식을 질환별 질문과 답변으로 구성해 의료용 챗봇과 초거대 언어모델 학습에 활용하도록 구축한 한국어 헬스케어 데이터셋이다.…

초거대 언어모델 신뢰성 벤치마크 데이터

safety
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

한국어 LLM의 무해성·정보 정확성·도움 적정성을 평가하는 벤치마크 33,000건과 신뢰성 학습 데이터 50,000건으로 구성된다.…

추상 요약 사실성 검증 데이터

safety
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

AI와 사람이 작성한 요약문의 문장 생성·내용 오류를 6개 세부 유형으로 분류하고 수정한 한국어 요약 사실성 학습 데이터 101,386건이다.…

캄보디아(크메르어) 규범 문화 말뭉치 데이터

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

캄보디아 문화·규범·관습·예절을 다룬 크메르어 말뭉치 287,528건·124,530,017어절과 Instruction QA 5,000건, 성능평…

컴플라이언스 데이터

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

규제 체계·체크리스트·검사 보고서를 바탕으로 6개 산업군의 질의응답 103,770건과 텍스트 분류 302,888건을 구축한 한국어 규정 데이터셋…

탄자니아(스와힐리어) 규범 문화 말뭉치 데이터

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

탄자니아 문화·규범·관습·예절을 다룬 스와힐리어 말뭉치 247,490건·105,312,248어절과 Instruction QA 5,000건, 성능…

텍스트 윤리검증 데이터

safety
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

대화형 AI의 윤리 검증을 위해 상위 온톨로지와 윤리 라벨을 적용한 453,340문장, 132,807개 대화 세트로 구성된 한국어 데이터셋이다.…

한국어 SNS 멀티턴 대화 데이터

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

한국어 SNS의 문체와 내용을 반영한 2인·3인 화자 멀티턴 대화 원천 및 라벨링 데이터 각 3,246,886발화로 구성된 대화 학습 데이터셋이…

한국어 다중 이벤트 추출 데이터

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

신문과 도서에서 수집한 원천 텍스트 230,837건을 바탕으로 다중 사건과 사건 주체·객체를 태깅한 이벤트 기준 가공 데이터 17,233건을 제…

한국어 대학 강의 데이터

speech
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

대학 강의 영상·음성의 자동 인식과 자막 생성을 위해 구축한 한국어 음성·전사 데이터로 원천 및 라벨링 데이터가 각각 2,120,832개다.…

한국어 대화

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

소상공인과 공공 민원 10개 분야의 대화 50만 건 이상에 도메인·의도·개체·시소러스 정보를 결합한 한국어 자연어이해 데이터셋이다.…

한국어 대화 요약

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

일상 대화와 토론 원문 350,000건 및 각 원문에 대응하는 한 문장 생성 요약문 350,000건으로 구성된 한국어 대화 요약 데이터셋이다.…

한국어 멀티세션 대화

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

두 참여자가 페르소나와 주제를 바탕으로 시간 간격을 두고 나눈 일상 대화에 세션·페르소나·요약 정보를 라벨링한 한국어 텍스트 데이터 80,000…

한국어 성능이 개선된 초거대AI 언어모델 개발 및 데이터

korean-corpus
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

약 20억 어절·310만 건의 한국어 말뭉치와 SFT·보상모델·PPO용 RLHF 데이터 7만7천 건으로 구성된 초거대 언어모델 학습 데이터셋이다…

한국어 아동 음성 데이터

speech
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

아동의 낭독 발화와 전사·메타데이터를 5,000시간 규모로 구축해 아동 음성인식과 교육 서비스 개발에 활용하도록 한 데이터셋이다.…

한국어 텍스트-비디오-사운드 데이터

multimodal
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

방송·개인 영상의 음성 전사, 주요 이미지, 영상 요약을 한국어 텍스트와 연결한 500,123건 규모의 비디오·사운드 검색 및 캡셔닝 데이터셋이…

한국어-다국어 번역 말뭉치 (인문학)

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

도서·논문·간행물에서 수집한 인문학 문장을 영어·중국어·일본어로 번역하고 검수한 한국어 중심 다국어 병렬 말뭉치 301,181건이다.…

한국어-다국어 번역 말뭉치(기초과학)

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

도서·논문·간행물의 기초과학 문장을 영어·중국어·일본어로 번역하고 검수한 한국어 중심 다국어 병렬 말뭉치 308,064건이다.…

한국어-다국어(영어 제외) 번역 말뭉치(기술과학)

domain-specific
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

도서·논문·간행물의 기술과학 문장을 중국어와 일본어로 번역하고 검수한 한국어 중심 병렬 말뭉치 302,130건이다.…

한국인 대화음성

speech
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

연령·지역·원거리·다자발화와 방송 콘텐츠를 포함한 한국어 대화 음성 4,000시간 및 전사·메타데이터로, 범용 음성인식과 화자인식 학습에 활용된…

행정 문서 대상 기계독해 데이터

qa
공식 출처 확인 공식 출처 확인공식 출처 1개 이상으로 확인되었습니다.

행정문서의 일반 텍스트와 표를 지문·질문·답변으로 가공한 411,840건 규모의 한국어 기계독해 데이터셋이다.…