오픈소스 48
한국어 AI 관련 GitHub·Hugging Face 프로젝트.
AutoRAG
한국 Marker Inc.가 개발한 RAG 프레임워크. AutoRAG 2.0은 문서 컬렉션을 탐색·큐레이션하는 자기진화형 에이전트로 재설계되었다…
CRAFT (구현)
NAVER Clova AI Research의 공식 PyTorch 구현(CVPR 2019). 문자 영역과 연결성을 학습해 곡선 텍스트 포함 다국어…
Deep Text Recognition Benchmark
NAVER Clova AI Research의 공식 구현. 4단계 STR(장면 텍스트 인식) 프레임워크로 모델별 정확도·속도·메모리 기여도를 비교…
Donut (구현)
NAVER Clova AI Research의 공식 구현(ECCV 2022). OCR 엔진 없이 문서를 엔드투엔드로 이해하는 트랜스포머로 합성 문…
Friendli Client
FriendliAI 서빙 엔드포인트에 접근하는 Python 클라이언트 SDK(동기/비동기). 이후 Friendli Python SDK로 대체되어…
Friendli Model Optimizer (FMO)
FriendliAI가 공개한 생성형 AI 모델 양자화·최적화 도구. FP8/INT8/AWQ 양자화를 지원해 Friendli Engine에서 효율…
FuriosaAI SDK
퓨리오사AI NPU에서 딥러닝 추론을 실행하기 위한 SDK. 컴파일러·프로파일러 CLI와 Python 바인딩·런타임을 포함한다.…
g2pK
발음 규칙과 문맥을 반영해 한국어 문자열을 발음(음소)으로 변환하는 grapheme-to-phoneme 모듈.…
GPT-NeoX
EleutherAI가 개발·공개한 대규모 자기회귀 언어모델 학습 프레임워크. Polyglot-Ko를 포함한 다수의 오픈소스 LLM 학습에 사용되…
HAE-RAE Evaluation Toolkit (HRET)
HAE-RAE HUB가 개발한 한국어 LLM 통합 평가 툴킷. HAE-RAE Bench, KMMLU 등 주요 한국어 벤치마크를 지원하며 Open…
HierSpeech++ (구현)
고려대 연구진의 공식 구현. 계층적 변분추론 기반 빠른 제로샷 음성합성기로 TTS와 음성변환(VC)을 함께 수행한다.…
HiFi-GAN (구현)
카카오 엔터프라이즈 연구진(Jungil Kong 등)의 공식 구현. 멜 스펙트로그램을 원음 파형으로 변환하는 고품질 GAN 보코더로 사전학습 모…
KakaoBrain KoGPT
카카오브레인이 공개한 60억 파라미터 규모의 한국어 생성형 사전학습 모델(KoGPT6B).…
KcBERT (repo)
정제된 문어가 아닌 한국어 뉴스 댓글로 학습해 구어·신조어·오타에 강한 BERT 모델.…
KcELECTRA
한국어 뉴스 댓글로 학습해 노이즈가 많은 사용자 생성 텍스트에 강한 ELECTRA 모델.…
khaiii (Kakao Hangul Analyzer III)
카카오가 CNN 기반 데이터 학습 방식으로 개발한 3세대 한국어 형태소 분석기.…
Kiwi (지능형 한국어 형태소 분석기)
이민철(bab2min)이 개발한 고성능 한국어 형태소 분석기. C++ 구현에 Python·Java·Rust·Go·JS 바인딩을 제공하며 속도·정…
Ko-LM-Evaluation-Harness
EleutherAI lm-evaluation-harness를 한국어로 포팅한 평가 하네스. KoBEST·NSMC·KLUE 등 13종 이상의 공개…
ko-reranker
bge-reranker-large를 한국어 데이터로 파인튜닝해 질문-문서 관련도를 재정렬하는 RAG용 리랭커.…
ko-sentence-transformers
KorNLU·KLUE 사전학습 모델을 활용해 한국어 문장 임베딩을 파인튜닝하는 저장소.…
KoAlpaca
Stanford Alpaca를 한국어에 적용한 오픈소스 프로젝트. 한국어 instruction 데이터셋 구축과 instruction-tuned …
KoBART
Text Infilling 노이즈로 40GB 이상의 한국어를 학습한 SKT의 인코더-디코더(BART) 모델.…
KoBERT
구글 다국어 BERT의 한국어 성능 한계를 개선하기 위해 SKT가 공개한 한국어 사전학습 BERT.…
KoBigBird
희소 어텐션으로 최대 4096 토큰의 긴 한국어 문서를 처리하는 BigBird 기반 사전학습 모델.…
KoELECTRA
약 34GB 한국어 코퍼스로 학습한 ELECTRA 기반 한국어 사전학습 모델(Base/Small, v1-v3).…
KoGPT2
40GB 이상의 한국어 텍스트로 학습한 SKT의 한국어 생성형 GPT-2 모델.…
KOMORAN
외부 의존성 없이 동작하는 순수 자바 구현 한국어 형태소 분석기.…
KoNLPy
여러 형태소 분석기를 통합 제공하는 대표적인 한국어 자연어처리 파이썬 패키지.…
KoParadigm
용언과 어미의 결합 규칙을 처리해 한국어 활용형을 생성하는 conjugation paradigm 생성기.…
Korpora (Korean Corpora Archives)
흩어진 한국어 말뭉치를 표준화된 인터페이스로 내려받고 전처리하게 해주는 코퍼스 도구.…
KR-SBERT
서울대 전산언어학연구실이 개발한 한국어 특화 Sentence-BERT 문장 임베딩 모델.…
KSS (Korean Sentence Splitter)
한국어 문장 분리를 중심으로 다양한 전처리 기능을 제공하는 텍스트 처리 도구.…
KUDGE
HAE-RAE HUB가 공개한 한국어 LLM-as-a-Judge·리워드 모델 메타평가 데이터셋. 원어민 주석 약 5천 건으로 비영어권 자동 평가…
KULLM (구름)
고려대 NLP&AI 연구실이 개발한 한국어 특화 instruction-tuned 대규모 언어모델.…
LangChain 한국어 튜토리얼 (langchain-kr)
테디노트가 운영하는 LangChain 한국어 학습 저장소. RAG·에이전트 등 실전 예제를 모듈로 정리했고 위키독스 전자책·유튜브 강의가 연계된…
Llama-2-Ko
Llama 2에 한국어 어휘 확장과 추가 사전학습을 적용한 한국어 특화 LLaMA 계열 모델.…
LogicKor (repo)
instructkr 커뮤니티의 한국어 LLM 다분야 추론·논리 평가 벤치마크 및 실행 하네스. 2024년 10월 이후 아카이브(읽기 전용).…
Open Ko-LLM Leaderboard (평가 플랫폼)
Upstage-NIA가 운영하는 한국어 LLM 자동 평가·순위 플랫폼(Hugging Face Space). 제출된 모델을 Ko-H5 벤치마크로 …
open-korean-text
정규화·토큰화·어간추출·구 추출을 제공하는 오픈소스 한국어 텍스트 처리기(twitter-korean-text 후속).…
Optimum-RBLN
리벨리온이 공개한 Hugging Face Optimum 확장. Transformers·Diffusers 모델을 RBLN NPU에서 효율적으로 추…
Polyglot-Ko
EleutherAI polyglot 팀이 공개한 대규모 한국어 오토리그레시브 언어모델 시리즈. 1.3B, 3.8B, 5.8B, 12.8B 규모가…
py-hanspell
네이버 맞춤법 검사기를 활용한 파이썬 한국어 맞춤법 교정 라이브러리.…
PyKoSpacing
딥러닝 기반으로 한국어 문장의 자동 띄어쓰기를 교정하는 파이썬 패키지.…
RAGchain
한국 Marker Inc.(NomaDamas)의 고급 RAG 워크플로우 프레임워크. LangChain을 확장하며 Ko-StrategyQA 등 한…
Raon-Eval
KVoiceBench, KOpenAudioBench, KMMAU를 지원하는 한국어 음성 언어모델 공개 평가 도구.…
soynlp
학습 데이터 없이 통계 기반으로 단어 추출·토큰화를 수행하는 순수 파이썬 한국어 분석 라이브러리.…
StarGAN v2 (구현)
NAVER Clova AI Research의 공식 PyTorch 구현(CVPR 2020). 다중 도메인에서 다양성 높은 이미지 변환·합성을 수행…
VITS (구현)
Jaehyeon Kim 등(카카오 엔터프라이즈)의 공식 구현. 조건부 VAE·적대적 학습·정규화 흐름을 결합한 엔드투엔드 병렬 TTS로 후속 한…