오픈소스 68
한국어 AI 관련 GitHub·Hugging Face 프로젝트.
AutoRAG
한국 Marker Inc.가 개발한 자기진화형 지식 에이전트. AutoRAG 2.3은 결과 수준 피드백 학습, 증분 클라우드 드라이브 연결, 범…
CRAFT (구현)
NAVER Clova AI Research의 공식 PyTorch 구현(CVPR 2019). 문자 영역과 연결성을 학습해 곡선 텍스트 포함 다국어…
Deep Text Recognition Benchmark
NAVER Clova AI Research의 공식 구현. 4단계 STR(장면 텍스트 인식) 프레임워크로 모델별 정확도·속도·메모리 기여도를 비교…
DNA Factory
Hugging Face TRL과 DeepSpeed 기반의 디노티시아 LLM 후학습 프레임워크. 공통 설정·저장 경로에서 SFT, DPO, GRP…
Donut (구현)
NAVER Clova AI Research의 공식 구현(ECCV 2022). OCR 엔진 없이 문서를 엔드투엔드로 이해하는 트랜스포머로 합성 문…
EgoSafetyBench Evaluation
EgoSafetyBench의 시나리오 작성, 영상 생성, 이축 안전 주석, VLM 가드 평가를 재현하는 공식 파이프라인. 로컬 오픈웨이트 모델과…
Friendli Model Optimizer (FMO)
FriendliAI가 공개한 생성형 AI 모델 양자화·최적화 도구. FP8/INT8/AWQ 양자화를 지원해 Friendli Engine에서 효율…
Friendli Python SDK
FriendliAI 추론 엔드포인트를 위한 공식 Python SDK. 동기·비동기 Chat Completions, 스트리밍·tool call·구…
FuriosaAI SDK
퓨리오사AI NPU에서 딥러닝 추론을 실행하기 위한 SDK. 컴파일러·프로파일러 CLI와 Python 바인딩·런타임을 포함한다.…
g2pK
발음 규칙과 문맥을 반영해 한국어 문자열을 발음(음소)으로 변환하는 grapheme-to-phoneme 모듈.…
GBDT-Guided Piecewise-Linear Embeddings
LG AI연구원이 공개한 KDD 2026 논문의 공식 PyTorch 구현. GBDT가 배정한 구간 경계를 이용해 수치형 표 데이터를 조각별 선형…
GPT-NeoX
EleutherAI가 개발·공개한 대규모 자기회귀 언어모델 학습 프레임워크. Polyglot-Ko를 포함한 다수의 오픈소스 LLM 학습에 사용되…
HAE-RAE Evaluation Toolkit (HRET)
HAE-RAE HUB가 개발한 한국어 LLM 통합 평가 툴킷. HAE-RAE Bench, KMMLU 등 주요 한국어 벤치마크를 지원하며 Open…
HierSpeech++ (구현)
고려대 연구진의 공식 구현. 계층적 변분추론 기반 빠른 제로샷 음성합성기로 TTS와 음성변환(VC)을 함께 수행한다.…
HiFi-GAN (구현)
카카오 엔터프라이즈 연구진(Jungil Kong 등)의 공식 구현. 멜 스펙트로그램을 원음 파형으로 변환하는 고품질 GAN 보코더로 사전학습 모…
K-BrowseComp Evaluation
K-BrowseComp 데이터와 웹 검색 에이전트 평가 하네스, 다중 검색 백엔드, 자동 문제 생성 파이프라인을 제공하는 공식 저장소.…
KakaoBrain KoGPT
카카오브레인이 공개한 60억 파라미터 규모의 한국어 생성형 사전학습 모델(KoGPT6B).…
KcBERT (repo)
정제된 문어가 아닌 한국어 뉴스 댓글로 학습해 구어·신조어·오타에 강한 BERT 모델.…
KcELECTRA
한국어 뉴스 댓글로 학습해 노이즈가 많은 사용자 생성 텍스트에 강한 ELECTRA 모델.…
khaiii (Kakao Hangul Analyzer III)
카카오가 CNN 기반 데이터 학습 방식으로 개발한 3세대 한국어 형태소 분석기.…
Kiwi (지능형 한국어 형태소 분석기)
이민철(bab2min)이 개발한 고성능 한국어 형태소 분석기. C++ 구현에 Python·Java·Rust·Go·JS 바인딩을 제공하며 속도·정…
Ko-LM-Evaluation-Harness
EleutherAI lm-evaluation-harness를 한국어로 포팅한 평가 하네스. KoBEST·NSMC·KLUE 등 13종 이상의 공개…
ko-prose
한국어 번역투·AI 상투어·불필요한 분량 채우기를 실제 리뷰 교정 사례 기반 11개 규칙으로 점검하는 Claude Code 스킬.…
ko-reranker
bge-reranker-large를 한국어 데이터로 파인튜닝해 질문-문서 관련도를 재정렬하는 RAG용 리랭커.…
ko-sentence-transformers
KorNLU·KLUE 사전학습 모델을 활용해 한국어 문장 임베딩을 파인튜닝하는 저장소.…
KoALa-Bench Evaluation
한국어 오디오 언어모델의 ASR·음성 번역·음성 질의응답·지시 이행·충실도 과제를 실행하는 공식 평가 코드와 백엔드 어댑터 모음.…
KoAlpaca
Stanford Alpaca를 한국어에 적용한 오픈소스 프로젝트. 한국어 instruction 데이터셋 구축과 instruction-tuned …
KoBART
Text Infilling 노이즈로 40GB 이상의 한국어를 학습한 SKT의 인코더-디코더(BART) 모델.…
KoBERT
구글 다국어 BERT의 한국어 성능 한계를 개선하기 위해 SKT가 공개한 한국어 사전학습 BERT.…
KoBigBird
희소 어텐션으로 최대 4096 토큰의 긴 한국어 문서를 처리하는 BigBird 기반 사전학습 모델.…
KoELECTRA
약 34GB 한국어 코퍼스로 학습한 ELECTRA 기반 한국어 사전학습 모델(Base/Small, v1-v3).…
KoEVD Evaluation Toolkit
KoEVD 한국어 안전성 데이터셋과 단계별 평가를 재현하는 KETI 공식 코드. 데이터는 연구·평가·교육용 커스텀 약관을 따른다.…
KoGPT2
40GB 이상의 한국어 텍스트로 학습한 SKT의 한국어 생성형 GPT-2 모델.…
KOMORAN
외부 의존성 없이 동작하는 순수 자바 구현 한국어 형태소 분석기.…
KoNLPy
여러 형태소 분석기를 통합 제공하는 대표적인 한국어 자연어처리 파이썬 패키지.…
KoParadigm
용언과 어미의 결합 규칙을 처리해 한국어 활용형을 생성하는 conjugation paradigm 생성기.…
Korpora (Korean Corpora Archives)
흩어진 한국어 말뭉치를 표준화된 인터페이스로 내려받고 전처리하게 해주는 코퍼스 도구.…
KR-SBERT
서울대 전산언어학연구실이 개발한 한국어 특화 Sentence-BERT 문장 임베딩 모델.…
KSS (Korean Sentence Splitter)
한국어 문장 분리를 중심으로 다양한 전처리 기능을 제공하는 텍스트 처리 도구.…
KUDGE
HAE-RAE HUB가 공개한 한국어 LLM-as-a-Judge·리워드 모델 메타평가 데이터셋. 원어민 주석 약 5천 건으로 비영어권 자동 평가…
KULLM (구름)
고려대 NLP&AI 연구실이 개발한 한국어 특화 instruction-tuned 대규모 언어모델.…
LangChain 한국어 튜토리얼 (langchain-kr)
테디노트가 운영하는 LangChain 한국어 학습 저장소. RAG·에이전트 등 실전 예제를 모듈로 정리했고 위키독스 전자책·유튜브 강의가 연계된…
Llama-2-Ko
Llama 2에 한국어 어휘 확장과 추가 사전학습을 적용한 한국어 특화 LLaMA 계열 모델.…
LogicKor (repo)
instructkr 커뮤니티의 한국어 LLM 다분야 추론·논리 평가 벤치마크 및 실행 하네스. 2024년 10월 이후 아카이브(읽기 전용).…
mailcrawl
Himalaya 기반 이메일 증분 동기화와 FTS5·EmbeddingGemma 하이브리드 검색을 제공하고 AI 에이전트·MCP에 JSON 인터페…
mlxcel
Apple Silicon과 NVIDIA CUDA에서 LLM·VLM·임베딩·리랭킹·음성 모델을 실행하는 래블업의 Rust 추론 런타임. OpenA…
Nari Qwen3-TTS
Nari Labs가 공개한 Qwen3-TTS 1.7B CustomVoice용 단일 H100 실시간 추론 서버. 통합 스케줄러·CUDA Graph…
NOLLI Evaluation
NOLLI의 퍼즐 생성·유일해 검증·모델 호출·결정적 채점을 재현하는 공식 평가 도구. LiteLLM 기반 상용 API와 vLLM 기반 자체 호…
On-Policy Delta Distillation (OPD²)
추론 튜닝 교사와 기반 모델의 확률 차이를 학습 신호로 사용하는 NAVER AI Lab의 온폴리시 델타 증류 공식 구현. 수학·과학·코드 및 영…
Open Ko-LLM Leaderboard (평가 플랫폼)
Upstage-NIA가 운영하는 한국어 LLM 자동 평가·순위 플랫폼(Hugging Face Space). 제출된 모델을 Ko-H5 벤치마크로 …
open-korean-text
정규화·토큰화·어간추출·구 추출을 제공하는 오픈소스 한국어 텍스트 처리기(twitter-korean-text 후속).…
Optimum-RBLN
리벨리온이 공개한 Hugging Face Optimum 확장. Transformers·Diffusers 모델을 RBLN NPU에서 효율적으로 추…
PCBWorld
KiCad의 실제 push-and-shove 배선과 DRC를 활용해 LLM·강화학습 기반 PCB 자동배선을 평가하는 Gymnasium 환경과 3…
Polyglot-Ko
EleutherAI polyglot 팀이 공개한 대규모 한국어 오토리그레시브 언어모델 시리즈. 1.3B, 3.8B, 5.8B, 12.8B 규모가…
py-hanspell
네이버 맞춤법 검사기를 활용한 파이썬 한국어 맞춤법 교정 라이브러리.…
PyKoSpacing
딥러닝 기반으로 한국어 문장의 자동 띄어쓰기를 교정하는 파이썬 패키지.…
Q-CARE
KAIST DISLab의 쿼리 비의존·참조 없는 RAG 평가 구현. 질의를 하위 질의로, 답변을 원자적 주장으로 분해해 검색의 커버리지와 생성 …
RAGchain
한국 Marker Inc.(NomaDamas)의 고급 RAG 워크플로우 프레임워크. LangChain을 확장하며 Ko-StrategyQA 등 한…
Raon-Eval
KVoiceBench, KOpenAudioBench, KMMAU를 지원하는 한국어 음성 언어모델 공개 평가 도구.…
ReCurveflow
곡선 반응 경로와 경로 이탈 보정을 학습해 화학 반응의 전이상태 구조를 예측하는 flow matching 연구의 공식 구현. 학습 코드와 세 가…
soynlp
학습 데이터 없이 통계 기반으로 단어 추출·토큰화를 수행하는 순수 파이썬 한국어 분석 라이브러리.…
StarGAN v2 (구현)
NAVER Clova AI Research의 공식 PyTorch 구현(CVPR 2020). 다중 도메인에서 다양성 높은 이미지 변환·합성을 수행…
torch-rbln
PyTorch의 rbln 디바이스와 torch.compile을 연결하는 리벨리온 공식 확장. 스트림·이벤트·메모리 바인딩과 CPU↔NPU 복사를…
VAETKI tokenizer v2
ETRI LIRS가 공개한 다국어 토크나이저 수정판. 모델 가중치가 아닌 토크나이저 도구로, 기존 137,216개 vocab/ID를 유지하면서 …
VITS (구현)
Jaehyeon Kim 등(카카오 엔터프라이즈)의 공식 구현. 조건부 VAE·적대적 학습·정규화 흐름을 결합한 엔드투엔드 병렬 TTS로 후속 한…
vLLM MBLT
모빌린트 NPU 런타임을 vLLM 서빙·벤치마크 스택에 연결하는 공식 out-of-tree 플러그인. 텍스트·비전언어 모델을 OpenAI 호환 …
vLLM-RBLN
리벨리온 NPU에서 vLLM 추론을 지원하는 공식 플러그인. Qwen 계열·MoE, reranker score API, KV 전송과 비동기 스케…
WHALE
모델 가중치와 에이전트 하네스를 번갈아 최적화하는 KRAFTON AI의 공식 연구 구현. 온라인 rejection-sampling 미세조정과 M…