논문 234
한국 AI 모델·벤치마크의 기술보고서와 한국 연구진 주도 대표 논문. 최신 연도순.
A.X K1 Technical Report
SKT의 519B 파라미터 MoE 모델로 10조 토큰을 학습했으며, 제어 가능한 추론 기능과 강력한 한국어 지원을 갖춘다.
Delta-XAI: A Unified Framework for Explaining Prediction Changes in Online Time Series Monitoring
온라인 시계열 모니터링에서 예측 변화를 설명하는 통합 XAI 프레임워크다.
Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model
상태와 행동을 이중 스트림 확산으로 함께 예측해 세계모델로 VLA를 강화한다.
Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models
학습 없이 프레임 단위 신호로 비디오 확산 모델을 세밀하게 제어하는 가이던스 기법이다.
GL-LowPopArt: A Nearly Instance-Wise Minimax-Optimal Estimator for Generalized Low-Rank Trace Regression
일반화 저랭크 트레이스 회귀를 위한 근사 인스턴스별 미니맥스 최적 추정기를 제시한다.
HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy
VLA 모델을 과거 맥락을 반영하는 히스토리 인지 정책으로 전환한다.
KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context
9개 학문 분야 3,466개 시험 문항으로 구성된 한국어 멀티모달 벤치마크로, 한국 문화·제도 맥락에서의 멀티모달 이해력을 평가한다.
KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs
한국어 음성 질의응답과 오디오 이해를 평가하는 세 벤치마크를 구축해 총 12,345개 샘플을 공개한다.
Learning to Generate Unit Test via Adversarial Reinforcement Learning
적대적 강화학습으로 단위 테스트 생성을 학습한다.
LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs
로짓 인지 최종블록 양자화로 저비트 LLM의 생성 품질을 향상한다.
MoBGS: Motion Deblurring Dynamic 3D Gaussian Splatting for Blurry Monocular Video
흐린 단안 비디오에서 선명한 신규 시점을 복원하는 동적 3D 가우시안 스플래팅.
Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs
텍스트를 넘어 다중 모달리티를 활용해 MLLM 프롬프트를 최적화한다.
Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech
공개 음성 61만 5천 시간에서 정제한 데이터로 0.3B·1B 오픈웨이트 TTS 모델과 강건성 평가 자료를 구축한다.
Raon-Speech Technical Report
한국어와 영어의 음성 이해·질의응답·생성을 지원하는 9B SpeechLM Raon-Speech와 실시간 전이중 대화 확장 모델 Raon-SpeechChat을 제안…
Solar Open 2 Technical Report
250B 전체 파라미터 중 토큰당 15B를 활성화하는 하이브리드 어텐션 MoE와 최대 100만 토큰 문맥을 적용한 에이전트 특화 오픈웨이트 모델 Solar Ope…
Verifier-free Test-Time Sampling for Vision-Language-Action Models
검증기 없이 테스트타임 샘플링으로 VLA 로봇 제어 성능을 향상한다.
Verifying Meta-Awareness via Predictive Rewards in Reasoning Models
예측 보상을 통해 추론 모델의 메타인지 능력을 검증한다.
Vision-aligned Latent Reasoning for Multi-modal Large Language Model
시각 정렬 잠재 추론으로 MLLM의 다단계 추론 능력을 개선한다.
What Happens When: Learning Temporal Orders of Events in Videos
비디오 사건의 시간 순서 이해를 평가·향상하는 VECTOR·MECOT.
When to Ensemble: Identifying Token-Level Points for Stable and Fast LLM Ensembling
토큰 수준에서 앙상블 시점을 찾아 안정적이고 빠른 LLM 앙상블을 수행한다.
XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity
10개 국가-언어 쌍 5,500개 테스트 케이스로 구성된 다국어 안전성 벤치마크로, 탈옥 견고성과 문화적 민감성을 함께 평가한다.
AdaSTaR: Adaptive Data Sampling for Training Self-Taught Reasoners
적응적 데이터 샘플링으로 self-taught reasoner 학습을 개선한다.
Arithmetic Transformers Can Length-Generalize in Both Operand Length and Count
산술 과제에서 트랜스포머의 길이 일반화를 피연산자 길이·개수 양쪽에서 개선. 다단계 Position Coupling과 스크래치패드로 2~3배 일반화 달성.
Axial Neural Networks for Dimension-Free Foundation Models
차원에 무관한 파운데이션 모델을 위한 축(axial) 신경망을 제안한다.
Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks
Prior-data fitted network로 신경망 스케일링 법칙을 베이지안적으로 외삽한다.
Combinative Matching for Geometric Shape Assembly
동일 표면·반대 부피 점유를 함께 모델링하는 형상 조립 매칭(ICCV 2025 Highlight).
Convergence and Implicit Bias of Gradient Descent on Continual Linear Classification
여러 선형 분류 과제를 순차 학습하는 연속학습의 수렴성과 암묵적 편향을 분석하고, 순환 학습 시 망각이 0으로 수렴함을 증명.
Cost-Sensitive Freeze-thaw Bayesian Optimization for Efficient Hyperparameter Tuning
비용을 고려한 freeze-thaw 베이지안 최적화로 효율적인 하이퍼파라미터 튜닝을 수행한다.
CUPID: Evaluating Personalized and Contextualized Alignment of LLMs from Interactions
사용자가 상호작용에서 드러내는 맥락적 선호를 추론·적용하는 개인화 정렬 능력을 평가하는 벤치마크(756개 세션). 최신 LLM들이 다중턴 선호 추론에서 큰 한계를…
DeClotH: Decomposable 3D Cloth and Human Body Reconstruction from a Single Image
단일 이미지에서 3D 의복·인체를 분리 복원한다.
Dimension Agnostic Neural Processes
입력 차원이 달라도 처리 가능한 Dimension Aggregator Block을 도입한 뉴럴 프로세스(DANP)로 다양한 차원의 회귀 과제에 대응.
Distilling LLM Agent into Small Models with Retrieval and Code Tools
검색·코드 도구를 활용하는 대형 LLM 에이전트의 추론 능력을 소형 모델로 증류하는 방법을 제안한다.
DistiLLM-2: A Contrastive Approach Boosts the Distillation of LLMs
대조적 접근으로 LLM 지식 증류 성능을 향상한다.
Does SGD really happen in tiny subspaces?
SGD가 저차원 지배 부분공간에서 이뤄진다는 통념을 반박하고, 이 정렬이 본질적이 아니라 허상임을 실험적으로 규명.
Efficient Parametric SVD of Koopman Operator for Stochastic Dynamical Systems
확률적 동역학계의 Koopman 연산자를 효율적으로 파라메트릭 SVD로 근사한다.
EXAONE 4.0: Unified Large Language Models Integrating Non-reasoning and Reasoning Modes
비추론·추론 모드를 통합한 EXAONE 4.0(32B, 1.2B) 모델 시리즈로, 에이전트형 도구 사용과 한국어·영어·스페인어 다국어 지원을 확장했다.
EXAONE Deep: Reasoning Enhanced Language Models
수학·과학·코딩 추론 능력을 강화한 EXAONE 계열 추론 특화 언어 모델이다.
Exploiting Diffusion Prior for Task-driven Image Restoration
확산 사전을 활용한 과제 지향 이미지 복원 EDTR.
FedSVD: Adaptive Orthogonalization for Private Federated Learning with LoRA
LoRA 기반 연합학습에서 적응적 직교화(SVD)로 프라이버시를 지키며 성능을 높이는 기법이다.
Flex-Judge: Text-Only Reasoning Unleashes Zero-Shot Multimodal Evaluators
텍스트 추론만으로 제로샷 멀티모달 평가자를 구현한다.
From KMMLU-Redux to KMMLU-Pro: A Professional Korean Benchmark Suite for LLM Evaluation
기술 자격시험 기반 KMMLU-Redux와 전문 면허시험 기반 KMMLU-Pro 두 전문가급 한국어 벤치마크로, 실무 산업 지식 영역에서 LLM 성능을 평가한다.
HyperCLOVA X THINK Technical Report
6조 토큰으로 사전학습한 추론 특화 한국어·영어 모델로, 128K 컨텍스트와 한국어 벤치마크 경쟁력을 낮은 학습 연산으로 달성했다.
Improving Sound Source Localization with Joint Slot Attention on Image and Audio
슬롯 어텐션으로 이미지·오디오를 분해해 음원 위치 추정을 개선한다.
Kanana: Compute-efficient Bilingual Language Models
카카오의 한국어·영어 이중언어 모델 Kanana 시리즈로, 유사 모델 대비 훨씬 적은 연산으로 경쟁력 있는 성능을 낸다.
KatFishNet: Detecting LLM-Generated Korean Text through Linguistic Feature Analysis
한국어 띄어쓰기·품사 조합·구두점 특성을 이용해 LLM 생성 텍스트를 탐지하는 KatFishNet과 KatFish 데이터셋을 제안한다.
KLASS: KL-Guided Fast Inference in Masked Diffusion Models
KL 기반 가이던스로 마스크드 확산 모델의 추론을 가속한다.
KoBALT: Korean Benchmark For Advanced Linguistic Tasks
한국어의 다섯 언어학 영역을 전문가 작성 문항으로 평가하는 KoBALT 벤치마크를 제안한다.
KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language
275개 이미지-질문 쌍과 객관적 채점 기준으로 구성된 한국어 자유형 VQA 벤치마크로, 심판 모델의 주관적 평가에 의존하지 않고 VLM을 평가한다.
KORMo: Korean Open Reasoning Model for Everyone
합성 데이터를 주로 사용해 학습한 10.8B 한국어·영어 오픈 추론 모델로, 균형 잡힌 합성 데이터가 대규모 사전학습에서 불안정을 초래하지 않음을 보인다.
KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts
한국어 텍스트가 포함된 실제 이미지에서 읽기와 고차 추론을 함께 평가하는 VQA 벤치마크를 제안한다.
Learning to Contextualize Web Pages for Enhanced Decision Making by LLM Agents
웹 페이지를 맥락화해 LLM 에이전트의 의사결정을 향상한다.
Locality-Aware Zero-Shot Human-Object Interaction Detection
CLIP에 지역성·상호작용 인식을 도입한 제로샷 HOI 검출 LAIN.
Masking meets Supervision: A Strong Learning Alliance
마스킹 증강과 지도 학습을 이중 분기로 결합하는 MaskSub.
Maximizing the Position Embedding for Vision Transformers with Global Average Pooling
전역 평균 풀링 시 위치 임베딩 효과를 극대화하는 MPVG.
MoDec-GS: Global-to-Local Motion Decomposition and Temporal Interval Adjustment for Compact Dynamic 3D Gaussian Splatting
움직임을 전역·지역 분해해 동적 3D 가우시안 스플래팅을 압축한다.
MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition
계층적 오디오-비주얼 전문가 혼합으로 강건한 음성인식을 달성한다.
Motif 2 12.7B technical report
Grouped Differential Attention과 최적화 기법을 결합해 제한된 연산 예산에서 더 큰 모델급 성능을 내는 12.7B 모델 Motif 2 기술…
Online Generic Event Boundary Detection
스트리밍 비디오에서 실시간 사건 경계를 검출하는 On-GEBD.
Parameter Expanded Stochastic Gradient Markov Chain Monte Carlo
파라미터 확장 기법으로 SGMCMC 기반 베이지안 신경망 학습을 개선한다.
System Prompt Optimization with Meta-Learning
메타러닝으로 다양한 사용자 프롬프트에 일반화되는 LLM 시스템 프롬프트를 최적화한다.
The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models
언어 모델을 평가자로 사용하는 원칙적이고 세밀한 언어 모델 평가 벤치마크이다.
TIMING: Temporality-Aware Integrated Gradients for Time Series Explanation
시간성을 반영한 통합 그래디언트로 시계열 예측을 설명한다.
Training-Free Safe Text Embedding Guidance for Text-to-Image Diffusion Models
재학습이나 입력 필터링 없이 샘플링 과정에서 텍스트 임베딩을 안전 방향으로 유도(STG)하는 학습 불필요 기법. 예상 디노이즈 출력에 안전 함수를 적용해 유해 생…
Trillion 7B Technical Report
트릴리온랩스가 공개한 7B 규모의 다국어 대규모 언어 모델 기술 보고서이다.
V-Agent: An Interactive Video Search System Using Vision-Language Models
엔씨소프트의 비전언어모델 기반 대화형 영상 검색 시스템으로, GME-VARCO-VISION-Embedding 멀티모달 임베딩을 활용해 시각·음성 정보를 통합 검색…
VARCO-VISION-2.0 Technical Report
엔씨소프트의 한국어·영어 오픈웨이트 비전언어모델 VARCO-VISION-2.0(14B, 1.7B) 기술보고서로, 다중 이미지 이해와 레이아웃 인식 OCR을 지원한…
Video Summarization with Large Language Models
프레임 캡션과 지역·전역 맥락으로 중요도를 평가하는 LLM 기반 비디오 요약 LLMVS.
Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity
질문 복잡도에 따라 검색 전략을 동적 선택하는 Adaptive-RAG.
Aligning Language Models to Explicitly Handle Ambiguity
모호한 질의를 명시적으로 다루도록 LM을 정렬.
Aligning Large Language Models by On-Policy Self-Judgment
보상모델 없이 스스로 심판하며 온-폴리시 정렬하는 SELF-JUDGE.
Aligning to Thousands of Preferences via System Message Generalization
시스템 메시지 일반화를 통해 수천 가지 다양한 사용자 선호에 정렬하는 방법을 제안한다.
AZ-NAS: Assembling Zero-Cost Proxies for Network Architecture Search
상호 보완적 제로 코스트 프록시 4종을 앙상블하는 학습 없는 NAS.
CLaM-TTS: Improving Neural Codec Language Model for Zero-Shot Text-to-Speech
확률적 잔차 벡터양자화와 멜 코덱 언어모델로 제로샷 TTS의 품질과 효율을 개선한다.
Classification Matters: Improving Video Action Detection with Class-Specific Attention
클래스 전용 쿼리로 비디오 행동 검출의 분류 정확도를 높인다(ECCV 2024 oral).
CLIcK: A Benchmark Dataset of Cultural and Linguistic Intelligence in Korean
한국의 문화적·언어적 지능을 평가하는 벤치마크 데이터셋이다.
Coffee-Gym: An Environment for Evaluating and Improving Natural Language Feedback on Erroneous Code
오류 코드 자연어 피드백을 평가·개선하는 RL 환경.
CoLLaVO: Crayon Large Language and Vision mOdel
객체 수준 이해를 강화하는 크레용 프롬프트를 도입해 시각 질의응답 성능을 높인 비전언어 모델.
Conditional Synthesis of 3D Molecules with Time Correction Sampler
시간 보정 샘플러로 3D 분자의 조건부 생성을 개선한다.
DASH: Warm-Starting Neural Network Training in Stationary Settings without Loss of Plasticity
warm-start 시 가소성 손실의 주원인을 노이즈 암기로 규명하고, 유용한 표현은 보존하며 암기된 노이즈만 축소하는 DASH 제안.
Dataverse: Open-Source ETL Pipeline for Large Language Models
LLM 학습용 확장 가능한 오픈소스 ETL 파이프라인.
DDDM-VC: Decoupled Denoising Diffusion Models with Disentangled Representation and Prior Mixup for Robust Voice Conversion
속성별로 분리된 디노이징 확산과 프라이어 믹스업으로 강건한 음성변환을 수행한다.
Efficient and Effective Vocabulary Expansion Towards Multilingual Large Language Models
효율적 어휘 확장을 통해 영어 중심 LLM을 한국어 등 다국어로 확장하는 방법(EEVE)을 제안한다.
Evalverse: Unified and Accessible Library for Large Language Model Evaluation
여러 평가 도구를 통합한 접근성 높은 LLM 평가 라이브러리.
EXAONE 3.0 7.8B Instruction Tuned Language Model
LG AI연구원이 공개한 7.8B 규모의 명령어 튜닝 이중언어 대규모 언어 모델이다.
EXAONE 3.5: Series of Large Language Models for Real-world Use Cases
LG AI Research의 EXAONE 3.5 기술보고서로, 2.4B·7.8B·32B 세 가지 instruction-tuned 모델을 소개하며 강력한 명령 수행…
Extreme Point Supervised Instance Segmentation
바운딩 박스에서 얻는 극점을 실제 마스크 일부로 활용하는 인스턴스 분할 방법.
FLASK: Fine-grained Language Model Evaluation based on Alignment Skill Sets
거친 단일 점수 대신 지시별로 필요한 스킬 셋 단위로 분해해 세분화 평가하는 프로토콜(FLASK). 모델의 강·약점을 정밀하게 진단.
FMA-Net: Flow-Guided Dynamic Filtering and Iterative Feature Refinement with Multi-Attention for Joint Video Super-Resolution and Deblurring
흐름 유도 동적 필터링과 다중 어텐션으로 비디오 초해상도·디블러링을 통합한다.
Fundamental Benefit of Alternating Updates in Minimax Optimization
미니맥스 최적화에서 교대 경사법(Alt-GDA)이 동시 갱신보다 빠름을 증명하고, 외삽 기반 Alex-GDA로 더 적은 계산으로 빠른 수렴을 달성.
Honeybee: Locality-enhanced Projector for Multimodal LLM
멀티모달 LLM에서 시각 토큰 수의 유연한 관리와 지역 문맥 보존을 동시에 만족하는 locality-enhanced 프로젝터(C-Abstractor/D-Abstr…
HyperCLOVA X Technical Report
네이버 클라우드의 HyperCLOVA X 기술보고서로, 한국어·영어 이중언어 역량과 한국 문화 이해·안전성을 강조한 LLM 제품군을 소개한다.
In Defense of Lazy Visual Grounding for Open-Vocabulary Semantic Segmentation
객체 마스크를 먼저 발견하고 텍스트를 나중에 부여하는 2단계 개방어휘 분할.
Instance-Aware Group Quantization for Vision Transformers
인스턴스별 활성 채널 그룹화로 ViT 사후학습 양자화를 개선하는 IGQ-ViT.
Joint Reconstruction of 3D Human and Object via Contact-Based Refinement Transformer
접촉 정보를 활용해 단일 이미지에서 3D 인간·객체를 함께 복원하는 CONTHO.
KMMLU: Measuring Massive Multitask Language Understanding in Korean
45개 주제 35,030개 객관식 문항으로 구성된 한국어 벤치마크로, GPT-4 등 최신 모델도 60%를 넘기지 못함을 보인다.
KoBBQ: Korean Bias Benchmark for Question Answering
질의응답에서 언어 모델의 사회적 편향을 측정하는 한국어 벤치마크를 제안한다.
KorNAT: LLM Alignment Benchmark for Korean Social Values and Common Knowledge
한국 사회 가치관과 상식에 대한 LLM 정렬 정도를 측정하는 벤치마크이다.
LangBridge: Multilingual Reasoning Without Multilingual Supervision
다국어 감독 없이도 언어 모델의 다국어 추론 능력을 확장하는 방법을 제안한다.
Meteor: Mamba-based Traversal of Rationale for Large Language and Vision Models
Mamba 구조로 다면적 추론 근거(rationale)를 순회 임베딩해, 효율적인 크기에서도 복잡한 시각-언어 이해 능력을 끌어올린 모델.
MoAI: Mixture of All Intelligence for Large Language and Vision Models
외부 세분화·검출·SGG·OCR 모델의 출력을 보조 시각정보로 활용하고, MoAI-Compressor와 MoAI-Mixer로 이를 융합해 모델 크기 확장 없이 성…
Multi-Task Inference: Can Large Language Models Follow Multiple Instructions at Once?
한 입력의 여러 지시를 동시에 수행하는지 평가하는 MTI-Bench.
Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark
Ko-H5 벤치마크와 공개 리더보드를 통한 한국어 LLM 평가 프레임워크로, 데이터 유출 분석과 평가 확장 필요성을 다룬다.
Pearl: A Review-driven Persona-Knowledge Grounded Conversational Recommendation Dataset
리뷰 기반 페르소나·지식 대화형 추천 데이터셋 Pearl.
Position Coupling: Improving Length Generalization of Arithmetic Transformers Using Task Structure
관련 토큰에 동일 위치 식별자를 부여하는 Position Coupling으로 산술 트랜스포머의 길이 일반화를 크게 개선.
Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models
다른 언어 모델의 응답을 평가하는 데 특화된 오픈소스 평가 전용 언어 모델이다.
Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained Evaluation
세밀한 평가 기준에 따라 다른 VLM의 출력을 채점하는 오픈소스 비전언어 평가자(judge) 모델.
Prometheus: Inducing Fine-grained Evaluation Capability in Language Models
사용자 정의 평가 기준(rubric)에 따라 장문 응답을 세밀하게 채점하도록 학습된 오픈소스 평가 특화 LLM. GPT-4에 준하는 평가 상관도를 달성.
Provable Benefit of Cutout and CutMix for Feature Learning
패치 단위 데이터 증강(Cutout, CutMix)이 2층 신경망 특징 학습에 주는 이론적 이득을 분석·증명.
Rethinking the Role of Proxy Rewards in Language Model Alignment
정렬에서 프록시 보상의 역할을 리버스 엔지니어링으로 재검토.
Rotary Position Embedding for Vision Transformer
회전 위치 임베딩(RoPE)을 비전 트랜스포머에 적용해 해상도 외삽을 개선한다.
Self-Explore: Enhancing Mathematical Reasoning in Language Models with Fine-grained Rewards
세밀한 보상을 활용해 언어 모델의 수학 추론 능력을 스스로 탐색하며 향상시킨다.
Semiparametric Token-Sequence Co-Supervision
토큰 예측과 비모수적 시퀀스 예측 손실을 함께 쓰는 이중 지도학습.
SkateFormer: Skeletal-Temporal Transformer for Human Action Recognition
관절·프레임을 골격-시간 범주로 분할해 어텐션하는 행동 인식 트랜스포머.
TelME: Teacher-leading Multimodal Fusion Network for Emotion Recognition in Conversation
언어모델 교사에서 비언어 학생으로 증류하는 대화 감정 인식.
TimeChara: Evaluating Point-in-Time Character Hallucination of Role-Playing Large Language Models
역할극 LLM의 시점 환각을 평가하는 TimeChara.
TroL: Traversal of Layers for Large Language and Vision Models
레이어를 재사용·순회하는 방식으로 파라미터를 늘리지 않고 효율적인 대형 비전언어 모델(VLM)을 구현한다.
VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models
엔씨소프트가 공개한 OCR·그라운딩 기능을 갖춘 한국어-영어 시각-언어 모델(VARCO-VISION)이다.
VoiceLDM: Text-to-Speech with Environmental Context
내용 프롬프트와 환경 설명 프롬프트를 함께 받아 배경 음향 맥락이 반영된 음성을 생성하는 잠재 확산 TTS.
Volcano: Mitigating Multimodal Hallucination through Self-Feedback Guided Revision
모델 스스로 피드백을 생성·수정하는 자기 피드백 방식으로 멀티모달 환각(hallucination)을 완화한다.
A Technical Report for Polyglot-Ko: Open-Source Large-Scale Korean Language Models
대규모 한국어 오픈소스 언어 모델 Polyglot-Ko에 대한 기술 보고서이다.
Accelerating Reinforcement Learning with Value-Conditional State Entropy Exploration
상태 엔트로피 탐색이 과제 보상과 결합될 때의 저가치 편향을 해결하는 가치 조건부 상태 엔트로피(VCSE)를 제안.
ACLS: Adaptive and Conditional Label Smoothing for Network Calibration
기존 정규화 보정법의 장점을 통합한 손실 ACLS(ICCV 2023 Oral).
Aligning Large Language Models through Synthetic Feedback
사람 주석 없이 합성 피드백만으로 대규모 언어 모델을 정렬하는 방법을 제안한다.
Can Language Models Laugh at YouTube Short-form Videos?
유튜브 짧은 영상 유머 이해를 평가하는 ExFunTube.
COMPASS: High-Efficiency Deep Image Compression with Arbitrary-scale Spatial Scalability
임의 스케일 공간 확장형 신경망 이미지 압축(LIFF).
Dialogue Chain-of-Thought Distillation for Commonsense-aware Conversational Agents
대화용 CoT를 대형 모델에서 증류해 상식 인지형 대화 에이전트를 구축.
Diffusion Models already have a Semantic Latent Space
확산 모델의 h-space라는 의미 잠재공간을 발견해 비대칭 역과정(Asyrp)으로 속성을 편집한다.
Diffusion Video Autoencoders: Toward Temporally Consistent Face Video Editing via Disentangled Video Encoding
신원·모션 특징을 분리 인코딩하는 확산 비디오 오토인코더로 시간적으로 일관된 얼굴 비디오 편집을 달성한다.
Exploring the Practicality of Generative Retrieval on Dynamic Corpora
동적 코퍼스에서 생성형 검색의 실용성을 이중 인코더와 비교 분석.
FactKG: Fact Verification via Reasoning on Knowledge Graphs
지식 그래프 위의 추론을 통해 사실을 검증하는 데이터셋과 방법을 제시한다.
Fair Streaming Principal Component Analysis: Statistical and Algorithmic Viewpoint
공정 PCA에 대해 PAFO 학습가능성 개념을 제시하고 메모리 효율적 알고리즘(FNPM)을 제안. 공정 PCA 최초의 통계적 보장 제공.
GeNAS: Neural Architecture Search with Better Generalization
손실 표면 평탄도를 지표로 일반화 성능이 좋은 구조를 찾는 NAS.
Grad-StyleSpeech: Any-speaker Adaptive Text-to-Speech Synthesis with Diffusion Models
스타일 기반 확산 모델로 임의 화자의 짧은 참조 음성만으로 적응형 TTS를 생성한다.
Gradient Ascent Post-training Enhances Language Model Generalization
소량의 사후 그래디언트 상승 학습으로 LM 일반화를 향상.
HAE-RAE Bench: Evaluation of Korean Knowledge in Language Models
4개 도메인 6개 과제로 구성된 한국어 벤치마크로, 영어에서 전이 가능한 능력이 아닌 한국 고유 문화·언어 지식을 평가한다.
HierSpeech++: Bridging the Gap between Semantic and Acoustic Representation of Speech by Hierarchical Variational Inference for Zero-shot Speech Synthesis
계층적 변분추론으로 의미·음향 표현의 간극을 메워 제로샷 TTS와 음성변환을 강건하게 수행하는 음성합성 모델.
How Well Do Large Language Models Truly Ground?
모델이 제공 문맥을 온전히 사용하는지 평가하는 grounding 정의·데이터셋.
Improving Sample Quality of Diffusion Models Using Self-Attention Guidance
모델의 셀프 어텐션 맵으로 블러 가이던스를 만들어 조건 없이도 확산 표본 품질을 향상시킨다.
Knowledge Unlearning for Mitigating Privacy Risks in Language Models
언어 모델의 프라이버시 위험을 줄이기 위해 특정 지식을 잊게 하는 언러닝 기법을 제안한다.
Knowledge-Augmented Language Model Verification
외부 지식으로 LM 출력의 사실성을 검증하는 별도 검증기.
KoSBi: A Dataset for Mitigating Social Bias Risks Towards Safer Large Language Model Application
안전한 대규모 언어 모델 활용을 위해 사회적 편향 위험을 완화하는 한국어 데이터셋이다.
KTRL+F: Knowledge-Augmented In-Document Search
문서 내 의미 대상을 실시간 검색하며 외부 지식을 결합하는 과제·모델.
Modernizing Old Photos Using Multiple References via Photorealistic Style Transfer
여러 현대 참조 이미지로 오래된 사진을 현대화하는 프레임워크.
MPCHAT: Towards Multimodal Persona-Grounded Conversation
이미지까지 포함하는 멀티모달 페르소나 기반 대화 데이터셋.
NANSY++: Unified Voice Synthesis with Neural Analysis and Synthesis
신경 분석-합성 프레임워크를 확장해 TTS·음성변환·가창합성·음성 디자인을 하나의 통합 백본으로 처리하는 음성 합성 모델.
PLASTIC: Improving Input and Label Plasticity for Sample Efficient Reinforcement Learning
강화학습 표본 효율을 위해 입력 가소성과 라벨 가소성을 구분하고 손실 지형 평탄화와 그래디언트 전파 개선을 결합한 PLASTIC 기법.
Practical Sharpness-Aware Minimization Cannot Converge All the Way to Optima
고정 섭동 크기와 그래디언트 정규화를 쓰는 실전 SAM이 최적점에 완전히 수렴하지 못함을 증명.
PromptStyler: Prompt-driven Style Generation for Source-free Domain Generalization
학습 이미지 없이 프롬프트로 다양한 스타일을 CLIP 잠재공간에 생성해 소스프리 도메인 일반화를 수행하는 PromptStyler.
SeiT: Storage-Efficient Vision Training with Tokens Using 1% of Pixel Storage
이미지를 픽셀 대신 이산 토큰으로 저장·학습해 저장공간을 픽셀의 1%로 줄이면서도 정확도를 유지하는 저장효율 비전 학습(SeiT) 기법을 제안한다.
SGDA with shuffling: faster convergence for nonconvex-PL minimax optimization
무작위 재셔플링 SGDA의 비볼록-PL 미니맥스 최적화 수렴을 분석하고 복원 추출 대비 개선된 수렴률을 증명.
Shatter and Gather: Learning Referring Image Segmentation with Text Supervision
텍스트만으로 지시 표현 이미지 분할을 학습하는 약지도 방법.
SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling
업스테이지가 제안한 depth up-scaling 기법으로 MoE 없이 효율적으로 모델을 확장해 더 큰 경쟁 모델을 능가하는 SOLAR 10.7B를 소개한다.
SQuARe: A Large-Scale Dataset of Sensitive Questions and Acceptable Responses Created Through Human-Machine Collaboration
민감한 질문과 수용 가능한 응답으로 구성된 대규모 한국어 데이터셋을 인간-기계 협업으로 구축했다.
SyncDiffusion: Coherent Montage via Synchronized Joint Diffusions
여러 확산 과정을 지각적 유사도로 동기화해 이음새 없는 파노라마·몽타주 이미지를 생성한다.
Task-Optimized Adapters for an End-to-End Task-Oriented Dialogue System
태스크별 최적화 어댑터로 종단간 대화 시스템을 개선.
Test-Time Self-Adaptive Small Language Models for Question Answering
테스트 시점 자기적응 소형 LM으로 QA 성능을 향상.
The CoT Collection: Improving Zero-shot and Few-shot Learning of Language Models via Chain-of-Thought Fine-Tuning
184만 개 추론 근거(CoT)로 구성된 대규모 데이터셋을 구축하고 이를 이용한 CoT 파인튜닝으로 언어모델의 제로샷·퓨샷 추론 능력을 향상.
The Devil is in the Points: Weakly Semi-Supervised Instance Segmentation via Point-Guided Mask Representation
점 주석을 약한 감독으로 쓰는 준지도 인스턴스 분할.
Tighter Lower Bounds for Shuffling SGD: Random Permutations and Beyond
비복원 추출 SGD의 수렴 하한을 분석해 강볼록·볼록 설정에서 상·하한 간극을 닫고 임의 순열 기반 SGD로 확장한 이론 논문.
Trajectory Alignment: Understanding the Edge of Stability Phenomenon via Bifurcation Theory
경사하강 학습의 Edge of Stability 현상을 분기 이론으로 규명하고, 서로 다른 학습 궤적이 공통 분기 다이어그램에 정렬됨을 증명.
UnitSpeech: Speaker-adaptive Speech Synthesis with Untranscribed Data
전사 없는 짧은 참조 음성만으로 확산 모델을 미세조정해 화자 적응형 TTS를 수행한다.
What Do Self-Supervised Vision Transformers Learn?
대조학습(CL)과 마스크 이미지 모델링(MIM)이 ViT에서 각각 무엇을 학습하는지 비교 분석. 두 방식이 상호보완적임을 밝히고 결합 전략을 제시한다.
Autoregressive Image Generation using Residual Quantization
잔차 양자화(RQ-VAE)로 이미지를 짧은 코드 시퀀스로 표현하고 RQ-Transformer로 자기회귀 생성하는 기법. 고해상도 이미지를 적은 토큰으로 효율적으로…
Critic-Guided Decoding for Controlled Text Generation
크리틱 모델이 디코딩을 안내하는 제어된 텍스트 생성.
DeMFI: Deep Joint Deblurring and Multi-Frame Interpolation with Flow-Guided Attentive Correlation and Recursive Boosting
흐릿한 저프레임률 비디오를 선명한 고프레임률로 변환하는 통합 프레임워크.
DiffusionCLIP: Text-Guided Diffusion Models for Robust Image Manipulation
확산 모델과 CLIP을 결합해 텍스트 프롬프트만으로 이미지를 강건하게 편집·조작하는 방법.
Efficiently Enhancing Zero-Shot Performance of Instruction Following Model via Retrieval of Soft Prompt
소프트 프롬프트 검색으로 지시 따르기 모델의 제로샷 성능 향상.
Fast Point Transformer
복셀 해싱 기반 이웃 탐색과 경량 자기어텐션으로 대규모 3D 포인트 클라우드를 빠르게 처리하는 Fast Point Transformer.
Guided-TTS 2: A Diffusion Model for High-quality Adaptive Text-to-Speech with Untranscribed Data
전사 없는 목표 화자 음성만으로 고품질 적응형 TTS를 구현하는 확산 모델.
Guided-TTS: A Diffusion Model for Text-to-Speech via Classifier Guidance
음소 분류기 가이던스를 활용해 전사되지 않은 음성 데이터로도 학습 가능한 확산 기반 TTS 모델.
InfoNeRF: Ray Entropy Minimization for Few-Shot Neural Volume Rendering
광선 밀도의 엔트로피 최소화 정규화로 소수 시점만으로도 신경 볼륨 렌더링을 학습하는 InfoNeRF.
KOBEST: Korean Balanced Evaluation of Significant Tasks
전문 언어학자가 설계한 5개 한국어 다운스트림 과제 벤치마크로, 고급 언어 지식과 추론 능력을 평가한다.
KOLD: Korean Offensive Language Dataset
댓글 4만여 건에 공격성 유형·대상·범위를 계층 주석한 한국어 데이터셋.
Large-scale Bilingual Language-Image Contrastive Learning
한국어·영어 이중언어 캡션 11억 쌍으로 CLIP 스타일 대조학습을 수행한 KELIP. 다국어 이미지-텍스트 정합 성능과 언어 간 편향을 분석하고 모델을 공개했다…
Learning Features with Parameter-Free Layers
학습 파라미터가 없는 연산(맥스풀링 등)만으로도 유용한 특징을 학습할 수 있음을 보이고, 파라미터-프리 층으로 네트워크를 효율화해 정확도-효율 균형을 개선한다.
MPViT: Multi-Path Vision Transformer for Dense Prediction
다양한 스케일의 패치 임베딩을 병렬 경로로 처리하는 멀티패스 ViT를 제안해, 분류·검출·분할 등 밀집 예측 과제에서 강력한 성능을 달성.
Perception Prioritized Training of Diffusion Models
확산 모델 학습에서 노이즈 수준별 손실 가중치를 재설계(P2)해, 지각적으로 중요한 콘텐츠 학습 단계를 우선시함으로써 생성 품질을 향상.
PointMixer: MLP-Mixer for Point Cloud Understanding
토큰믹싱 MLP를 소프트맥스로 대체해 비정형 3D 점군에 적용 가능한 MLP-Mixer 구조 PointMixer를 제안한다.
Preservation of the Global Knowledge by Not-True Distillation in Federated Learning
연합학습의 병목이 망각일 수 있음을 지적하고, not-true 클래스에 대한 전역 관점을 보존하는 FedNTD를 제안.
PriorGrad: Improving Conditional Denoising Diffusion Models with Data-Dependent Adaptive Prior
데이터 의존적 적응형 프라이어를 도입해 조건부 디노이징 확산 모델의 보코더·음향모델 성능을 향상시킨다.
RenyiCL: Contrastive Representation Learning with Skew Renyi Divergence
강한 증강의 트레이드오프를 Rényi 발산으로 다루어 어려운 음성·쉬운 양성 샘플링을 동시에 수행하는 대조학습 RenyiCL.
Soft Truncation: A Universal Training Technique of Score-based Diffusion Model for High Precision Score Estimation
점수 기반 확산 모델의 학습 시 노이즈 레벨을 소프트하게 절단해 고정밀 스코어 추정과 표본 품질을 개선하는 범용 학습 기법.
TemporalWiki: A Lifelong Benchmark for Training and Evaluating Ever-Evolving Language Models
끊임없이 변하는 언어 모델을 학습·평가하기 위한 평생 학습 벤치마크를 제안한다.
ViDT: An Efficient and Effective Fully Transformer-based Object Detector
비전 트랜스포머 백본에 검출 토큰을 결합한 ViDT를 확장해, 인코더-프리 구조와 다중스케일 특징으로 정확도-속도 균형이 뛰어난 완전 트랜스포머 객체 검출기를 제…
AdamP: Slowing Down the Slowdown for Momentum Optimizers on Scale-invariant Weights
정규화로 인한 스케일 불변 가중치에서 모멘텀 옵티마이저의 유효 스텝이 과도하게 줄어드는 문제를 분석하고, 방사 방향 성분을 제거해 이를 완화한 AdamP/SGDP…
Anti-Adversarially Manipulated Attributions for Weakly and Semi-Supervised Semantic Segmentation
적대적 방향의 역조작으로 클래스 위치화 맵(CAM)을 확장해 약지도·준지도 의미론적 분할 정확도를 높인다.
BROS: A Pre-trained Language Model Focusing on Text and Layout for Better Key Information Extraction from Documents
문서의 텍스트와 2D 공간 배치(layout)를 함께 인코딩하는 사전학습 언어모델 BROS. 상대적 위치 인코딩과 영역 마스킹 목적함수로 문서 핵심정보 추출(KI…
Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech (VITS)
조건부 VAE와 정규화 흐름·적대적 학습·확률적 지속시간 예측을 결합한 완전 end-to-end TTS. 2단계 파이프라인 없이 자연스러운 단일 단계 음성 합성을…
Diff-TTS: A Denoising Diffusion Model for Text-to-Speech
디노이징 확산 확률 모델을 TTS에 최초로 적용해 멜스펙트로그램을 생성하는 비자기회귀 음성합성 모델.
Exploiting Spatial Dimensions of Latent in GAN for Real-time Image Editing
공간 차원을 가진 잠재 표현(stylemap)을 도입해 GAN 기반 이미지 편집을 실시간으로 수행하는 StyleMapGAN. 최적화 없이 정확한 임베딩과 지역 편…
Fre-GAN: Adversarial Frequency-consistent Audio Synthesis
주파수 일관성을 유지하는 적대적 생성 방식으로 스펙트럼 왜곡을 줄여 고품질 오디오를 합성하는 보코더.
HOTR: End-to-End Human-Object Interaction Detection with Transformers
트랜스포머로 사람·물체·상호작용 삼중항을 직접 예측하는 종단간 HOI 검출기 HOTR로 후처리 없이 빠른 추론을 달성한다.
ILVR: Conditioning Method for Denoising Diffusion Probabilistic Models
추가 학습 없이 참조 이미지의 저주파 성분으로 DDPM 샘플링을 조건화(ILVR)해, 이미지 변환·편집 등 다양한 생성 방향을 제어하는 방법.
KLUE: Korean Language Understanding Evaluation
8개 한국어 자연어이해(NLU) 과제로 구성된 벤치마크 KLUE로, 데이터셋·사전학습 모델·평가 지표를 함께 제공한다.
Minimum Width for Universal Approximation
보편 근사에 필요한 신경망의 최소 너비를 정밀 규명. ReLU 망에서 Lp 함수 보편 근사에 필요한 최소 너비가 정확히 max{d_x+1, d_y}임을 증명.
N-ImageNet: Towards Robust, Fine-Grained Object Recognition with Event Cameras
이벤트 카메라 기반 세밀 객체 인식을 위한 대규모 데이터셋 N-ImageNet과 강건한 이벤트 표현 학습 방법을 제시한다.
Neural Analysis and Synthesis: Reconstructing Speech from Self-Supervised Representations
자기지도 표현으로부터 음성을 분석·재합성하는 프레임워크로, 음높이·음색을 분리해 음성변환과 조작을 가능하게 한다.
OCR-free Document Understanding Transformer
별도 OCR 엔진 없이 문서 이미지를 직접 읽어 구조화 정보를 출력하는 엔드투엔드 트랜스포머 Donut. OCR 오류 전파와 비용 문제를 없애고 문서 파싱·분류·…
Provable Memorization via Deep Neural Networks using Sub-linear Parameters
심층 신경망이 N개 입력-라벨 쌍을 O(N^{2/3}) 서브선형 파라미터로 암기할 수 있음을 증명하고 깊이의 이득을 규명.
Re-labeling ImageNet: from Single to Multi-Labels, from Global to Localized Labels
ImageNet의 단일 라벨 한계를 지적하고, 다중·지역화 라벨(ReLabel)을 부여해 랜덤 크롭과의 라벨 불일치를 해소하며 분류 정확도를 크게 향상.
Rethinking Spatial Dimensions of Vision Transformers (PiT)
CNN의 공간 차원 축소 원리를 ViT에 도입해 풀링 기반 토큰 축소를 적용한 Pooling-based Vision Transformer(PiT)를 제안, 성능·…
Self-Calibrating Neural Radiance Fields
카메라 내·외부 파라미터를 사전 보정 없이 자체 보정하며 장면을 학습하는 Self-Calibrating NeRF.
Sparse DETR: Efficient End-to-End Object Detection with Learnable Sparsity
디코더가 참조하는 인코더 토큰만 선택적으로 갱신하도록 학습 가능한 희소성을 도입해 DETR 계열의 연산량을 크게 줄인 검출기. 적은 토큰으로도 정확도를 유지·향상…
State Entropy Maximization with Random Encoders for Efficient Exploration
고정 무작위 인코더 표현 위 k-최근접 이웃으로 상태 엔트로피를 추정해 내재 보상으로 쓰는 RE3 탐색 기법.
SWAD: Domain Generalization by Seeking Flat Minima
평평한(flat) 손실 최소점을 찾으면 도메인 일반화가 향상됨을 이론·실험으로 보이고, 학습 중 가중치를 밀집 평균하는 SWAD를 제안해 다수 DG 벤치마크에서 …
UnivNet: A Neural Vocoder with Multi-Resolution Spectrogram Discriminators for High-Fidelity Waveform Generation
다중 해상도 스펙트로그램 판별기를 사용해 전 대역폭에서 고충실도 파형을 생성하는 신경 보코더.
ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision
무거운 영역 검출·합성곱 시각 임베딩 없이 이미지 패치를 그대로 트랜스포머에 넣는 경량 비전-언어 모델. 시각 임베딩을 대폭 단순화해 수십 배 빠르면서 경쟁력 있…
XVFI: eXtreme Video Frame Interpolation
4K 대변위 상황을 위한 재귀적 다중스케일 공유 구조의 XVFI와 X4K1000FPS 데이터셋을 제안한다.
AdaCoF: Adaptive Collaboration of Flows for Video Frame Interpolation
각 픽셀마다 적응적 커널과 오프셋으로 흐름을 협업 추정하는 AdaCoF로 비디오 프레임 보간을 수행한다.
Adversarial Self-Supervised Contrastive Learning
라벨 없이 적대적 강건성을 학습하는 Robust Contrastive Learning(RoCL) 제안. 무라벨 데이터의 적대적 섭동과 증강본 간 유사도를 최대화.
CenterMask: Real-Time Anchor-Free Instance Segmentation
FCOS 검출기에 공간 어텐션 기반 마스크 분기와 개선된 VoVNetV2 백본을 결합한 실시간 앵커프리 인스턴스 분할 기법.
CSI: Novelty Detection via Contrastive Learning on Distributionally Shifted Instances
대조학습에 분포 이동 증강을 결합해 샘플의 이동 증강본과 대조함으로써 신규성/이상치를 탐지하는 CSI 제안.
Glow-TTS: A Generative Flow for Text-to-Speech via Monotonic Alignment Search
단조 정렬 탐색(MAS)을 도입한 흐름 기반 생성 TTS로, 외부 정렬기 없이 병렬적으로 빠르고 강건한 음성합성을 수행한다.
HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis
멜스펙트로그램으로부터 고품질 음성을 효율적으로 합성하는 GAN 기반 보코더. 다중 주기/스케일 판별기로 실시간에 근접한 속도와 고충실도를 동시에 달성.
I2L-MeshNet: Image-to-Lixel Prediction Network for Accurate 3D Human Pose and Mesh Estimation from a Single RGB Image
단일 RGB 이미지에서 lixel 기반 히트맵 예측으로 3D 인체 포즈와 메쉬를 정밀 복원하는 I2L-MeshNet.
InterHand2.6M: A Dataset and Baseline for 3D Interacting Hand Pose Estimation from a Single RGB Image
상호작용하는 양손의 3D 포즈 추정을 위한 대규모 데이터셋 InterHand2.6M과 InterNet 베이스라인을 공개한다.
KorNLI and KorSTS: New Benchmark Datasets for Korean Natural Language Understanding
카카오브레인이 영어 데이터셋을 번역해 구축한 한국어 자연어추론(KorNLI)·의미유사도(KorSTS) 두 벤치마크 데이터셋과 베이스라인 모델.
Learning from Failure: Training Debiased Classifier from Biased Classifier
편향된 모델이 먼저 학습하는 쉬운 상관관계를 이용해, 그 실패 사례를 강조 학습함으로써 편향을 제거한 분류기를 훈련하는 방법(LfF).
Pose2Mesh: Graph Convolutional Network for 3D Human Pose and Mesh Recovery from a 2D Human Pose
2D 포즈로부터 그래프 컨볼루션 네트워크로 3D 인체 포즈와 메쉬 정점을 직접 회귀하는 Pose2Mesh.
Puzzle Mix: Exploiting Saliency and Local Statistics for Optimal Mixup
이미지의 saliency 정보와 지역 통계를 활용해 최적 혼합 마스크를 찾는 데이터 증강 기법. 기존 mixup/CutMix 대비 일반화 성능과 적대적 견고성을 …
Rethinking Channel Dimensions for Efficient Model Design
네트워크 각 층의 채널 구성(확장 비율)이 표현력에 미치는 영향을 분석하고, 채널 차원을 재설계해 효율적이고 성능 좋은 백본 ReXNet을 제안한다.
Rethinking the Truly Unsupervised Image-to-Image Translation
도메인 라벨이나 쌍 데이터 없이 이미지-이미지 변환을 학습하는 완전 비지도 방법(TUNIT). 유사 도메인을 스스로 군집화하는 가이딩 네트워크로 라벨 없는 다중 …
StarGAN v2: Diverse Image Synthesis for Multiple Domains
하나의 모델로 여러 도메인에 걸쳐 다양성 있는 이미지를 생성·변환하는 GAN 프레임워크.
U-GAT-IT: Unsupervised Generative Attentional Networks with Adaptive Layer-Instance Normalization for Image-to-Image Translation
어텐션 모듈과 적응형 레이어-인스턴스 정규화(AdaLIN)로 형태 변화가 큰 이미지 간 변환을 비지도로 수행한다.
Video Panoptic Segmentation
비디오 파놉틱 분할 과제를 새롭게 정의하고 시간적으로 일관된 인스턴스·의미 분할을 수행하는 VPSNet과 벤치마크를 제시한다.
Character Region Awareness for Text Detection
문자 영역과 문자 간 연결성(affinity)을 예측해 임의 형태의 텍스트를 검출하는 CRAFT 기법. 개별 문자 단위 지역화로 곡선·긴 텍스트에서도 강건한 장면…
CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features
학습 이미지의 패치를 잘라 다른 이미지에 붙이고 라벨도 면적 비율로 섞는 데이터 증강 기법. 정보 손실 없이 지역화 가능한 특징을 학습해 분류·검출·전이학습 성능…
Deep Video Inpainting
프레임 간 시간적 일관성을 유지하며 비디오 결손 영역을 복원하는 순환 기반 딥러닝 비디오 인페인팅 프레임워크.
FickleNet: Weakly and Semi-supervised Semantic Image Segmentation using Stochastic Inference
확률적 은닉 유닛 선택으로 다양한 위치화 맵을 생성해 약지도 의미론적 분할 성능을 향상한다.
Gaussian YOLOv3: An Accurate and Fast Object Detector Using Localization Uncertainty for Autonomous Driving
YOLOv3의 바운딩박스 예측에 가우시안 모델링을 도입해 위치 불확실성을 추정하고 자율주행용 실시간 객체검출의 정확도를 높인다.
KorQuAD1.0: Korean QA Dataset for Machine Reading Comprehension
한국어 위키백과 기반 7만여 개 질의응답 쌍으로 구성된 대규모 기계독해(추출형) 데이터셋 KorQuAD 1.0.
Spectral Approximate Inference
그래프 모델의 분배함수 근사를 스펙트럼 기반으로 접근해 저계수 결합 행렬에 대한 다항시간 근사와 스펙트럼 평균장 알고리즘을 제안.
What Is Wrong With Scene Text Recognition Model Comparisons? Dataset and Model Analysis
장면 텍스트 인식(STR) 모델 비교의 비일관성 문제를 지적하고, 통일된 학습·평가 데이터셋과 4단계 모듈 프레임워크를 제안해 공정한 비교와 성능 기여 분석을 수…
Learning to Quantize Deep Networks by Optimizing Quantization Intervals with Task Loss
양자화 구간(interval) 자체를 태스크 손실로 학습해 가중치·활성값을 함께 양자화하는 QIL. 극저비트에서도 정확도 손실을 최소화하는 학습 가능한 양자화 기…