논문 291

한국 AI 모델·벤치마크의 기술보고서와 한국 연구진 주도 대표 논문. 최신 연도순.

</think> Doesn't Stop Reasoning: Analysis of Spurious CoT Termination

KAIST · EMNLP 2026 Main Conference · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

추론 중간에 종료 토큰을 주입해도 답변 구간에서 추론이 계속되다가 종료 토큰이 다시 생성되는 허위 사고과정 종료 현상을 규명한다. 종료 토큰에 대한 어텐션을 높이…

A VLM Answer Is Not an Anomaly Score: Rank Compression in Training-Free Video Anomaly Detection

Sungkyunkwan University · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

VLM의 생성 답변을 곧바로 이상 점수로 쓰면 순위 정보가 압축되는 문제를 규명하고, 전체 답변 확률 분포 기반 판독이 네 모델과 모든 실험 설정에서 더 안정적임…

A.X K1 Technical Report

SK Telecom · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

SKT의 519B 파라미터 MoE 모델로 10조 토큰을 학습했으며, 제어 가능한 추론 기능과 강력한 한국어 지원을 갖춘다.

A.X K2 ALM Technical Report

SK Telecom · Technical Report · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

자체 A.X K2 Light 백본에 한국어 음성 인식·생성·대화와 문맥 기반 VAD를 통합한 약 22B-A4B 스트리밍 오디오 언어모델의 구조와 학습법을 제시한다…

A.X K2 Technical Report

SK Telecom · Technical Report · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

688B 파라미터 MoE 언어모델 A.X K2의 Sparse Gated Attention·Gated Norm·네이티브 FP8 학습과 Think-Fusion을 설명…

ACE: A Self-Correcting Agentic Canvas Editor for Multi-Slide Presentation Automation

Seoul National University · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

계층적 장면 그래프와 프레젠테이션 전용 98개 도구, 관련 슬라이스만 전달하는 CARE 라우터, 지시 준수 판정 기반 자기수정 루프를 결합한 멀티슬라이드 편집 에…

ACE: Adapter Consolidation across Experts for Parameter-Efficient Fine-Tuning of MoE LLMs

UNIST · EMNLP 2026 · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

MoE의 전문가별 LoRA 가운데 기능적으로 중복되는 어댑터를 묶어 같은 PEFT 예산에서 그룹 공유형 고랭크 LoRA로 통합한다. 12개 데이터셋과 4개 MoE…

Agents Trust Tools Too Much: Measuring Reliance on Unreliable Tools

Seoul National University · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

웹 검색·하위 LLM 에이전트·코드 실행 도구의 반환값을 오염시켜 14개 LLM 에이전트가 잘못된 내용을 최종 답에 채택하는지 측정한다. 모든 도구에서 평균 채택…

Beneath the Surface of Chains-of-Thought: A Mechanistic Interpretation of Reasoning Operations in LLMs

KAIST · NAVER AI Lab · EMNLP 2026 Main Conference · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

문제 정식화·목표 분해·연역 등 사고과정 연산이 LLM 은닉표현 공간에서 구분되는지 분석한다. 연산 분리도가 중간 층에서 가장 높고 어휘·위치 혼입만으로 설명되지…

Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding

Pohang University of Science and Technology (POSTECH) · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

검색 문서가 토큰 확률을 부풀리는 copy inflation 문제를 규명하고, 답변과 검색 문서의 어휘 중첩으로 롤아웃을 평가하는 Retrieval-Grounde…

Breaking High Confidence: Practical Face Impersonation under High-Security Thresholds

Hanyang University · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

엄격한 요청 제한과 고보안 판정 임계값에서도 가능한 점수 기반 얼굴 사칭 공격을 분석하며, Amazon Rekognition과 공개 얼굴인식 시스템에서 위험을 실…

Delta-XAI: A Unified Framework for Explaining Prediction Changes in Online Time Series Monitoring

KAIST · ICLR · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

온라인 시계열 모니터링에서 예측 변화를 설명하는 통합 XAI 프레임워크다.

Don't Scroll Back: Missing-Evidence Memory for Streaming Dialogue Summarization

KAIST Data Intelligence System Lab · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

무한히 누적되는 대화 기록에서 현재 구간이 전제하는 과거 근거만 고정 예산으로 복원하는 스트리밍 대화 요약 문제를 정의한다. 900개 인스턴스의 평가 프로토콜과 …

Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model

KAIST · ICML · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

상태와 행동을 이중 스트림 확산으로 함께 예측해 세계모델로 VLA를 강화한다.

EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards

AIM Intelligence · Seoul National University · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

체화형 VLM의 실시간 안전 감시 능력을 진단하는 1,200개 1인칭 영상 벤치마크를 제안한다. 일상·의심스러운 안전 장면과 명백·맥락 의존 위험을 구분하고, 장…

Evidence-Consistent Generative Detection under Scenario-Level Distribution Shift

Sungkyunkwan University · CIKM 2026 · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

SMS·보이스피싱의 공격 시나리오 전체를 학습에서 제외하는 OOD 평가를 구성하고, 증거 구간 감독과 근거·판정 일관성 목적을 결합한 ECoG로 새로운 사회공학 …

EXAONE Tabular 1.0 : Technical Report

LG AI Research · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

데이터셋별 경사 업데이트 없이 문맥학습으로 분류와 회귀를 수행하는 소형 표형 파운데이션 모델 계열을 제안한다. 합성 구조적 인과 모델 사전분포만으로 사전학습하고 …

Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models

KAIST · ICLR · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

학습 없이 프레임 단위 신호로 비디오 확산 모델을 세밀하게 제어하는 가이던스 기법이다.

GL-LowPopArt: A Nearly Instance-Wise Minimax-Optimal Estimator for Generalized Low-Rank Trace Regression

KAIST · AISTATS · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

일반화 저랭크 트레이스 회귀를 위한 근사 인스턴스별 미니맥스 최적 추정기를 제시한다.

GraniKV: Asymmetric Granularity KV-Cache Paging for Multi-Agent Systems with Long Shared Prefix

Seoul National University · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

다중 에이전트 추론의 긴 공유 프리픽스는 연속 HOT 풀에, 요청별 서픽스는 토큰 단위 COLD 풀에 배치하는 비대칭 KV 캐시 페이징으로 처리량과 메모리 효율을…

HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy

KAIST · ICLR · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

VLA 모델을 과거 맥락을 반영하는 히스토리 인지 정책으로 전환한다.

Hidden Axis of Uncertainty: Latent-Posterior Alignment in Graph Neural Networks with Bayesian Output Layers

KIST · Korea University · University of Science and Technology · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

베이지안 출력층 GNN의 불확실성 감소를 posterior contraction이 아닌 잠재표현과 저분산 posterior 방향의 정렬로 설명하고 Alignmen…

Hidden Threat in Synthetic Data: Covert Targeted Bias Injection through Benign Text

KAIST · Dankook University · EMNLP 2026 · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

오정렬 교사 모델이 만든 창작·코드 합성 데이터를 겉보기에는 정상인 형태로 정제해 정렬된 학생 모델을 미세조정할 때 표적 사회적 편향이 은밀하게 전이될 수 있음을…

K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts

Chung-Ang University · KAIST · Seoul National University · OnelineAI · NAVER Cloud AI · Carnegie Mellon University · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국 맥락의 어려운 공개 정보를 찾고 여러 웹 출처의 근거와 제약을 유지하는 능력을 평가하는 한국어 웹 탐색 에이전트 벤치마크를 제안한다.

K-EXAONE 2.0 Technical Report

LG AI Research · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

K-EXAONE을 깊이와 폭 양쪽으로 업사이클링한 750B-A37B MoE 모델을 제시하며, 256K 문맥과 10개 언어, 에이전틱 코딩·장문 이해·한국 사회문화…

Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation

Kakao Corp. · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

영상 콘텐츠의 정보량에 따라 토큰을 보존·삭제하는 적응형 VAE 토크나이저 KATok을 제안하고, 토큰 삭제로 인한 시공간 정렬 문제를 위치 예측 전략으로 보완한…

KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context

arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

9개 학문 분야 3,466개 시험 문항으로 구성된 한국어 멀티모달 벤치마크로, 한국 문화·제도 맥락에서의 멀티모달 이해력을 평가한다.

KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness

Chung-Ang University · Upstage AI · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

대규모 오디오 언어모델의 한국어 음성 이해와 음성 입력 충실도를 여섯 과제로 평가하는 벤치마크를 제안한다.

KoViDoRe: Korean Visual Document Retrieval

Kyung Hee University · MAGMaR 2026 · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

표·그림·다단 편집과 여러 페이지의 증거 결합을 포함하는 한국어 시각 문서 검색 벤치마크 KoViDoRe와 대규모 학습 데이터 Ko-VDR Train Public…

KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs

KRAFTON · KAIST · Seoul National University · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 음성 질의응답과 오디오 이해를 평가하는 세 벤치마크를 구축해 총 12,345개 샘플을 공개한다.

Learning to Generate Unit Test via Adversarial Reinforcement Learning

KAIST · ICLR · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

적대적 강화학습으로 단위 테스트 생성을 학습한다.

Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts

Kakao Corp. · Upstage AI · COLM 2026 · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

소형 프록시 모델에서 폭과 토큰 예산을 단계적으로 확장해 대규모 MoE의 최적 학습률을 저비용으로 추정하고, 155B 규모 자체 사전학습 모델에 적용해 전이 가능…

LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs

KAIST · ICML · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

로짓 인지 최종블록 양자화로 저비트 LLM의 생성 품질을 향상한다.

LT-Mem: Volatility-Aware Spatio-Temporal Memory for Lifelong Scene Understanding

DGIST · IROS 2026 · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

반복 방문 환경의 객체 상태와 변화 이력을 Live·Delta·Meta 메모리로 보존해 장기 로봇 장면 이해와 시간적 질의응답을 지원하며, 다중 세션 LT-VQA…

M2Depth: Unifying Monocular Depth Foundation Priors with Multi-View Stereo

Dongguk University · 42dot · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

단안 깊이 파운데이션 모델과 계단식 다중시점 스테레오를 양방향으로 보정해 가림·희소 시점 환경에서 깊이 지도의 완전성과 기하 정합성을 함께 높인다.

MC-CXR: A Multi-Context Chest X-ray Benchmark for Context-Induced Disruption in Vision-Language Models

Seoul National University · Seoul National University Hospital · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

흉부 X선과 신뢰할 수 있거나 오도하는 텍스트·이전 영상 맥락을 짝지은 2,522개 인스턴스 벤치마크로 VLM의 맥락 유발 판단 전환을 측정하고 텍스트·시각 맥락…

Mechanistic Circuit Identification for Controllable Data Generation

Seoul National University · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

데이터의 학습 가능성·도전성·정렬을 조절하는 모델 내부 회로를 식별하고, 모델 학습 단계에 맞춰 회로 조정 데이터를 배치하는 SAMS로 프롬프트 기반 생성보다 다…

Meta^n: Recursive Self-Improvement through Emergent Depth

Seoul National University · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

고정된 메타 연산을 자신의 산출물에 반복 적용해 추론 계층을 확장하는 자기개선 에이전트를 제안하고, 수렴 기반 깊이와 진화적 계층 탐색으로 여러 벤치마크에서 성능…

MnemoDyn: Learning Resting State Dynamics from 40K fMRI sequences

Pohang University of Science and Technology (POSTECH) · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

약 4만 개의 휴지기 fMRI 시퀀스에서 다중 해상도 시간 동역학을 학습하는 모델을 제안하고, 다양한 집단·스캔 프로토콜에서 재구성과 전이 성능을 평가한다.

MoBGS: Motion Deblurring Dynamic 3D Gaussian Splatting for Blurry Monocular Video

KAIST VICLAB · AAAI · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

흐린 단안 비디오에서 선명한 신규 시점을 복원하는 동적 3D 가우시안 스플래팅.

Motif 3: Technical Report

Motif Technologies · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

3,148억 개 전체 파라미터와 토큰당 132억 개 활성 파라미터를 갖는 독자 설계 MoE 언어모델 Motif 3의 기술보고서. 12.5조 토큰 사전학습, 256…

Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe

LG CNS · EMNLP 2026 Industry Track · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국 공공 API를 여러 단계로 호출하는 실제 과제 145개로 KOPA-Bench를 만들고, 실제 호출에 성공한 도구 입출력 연결만 그래프로 유지해 실행 가능한 …

Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs

KAIST · ICLR · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

텍스트를 넘어 다중 모달리티를 활용해 MLLM 프롬프트를 최적화한다.

Natural-Language-Guided Generator-Agnostic Shortlisting for Protein Binder Design

KAIST · LG AI Research · Seoul National University · KETI · ICML 2026 Workshop on Generative and Agentic AI for Biology · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

여러 단백질 결합체 생성기에서 얻은 후보와 구조 신뢰도·인터페이스 품질 지표를 입력으로 받아, LLM이 해석 가능한 순위 정책을 생성해 습식 실험에 보낼 후보를 …

NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap

AIM Intelligence · KT Corp. · Sionic AI · Lablup · Hankuk University of Foreign Studies · HAERAE LAB · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

절차적으로 생성한 15개 퍼즐 유형, 25개 태스크, 7,500개 문항으로 영어와 한국어 사이의 추론 성능 격차를 진단한다. 직접 번역 문제에서는 언어 자체의 비…

On-Policy Delta Distillation for Multilingual Math Reasoning

NAVER AI Lab · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

온폴리시 델타 증류(OPD²)를 영어·한국어·일본어 수학 추론에 적용한 연구. Qwen3 기반 실험에서 기존 온폴리시 증류보다 일관되게 높은 성능을 보였고 특히 …

PACE: Towards Surfacing Hidden Conflicts in User Requests

POSTECH · EMNLP 2026 · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

겉보기에는 합리적인 사용자 요청과 개인 지식·사건의 잠재 충돌을 판별하는 PACE 데이터셋을 제안한다. PaceMaker가 질의 재작성·다중 홉 그래프 탐색·충돌…

Persistent Cross Entropy

Pohang University of Science and Technology (POSTECH) · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

서로 다른 persistence diagram 사이의 사건 공간을 유사도와 persistence 가중치로 연결해 persistent cross entropy를 정…

Personalized Privacy Control in LLMs via Attention Head Intervention

Seoul National University IPAI · Max Planck Institute for Software Systems · EMNLP 2026 · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

사용자마다 다른 정보 공개 허용 범위를 평가하는 P3Bench를 제안하고, 정책 관련 어텐션 헤드를 추론 시점에 조정하는 Repair로 LLM 에이전트의 과잉 공…

PLC-DPO: Posterior Label Correction in Noisy and Ambiguous Preference Optimization

KAIST · KENTECH · Findings of EMNLP 2026 · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

정책 모델과 참조 모델의 보정된 마진을 온라인 증거로 사용해 각 선호 쌍을 정상·반전·동률 신호로 라우팅하는 PLC-DPO를 제안한다. 57개 데이터셋·모델·벤치…

Poisoning Agentic Alpha: Adversarial Vulnerabilities Across Roles and Architectures in Multi-Agent Trading Systems

Sungkyunkwan University · Ulsan National Institute of Science and Technology (UNIST) · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

다중 에이전트 거래 시스템의 데이터·프롬프트 입력을 공격하는 역할별 위협 모델을 구성하고, 네 통신 토폴로지에서 공격 신호가 최종 의사결정까지 보존되는 양상을 체…

PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents

KAIST · DeepAuto.ai · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

조직 정책을 워크플로 그래프로 변환하고 대화 단계마다 선제 검증기를 호출해 고객 서비스 LLM 에이전트가 금지 행동뿐 아니라 필수 절차 누락까지 피하도록 안내한다…

PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control

MAUM.AI · Seoul National University · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

사전학습 MLLM이 관찰·시연·이전 인지를 누적하는 에피소드 컨텍스트 엔진 Ponder와 현재 행동을 생성하는 Pounce를 결합해 별도 메모리 모듈 없이 로봇 …

Profiling What Matters: Context-Aware Item Profiles from Large-Scale Metadata for LLM Recommenders

Korea University · KT Corporation · CIKM 2026 · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

방대한 상품 메타데이터와 리뷰를 객관적 속성·주관적 특성으로 구조화한 뒤 사용자와 상품 맥락에 중요한 정보만 고르는 CAIRO 프로파일러로 LLM 추천 재정렬을 …

Quantifying and Mitigating Korean Jamo-Level Typographical Vulnerabilities in Large Language Models

Chung-Ang University LILAB · EMNLP 2026 (Main Conference) · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 음절 내부 자모 단위 오탈자가 대규모 언어모델의 토큰화와 정확도에 미치는 영향을 KMMLU로 정량화하고, 오탈자 감지 시에만 추론을 강화하는 Typo-Aw…

Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech

KRAFTON · Seoul National University · University of Washington · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

공개 음성 61만 5천 시간에서 정제한 데이터로 0.3B·1B 오픈웨이트 TTS 모델과 강건성 평가 자료를 구축한다.

Raon-Speech Technical Report

KRAFTON · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어와 영어의 음성 이해·질의응답·생성을 지원하는 9B SpeechLM Raon-Speech와 실시간 전이중 대화 확장 모델 Raon-SpeechChat을 제안…

ReCurveflow: A Flow Matching Framework that Learns Curved Reaction Trajectories to Predict Transition State Geometries

Korea University · Hankuk University of Foreign Studies · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

직선 보간 대신 NEB 기반 곡선 반응 경로를 학습하고 경로 이탈 상태를 되돌리는 보정장을 결합해, 화학 반응의 전이상태 구조와 전체 반응 궤적을 예측한다.

Rethinking Pre-Training and Augmentation for Zero-Shot Cross-City Object Detection

Sungkyunkwan University · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

도시 간 분포 이동을 줄이기 위해 클래스 비종속 objectness 증류 사전학습과 색상 단서를 억제하는 Grayworld 증강을 결합한 객체 검출 파이프라인을 …

ReWEIGH the Evidence: Calibrating Token-Level Ordinal Visual Evidence to Mitigate Hallucinations in Large Vision-Language Models

POSTECH · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

시각 토큰별 어휘 순위 증거를 보정해 이미지 근거가 약한 출력 후보만 억제하는 학습 없는 디코딩 기법으로, 다양한 대형 비전언어모델의 객체 환각을 줄인다.

SafeBranch: Branch-Pair Safety Alignment for Embodied Agents

Dongguk University · Seoul National University · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

체화형 에이전트의 위험 행동 직전으로 환경을 되돌려 안전·위험 행동 쌍을 만들고 학습함으로써, 배포 시 별도 비평기 없이 안전한 행동을 선택하도록 정렬한다.

Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models

Yonsei University · Carnegie Mellon University · Seoul National University · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

같은 로봇 궤적의 의미가 같은 목표 문장 표현만 바뀌어도 VLM 보상이 달라지는 문제를 측정한다. 실제 로봇 궤적 2,390개와 검증된 패러프레이즈 21,673개…

SCRIPTIOC-BENCH: A Benchmark for Recognizing Actionable Threat Intelligence from Script-Based Malware using LLMs

KAIST · ETRI · University of Illinois Urbana-Champaign · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

실제 JavaScript·PowerShell·VBScript 악성코드 634개에서 URL·도메인·IP·파일시스템 침해지표를 정적으로 추출하는 LLM 벤치마크다. …

SHADOWBENCH: Toward Reliable Automatic Evaluation of Semantic Alignment in Autoformalization

ETRI · Seoul National University · University of Maryland · Amazon Web Services · EMNLP 2026 · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

Lean 자동정형화 결과가 원문 수학 명제와 의미적으로 일치하는지를 보조 명제의 양방향 함의로 판정하는 SA-Pass를 제안한다. 대학원·연구 수준 8개 분야 1…

Solar Open 2 Technical Report

Upstage AI · Technical Report · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

250B 전체 파라미터 중 토큰당 15B를 활성화하는 하이브리드 어텐션 MoE와 최대 100만 토큰 문맥을 적용한 에이전트 특화 오픈웨이트 모델 Solar Ope…

Structured Frequency-Domain Evidence for LLM-Based Time-Series Anomaly Detection

Hanyang University · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

시계열 이상 탐지 LLM에 전역·국소 FFT 주파수 증거를 추가해 반복 구조와 국소 진동 변화를 명시적으로 제공하고, 제로샷 탐지 성능 변화를 평가한다.

Syn2RealTrack: Bridging the Gap Between Synthetic and Real-World Datasets for Online Multi-View Multi-Target Tracking

Sungkyunkwan University · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

다중 카메라 추적의 합성-실세계 격차를 보정·형상·객체 수 사전으로 분해하고, 각 지점에 맞춘 온라인 보정과 가시성 가중 특징을 결합해 AI City Challe…

The Fragility of Jailbreak Robustness Across Operational States

Yonsei University · KIST · Korea University · Kyung Hee University · Findings of EMNLP 2026 · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

공격은 그대로 둔 채 일반적인 시스템 프롬프트로 운용 상태만 바꿔도 7개 정렬 모델의 탈옥 성공률이 크게 달라짐을 보인다. 한 사례에서는 성공률이 2%에서 58%…

ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection

KETI · Korea University · National Forensic Service · Findings of EMNLP 2026 · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

진짜·조작 음성이 시간 전환이나 음원 중첩으로 섞인 상황에서 오디오 LLM이 음원 분리와 도메인별 탐지기를 선택 호출하고 근거를 통합하도록 한다. 혼합 진위 오디…

Towards Query-Agnostic RAG Evaluation via Query Coverage and Claim Verifiability

Korea Advanced Institute of Science and Technology (KAIST) · Cluvion · COLM 2026 · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

질의를 하위 질의로, 답변을 원자적 주장으로 분해하는 참조 없는 RAG 평가 프레임워크를 제안하고, 질의 커버리지와 주장 검증 가능성으로 검색·생성 품질을 한 체…

Towards Understanding Pause Token Fine-Tuning Dynamics: A Mode Retention Perspective

HodooAI Lab · Seoul National University · arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

일시정지 토큰을 추론 단계 경계에 두고 손실을 마스킹하는 MBP를 제안한다. 기존 분포의 덮어쓰기를 줄이고 경계 인접 토큰에 다음 단계 정보를 압축해 1B~8B …

TRACER: Balancing Stability-Plasticity-Cognitivity Trilemma for LLM Enhanced Continual Recommendation

POSTECH · Korea University · University of Illinois Urbana-Champaign · CIKM 2026 · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

LLM을 결합한 연속 추천에서 과거 선호 보존, 새 관심사 적응, 일반 의미지식 활용 사이의 충돌을 정의하고 세 모듈을 조율하는 TRACER로 이를 완화한다.

Verifier-free Test-Time Sampling for Vision-Language-Action Models

KAIST · ICLR · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

검증기 없이 테스트타임 샘플링으로 VLA 로봇 제어 성능을 향상한다.

Verifying Meta-Awareness via Predictive Rewards in Reasoning Models

KAIST · ICML · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

예측 보상을 통해 추론 모델의 메타인지 능력을 검증한다.

Vision-aligned Latent Reasoning for Multi-modal Large Language Model

KAIST · ICML · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

시각 정렬 잠재 추론으로 MLLM의 다단계 추론 능력을 개선한다.

What Happens When: Learning Temporal Orders of Events in Videos

Yonsei University · WACV · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

비디오 사건의 시간 순서 이해를 평가·향상하는 VECTOR·MECOT.

When to Ensemble: Identifying Token-Level Points for Stable and Fast LLM Ensembling

KAIST · ICLR · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

토큰 수준에서 앙상블 시점을 찾아 안정적이고 빠른 LLM 앙상블을 수행한다.

XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity

arXiv · 2026
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

10개 국가-언어 쌍 5,500개 테스트 케이스로 구성된 다국어 안전성 벤치마크로, 탈옥 견고성과 문화적 민감성을 함께 평가한다.

AdaSTaR: Adaptive Data Sampling for Training Self-Taught Reasoners

KAIST · NeurIPS · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

적응적 데이터 샘플링으로 self-taught reasoner 학습을 개선한다.

Arithmetic Transformers Can Length-Generalize in Both Operand Length and Count

KAIST · ICLR 2025 · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

산술 과제에서 트랜스포머의 길이 일반화를 피연산자 길이·개수 양쪽에서 개선. 다단계 Position Coupling과 스크래치패드로 2~3배 일반화 달성.

Axial Neural Networks for Dimension-Free Foundation Models

KAIST · NeurIPS · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

차원에 무관한 파운데이션 모델을 위한 축(axial) 신경망을 제안한다.

Bayesian Neural Scaling Law Extrapolation with Prior-Data Fitted Networks

KAIST · ICML · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

Prior-data fitted network로 신경망 스케일링 법칙을 베이지안적으로 외삽한다.

Combinative Matching for Geometric Shape Assembly

POSTECH · ICCV · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

동일 표면·반대 부피 점유를 함께 모델링하는 형상 조립 매칭(ICCV 2025 Highlight).

Convergence and Implicit Bias of Gradient Descent on Continual Linear Classification

KAIST · ICLR 2025 · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

여러 선형 분류 과제를 순차 학습하는 연속학습의 수렴성과 암묵적 편향을 분석하고, 순환 학습 시 망각이 0으로 수렴함을 증명.

Cost-Sensitive Freeze-thaw Bayesian Optimization for Efficient Hyperparameter Tuning

KAIST · NeurIPS · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

비용을 고려한 freeze-thaw 베이지안 최적화로 효율적인 하이퍼파라미터 튜닝을 수행한다.

CUPID: Evaluating Personalized and Contextualized Alignment of LLMs from Interactions

KAIST · 서울대 · NAVER AI Lab · COLM 2025 · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

사용자가 상호작용에서 드러내는 맥락적 선호를 추론·적용하는 개인화 정렬 능력을 평가하는 벤치마크(756개 세션). 최신 LLM들이 다중턴 선호 추론에서 큰 한계를…

DeClotH: Decomposable 3D Cloth and Human Body Reconstruction from a Single Image

Seoul National University · CVPR · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

단일 이미지에서 3D 의복·인체를 분리 복원한다.

Dimension Agnostic Neural Processes

KAIST · ICLR 2025 · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

입력 차원이 달라도 처리 가능한 Dimension Aggregator Block을 도입한 뉴럴 프로세스(DANP)로 다양한 차원의 회귀 과제에 대응.

Distilling LLM Agent into Small Models with Retrieval and Code Tools

KAIST · NeurIPS · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

검색·코드 도구를 활용하는 대형 LLM 에이전트의 추론 능력을 소형 모델로 증류하는 방법을 제안한다.

DistiLLM-2: A Contrastive Approach Boosts the Distillation of LLMs

KAIST · ICML · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

대조적 접근으로 LLM 지식 증류 성능을 향상한다.

Does SGD really happen in tiny subspaces?

KAIST · ICLR 2025 · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

SGD가 저차원 지배 부분공간에서 이뤄진다는 통념을 반박하고, 이 정렬이 본질적이 아니라 허상임을 실험적으로 규명.

Efficient Parametric SVD of Koopman Operator for Stochastic Dynamical Systems

KAIST · NeurIPS · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

확률적 동역학계의 Koopman 연산자를 효율적으로 파라메트릭 SVD로 근사한다.

EXAONE 4.0: Unified Large Language Models Integrating Non-reasoning and Reasoning Modes

LG AI Research · arXiv · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

비추론·추론 모드를 통합한 EXAONE 4.0(32B, 1.2B) 모델 시리즈로, 에이전트형 도구 사용과 한국어·영어·스페인어 다국어 지원을 확장했다.

EXAONE Deep: Reasoning Enhanced Language Models

LG AI Research · arXiv · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

수학·과학·코딩 추론 능력을 강화한 EXAONE 계열 추론 특화 언어 모델이다.

Exploiting Diffusion Prior for Task-driven Image Restoration

Seoul National University · ICCV · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

확산 사전을 활용한 과제 지향 이미지 복원 EDTR.

FedSVD: Adaptive Orthogonalization for Private Federated Learning with LoRA

KAIST · NeurIPS · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

LoRA 기반 연합학습에서 적응적 직교화(SVD)로 프라이버시를 지키며 성능을 높이는 기법이다.

Flex-Judge: Text-Only Reasoning Unleashes Zero-Shot Multimodal Evaluators

KAIST · NeurIPS · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

텍스트 추론만으로 제로샷 멀티모달 평가자를 구현한다.

From KMMLU-Redux to KMMLU-Pro: A Professional Korean Benchmark Suite for LLM Evaluation

HAE-RAE · arXiv · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

기술 자격시험 기반 KMMLU-Redux와 전문 면허시험 기반 KMMLU-Pro 두 전문가급 한국어 벤치마크로, 실무 산업 지식 영역에서 LLM 성능을 평가한다.

HyperCLOVA X THINK Technical Report

NAVER Cloud · arXiv · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

6조 토큰으로 사전학습한 추론 특화 한국어·영어 모델로, 128K 컨텍스트와 한국어 벤치마크 경쟁력을 낮은 학습 연산으로 달성했다.

Improving Sound Source Localization with Joint Slot Attention on Image and Audio

POSTECH · CVPR · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

슬롯 어텐션으로 이미지·오디오를 분해해 음원 위치 추정을 개선한다.

Kanana: Compute-efficient Bilingual Language Models

Kakao · arXiv · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

카카오의 한국어·영어 이중언어 모델 Kanana 시리즈로, 유사 모델 대비 훨씬 적은 연산으로 경쟁력 있는 성능을 낸다.

KatFishNet: Detecting LLM-Generated Korean Text through Linguistic Feature Analysis

Yonsei University · ACL 2025 · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 띄어쓰기·품사 조합·구두점 특성을 이용해 LLM 생성 텍스트를 탐지하는 KatFishNet과 KatFish 데이터셋을 제안한다.

KLASS: KL-Guided Fast Inference in Masked Diffusion Models

KAIST · NeurIPS · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

KL 기반 가이던스로 마스크드 확산 모델의 추론을 가속한다.

KoBALT: Korean Benchmark For Advanced Linguistic Tasks

Seoul National University · LG AI Research · arXiv · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어의 다섯 언어학 영역을 전문가 작성 문항으로 평가하는 KoBALT 벤치마크를 제안한다.

KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language

NCSOFT · arXiv · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

275개 이미지-질문 쌍과 객관적 채점 기준으로 구성된 한국어 자유형 VQA 벤치마크로, 심판 모델의 주관적 평가에 의존하지 않고 VLM을 평가한다.

KORMo: Korean Open Reasoning Model for Everyone

Korea University (NLP&AI Lab) · arXiv · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

합성 데이터를 주로 사용해 학습한 10.8B 한국어·영어 오픈 추론 모델로, 균형 잡힌 합성 데이터가 대규모 사전학습에서 불안정을 초래하지 않음을 보인다.

KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts

Waddle · Seoul National University · KRAFTON · UNIST · SK Telecom · EMNLP 2025 · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 텍스트가 포함된 실제 이미지에서 읽기와 고차 추론을 함께 평가하는 VQA 벤치마크를 제안한다.

Learning to Contextualize Web Pages for Enhanced Decision Making by LLM Agents

KAIST · ICLR · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

웹 페이지를 맥락화해 LLM 에이전트의 의사결정을 향상한다.

Locality-Aware Zero-Shot Human-Object Interaction Detection

POSTECH · CVPR · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

CLIP에 지역성·상호작용 인식을 도입한 제로샷 HOI 검출 LAIN.

Masking meets Supervision: A Strong Learning Alliance

NAVER AI Lab · CVPR · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

마스킹 증강과 지도 학습을 이중 분기로 결합하는 MaskSub.

Maximizing the Position Embedding for Vision Transformers with Global Average Pooling

Yonsei University, KIST · AAAI · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

전역 평균 풀링 시 위치 임베딩 효과를 극대화하는 MPVG.

MoDec-GS: Global-to-Local Motion Decomposition and Temporal Interval Adjustment for Compact Dynamic 3D Gaussian Splatting

KAIST VICLAB, ETRI · CVPR · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

움직임을 전역·지역 분해해 동적 3D 가우시안 스플래팅을 압축한다.

MoHAVE: Mixture of Hierarchical Audio-Visual Experts for Robust Speech Recognition

KAIST · ICML · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

계층적 오디오-비주얼 전문가 혼합으로 강건한 음성인식을 달성한다.

Motif 2 12.7B technical report

Motif Technologies · arXiv · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

Grouped Differential Attention과 최적화 기법을 결합해 제한된 연산 예산에서 더 큰 모델급 성능을 내는 12.7B 모델 Motif 2 기술…

Online Generic Event Boundary Detection

Yonsei University, GIST · ICCV · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

스트리밍 비디오에서 실시간 사건 경계를 검출하는 On-GEBD.

Parameter Expanded Stochastic Gradient Markov Chain Monte Carlo

KAIST · ICLR · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

파라미터 확장 기법으로 SGMCMC 기반 베이지안 신경망 학습을 개선한다.

System Prompt Optimization with Meta-Learning

KAIST · NeurIPS · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

메타러닝으로 다양한 사용자 프롬프트에 일반화되는 LLM 시스템 프롬프트를 최적화한다.

The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models

KAIST · NAACL 2025 · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

언어 모델을 평가자로 사용하는 원칙적이고 세밀한 언어 모델 평가 벤치마크이다.

TIMING: Temporality-Aware Integrated Gradients for Time Series Explanation

KAIST · ICML · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

시간성을 반영한 통합 그래디언트로 시계열 예측을 설명한다.

Training-Free Safe Text Embedding Guidance for Text-to-Image Diffusion Models

KAIST (AAILab) · NAVER · NeurIPS 2025 · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

재학습이나 입력 필터링 없이 샘플링 과정에서 텍스트 임베딩을 안전 방향으로 유도(STG)하는 학습 불필요 기법. 예상 디노이즈 출력에 안전 함수를 적용해 유해 생…

Trillion 7B Technical Report

Trillion Labs · arXiv · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

트릴리온랩스가 공개한 7B 규모의 다국어 대규모 언어 모델 기술 보고서이다.

V-Agent: An Interactive Video Search System Using Vision-Language Models

NCSOFT · arXiv · 2025
검토 필요 검토 필요정보 재검토가 필요합니다. 일부 값이 공식 출처로 확인되지 않았습니다.

엔씨소프트의 비전언어모델 기반 대화형 영상 검색 시스템으로, GME-VARCO-VISION-Embedding 멀티모달 임베딩을 활용해 시각·음성 정보를 통합 검색…

VARCO-VISION-2.0 Technical Report

NCSOFT · arXiv · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

엔씨소프트의 한국어·영어 오픈웨이트 비전언어모델 VARCO-VISION-2.0(14B, 1.7B) 기술보고서로, 다중 이미지 이해와 레이아웃 인식 OCR을 지원한…

Video Summarization with Large Language Models

POSTECH · CVPR · 2025
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

프레임 캡션과 지역·전역 맥락으로 중요도를 평가하는 LLM 기반 비디오 요약 LLMVS.

Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity

KAIST · NAACL · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

질문 복잡도에 따라 검색 전략을 동적 선택하는 Adaptive-RAG.

Aligning Language Models to Explicitly Handle Ambiguity

SNU · NAVER · Hanyang · EMNLP · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

모호한 질의를 명시적으로 다루도록 LM을 정렬.

Aligning Large Language Models by On-Policy Self-Judgment

NAVER Cloud · KAIST · Yonsei · ACL · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

보상모델 없이 스스로 심판하며 온-폴리시 정렬하는 SELF-JUDGE.

Aligning to Thousands of Preferences via System Message Generalization

KAIST · NeurIPS 2024 · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

시스템 메시지 일반화를 통해 수천 가지 다양한 사용자 선호에 정렬하는 방법을 제안한다.

AZ-NAS: Assembling Zero-Cost Proxies for Network Architecture Search

Yonsei University · CVPR · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

상호 보완적 제로 코스트 프록시 4종을 앙상블하는 학습 없는 NAS.

CLaM-TTS: Improving Neural Codec Language Model for Zero-Shot Text-to-Speech

KRAFTON · ICLR · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

확률적 잔차 벡터양자화와 멜 코덱 언어모델로 제로샷 TTS의 품질과 효율을 개선한다.

Classification Matters: Improving Video Action Detection with Class-Specific Attention

POSTECH, NAVER · ECCV · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

클래스 전용 쿼리로 비디오 행동 검출의 분류 정확도를 높인다(ECCV 2024 oral).

CLIcK: A Benchmark Dataset of Cultural and Linguistic Intelligence in Korean

KAIST · LREC-COLING 2024 · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국의 문화적·언어적 지능을 평가하는 벤치마크 데이터셋이다.

Coffee-Gym: An Environment for Evaluating and Improving Natural Language Feedback on Erroneous Code

Yonsei · SNU · EMNLP · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

오류 코드 자연어 피드백을 평가·개선하는 RL 환경.

CoLLaVO: Crayon Large Language and Vision mOdel

KAIST · ACL Findings · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

객체 수준 이해를 강화하는 크레용 프롬프트를 도입해 시각 질의응답 성능을 높인 비전언어 모델.

Conditional Synthesis of 3D Molecules with Time Correction Sampler

KAIST · NeurIPS · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

시간 보정 샘플러로 3D 분자의 조건부 생성을 개선한다.

DASH: Warm-Starting Neural Network Training in Stationary Settings without Loss of Plasticity

KAIST · NeurIPS 2024 · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

warm-start 시 가소성 손실의 주원인을 노이즈 암기로 규명하고, 유용한 표현은 보존하며 암기된 노이즈만 축소하는 DASH 제안.

Dataverse: Open-Source ETL Pipeline for Large Language Models

Upstage · NAACL Demo · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

LLM 학습용 확장 가능한 오픈소스 ETL 파이프라인.

DDDM-VC: Decoupled Denoising Diffusion Models with Disentangled Representation and Prior Mixup for Robust Voice Conversion

고려대 · AAAI · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

속성별로 분리된 디노이징 확산과 프라이어 믹스업으로 강건한 음성변환을 수행한다.

Efficient and Effective Vocabulary Expansion Towards Multilingual Large Language Models

Yanolja · arXiv · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

효율적 어휘 확장을 통해 영어 중심 LLM을 한국어 등 다국어로 확장하는 방법(EEVE)을 제안한다.

Evalverse: Unified and Accessible Library for Large Language Model Evaluation

Upstage · EMNLP Demo · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

여러 평가 도구를 통합한 접근성 높은 LLM 평가 라이브러리.

EXAONE 3.0 7.8B Instruction Tuned Language Model

LG AI Research · arXiv · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

LG AI연구원이 공개한 7.8B 규모의 명령어 튜닝 이중언어 대규모 언어 모델이다.

EXAONE 3.5: Series of Large Language Models for Real-world Use Cases

LG AI Research · arXiv · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

LG AI Research의 EXAONE 3.5 기술보고서로, 2.4B·7.8B·32B 세 가지 instruction-tuned 모델을 소개하며 강력한 명령 수행…

Extreme Point Supervised Instance Segmentation

POSTECH · CVPR · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

바운딩 박스에서 얻는 극점을 실제 마스크 일부로 활용하는 인스턴스 분할 방법.

FLASK: Fine-grained Language Model Evaluation based on Alignment Skill Sets

KAIST · NAVER (Minjoon Seo 등) · ICLR 2024 · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

거친 단일 점수 대신 지시별로 필요한 스킬 셋 단위로 분해해 세분화 평가하는 프로토콜(FLASK). 모델의 강·약점을 정밀하게 진단.

FMA-Net: Flow-Guided Dynamic Filtering and Iterative Feature Refinement with Multi-Attention for Joint Video Super-Resolution and Deblurring

KAIST VICLAB · CVPR · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

흐름 유도 동적 필터링과 다중 어텐션으로 비디오 초해상도·디블러링을 통합한다.

Fundamental Benefit of Alternating Updates in Minimax Optimization

KAIST · ICML 2024 · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

미니맥스 최적화에서 교대 경사법(Alt-GDA)이 동시 갱신보다 빠름을 증명하고, 외삽 기반 Alex-GDA로 더 적은 계산으로 빠른 수렴을 달성.

Honeybee: Locality-enhanced Projector for Multimodal LLM

Kakao Brain · CVPR 2024 · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

멀티모달 LLM에서 시각 토큰 수의 유연한 관리와 지역 문맥 보존을 동시에 만족하는 locality-enhanced 프로젝터(C-Abstractor/D-Abstr…

HyperCLOVA X Technical Report

NAVER Cloud · arXiv · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

네이버 클라우드의 HyperCLOVA X 기술보고서로, 한국어·영어 이중언어 역량과 한국 문화 이해·안전성을 강조한 LLM 제품군을 소개한다.

In Defense of Lazy Visual Grounding for Open-Vocabulary Semantic Segmentation

POSTECH · ECCV · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

객체 마스크를 먼저 발견하고 텍스트를 나중에 부여하는 2단계 개방어휘 분할.

Instance-Aware Group Quantization for Vision Transformers

Yonsei University · CVPR · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

인스턴스별 활성 채널 그룹화로 ViT 사후학습 양자화를 개선하는 IGQ-ViT.

Joint Reconstruction of 3D Human and Object via Contact-Based Refinement Transformer

Seoul National University · CVPR · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

접촉 정보를 활용해 단일 이미지에서 3D 인간·객체를 함께 복원하는 CONTHO.

KMMLU: Measuring Massive Multitask Language Understanding in Korean

HAE-RAE · arXiv · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

45개 주제 35,030개 객관식 문항으로 구성된 한국어 벤치마크로, GPT-4 등 최신 모델도 60%를 넘기지 못함을 보인다.

KoBBQ: Korean Bias Benchmark for Question Answering

KAIST · TACL 2024 · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

질의응답에서 언어 모델의 사회적 편향을 측정하는 한국어 벤치마크를 제안한다.

KorNAT: LLM Alignment Benchmark for Korean Social Values and Common Knowledge

KAIST · ACL 2024 Findings · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국 사회 가치관과 상식에 대한 LLM 정렬 정도를 측정하는 벤치마크이다.

LangBridge: Multilingual Reasoning Without Multilingual Supervision

KAIST · ACL 2024 · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

다국어 감독 없이도 언어 모델의 다국어 추론 능력을 확장하는 방법을 제안한다.

Meteor: Mamba-based Traversal of Rationale for Large Language and Vision Models

KAIST (Yong Man Ro 그룹) · NeurIPS 2024 · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

Mamba 구조로 다면적 추론 근거(rationale)를 순회 임베딩해, 효율적인 크기에서도 복잡한 시각-언어 이해 능력을 끌어올린 모델.

MoAI: Mixture of All Intelligence for Large Language and Vision Models

KAIST (Yong Man Ro 그룹) · ECCV 2024 · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

외부 세분화·검출·SGG·OCR 모델의 출력을 보조 시각정보로 활용하고, MoAI-Compressor와 MoAI-Mixer로 이를 융합해 모델 크기 확장 없이 성…

Multi-Task Inference: Can Large Language Models Follow Multiple Instructions at Once?

KAIST · HAERAE Hub · ACL · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한 입력의 여러 지시를 동시에 수행하는지 평가하는 MTI-Bench.

Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark

Upstage · ACL · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

Ko-H5 벤치마크와 공개 리더보드를 통한 한국어 LLM 평가 프레임워크로, 데이터 유출 분석과 평가 확장 필요성을 다룬다.

Pearl: A Review-driven Persona-Knowledge Grounded Conversational Recommendation Dataset

Yonsei · ACL Findings · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

리뷰 기반 페르소나·지식 대화형 추천 데이터셋 Pearl.

Position Coupling: Improving Length Generalization of Arithmetic Transformers Using Task Structure

KAIST · NeurIPS 2024 · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

관련 토큰에 동일 위치 식별자를 부여하는 Position Coupling으로 산술 트랜스포머의 길이 일반화를 크게 개선.

Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models

KAIST & LG AI Research · EMNLP 2024 · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

다른 언어 모델의 응답을 평가하는 데 특화된 오픈소스 평가 전용 언어 모델이다.

Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained Evaluation

KAIST · ACL Findings · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

세밀한 평가 기준에 따라 다른 VLM의 출력을 채점하는 오픈소스 비전언어 평가자(judge) 모델.

Prometheus: Inducing Fine-grained Evaluation Capability in Language Models

KAIST · NAVER AI Lab (Minjoon Seo 등) · ICLR 2024 · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

사용자 정의 평가 기준(rubric)에 따라 장문 응답을 세밀하게 채점하도록 학습된 오픈소스 평가 특화 LLM. GPT-4에 준하는 평가 상관도를 달성.

Provable Benefit of Cutout and CutMix for Feature Learning

KAIST · NeurIPS 2024 · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

패치 단위 데이터 증강(Cutout, CutMix)이 2층 신경망 특징 학습에 주는 이론적 이득을 분석·증명.

Rethinking the Role of Proxy Rewards in Language Model Alignment

NAVER Cloud · KAIST · EMNLP · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

정렬에서 프록시 보상의 역할을 리버스 엔지니어링으로 재검토.

Rotary Position Embedding for Vision Transformer

NAVER AI Lab · ECCV · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

회전 위치 임베딩(RoPE)을 비전 트랜스포머에 적용해 해상도 외삽을 개선한다.

Self-Explore: Enhancing Mathematical Reasoning in Language Models with Fine-grained Rewards

KAIST · EMNLP 2024 Findings · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

세밀한 보상을 활용해 언어 모델의 수학 추론 능력을 스스로 탐색하며 향상시킨다.

Semiparametric Token-Sequence Co-Supervision

KAIST · ACL · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

토큰 예측과 비모수적 시퀀스 예측 손실을 함께 쓰는 이중 지도학습.

SkateFormer: Skeletal-Temporal Transformer for Human Action Recognition

KAIST VICLAB · ECCV · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

관절·프레임을 골격-시간 범주로 분할해 어텐션하는 행동 인식 트랜스포머.

TelME: Teacher-leading Multimodal Fusion Network for Emotion Recognition in Conversation

Yonsei · NAACL · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

언어모델 교사에서 비언어 학생으로 증류하는 대화 감정 인식.

TimeChara: Evaluating Point-in-Time Character Hallucination of Role-Playing Large Language Models

SNU · NAVER · ACL Findings · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

역할극 LLM의 시점 환각을 평가하는 TimeChara.

TroL: Traversal of Layers for Large Language and Vision Models

KAIST · EMNLP · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

레이어를 재사용·순회하는 방식으로 파라미터를 늘리지 않고 효율적인 대형 비전언어 모델(VLM)을 구현한다.

VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models

NCSOFT · arXiv · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

엔씨소프트가 공개한 OCR·그라운딩 기능을 갖춘 한국어-영어 시각-언어 모델(VARCO-VISION)이다.

VoiceLDM: Text-to-Speech with Environmental Context

KAIST · ICASSP · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

내용 프롬프트와 환경 설명 프롬프트를 함께 받아 배경 음향 맥락이 반영된 음성을 생성하는 잠재 확산 TTS.

Volcano: Mitigating Multimodal Hallucination through Self-Feedback Guided Revision

KAIST · NAACL · 2024
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

모델 스스로 피드백을 생성·수정하는 자기 피드백 방식으로 멀티모달 환각(hallucination)을 완화한다.

A Technical Report for Polyglot-Ko: Open-Source Large-Scale Korean Language Models

TUNiB / EleutherAI Polyglot Team · arXiv · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

대규모 한국어 오픈소스 언어 모델 Polyglot-Ko에 대한 기술 보고서이다.

Accelerating Reinforcement Learning with Value-Conditional State Entropy Exploration

KAIST · NeurIPS 2023 · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

상태 엔트로피 탐색이 과제 보상과 결합될 때의 저가치 편향을 해결하는 가치 조건부 상태 엔트로피(VCSE)를 제안.

ACLS: Adaptive and Conditional Label Smoothing for Network Calibration

Yonsei University · ICCV · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

기존 정규화 보정법의 장점을 통합한 손실 ACLS(ICCV 2023 Oral).

Aligning Large Language Models through Synthetic Feedback

NAVER Cloud · EMNLP 2023 · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

사람 주석 없이 합성 피드백만으로 대규모 언어 모델을 정렬하는 방법을 제안한다.

Can Language Models Laugh at YouTube Short-form Videos?

SNU · EMNLP · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

유튜브 짧은 영상 유머 이해를 평가하는 ExFunTube.

COMPASS: High-Efficiency Deep Image Compression with Arbitrary-scale Spatial Scalability

KAIST VICLAB, ETRI · ICCV · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

임의 스케일 공간 확장형 신경망 이미지 압축(LIFF).

Dialogue Chain-of-Thought Distillation for Commonsense-aware Conversational Agents

Yonsei · EMNLP · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

대화용 CoT를 대형 모델에서 증류해 상식 인지형 대화 에이전트를 구축.

Diffusion Models already have a Semantic Latent Space

연세대 · ICLR · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

확산 모델의 h-space라는 의미 잠재공간을 발견해 비대칭 역과정(Asyrp)으로 속성을 편집한다.

Diffusion Video Autoencoders: Toward Temporally Consistent Face Video Editing via Disentangled Video Encoding

KAIST, NAVER AI Lab · CVPR 2023 · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

신원·모션 특징을 분리 인코딩하는 확산 비디오 오토인코더로 시간적으로 일관된 얼굴 비디오 편집을 달성한다.

Exploring the Practicality of Generative Retrieval on Dynamic Corpora

KAIST · EMNLP · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

동적 코퍼스에서 생성형 검색의 실용성을 이중 인코더와 비교 분석.

FactKG: Fact Verification via Reasoning on Knowledge Graphs

KAIST · ACL 2023 · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

지식 그래프 위의 추론을 통해 사실을 검증하는 데이터셋과 방법을 제시한다.

Fair Streaming Principal Component Analysis: Statistical and Algorithmic Viewpoint

KAIST · NeurIPS 2023 · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

공정 PCA에 대해 PAFO 학습가능성 개념을 제시하고 메모리 효율적 알고리즘(FNPM)을 제안. 공정 PCA 최초의 통계적 보장 제공.

GeNAS: Neural Architecture Search with Better Generalization

NAVER Cloud · IJCAI · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

손실 표면 평탄도를 지표로 일반화 성능이 좋은 구조를 찾는 NAS.

Grad-StyleSpeech: Any-speaker Adaptive Text-to-Speech Synthesis with Diffusion Models

KAIST · ICASSP · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

스타일 기반 확산 모델로 임의 화자의 짧은 참조 음성만으로 적응형 TTS를 생성한다.

Gradient Ascent Post-training Enhances Language Model Generalization

KAIST · NAVER · ACL · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

소량의 사후 그래디언트 상승 학습으로 LM 일반화를 향상.

HAE-RAE Bench: Evaluation of Korean Knowledge in Language Models

HAE-RAE · arXiv · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

4개 도메인 6개 과제로 구성된 한국어 벤치마크로, 영어에서 전이 가능한 능력이 아닌 한국 고유 문화·언어 지식을 평가한다.

HierSpeech++: Bridging the Gap between Semantic and Acoustic Representation of Speech by Hierarchical Variational Inference for Zero-shot Speech Synthesis

고려대 · arXiv · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

계층적 변분추론으로 의미·음향 표현의 간극을 메워 제로샷 TTS와 음성변환을 강건하게 수행하는 음성합성 모델.

How Well Do Large Language Models Truly Ground?

KAIST · NAACL · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

모델이 제공 문맥을 온전히 사용하는지 평가하는 grounding 정의·데이터셋.

Improving Sample Quality of Diffusion Models Using Self-Attention Guidance

고려대 · ICCV · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

모델의 셀프 어텐션 맵으로 블러 가이던스를 만들어 조건 없이도 확산 표본 품질을 향상시킨다.

Knowledge Unlearning for Mitigating Privacy Risks in Language Models

KAIST · ACL 2023 · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

언어 모델의 프라이버시 위험을 줄이기 위해 특정 지식을 잊게 하는 언러닝 기법을 제안한다.

Knowledge-Augmented Language Model Verification

KAIST · EMNLP · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

외부 지식으로 LM 출력의 사실성을 검증하는 별도 검증기.

KoSBi: A Dataset for Mitigating Social Bias Risks Towards Safer Large Language Model Application

NAVER AI Lab · ACL 2023 · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

안전한 대규모 언어 모델 활용을 위해 사회적 편향 위험을 완화하는 한국어 데이터셋이다.

KTRL+F: Knowledge-Augmented In-Document Search

KAIST · NAACL · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

문서 내 의미 대상을 실시간 검색하며 외부 지식을 결합하는 과제·모델.

Modernizing Old Photos Using Multiple References via Photorealistic Style Transfer

KAIST VICLAB · CVPR · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

여러 현대 참조 이미지로 오래된 사진을 현대화하는 프레임워크.

MPCHAT: Towards Multimodal Persona-Grounded Conversation

SNU · NAVER AI Lab · ACL · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

이미지까지 포함하는 멀티모달 페르소나 기반 대화 데이터셋.

NANSY++: Unified Voice Synthesis with Neural Analysis and Synthesis

Supertone · ICLR · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

신경 분석-합성 프레임워크를 확장해 TTS·음성변환·가창합성·음성 디자인을 하나의 통합 백본으로 처리하는 음성 합성 모델.

PLASTIC: Improving Input and Label Plasticity for Sample Efficient Reinforcement Learning

KAIST · NeurIPS 2023 · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

강화학습 표본 효율을 위해 입력 가소성과 라벨 가소성을 구분하고 손실 지형 평탄화와 그래디언트 전파 개선을 결합한 PLASTIC 기법.

Practical Sharpness-Aware Minimization Cannot Converge All the Way to Optima

KAIST · NeurIPS 2023 · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

고정 섭동 크기와 그래디언트 정규화를 쓰는 실전 SAM이 최적점에 완전히 수렴하지 못함을 증명.

PromptStyler: Prompt-driven Style Generation for Source-free Domain Generalization

POSTECH · ICCV 2023 · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

학습 이미지 없이 프롬프트로 다양한 스타일을 CLIP 잠재공간에 생성해 소스프리 도메인 일반화를 수행하는 PromptStyler.

SeiT: Storage-Efficient Vision Training with Tokens Using 1% of Pixel Storage

NAVER AI Lab · ICCV 2023 · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

이미지를 픽셀 대신 이산 토큰으로 저장·학습해 저장공간을 픽셀의 1%로 줄이면서도 정확도를 유지하는 저장효율 비전 학습(SeiT) 기법을 제안한다.

SGDA with shuffling: faster convergence for nonconvex-PL minimax optimization

KAIST · ICLR 2023 · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

무작위 재셔플링 SGDA의 비볼록-PL 미니맥스 최적화 수렴을 분석하고 복원 추출 대비 개선된 수렴률을 증명.

Shatter and Gather: Learning Referring Image Segmentation with Text Supervision

POSTECH · ICCV · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

텍스트만으로 지시 표현 이미지 분할을 학습하는 약지도 방법.

SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling

Upstage · arXiv · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

업스테이지가 제안한 depth up-scaling 기법으로 MoE 없이 효율적으로 모델을 확장해 더 큰 경쟁 모델을 능가하는 SOLAR 10.7B를 소개한다.

SQuARe: A Large-Scale Dataset of Sensitive Questions and Acceptable Responses Created Through Human-Machine Collaboration

NAVER AI Lab · ACL 2023 · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

민감한 질문과 수용 가능한 응답으로 구성된 대규모 한국어 데이터셋을 인간-기계 협업으로 구축했다.

SyncDiffusion: Coherent Montage via Synchronized Joint Diffusions

KAIST · NeurIPS · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

여러 확산 과정을 지각적 유사도로 동기화해 이음새 없는 파노라마·몽타주 이미지를 생성한다.

Task-Optimized Adapters for an End-to-End Task-Oriented Dialogue System

Sogang University · ACL Findings · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

태스크별 최적화 어댑터로 종단간 대화 시스템을 개선.

Test-Time Self-Adaptive Small Language Models for Question Answering

KAIST · EMNLP Findings · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

테스트 시점 자기적응 소형 LM으로 QA 성능을 향상.

The CoT Collection: Improving Zero-shot and Few-shot Learning of Language Models via Chain-of-Thought Fine-Tuning

KAIST (Minjoon Seo 그룹) · EMNLP 2023 · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

184만 개 추론 근거(CoT)로 구성된 대규모 데이터셋을 구축하고 이를 이용한 CoT 파인튜닝으로 언어모델의 제로샷·퓨샷 추론 능력을 향상.

The Devil is in the Points: Weakly Semi-Supervised Instance Segmentation via Point-Guided Mask Representation

NAVER Cloud, KAIST · CVPR · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

점 주석을 약한 감독으로 쓰는 준지도 인스턴스 분할.

Tighter Lower Bounds for Shuffling SGD: Random Permutations and Beyond

KAIST · ICML 2023 · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

비복원 추출 SGD의 수렴 하한을 분석해 강볼록·볼록 설정에서 상·하한 간극을 닫고 임의 순열 기반 SGD로 확장한 이론 논문.

Trajectory Alignment: Understanding the Edge of Stability Phenomenon via Bifurcation Theory

KAIST · NeurIPS 2023 · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

경사하강 학습의 Edge of Stability 현상을 분기 이론으로 규명하고, 서로 다른 학습 궤적이 공통 분기 다이어그램에 정렬됨을 증명.

UnitSpeech: Speaker-adaptive Speech Synthesis with Untranscribed Data

서울대 DSAIL · Interspeech · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

전사 없는 짧은 참조 음성만으로 확산 모델을 미세조정해 화자 적응형 TTS를 수행한다.

What Do Self-Supervised Vision Transformers Learn?

NAVER AI Lab · ICLR 2023 · 2023
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

대조학습(CL)과 마스크 이미지 모델링(MIM)이 ViT에서 각각 무엇을 학습하는지 비교 분석. 두 방식이 상호보완적임을 밝히고 결합 전략을 제시한다.

Autoregressive Image Generation using Residual Quantization

Kakao Brain · CVPR 2022 · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

잔차 양자화(RQ-VAE)로 이미지를 짧은 코드 시퀀스로 표현하고 RQ-Transformer로 자기회귀 생성하는 기법. 고해상도 이미지를 적은 토큰으로 효율적으로…

Critic-Guided Decoding for Controlled Text Generation

SNU · NAVER · ACL Findings · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

크리틱 모델이 디코딩을 안내하는 제어된 텍스트 생성.

DeMFI: Deep Joint Deblurring and Multi-Frame Interpolation with Flow-Guided Attentive Correlation and Recursive Boosting

KAIST VICLAB · ECCV · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

흐릿한 저프레임률 비디오를 선명한 고프레임률로 변환하는 통합 프레임워크.

DiffusionCLIP: Text-Guided Diffusion Models for Robust Image Manipulation

KAIST · CVPR · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

확산 모델과 CLIP을 결합해 텍스트 프롬프트만으로 이미지를 강건하게 편집·조작하는 방법.

Efficiently Enhancing Zero-Shot Performance of Instruction Following Model via Retrieval of Soft Prompt

KAIST · EMNLP Findings · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

소프트 프롬프트 검색으로 지시 따르기 모델의 제로샷 성능 향상.

Fast Point Transformer

POSTECH · CVPR 2022 · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

복셀 해싱 기반 이웃 탐색과 경량 자기어텐션으로 대규모 3D 포인트 클라우드를 빠르게 처리하는 Fast Point Transformer.

Guided-TTS 2: A Diffusion Model for High-quality Adaptive Text-to-Speech with Untranscribed Data

서울대 DSAIL · arXiv · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

전사 없는 목표 화자 음성만으로 고품질 적응형 TTS를 구현하는 확산 모델.

Guided-TTS: A Diffusion Model for Text-to-Speech via Classifier Guidance

서울대 DSAIL · ICML · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

음소 분류기 가이던스를 활용해 전사되지 않은 음성 데이터로도 학습 가능한 확산 기반 TTS 모델.

InfoNeRF: Ray Entropy Minimization for Few-Shot Neural Volume Rendering

서울대학교 · CVPR 2022 · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

광선 밀도의 엔트로피 최소화 정규화로 소수 시점만으로도 신경 볼륨 렌더링을 학습하는 InfoNeRF.

KOBEST: Korean Balanced Evaluation of Significant Tasks

SK Telecom / Enliple · COLING · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

전문 언어학자가 설계한 5개 한국어 다운스트림 과제 벤치마크로, 고급 언어 지식과 추론 능력을 평가한다.

KOLD: Korean Offensive Language Dataset

KAIST · EMNLP · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

댓글 4만여 건에 공격성 유형·대상·범위를 계층 주석한 한국어 데이터셋.

Large-scale Bilingual Language-Image Contrastive Learning

Kakao Brain · ICLRW 2022 · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어·영어 이중언어 캡션 11억 쌍으로 CLIP 스타일 대조학습을 수행한 KELIP. 다국어 이미지-텍스트 정합 성능과 언어 간 편향을 분석하고 모델을 공개했다…

Learning Features with Parameter-Free Layers

NAVER AI Lab · ICLR 2022 · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

학습 파라미터가 없는 연산(맥스풀링 등)만으로도 유용한 특징을 학습할 수 있음을 보이고, 파라미터-프리 층으로 네트워크를 효율화해 정확도-효율 균형을 개선한다.

MPViT: Multi-Path Vision Transformer for Dense Prediction

ETRI · KAIST · CVPR 2022 · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

다양한 스케일의 패치 임베딩을 병렬 경로로 처리하는 멀티패스 ViT를 제안해, 분류·검출·분할 등 밀집 예측 과제에서 강력한 성능을 달성.

Perception Prioritized Training of Diffusion Models

서울대학교 (Sungroh Yoon 그룹) · CVPR 2022 · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

확산 모델 학습에서 노이즈 수준별 손실 가중치를 재설계(P2)해, 지각적으로 중요한 콘텐츠 학습 단계를 우선시함으로써 생성 품질을 향상.

PointMixer: MLP-Mixer for Point Cloud Understanding

KAIST, POSTECH · ECCV 2022 · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

토큰믹싱 MLP를 소프트맥스로 대체해 비정형 3D 점군에 적용 가능한 MLP-Mixer 구조 PointMixer를 제안한다.

Preservation of the Global Knowledge by Not-True Distillation in Federated Learning

KAIST · NeurIPS 2022 · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

연합학습의 병목이 망각일 수 있음을 지적하고, not-true 클래스에 대한 전역 관점을 보존하는 FedNTD를 제안.

PriorGrad: Improving Conditional Denoising Diffusion Models with Data-Dependent Adaptive Prior

서울대 DSAIL / MSR · ICLR · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

데이터 의존적 적응형 프라이어를 도입해 조건부 디노이징 확산 모델의 보코더·음향모델 성능을 향상시킨다.

RenyiCL: Contrastive Representation Learning with Skew Renyi Divergence

KAIST · NeurIPS 2022 · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

강한 증강의 트레이드오프를 Rényi 발산으로 다루어 어려운 음성·쉬운 양성 샘플링을 동시에 수행하는 대조학습 RenyiCL.

Soft Truncation: A Universal Training Technique of Score-based Diffusion Model for High Precision Score Estimation

KAIST · ICML · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

점수 기반 확산 모델의 학습 시 노이즈 레벨을 소프트하게 절단해 고정밀 스코어 추정과 표본 품질을 개선하는 범용 학습 기법.

TemporalWiki: A Lifelong Benchmark for Training and Evaluating Ever-Evolving Language Models

KAIST · EMNLP 2022 · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

끊임없이 변하는 언어 모델을 학습·평가하기 위한 평생 학습 벤치마크를 제안한다.

ViDT: An Efficient and Effective Fully Transformer-based Object Detector

NAVER AI Lab · ICLR 2022 · 2022
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

비전 트랜스포머 백본에 검출 토큰을 결합한 ViDT를 확장해, 인코더-프리 구조와 다중스케일 특징으로 정확도-속도 균형이 뛰어난 완전 트랜스포머 객체 검출기를 제…

AdamP: Slowing Down the Slowdown for Momentum Optimizers on Scale-invariant Weights

NAVER AI Lab / Clova · ICLR 2021 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

정규화로 인한 스케일 불변 가중치에서 모멘텀 옵티마이저의 유효 스텝이 과도하게 줄어드는 문제를 분석하고, 방사 방향 성분을 제거해 이를 완화한 AdamP/SGDP…

Anti-Adversarially Manipulated Attributions for Weakly and Semi-Supervised Semantic Segmentation

서울대학교 · CVPR 2021 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

적대적 방향의 역조작으로 클래스 위치화 맵(CAM)을 확장해 약지도·준지도 의미론적 분할 정확도를 높인다.

BROS: A Pre-trained Language Model Focusing on Text and Layout for Better Key Information Extraction from Documents

NAVER Clova · AAAI 2022 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

문서의 텍스트와 2D 공간 배치(layout)를 함께 인코딩하는 사전학습 언어모델 BROS. 상대적 위치 인코딩과 영역 마스킹 목적함수로 문서 핵심정보 추출(KI…

Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech (VITS)

Kakao Enterprise · ICML 2021 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

조건부 VAE와 정규화 흐름·적대적 학습·확률적 지속시간 예측을 결합한 완전 end-to-end TTS. 2단계 파이프라인 없이 자연스러운 단일 단계 음성 합성을…

Diff-TTS: A Denoising Diffusion Model for Text-to-Speech

서울대 · Interspeech · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

디노이징 확산 확률 모델을 TTS에 최초로 적용해 멜스펙트로그램을 생성하는 비자기회귀 음성합성 모델.

Exploiting Spatial Dimensions of Latent in GAN for Real-time Image Editing

NAVER Clova · CVPR 2021 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

공간 차원을 가진 잠재 표현(stylemap)을 도입해 GAN 기반 이미지 편집을 실시간으로 수행하는 StyleMapGAN. 최적화 없이 정확한 임베딩과 지역 편…

Fre-GAN: Adversarial Frequency-consistent Audio Synthesis

고려대 · Interspeech · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

주파수 일관성을 유지하는 적대적 생성 방식으로 스펙트럼 왜곡을 줄여 고품질 오디오를 합성하는 보코더.

HOTR: End-to-End Human-Object Interaction Detection with Transformers

고려대학교, Kakao Brain · CVPR 2021 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

트랜스포머로 사람·물체·상호작용 삼중항을 직접 예측하는 종단간 HOI 검출기 HOTR로 후처리 없이 빠른 추론을 달성한다.

ILVR: Conditioning Method for Denoising Diffusion Probabilistic Models

서울대학교 (Sungroh Yoon 그룹) · ICCV 2021 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

추가 학습 없이 참조 이미지의 저주파 성분으로 DDPM 샘플링을 조건화(ILVR)해, 이미지 변환·편집 등 다양한 생성 방향을 제어하는 방법.

KLUE: Korean Language Understanding Evaluation

KLUE Consortium · NeurIPS Datasets and Benchmarks · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

8개 한국어 자연어이해(NLU) 과제로 구성된 벤치마크 KLUE로, 데이터셋·사전학습 모델·평가 지표를 함께 제공한다.

Minimum Width for Universal Approximation

KAIST · ICLR 2021 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

보편 근사에 필요한 신경망의 최소 너비를 정밀 규명. ReLU 망에서 Lp 함수 보편 근사에 필요한 최소 너비가 정확히 max{d_x+1, d_y}임을 증명.

N-ImageNet: Towards Robust, Fine-Grained Object Recognition with Event Cameras

서울대학교 · ICCV 2021 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

이벤트 카메라 기반 세밀 객체 인식을 위한 대규모 데이터셋 N-ImageNet과 강건한 이벤트 표현 학습 방법을 제시한다.

Neural Analysis and Synthesis: Reconstructing Speech from Self-Supervised Representations

Supertone / 서울대 · NeurIPS · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

자기지도 표현으로부터 음성을 분석·재합성하는 프레임워크로, 음높이·음색을 분리해 음성변환과 조작을 가능하게 한다.

OCR-free Document Understanding Transformer

NAVER Clova · ECCV 2022 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

별도 OCR 엔진 없이 문서 이미지를 직접 읽어 구조화 정보를 출력하는 엔드투엔드 트랜스포머 Donut. OCR 오류 전파와 비용 문제를 없애고 문서 파싱·분류·…

Provable Memorization via Deep Neural Networks using Sub-linear Parameters

KAIST · COLT 2021 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

심층 신경망이 N개 입력-라벨 쌍을 O(N^{2/3}) 서브선형 파라미터로 암기할 수 있음을 증명하고 깊이의 이득을 규명.

Re-labeling ImageNet: from Single to Multi-Labels, from Global to Localized Labels

NAVER AI Lab · CVPR 2021 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

ImageNet의 단일 라벨 한계를 지적하고, 다중·지역화 라벨(ReLabel)을 부여해 랜덤 크롭과의 라벨 불일치를 해소하며 분류 정확도를 크게 향상.

Rethinking Spatial Dimensions of Vision Transformers (PiT)

NAVER AI Lab · ICCV 2021 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

CNN의 공간 차원 축소 원리를 ViT에 도입해 풀링 기반 토큰 축소를 적용한 Pooling-based Vision Transformer(PiT)를 제안, 성능·…

Self-Calibrating Neural Radiance Fields

POSTECH · ICCV 2021 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

카메라 내·외부 파라미터를 사전 보정 없이 자체 보정하며 장면을 학습하는 Self-Calibrating NeRF.

Sparse DETR: Efficient End-to-End Object Detection with Learnable Sparsity

Kakao Brain · ICLR 2022 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

디코더가 참조하는 인코더 토큰만 선택적으로 갱신하도록 학습 가능한 희소성을 도입해 DETR 계열의 연산량을 크게 줄인 검출기. 적은 토큰으로도 정확도를 유지·향상…

State Entropy Maximization with Random Encoders for Efficient Exploration

KAIST · ICML 2021 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

고정 무작위 인코더 표현 위 k-최근접 이웃으로 상태 엔트로피를 추정해 내재 보상으로 쓰는 RE3 탐색 기법.

SWAD: Domain Generalization by Seeking Flat Minima

NAVER AI Lab · NeurIPS 2021 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

평평한(flat) 손실 최소점을 찾으면 도메인 일반화가 향상됨을 이론·실험으로 보이고, 학습 중 가중치를 밀집 평균하는 SWAD를 제안해 다수 DG 벤치마크에서 …

UnivNet: A Neural Vocoder with Multi-Resolution Spectrogram Discriminators for High-Fidelity Waveform Generation

Kakao Enterprise · Interspeech · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

다중 해상도 스펙트로그램 판별기를 사용해 전 대역폭에서 고충실도 파형을 생성하는 신경 보코더.

ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision

Kakao Enterprise · ICML 2021 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

무거운 영역 검출·합성곱 시각 임베딩 없이 이미지 패치를 그대로 트랜스포머에 넣는 경량 비전-언어 모델. 시각 임베딩을 대폭 단순화해 수십 배 빠르면서 경쟁력 있…

XVFI: eXtreme Video Frame Interpolation

KAIST · ICCV 2021 · 2021
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

4K 대변위 상황을 위한 재귀적 다중스케일 공유 구조의 XVFI와 X4K1000FPS 데이터셋을 제안한다.

AdaCoF: Adaptive Collaboration of Flows for Video Frame Interpolation

연세대학교 · CVPR 2020 · 2020
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

각 픽셀마다 적응적 커널과 오프셋으로 흐름을 협업 추정하는 AdaCoF로 비디오 프레임 보간을 수행한다.

Adversarial Self-Supervised Contrastive Learning

KAIST · NeurIPS 2020 · 2020
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

라벨 없이 적대적 강건성을 학습하는 Robust Contrastive Learning(RoCL) 제안. 무라벨 데이터의 적대적 섭동과 증강본 간 유사도를 최대화.

CenterMask: Real-Time Anchor-Free Instance Segmentation

ETRI · CVPR 2020 · 2020
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

FCOS 검출기에 공간 어텐션 기반 마스크 분기와 개선된 VoVNetV2 백본을 결합한 실시간 앵커프리 인스턴스 분할 기법.

CSI: Novelty Detection via Contrastive Learning on Distributionally Shifted Instances

KAIST · NeurIPS 2020 · 2020
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

대조학습에 분포 이동 증강을 결합해 샘플의 이동 증강본과 대조함으로써 신규성/이상치를 탐지하는 CSI 제안.

Glow-TTS: A Generative Flow for Text-to-Speech via Monotonic Alignment Search

Kakao Enterprise / 서울대 · NeurIPS · 2020
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

단조 정렬 탐색(MAS)을 도입한 흐름 기반 생성 TTS로, 외부 정렬기 없이 병렬적으로 빠르고 강건한 음성합성을 수행한다.

HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis

Kakao Enterprise · NeurIPS 2020 · 2020
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

멜스펙트로그램으로부터 고품질 음성을 효율적으로 합성하는 GAN 기반 보코더. 다중 주기/스케일 판별기로 실시간에 근접한 속도와 고충실도를 동시에 달성.

I2L-MeshNet: Image-to-Lixel Prediction Network for Accurate 3D Human Pose and Mesh Estimation from a Single RGB Image

서울대학교 · ECCV 2020 · 2020
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

단일 RGB 이미지에서 lixel 기반 히트맵 예측으로 3D 인체 포즈와 메쉬를 정밀 복원하는 I2L-MeshNet.

InterHand2.6M: A Dataset and Baseline for 3D Interacting Hand Pose Estimation from a Single RGB Image

서울대학교 · ECCV 2020 · 2020
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

상호작용하는 양손의 3D 포즈 추정을 위한 대규모 데이터셋 InterHand2.6M과 InterNet 베이스라인을 공개한다.

KorNLI and KorSTS: New Benchmark Datasets for Korean Natural Language Understanding

Kakao Brain · Findings of EMNLP · 2020
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

카카오브레인이 영어 데이터셋을 번역해 구축한 한국어 자연어추론(KorNLI)·의미유사도(KorSTS) 두 벤치마크 데이터셋과 베이스라인 모델.

Learning from Failure: Training Debiased Classifier from Biased Classifier

KAIST (Jinwoo Shin 그룹) · NeurIPS 2020 · 2020
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

편향된 모델이 먼저 학습하는 쉬운 상관관계를 이용해, 그 실패 사례를 강조 학습함으로써 편향을 제거한 분류기를 훈련하는 방법(LfF).

Pose2Mesh: Graph Convolutional Network for 3D Human Pose and Mesh Recovery from a 2D Human Pose

서울대학교 · ECCV 2020 · 2020
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

2D 포즈로부터 그래프 컨볼루션 네트워크로 3D 인체 포즈와 메쉬 정점을 직접 회귀하는 Pose2Mesh.

Puzzle Mix: Exploiting Saliency and Local Statistics for Optimal Mixup

서울대학교 (Hyun Oh Song 그룹) · ICML 2020 · 2020
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

이미지의 saliency 정보와 지역 통계를 활용해 최적 혼합 마스크를 찾는 데이터 증강 기법. 기존 mixup/CutMix 대비 일반화 성능과 적대적 견고성을 …

Rethinking Channel Dimensions for Efficient Model Design

NAVER AI Lab · CVPR 2021 · 2020
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

네트워크 각 층의 채널 구성(확장 비율)이 표현력에 미치는 영향을 분석하고, 채널 차원을 재설계해 효율적이고 성능 좋은 백본 ReXNet을 제안한다.

Rethinking the Truly Unsupervised Image-to-Image Translation

Clova AI Research, NAVER · ICCV 2021 · 2020
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

도메인 라벨이나 쌍 데이터 없이 이미지-이미지 변환을 학습하는 완전 비지도 방법(TUNIT). 유사 도메인을 스스로 군집화하는 가이딩 네트워크로 라벨 없는 다중 …

StarGAN v2: Diverse Image Synthesis for Multiple Domains

NAVER Clova AI · CVPR · 2020
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

하나의 모델로 여러 도메인에 걸쳐 다양성 있는 이미지를 생성·변환하는 GAN 프레임워크.

U-GAT-IT: Unsupervised Generative Attentional Networks with Adaptive Layer-Instance Normalization for Image-to-Image Translation

NCSOFT · ICLR · 2020
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

어텐션 모듈과 적응형 레이어-인스턴스 정규화(AdaLIN)로 형태 변화가 큰 이미지 간 변환을 비지도로 수행한다.

Video Panoptic Segmentation

KAIST · CVPR 2020 · 2020
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

비디오 파놉틱 분할 과제를 새롭게 정의하고 시간적으로 일관된 인스턴스·의미 분할을 수행하는 VPSNet과 벤치마크를 제시한다.

Character Region Awareness for Text Detection

Clova AI Research, NAVER · CVPR 2019 · 2019
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

문자 영역과 문자 간 연결성(affinity)을 예측해 임의 형태의 텍스트를 검출하는 CRAFT 기법. 개별 문자 단위 지역화로 곡선·긴 텍스트에서도 강건한 장면…

CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features

NAVER Clova AI Research · ICCV 2019 · 2019
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

학습 이미지의 패치를 잘라 다른 이미지에 붙이고 라벨도 면적 비율로 섞는 데이터 증강 기법. 정보 손실 없이 지역화 가능한 특징을 학습해 분류·검출·전이학습 성능…

Deep Video Inpainting

KAIST · CVPR 2019 · 2019
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

프레임 간 시간적 일관성을 유지하며 비디오 결손 영역을 복원하는 순환 기반 딥러닝 비디오 인페인팅 프레임워크.

FickleNet: Weakly and Semi-supervised Semantic Image Segmentation using Stochastic Inference

서울대학교 · CVPR 2019 · 2019
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

확률적 은닉 유닛 선택으로 다양한 위치화 맵을 생성해 약지도 의미론적 분할 성능을 향상한다.

Gaussian YOLOv3: An Accurate and Fast Object Detector Using Localization Uncertainty for Autonomous Driving

서울대학교 · ICCV 2019 · 2019
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

YOLOv3의 바운딩박스 예측에 가우시안 모델링을 도입해 위치 불확실성을 추정하고 자율주행용 실시간 객체검출의 정확도를 높인다.

KorQuAD1.0: Korean QA Dataset for Machine Reading Comprehension

LG CNS · arXiv · 2019
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

한국어 위키백과 기반 7만여 개 질의응답 쌍으로 구성된 대규모 기계독해(추출형) 데이터셋 KorQuAD 1.0.

Spectral Approximate Inference

KAIST · ICML 2019 · 2019
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

그래프 모델의 분배함수 근사를 스펙트럼 기반으로 접근해 저계수 결합 행렬에 대한 다항시간 근사와 스펙트럼 평균장 알고리즘을 제안.

What Is Wrong With Scene Text Recognition Model Comparisons? Dataset and Model Analysis

Clova AI Research, NAVER · ICCV 2019 · 2019
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

장면 텍스트 인식(STR) 모델 비교의 비일관성 문제를 지적하고, 통일된 학습·평가 데이터셋과 4단계 모듈 프레임워크를 제안해 공정한 비교와 성능 기여 분석을 수…

Learning to Quantize Deep Networks by Optimizing Quantization Intervals with Task Loss

Samsung Advanced Institute of Technology (SAIT) · CVPR 2019 · 2018
검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

양자화 구간(interval) 자체를 태스크 손실로 학습해 가중치·활성값을 함께 양자화하는 QIL. 극저비트에서도 정확도 손실을 최소화하는 학습 가능한 양자화 기…