Hidden Threat in Synthetic Data: Covert Targeted Bias Injection through Benign Text

KAIST · Dankook University · EMNLP 2026 · 2026 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.

오정렬 교사 모델이 만든 창작·코드 합성 데이터를 겉보기에는 정상인 형태로 정제해 정렬된 학생 모델을 미세조정할 때 표적 사회적 편향이 은밀하게 전이될 수 있음을 보인다. 일반 과제 능력은 대체로 유지돼 합성 데이터 학습 파이프라인에 대한 별도 안전 검증의 필요성을 제기한다.

arXiv
2608.30619
원문
https://arxiv.org/abs/2608.30619

관련 항목

출처 및 검증

마지막 검증일: 2026-09-01

✎ 정보 수정 제안