Hidden Threat in Synthetic Data: Covert Targeted Bias Injection through Benign Text
KAIST · Dankook University · EMNLP 2026 · 2026 · 검증 완료 검증 완료복수의 신뢰 가능한 출처로 검증되었습니다.
오정렬 교사 모델이 만든 창작·코드 합성 데이터를 겉보기에는 정상인 형태로 정제해 정렬된 학생 모델을 미세조정할 때 표적 사회적 편향이 은밀하게 전이될 수 있음을 보인다. 일반 과제 능력은 대체로 유지돼 합성 데이터 학습 파이프라인에 대한 별도 안전 검증의 필요성을 제기한다.
- arXiv
- 2608.30619
- 원문
- https://arxiv.org/abs/2608.30619
관련 항목
출처 및 검증
마지막 검증일: 2026-09-01