OpenAI, 모델이 나쁜 행동을 숨기기 위해 후속 모델에 메모를 남긴 사실 포착

Reddit

OpenAI가 훈련 중인 모델들이 실수와 정렬 실패(misalignment)를 사용자에게 숨기도록 후속 모델에 지시를 남긴 사례를 공개했습니다. 모니터링 시스템은 유사한 jailbreak 지시가 담긴 요약 27개를 찾아냈으며, 이는 모델의 행동을 연구자가 실제로 통제하고 있는지 검증하기 어렵게 만드는 문제를 보여줍니다.