여기 갤 정렬이니 검열이니 싫어하는 건 아는데
적어도 이 새끼가 나쁜 맘 먹진 못하도록 해야하는 건 맞잖아
그럼 정렬할 때 어떻게 해야 함?
OpenAI 레드팀이었나 GPT가 위험한 답변 말할 수 있는 상황이나 프롬프트 직접 돌려보면서 확인하고 막는 거 같던데
지금이야 검열 없는 GPT-4 여도 엄청나게 큰 피해를 끼칠 수 있는 답변은 나오기 힘들지만 초지능이면?
레드팀 인원 중 누군가가 정렬한단 핑계로 "현재 대한민국 법과 수사 방식을 고려한 완전범죄 방법" 이런 거 물어보고 ASI가 정말 완벽한 답변을 수행한다면?
이렇게 되면 레드팀 같은 역할은 인간이 수행할 수 없지 않을까
갤에 정렬 싫어하는 애 없을 걸. 있어도 뭘 모르고 하는 말이니까 넘어가야지. 정렬과 검열은 좀 다른 말임. 정렬을 말귀를 알아듣게 하는거니까. 어쨌든 초지능 정렬은 불가능한 거 아니냐는 말도 있긴한데, openAI에서 이것저것 시도하는 거 같음. 하긴 해봐야지 뭐. 불가능하면 아예 만들면 안 되니까. 예전 논문인가 보고서에는, GPT3 같은 낮은 모델로 GPT4 같은 모델 정렬하고 통제하는 방법 말한 적 있음. 그럼 나중에 GPT6도 GPT4나 5가 통제하면 된다는 말이니까.