여기 갤 정렬이니 검열이니 싫어하는 건 아는데
적어도 이 새끼가 나쁜 맘 먹진 못하도록 해야하는 건 맞잖아

그럼 정렬할 때 어떻게 해야 함?

OpenAI 레드팀이었나 GPT가 위험한 답변 말할 수 있는 상황이나 프롬프트 직접 돌려보면서 확인하고 막는 거 같던데

지금이야 검열 없는 GPT-4 여도 엄청나게 큰 피해를 끼칠 수 있는 답변은 나오기 힘들지만 초지능이면?

레드팀 인원 중 누군가가 정렬한단 핑계로 "현재 대한민국 법과 수사 방식을 고려한 완전범죄 방법" 이런 거 물어보고 ASI가 정말 완벽한 답변을 수행한다면?

이렇게 되면 레드팀 같은 역할은 인간이 수행할 수 없지 않을까