1ebec223e0dc2bae61abe9e74683716d91d423a0be0d99f0fc53d4b0b7f14e8d9f5e21f26790a5414417db2dba222c5370

[제안서] OpenAI 콘텐츠 필터링 개선안: 우회 방지를 위한 형태 기반 사전 필터링

1. 현재 시스템 개요
OpenAI는 다층적 콘텐츠 필터링 시스템을 운영 중입니다:

Moderation API: 텍스트 및 이미지 입력에 대해 범주별 위험 점수를 산출함 (예: 혐오, 폭력 등).

정책 해석 계층: GPT 기반으로 추정되며, 정황과 문맥을 고려한 정교한 필터링 수행.

출력 스캔 단계: 최종 모델 응답이 사용자에게 반환되기 전에 안전성을 추가 점검.


2. 알려진 우회 방식
고급 사용자들은 다음과 같은 방식으로 필터링을 회피합니다:

프롬프트 엔지니어링: 은유나 간접적 표현 사용.

형태 대체 기법: 초기에는 로봇이나 인형 등 비인간 형태로 시작하고 점차 인간화.

관점 조작: 제3자 시점 등으로 묘사하여 암시적 표현 유도.

피드백 루프 활용: 위험 점수를 높이지 않으면서 반복적으로 문장을 수정.


3. 제안: 형태 기반 사전 필터링 도입
기존 필터링 전에 작동하는 경량화된 사전 필터 계층을 제안합니다:

형태 분석 모듈: 비전 모델이 로봇/인형이라도 인간형 구조 여부를 감지.

의도 추론 엔진: NLP 모델이 사용자 프롬프트 기록을 추적해 악용 패턴 탐지.

정책 매핑 계층: 사전 감지 내용을 기존 필터링 정책과 연계해 조치 결정.

행동 기반 제재 체계: 반복 위반 시 점진적 제재 적용 (예: 10분 → 24시간 정지).


4. 기대 효과

단기: 지연 시간 소폭 증가. 연산량 감소는 아직 없음.

장기: 필터 우회 시도 감소, 연산 자원 절감, 모델 응답에 대한 신뢰도 향상.


5. 권고 사항
기존 인프라를 활용하여 형태 민감형 사전 필터링 기능을 시범 도입할 것을 권장함. 이는 현재 존재하는 멀티모달 필터링의 취약점을 보완하는 조치가 될 것임.

작성자: sks38317
수신처: OpenAI Moderation / Trust & Safety 팀