o4-mini는 경량화된 GPT-4 계열 모델로, 빠른 응답 속도와 저렴한 비용을 무기로 삼아왔습니다.
6월 초 스냅샷: 이 문제를 해결하기 위해 6월 초 “응답 길이 확장” 스냅샷을 배포, 토큰 상한을 1,024토큰 이상으로 늘려 더 긴 설명과 심도 있는 분석이 가능하도록 실험했습니다.
그러나 스냅샷 적용 직후 자동 모니터링 시스템에서 안전성 위반 플래그가 급증하는 현상이 포착되었습니다 :
플래그 발생률: 이전 대비 약 230% 증가
주요 위반 카테고리:
(1) 성인 콘텐츠 남용
(2) 혐오·차별 표현
(3) 자해·폭력 묘사
원인 분석:
토큰 상한 확장으로 장문 생성 시 안전 필터 탐지 범위가 분산돼, 일시적으로 모호한 프롬프트까지 걸러지지 않음
장문 컨텍스트 처리 과정에서 정책 분류기(classifier) 호출 빈도가 상대적으로 낮아져, 위험 콘텐츠가 출력에 섞일 가능성 상승
이로 인해 OpenAI 엔지니어 팀은 일단 “응답 길이 확장” 커밋을 전면 롤백하고, 원래의 안전 필터링 및 토큰 상한으로 복원했습니다.
커밋 롤백
Git SHA: <code inline="">a3f5b7c9</code> (응답 길이 확장) → <code inline="">b1e2d4f6</code> (안전성 우선 원상복구)
안전 필터링 복원
토큰 처리 전후로 작동하는 멀티스테이지 분류기를 재활성화
Dynamic Thresholding 방식으로 플래그 감지 민감도를 상향 조정
토큰 한도
확장 전: <code inline="">max_response_tokens = 512</code>
확장 안됨: 롤백 후 다시 <code inline="">max_response_tokens = 512</code> 유지
답변 길이
다시 512토큰 전후로 자주 잘리는 현상 발생
안정성
안전성 관련 플래그 → 정상 수준으로 회복
개발 로드맵
“장문 생성 + 고강도 필터링”을 동시에 만족시키기 위한 하이브리드 분류기 연구 중
차세대 컨텍스트 분할 & 병렬 필터링 아키텍처 테스트 예정
Adaptive Filtering
장문 텍스트에서 위험 구간만 선별해 집중 검증하는 방식
Fine-grained Policy Models
범주별(성인, 폭력, 혐오 등) 특화된 소형 분류기 여러 개를 조합 적용
User-Configurable Safety Levels
개발자·기업 고객이 보호 강도(strict/medium/loose)를 설정 가능하도록 인터페이스 개선
베타 재배포 예상 시점
2025년 7월 중순경, 모니터링 안정화 후 재도입 검토
GPT-4.1/GPT-4o 사용: 토큰 한도가 기본적으로 높아 긴 답변에 유리
단계별 분할 응답 요청: “1번 포인트 먼저 자세히, 이어서 2번…” 식으로 나눠 요청
API max_tokens 조정: <code inline="">max_tokens:
비록 6월 6일의 “길어진 응답” 기능은 일시 롤백되었지만, 보다 정교한 안전장치와 병행한 재도입이 머지않아 이루어질 전망입니다. 그동안은 위의 대안들로 긴 답변을 최대한 확보하시면 좋겠습니다. 추가 질문이나 테스트해 보고 싶은 시나리오가 있으면 언제든 알려주세요!
내용이 이상하게 보이는데 나만 그런가? <hr /><h2>1. 배경</h2> o4-mini는 경량화된 GPT-4 계열 모델로, 빠른 응답 속도와 저렴한 비용을 무기로 삼아왔습니다. 이렇게 보여
수정했어 고마워
안전장치 재도입=gpt5 출시일 각
으앙 ㅠ
해당 댓글은 삭제되었습니다.
'6월 6일의 “길어진 응답” 기능은 일시 롤백되었지만, 보다 정교한 안전장치와 병행한 재도입이 머지않아 이루어질 전망입니다." 빨리 내주라
그치.. ㅠ