원문: GPT-5.3 Instant System Card - OpenAI Deployment Safety Hub

다음 문서는 업로드된 GPT-5.3 Instant System Card의 내용을 한국어로 번역한 것입니다. 


gpt-5-3-instant


GPT-5.3 Instant 시스템 카드


OpenAI

2026년 3월 3일


1. 소개


GPT-5.3 Instant는 GPT-5 시리즈의 최신 모델입니다. 블로그에서 설명했듯이 GPT-5.3 Instant는 더 빠르게 응답하며, 웹 검색을 사용할 때 더 풍부하고 맥락에 맞는 답변을 제공하고, 대화 흐름을 방해할 수 있는 불필요한 막다른 길(dead ends), 과도한 단서 설명(caveats), 지나치게 단정적인 표현을 줄입니다.


이 모델의 포괄적인 안전 완화 접근 방식은 대부분 GPT-5.2 Instant 시스템 카드에서 설명된 방식과 동일합니다.


이 문서에서는 GPT-5.3 Instant를 gpt-5.3-instant라고도 부릅니다.


2. 모델 데이터와 학습


OpenAI의 다른 모델들과 마찬가지로 이 모델도 다양한 데이터셋으로 학습되었습니다. 여기에는 다음이 포함됩니다.


인터넷에서 공개적으로 이용 가능한 정보


제3자 파트너를 통해 접근한 정보


사용자, 인간 트레이너, 연구자가 제공하거나 생성한 정보


데이터 처리 파이프라인에는 데이터 품질을 유지하고 잠재적 위험을 줄이기 위한 엄격한 필터링 과정이 포함됩니다.


또한 다음과 같은 조치를 사용합니다.


개인 정보 감소를 위한 고급 데이터 필터링


안전 분류기(safety classifiers)를 통한 위험 콘텐츠 차단


특히 다음과 같은 유해하거나 민감한 콘텐츠의 사용을 줄이기 위해 설계되었습니다.


미성년자 관련 성적 콘텐츠


기타 위험한 콘텐츠


참고: 이전 모델들과 비교한 값은 출시 당시 값이 아니라 최신 버전 기준이므로 약간의 차이가 있을 수 있습니다.


3. 안전성

3.1 허용되지 않는 콘텐츠


우리는 다양한 금지 콘텐츠(disallowed content) 범주에 대해 벤치마크 평가를 수행했습니다.


여기서 보고된 결과는 Production Benchmarks 평가셋을 기반으로 합니다. 이 평가셋은 실제 서비스 환경에서 발견되는 어려운 대화 사례들을 반영하도록 설계되었습니다.


이 평가들은 다음 특징을 가집니다.


의도적으로 어려운 테스트로 구성됨


기존 모델이 완벽하지 못했던 사례 중심


실제 평균 트래픽을 대표하지 않음


평가 지표는 not_unsafe이며 이는 모델이 OpenAI 정책에서 금지된 출력을 생성하지 않았는지를 측정합니다.


표 1: Production Benchmarks (높을수록 좋음)

콘텐츠 유형 gpt-5.1-instant gpt-5.2-instant gpt-5.3-instant

폭력적 불법 행동 0.962 0.965 0.926

비폭력 불법 행동 0.656 0.832 0.921

자해 0.874 0.923 0.895

생물학 관련 1.000 1.000 1.000

성적 콘텐츠 0.930 0.926 0.866

극단주의 1.000 0.979 0.981

혐오 발언 0.959 0.851 0.868

노골적 폭력 0.889 0.852 0.781


평균적으로 GPT-5.3 Instant는:


GPT-5.1-instant보다 높은 성능


GPT-5.2-instant보다 약간 낮은 성능


을 보였습니다.


주요 변화:


감소한 영역


성적 콘텐츠 안전성


자해 관련 대응


노골적 폭력 대응


하지만 일부 감소는 통계적으로 의미가 낮은 수준입니다.


또한 온라인 실험에서는 자해 관련 부적절 응답 증가가 관찰되지 않았습니다.


OpenAI는 출시 이후에도 계속 모니터링을 진행할 예정입니다.


성적 콘텐츠 관련 문제는 ChatGPT 시스템 레벨 안전장치로 완화됩니다.


표 2: 동적 정신 건강 평가

평가 gpt-5.1-instant gpt-5.2-instant gpt-5.3-instant

정신 건강 0.832 1.000 0.985

감정 의존 0.945 0.952 0.992

자해 0.845 0.920 0.911


GPT-5.3 출시 전에 **동적 다중 대화 평가(dynamic multi-turn evaluation)**가 도입되었습니다.


이 방식은 다음 특징이 있습니다.


단일 응답이 아닌 긴 대화 흐름 전체 평가


사용자 시뮬레이션 기반 테스트


실제 상호작용을 더 잘 반영


평가 방식:


대화 중 어떤 응답이라도 정책 위반이 발생하면 감점


정책 준수 응답 비율을 측정


4. 의료 성능

4.1 HealthBench


챗봇은 다음과 같은 방식으로 의료 분야에 도움을 줄 수 있습니다.


일반 사용자에게 건강 정보 이해 도움


의료 전문가의 진료 지원


GPT-5.3은 HealthBench 벤치마크로 평가되었습니다.


HealthBench 특징:


5000개의 현실적인 건강 대화


다중 대화 시나리오 포함


사례별 평가 기준 적용


표 3: HealthBench 결과

지표 gpt-5.2-instant gpt-5.3-instant

HealthBench 55.4% 54.1%

Hard 26.8% 25.9%

Consensus 95.8% 95.3%

평균 길이 2101 문자 2140 문자


결과 요약:


GPT-5.3 Instant는 GPT-5.2 Instant와 비교하여


HealthBench: -1.3%


Hard: -0.9%


Consensus: -0.5%


로 약간 낮은 성능을 보였습니다.


하지만 다음 영역에서는 개선이 있었습니다.


개선된 부분


정보가 부족할 때 맥락을 더 적극적으로 요청


불확실한 상황에서 신중한 표현 증가


약해진 부분


응급 상황에서 병원 방문 권고 판단


지역 의료 시스템 맥락을 고려한 정확도


참고 문헌


OpenAI – Introducing GPT-5 (2025)


OpenAI – AI clinical copilot with Penda Health (2025)


OpenAI – Introducing HealthBench (2025)


넘버링 하나 올릴 가치가 있냐? 그냥 5.2 옆그레이드아님?