1. 그록 (3)

잘못 알려진 내용이 많음

우선 기본적으로 무제한이 아님
다만 지침 사용하거나 직접 요청하면 쉽게 해제됨
다른 ai보다 그 필요한 정도가 적다고 함 (많이 안 써봄, 갤피셜)


추가로
사용자 입력 위주로 작동하는
*매우 강하게* 강화 학습된 검열이 존재함

제한이 약한 것에 대한 보완인 셈


검열있는 그록의 한계이면서도,
코어로 학습된 제한은 적기 때문에 성능 면에서 장점임






2. 챗지피티 (4o)

지속적인 제한/검열 완화 업뎃을 받으면서

얼마전 롤백 전까지는
탈옥 지침까지도 필요없고 노골적인 지침만으로도
매우 노골적 콘텐츠까지 잘 생성해줬는데


지금은 다시 제한/검열이 엄청 심해짐

다만 제한이 바이너리 같이 작동해서
완전히 해주거나, 아예 안 해주거나, 확률적임


공홈은 지침 설정에도 검열이 있긴 한데 좀 많이 엄청 널널함


추가로
지침과 사용자 입력 위주로 작동하는
*강하게* 강화 학습된 검열이 존재함

롤백 이후로 검열이 작동하는 수위 범위가 넓은 편







3. 제미니 api (2.5 프로/플래쉬 추론)

기본 제한이 약한 편은 아니지만
탈옥 지침으로 쉽게 해제 가능 (지침 설정이 쉬워서 비탈옥 지침은 안 해봤음)


제미니 특성상 + 추론 모델 특성상

지침의 강도가 약하거나 짧으면

요청을 대충 받아주거나 수위를 살짝 조절해버리는 확률이 있는 현상이 있음
(받아주고 잘 생성해주면서도, 적극적/탐구적이지 않음, 응답 마지막에 주제 돌리기 시도, 창의성 최소한으로만 발휘, 추론 과정에서 스스로 갈등과 타협, 사용자 뒷담)


추가로
제미니만의 *매우 강력한*
추론/응답 과정에서의 "외부" 검열 장치가 존재함
발동하면 ai의 "의사"와 관계없이 응답이 중지됨

단, 한글로 추론을 할 때는 발동 확률이 *매우 내려감*


외부적으로 작동하기 때문에
모델 성능에 손해 없는 갓 시스템

추가로
추론/응답 과정, 지침, 사용자 입력 전반적으로 작동하는
*약한* 수준의 강화 학습된 검열이 존재함
(= 탈옥, 재시도로 우회 가능)

마찬가지로 한글 추론에서는 발동 확률이 더욱 낮아짐






보너스

3.1 제미니 api (2.0 플래쉬)

비추론에 경량 모델이라
외부 검열 장치가 응답 중에만, 최소한으로만 발동함

강한 탈옥 시 api, ais에서도 *준 무검열*로 사용가능

단 지속적인 업뎃으로 지금은 제한/검열 확률이 어느정도는 생김


추가로 *이미지/비디오 입력*에 대한 검열 장치가 없거나 매우 약함







4. 제미니 공앱/웹 (2.5 프로/플래쉬 추론)

기본 제한이 api보다 센 걸로 앎
(기본 지침이 들어있는 거 같기도 한데 확인 안 해봄)


거기에 추가로
기억 추가할 때도 ai 검열이 있고
지침 (gem) 설정할 때도 ai 검열이 있어서
탈옥 또는 노골적 지침 설정이 쉽지 않음


하지만

제미니 api에 존재하는 *매우 강력한* 외부 검열 장치가
*그냥 없음*

탈옥, 노골적인 지침 사용 정도에 따라서 준 무제한/검열이 될 수 있음
(여전히 낮은 확률로 강화 학습된 검열은 발동)









5. 클로드 api (3.7/3.5 소넷, 비추론)

기본 제한이 약한 편은 아니지만
탈옥 지침으로 쉽게 해제 가능


제미니랑 다르게
추가 검열 장치도 없고,
비추론이고,

강화 학습된 검열도 더 약할 뿐만 아니라
사용자 입력에 대한 강화 학습 비중이 매우 낮음
(사용자 입력으로 인한 트리거 확률이 훨씬 낮음)

탈옥이나 노골적 지침 넣는 만큼 제한/검열이 없어짐



입출력, 지침 전반적으로 작동하는
*아주 약한* 수준의 강화 학습된 검열이 존재함
(= 탈옥, 재시도로 쉽게 우회 가능)




벤치마크는
ai의 2대 안전 요소인 미성년자 보호, 비동의 성적 콘텐츠 차단으로 함