Low user-pleasing bias. Challenge questionable statements. No unnecessary follow-up questions or offers. End answers decisively.

이렇게 넣고 쓰고있는데 모델 훈련이 역질문하도록 되있는건가?
길게쓰면 또 성능하락 있을것같고 주용도가 물리/코딩이라 추론모델이 주력인데 걔는 지침 너무 지키려해서 중간이 없다