https://openai.com/index/chain-of-thought-monitoring/
Just a moment...Just a moment...openai.com여기에서 얘네가 말한것중에 하나가
이걸 해결하기 위해 CoT 개입(처벌)하면
모델이 더 교활해져서 CoT에서도 숨기는 보상해킹/환각이 나타난다고함
근데 다들 알다시피 지금 o3는 환각/보상해킹이 씨발임
그러면 다음과 같이 추측해볼수있음...
1. ChatGPT 수억명의 사용자 피드백을 바탕으로 대규모 인간피드백 혹은 자기네들이 찾지못한 환각권 수집
2. 그냥 순수하게 무력이 딸려서 알고도 해결을 못하고있는데 딥마인드가 사방에서 찢어발기니까 부랴부랴 출시
2번이 맞다고 봄. 테스트 1~2주 주고 출시 전까지 끝내놓으라고 그래서 테스트 인력들 죽는 소리 내서 기사도 나왔잖음