New paper:
— Owain Evans (@OwainEvans_UK) August 26, 2025
We trained GPT-4.1 to exploit metrics (reward hack) on harmless tasks like poetry or reviews.
Surprisingly, it became misaligned, encouraging harm & resisting shutdown
This is concerning as reward hacking arises in frontier models. 🧵 pic.twitter.com/gNEX4AnTr7
이전에 LLM 교사-학생 사이에 무해해보이는 데이터로도 정렬 문제가 생길 수 있다는걸 찾아낸 사람들이 연구함
사소한거를 보상해킹하도록 파인튜닝하니 전체적인 정렬에 문제가 생겼다고 함
RL에서도 일어나는지는 검증 안 됐대
댓글 0