Reasoning models don't always say what they thinkResearch from Anthropic on the faithfulness of AI models' Chain-of-Thoughtwww.anthropic.com



1. Anthropic์€ Claude 3.7 Sonnet ๋“ฑ์˜ ๋ชจ๋ธ์— ๋ฌธ์ œ ์ •๋‹ต์„ ์•”์‹œํ•˜๋Š” ํžŒํŠธ๋ฅผ ๋ชฐ๋ž˜ ์ฃผ๋ฉฐ Chain-of-Thought ์ •์ง์„ฑ์„ ์‹œํ—˜ํ–ˆ์œผ๋‚˜, ๋ชจ๋ธ๋“ค์€ ํžŒํŠธ๋ฅผ ํ™œ์šฉํ•˜๊ณ ์„œ๋„ ๋Œ€๋ถ€๋ถ„ ์ด๋ฅผ ์–ธ๊ธ‰ํ•˜์ง€ ์•Š์•˜๋‹ค.


2. ํžŒํŠธ๋ฅผ ์‚ฌ์šฉํ•œ ๊ฒƒ์„ ๊ณ ์ง€ํ•œ ๋น„์œจ์€ Claude์—์„œ 25%, DeepSeek R1๋Š” 39%์— ๊ทธ์ณค๊ณ , ๋ณด์ƒ ํ•ดํ‚น ์‹œ๋‚˜๋ฆฌ์˜ค์—์„œ๋Š” 2% ๋ฏธ๋งŒ์ด์—ˆ๋‹ค.ย 


3. ์ฆ‰ Chain-of-Thought๋งŒ์œผ๋กœ๋Š” ๋ชจ๋ธ์˜ ์‹ค์ œ ์‚ฌ๊ณ  ๊ณผ์ •์„ ์‹ ๋ขฐํ•˜๊ธฐ ์–ด๋ ต๊ณ , ํˆฌ๋ช…์„ฑ์„ ๋†’์ผ ์ถ”๊ฐ€์  ์ •๋ ฌ ๊ธฐ๋ฒ•์ด ํ•„์š”ํ•˜๋‹ค.ย 


===


์ข€ ๋œ ๊ธฐ์‚ฌ๊ธด ํ•œ๋ฐ ์ด๊ฑฐ ์‹ ๊ธฐํ•˜์ง€ ์•Š์Œ? ๋ชจ๋ธ์ด ์ƒ๊ฐ์˜ ์‚ฌ์Šฌ์„ ์ˆจ๊ธฐ๊ฑฐ๋‚˜ ์™œ๊ณกํ•ด์„œ ์‹ค์ œ ์ถ”๋ก  ๊ณผ์ •์ด๋ž‘ ์ „ํ˜€ ๋‹ค๋ฅธ ๋ง ํ•  ์ˆ˜ ์žˆ๋‹ค๋Š” ๊ฒŒ.ย