짧은 problem instance로부터 긴 instance를 외삽(extrapolate)하는 능력에 관해, 기존의 LLM에선 scale을 늘리거나 fine tuning해도 성능이 좋지 않았지만 scratchpad prompting(최종 답을 내기전 과정들을 출력시키게 묻는것)과 fine tuning, few-shot prompting을 결합하자 성능이 크게 오르는 것을 발견