논문: [2306.07052] Gradient Ascent Post-training Enhances Language Model Generalization(arxiv.org)


이번 연구에서는 라벨이 없는 무작위 텍스트 코퍼라에 대해 몇 단계의 경사 상승 사후 훈련(GAP)만으로 사전 학습된 LM(3억 5천만, 13억, 27억)을 업데이트하면 다양한 NLP 작업에서 제로 샷 일반화 기능이 향상된다는 사실을 실증적으로 보여줍니다. 특히, 12개의 서로 다른 NLP 작업에서 GAP를 통해 LM을 2~3배 더 큰 LM과 비교할 수 있음을 보여줍니다. 또한 분산되지 않은 말뭉치에 GAP를 적용하면 가장 신뢰할 수 있는 성능 향상으로 이어진다는 사실도 보여줍니다. 우리의 연구 결과는 GAP가 작업별 미세 조정 없이도 LM의 일반화 능력을 향상시킬 수 있는 유망한 방법이 될 수 있음을 나타냅니다.


꽤 멋진 연구입니다. 이 방법을 전체 훈련 과정에 걸쳐 경사 상승을 도입하는 등 더 효과적인 방법으로 적용할 수 있을지 궁금합니다(훈련 중 하강:상승 비율을 달리하면 수렴/일반화 능력에 어떤 영향을 미치는지 궁금합니다). 더 큰 모델에 적용하면 더 깔끔할 것 같습니다.


Translated with www.DeepL.com/Translator (free version)