[논문 리뷰] LORA: LOW-RANK ADAPTATION OF LARGE LAN-GUAGE MODELS - ICLR 2022
·
AI Research Paper Review
배경과 문제의식대규모 언어모델의 일반적인 활용 방식은 대규모 데이터로 사전학습한 모델을 특정 downstream task에 맞게 fine-tuning하는 것이다. 그러나 모델 규모가 커질수록 모든 파라미터를 업데이트하는 full fine-tuning은 점점 비현실적인 방법이 된다. 예를 들어 GPT-3 175B와 같은 모델을 task마다 별도로 fine-tuning하면, 각 task마다 1,750억 개 규모의 파라미터를 가진 모델 복사본을 저장하고 배포해야 한다. 이는 저장 비용, GPU 메모리, 배포 비용, task switching 측면에서 매우 비효율적이다. 기존에도 parameter-efficient tuning을 위한 adapter, prefix tuning, prompt tuning 등의 방법..