[논문 리뷰] LORA: LOW-RANK ADAPTATION OF LARGE LAN-GUAGE MODELS - ICLR 2022
·
AI Research Paper Review
배경과 문제의식대규모 언어모델의 일반적인 활용 방식은 대규모 데이터로 사전학습한 모델을 특정 downstream task에 맞게 fine-tuning하는 것이다. 그러나 모델 규모가 커질수록 모든 파라미터를 업데이트하는 full fine-tuning은 점점 비현실적인 방법이 된다. 예를 들어 GPT-3 175B와 같은 모델을 task마다 별도로 fine-tuning하면, 각 task마다 1,750억 개 규모의 파라미터를 가진 모델 복사본을 저장하고 배포해야 한다. 이는 저장 비용, GPU 메모리, 배포 비용, task switching 측면에서 매우 비효율적이다. 기존에도 parameter-efficient tuning을 위한 adapter, prefix tuning, prompt tuning 등의 방법..
[논문 리뷰] Attention is All You Need - NIPS 2017
·
AI Research Paper Review/Post-Transformer
들어가기 앞서, 본 논문의 리뷰를 한 번 더 하는 이유는 그 어떤 논문보다 중요한 논문인 것이 자명할 뿐더러, 스스로 돌아봤을 때 이전보다 더욱 밀도 높게 이해하여 좀 더 자세히 기록해보고자 한다. 배경과 문제의식기존 sequence transduction 모델, 특히 기계번역 모델은 주로 RNN, LSTM, GRU 기반의 encoder-decoder 구조를 사용했다. 이러한 모델은 입력 문장을 순차적으로 읽고, 이전 hidden state를 다음 시점으로 전달하면서 문맥 정보를 축적한다. 여기에 attention mechanism을 결합하면 디코더가 출력 단어를 생성할 때 입력 시퀀스의 특정 위치를 선택적으로 참고할 수 있어 성능이 향상되었다. 그러나 RNN 기반 구조에는 근본적인 한계가 있었다. 첫째..
[논문 리뷰] CLIP : Learning transferable visual models from natural language supervision - 2021 ICML
·
AI Research Paper Review/Vision
배경과 문제의식기존 Computer Vision 모델은 대부분 ImageNet처럼 고정 클래스를 맞히도록 학습됐다. 예를 들어, 모델은 “이 이미지는 1,000개 클래스 중 무엇인가?”를 푸는 방식이다. 이러한 구조는 고정된 라벨 집합에 갇힌다는 문제를 갖는다. 새로운 개념을 인식하려면 다시 라벨 데이터를 모으고 Classifier를 학습해야 하는데, 본 논문에서는 해당 방식이 모델의 일반성과 활용성을 제한한다고 봤다. 반면 NLP에서는 GPT 계열처럼 웹 규모의 텍스트로 사전 학습한 모델이 Zero-Shot으로 여러 작업에 전이되는 흐름이 이미 성공했고, CLIP의 문제의식은 여기서 출발한다. “그렇다면 비전에서도 ImageNet 라벨이 아니라, 인터넷에 있는 이미지-텍스트 쌍을 이용해 범용적인 Vis..
[논문 리뷰] Swin Transformer: Hierarchical Vision Transformer using Shifted Windows - 2021 ICCV
·
AI Research Paper Review/Vision
배경과 문제의식2012년 AlexNet 이후 딥러닝 비전은 CNN이 지배해왔다. 한편 NLP에서는 2017년 Transformer가 등장해 장거리 의존성 포착이라는 강점으로 빠르게 표준이 됐다. 이 성공에 자극받아 2020년 ViT(Vision Transformer)가 등장하는데, 이미지를 16×16 패치로 잘라 토큰처럼 취급하고 Transformer를 그대로 적용하는 방식이었다.문제는 ViT가 분류(Classification)에는 강하지만 구조적으로 두 가지 결함을 안고 있었다는 점이다. 첫째, 이차 복잡도다.Self-attention은 모든 패치 쌍의 관계를 계산하므로 복잡도가 O((HW)²C)로 이미지 크기의 제곱에 비례한다. 고해상도 이미지에서는 비실용적인 연산량이 된다. 둘째, 단일 해상도 Fe..
[논문 리뷰] You Only Look Once: Unified, Real-Time Object Detection(YOLO) - 2016 CVPR
·
AI Research Paper Review/Vision
배경과 문제의식2016년 이전 객체 탐지는 R-CNN 계열이 지배하고 있었다. R-CNN이 작동하는 방식은 두 단계다.먼저 Selective Search로 이미지에서 객체가 있을 법한 후보 영역 2,000개를 뽑고, 그 다음 각 영역을 잘라서 CNN에 넣고 분류한다.즉, 이미지 한 장에 CNN을 2,000번 돌리는 셈이다. Fast R-CNN은 ROI Pooling으로 속도를 개선했고, Faster R-CNN이 RPN으로 Region Proposal까지 학습 가능하게 만들었다.그래도 한계가 존재하는데, Faster R-CNN의 처리 속도가 초당 7장 수준이었고, 실시간 처리에 필요한 30fps에는 한참 모자랐다.더욱 근본적인 문제는 Region Proposal과 Classificaition이 분리되어 있..