LLM 스터디 #2
간략한 논문 리뷰: Attention Is All You Need #1
시퀀스 변환 모델은 Encoder와 Decoder를 포함하는 복잡한 RNN이나 CNN을 기반으로 합니다. 그리고 어텐션 메커니즘으로 Encoder와 Decoder을 연결한 모델이 가장 성능이 좋은 모델이었습니다. 이에, Google 연구팀에서는 어텐션 메커니즘만을 기반으로 하는 트랜스포머 모델을 제안하게 됩니다.
RNN은 기본적으로 입력 시퀀스 데이터의 token 위치와 출력 시퀀스 데이터의 token 위치에 대해 계산을 하게 됩니다. 조금 더 상세하게 표현하면, RNN은 바로 이전 데이터가 t-1 시점의 입력 데이터이면, t 시점에 올 데이터를 예측합니다. 이러한 시퀀스의 기본적인 특징으로 인해 학습 데이터들의 병렬화가 되지 않습니다. 그리고 이것은 데이터의 길이가 길수록 더욱 중요해지는 문제가 됩니다. 메모리의 한계로 인해 학습 효율이 많이 떨어지게 되죠. 물론 이 또한 어느 정도는 개선이 되었지만, 아직 효율성의 문제점은 남아있었습니다.
어텐션 메커니즘은 출력 데이터의 길이에 상관 없이 token들 사이의 연관성을 모델링 할 수 있습니다. 그러나, 대부분의 케이스들에서 어텐션 메커니즘은 RNN과 같이 사용되었습니다.
이 논문에서, Google 연구팀은 RNN을 피하고 어텐션 메커니즘에 전적으로 의존하는 트랜스포머 모델을 제안합니다. 그리고 이는 입력 데이터와 출력 데이터 사이에서 global한 token들 사이의 연관성들을 이끌어 냅니다. 이 때문인지는 몰라도, 트랜스포머 모델은 훨씬 더 많은 병렬화를 할 수 있게 됩니다.
모델 아키텍쳐에 대한 글은 다음 번 기록에서 남겨볼게요~
(논문 읽다가 오해한 부분이 있어 정정했습니다)
https://arxiv.org/pdf/1706.03762.pdf
댓글
로그인 후 댓글을 남길 수 있습니다.
공부 열심히 하시네요 굿
그럼요~~