Transformer: 순환 없이 토큰 관계를 병렬로 계산하는 구조

Transformer: 순환 없이 토큰 관계를 병렬로 계산하는 구조

Transformer는 토큰 사이 관계를 어텐션으로 계산하고 각 위치를 피드포워드 층으로 변환하는 블록을 쌓은 구조이며, 위치 정보·잔차 연결·정규화까지 포함해야 전체 동작을 설명할 수 있습니다.

토큰과 위치 표현이 멀티헤드 어텐션, 피드포워드, 잔차 경로를 지나 다음 블록으로 흐르는 Transformer 도식

핵심 혁신은 어텐션이라는 이름 하나가 아니라 시퀀스 의존성을 순환 상태 없이 계산하도록 구성 요소를 재배치한 데 있습니다.

AI 핵심 지식 52편 중 13편입니다. 제품 화면이 바뀌어도 남는 원리와 판단 기준을 다룹니다.

Transformer 블록의 핵심 구성

구성담당 기능확인할 한계
토큰·위치 표현내용 벡터에 순서 정보를 결합길이 외삽과 위치 표현 방식
멀티헤드 어텐션서로 다른 관계 관점으로 토큰 정보를 혼합시퀀스 길이에 따른 계산·메모리 증가
피드포워드 층각 위치의 표현을 같은 비선형 변환으로 갱신위치 간 정보 교환은 직접 수행하지 않음
잔차·정규화깊은 블록에서 정보 흐름과 학습 안정성을 보조배치 순서와 구현 차이가 결과에 영향
토큰·위치 표현에서 어텐션과 피드포워드, 잔차·정규화를 거치는 블록 흐름

Transformer 한 블록을 읽는 순서

  1. 텍스트를 토큰으로 나누고 각 토큰을 벡터로 바꾼다.
  2. 토큰 표현에 위치 또는 상대 거리 정보를 반영한다.
  3. 어텐션으로 각 위치가 참고할 다른 위치의 정보를 모은다.
  4. 잔차 연결과 정규화를 거쳐 피드포워드 변환을 적용한다.
  5. 블록을 반복한 뒤 과업에 맞는 출력 층에서 예측을 만든다.

Transformer는 순환 상태 대신 직접 관계를 계산한다

Transformer 이전의 대표적인 시퀀스 모델은 앞 시점의 은닉 상태를 다음 시점으로 넘기며 문장을 읽었다. 이 방식은 순서를 자연스럽게 담지만 먼 위치의 정보를 여러 단계를 거쳐 전달하고 학습 계산을 시간축으로 순차 실행해야 했다. Transformer는 한 층에서 각 토큰이 다른 토큰을 얼마나 참고할지 어텐션으로 계산한다. 학습할 때 여러 위치의 표현을 함께 처리할 수 있어 병렬화에 유리하고, 멀리 떨어진 두 위치도 같은 어텐션 층에서 직접 연결할 수 있다. 다만 순환을 없앴다는 말이 생성 순서까지 항상 병렬이라는 뜻은 아니다. 다음 토큰을 하나씩 만드는 자기회귀 추론은 이전 출력에 의존하므로 순차적으로 진행된다. 구조의 장점은 학습과 표현 계산의 경로에서 이해해야 하며, 모든 실행 단계가 동시에 끝난다고 설명하면 실제 동작을 왜곡한다.

인코더 양방향 참조와 디코더 인과 마스크, 교차 어텐션의 정보 방향 비교

어텐션만으로 Transformer 전체를 설명할 수 없다

하나의 Transformer 블록에는 어텐션 외에도 위치별 피드포워드 층, 잔차 연결, 정규화와 위치 정보가 들어간다. 어텐션은 여러 위치의 표현을 섞어 문맥을 모으고, 피드포워드 층은 모인 표현을 각 위치에서 비선형적으로 변환한다. 잔차 연결은 입력 신호가 깊은 층을 통과할 경로를 제공하며 정규화는 값의 규모를 다루는 데 관여한다. 멀티헤드는 같은 입력에서 서로 다른 투영을 사용해 복수의 관계 패턴을 계산하도록 만든다. 이 요소들의 순서와 세부 구현은 모델 계열에 따라 달라질 수 있다. 따라서 어떤 시스템을 Transformer라고 부를 때는 블록 수나 머리 수만 보지 말고, 인코더 전용인지 디코더 전용인지, 양방향 또는 인과 마스크를 쓰는지, 위치를 어떻게 표현하는지까지 확인해야 한다.

인코더와 디코더는 같은 블록을 다른 목적으로 배치한다

원 논문의 Transformer는 입력 전체를 표현하는 인코더와 앞에서 생성한 토큰을 바탕으로 출력을 만드는 디코더를 결합했다. 인코더의 셀프어텐션은 보통 입력 양쪽 문맥을 함께 볼 수 있고, 디코더의 마스크드 셀프어텐션은 미래 토큰을 미리 보지 못하게 제한한다. 디코더는 인코더 출력에 주목하는 교차 어텐션도 사용한다. 이후에는 인코더만 쓰는 표현 학습 모델, 디코더만 쓰는 자기회귀 언어 모델처럼 목적에 맞춘 변형이 널리 쓰였다. 같은 Transformer라는 이름 아래에서도 학습 목표와 마스크가 다르면 잘하는 과업이 달라진다. 문서 분류용 표현을 만들려는지, 입력을 다른 시퀀스로 변환하려는지, 다음 토큰을 생성하려는지를 먼저 정해야 구조 비교가 의미를 갖는다. 이름보다 정보가 어느 방향으로 흐르는지가 중요한 판단 기준이다.

병렬화 이점과 긴 시퀀스 비용을 함께 본다

기본적인 전역 셀프어텐션은 모든 토큰 쌍의 관계 점수를 계산하므로 시퀀스가 길어질수록 점수 행렬의 크기와 메모리 부담이 빠르게 늘어난다. 병렬 연산에 적합하다는 장점이 긴 입력에서 계산이 저렴하다는 뜻은 아니다. 실제 모델은 지역 어텐션, 희소 패턴, 메모리 재사용, 검색이나 입력 압축 등으로 이 문제를 다르게 다룬다. 구조를 고를 때는 파라미터 수만이 아니라 목표 길이에서의 처리량, 지연, 메모리와 정확도를 같은 조건으로 측정해야 한다. 또한 어텐션이 장거리 연결 경로를 제공해도 학습 데이터에 없던 길이와 위치를 자동으로 일반화한다고 보장할 수 없다. Transformer를 만능 구조로 취급하기보다 필요한 문맥 범위와 출력 방식, 하드웨어 제약을 연결해 평가해야 설계 선택이 실제 운영 성능으로 이어진다.

판단 체크리스트

  1. 인코더·디코더 구성과 어텐션 마스크 방향을 확인한다.
  2. 위치 표현, 정규화 순서와 잔차 연결 방식을 기록한다.
  3. 목표 시퀀스 길이에서 메모리와 처리 지연을 측정한다.
  4. 파라미터 수가 아닌 동일 데이터·과업의 품질을 비교한다.

자주 생기는 오해

  • Transformer는 어텐션 층 하나를 뜻한다 — 어텐션, 피드포워드, 잔차 연결, 정규화와 위치 표현을 조합한 블록 구조를 가리킨다.
  • Transformer는 모든 토큰을 항상 동시에 생성한다 — 학습의 위치 계산은 병렬화할 수 있지만 자기회귀 생성은 이전 출력에 의존해 순차 진행된다.

Transformer라는 이름만으로 판단하면 안 되는 경우

상황해석다음 행동
구조명만 같고 마스크가 다름참조 가능한 정보 방향이 달라짐인코더·디코더·인과 마스크 확인
긴 입력에서 메모리가 급증전역 토큰 쌍 계산이 병목일 수 있음목표 길이의 지연·메모리 실측
파라미터 수만으로 모델 선택학습 목표와 데이터 차이를 놓침동일 과업·입력 조건에서 평가

자주 묻는 질문

Transformer와 대규모 언어 모델은 같은 말인가?

아닙니다. Transformer는 모델 구조이고, 언어 모델은 학습 목표와 데이터로 정의되는 모델 유형입니다. 많은 언어 모델이 Transformer를 사용하지만 두 용어는 범위가 다릅니다.

RNN보다 언제나 정확한가?

구조만으로 우열이 고정되지 않습니다. 데이터 규모, 시퀀스 길이, 학습 설정, 지연과 메모리 제약을 포함한 과업별 평가가 필요합니다.

피드포워드 층은 토큰끼리 정보를 섞나?

일반적인 블록에서 피드포워드 층은 각 위치에 같은 변환을 독립 적용합니다. 위치 사이 정보 혼합은 주로 어텐션이 담당합니다.

인코더 없이도 번역 같은 생성이 가능한가?

디코더 전용 모델도 입력과 출력 형식을 한 시퀀스로 구성해 생성 과업을 수행할 수 있습니다. 다만 정보 흐름과 학습 방식은 원래 인코더·디코더 구조와 다릅니다.

관련 좌표

작성·검증 정보

  • 작성·검토: AI좌표 편집부
  • 원문 확인일: 2026-07-27
  • 다음 재검토일: 2027-01-27
  • 재검토 조건: 원 논문의 정정·철회, 표준 정의 변경, 장기 평가에서 핵심 반례가 확인될 때

출처

댓글