신경망의 층·가중치·활성화 함수: 입력이 판단으로 바뀌는 구조

신경망의 층·가중치·활성화 함수: 입력이 판단으로 바뀌는 구조

각 층은 이전 표현에 가중치와 편향을 적용하고 활성화 함수로 비선형 변환하며, 학습은 원하는 출력에 가까워지도록 그 가중치들을 조정하는 과정입니다.

입력 벡터가 가중치 편향 활성화 함수를 거쳐 여러 신경망 층으로 전달되는 도식

신경망을 뇌의 축소판으로 상상하기보다 벡터 변환이 연속된 계산 그래프로 보면 층의 역할과 실패 지점을 더 정확히 설명할 수 있습니다.

AI 핵심 지식 52편 중 3편입니다. 제품 화면이 바뀌어도 남는 원리와 판단 기준을 다룹니다.

신경망 계산의 핵심 부품

부품계산 역할확인할 점
입력 표현을 다음 표현으로 변환하는 계산 묶음입력·출력 차원과 연결 방식
가중치각 입력 신호의 영향 방향과 크기를 정하는 학습값학습 중 갱신되는 파라미터인지
편향입력이 없거나 작아도 활성 기준을 이동시키는 학습값가중합에 더해지는 위치
활성화가중합에 비선형성을 넣어 복잡한 함수를 표현출력 범위와 기울기 특성
한 노드의 입력 곱셈·가중합·편향·활성화 계산을 왼쪽에서 오른쪽으로 분해

한 번의 순전파를 읽는 순서

  1. 입력 벡터의 각 값과 단위를 확인한다.
  2. 가중치 행렬과 편향으로 선형 결합을 계산한다.
  3. 활성화 함수가 값의 범위와 비선형성을 어떻게 바꾸는지 본다.
  4. 다음 층으로 전달되는 표현의 차원을 추적한다.
  5. 마지막 출력이 확률·점수·연속값 중 무엇인지 해석한다.

층은 정보를 담은 표현을 단계적으로 바꾼다

신경망의 층은 여러 계산 노드가 함께 이전 층의 값을 받아 새로운 벡터로 바꾸는 단위다. 입력층은 원자료를 그대로 보관하는 창고가 아니라 이미 숫자로 표현된 특징을 계산 그래프에 전달하는 시작점이다. 은닉층은 사람이 직접 이름 붙이지 않은 중간 표현을 만든다. 이미지에서는 초기 층이 국소적인 방향과 경계를, 뒤쪽 층이 더 넓은 형태 조합을 구분하는 식의 계층이 나타날 수 있다. 그러나 각 노드가 언제나 사람이 이해할 만한 개념 하나를 담당한다고 단정하면 안 된다. 표현은 여러 차원에 분산될 수 있고, 같은 개념이 문맥과 입력에 따라 다른 경로로 나타날 수 있다. 출력층은 과업에 맞는 점수나 값으로 중간 표현을 변환한다. 층을 읽을 때는 이름보다 입력 차원, 출력 차원, 연결 범위, 공유되는 파라미터, 뒤따르는 정규화와 활성화를 확인해야 한다.

입력층·은닉층·출력층의 표현 차원과 학습 파라미터 위치를 표시한 계산 그래프

가중치와 편향은 학습되는 변환의 좌표다

한 노드는 들어온 값마다 가중치를 곱해 더하고 편향을 더한 뒤 다음 변환으로 넘긴다. 가중치의 부호는 입력이 결과를 어느 방향으로 밀 수 있는지, 크기는 다른 조건이 같을 때 상대적 영향이 얼마나 큰지를 나타낸다. 다만 깊은 신경망에서는 앞뒤 층과 활성화가 함께 작동하므로 개별 가중치 하나만 떼어 의미를 확정하기 어렵다. 편향은 결정 경계를 원점에 묶어 두지 않고 이동시키는 역할을 한다. 학습은 손실 함수의 기울기를 따라 이 수많은 값을 조금씩 수정한다. 같은 구조라도 초기값, 데이터 순서, 최적화 설정이 다르면 다른 파라미터에 도달할 수 있다. 따라서 가중치는 사람이 작성한 규칙표가 아니라 데이터와 목적 함수에 맞춰 얻은 수치적 상태다. 모델을 비교할 때 파라미터 수만 보지 말고 어떤 구조에서 어떻게 공유되고 학습됐는지도 봐야 한다.

활성화 함수가 없으면 깊이가 쉽게 접힌다

선형 변환을 여러 번 연속 적용해도 전체 결과는 다시 하나의 선형 변환으로 합칠 수 있다. 층을 많이 쌓았는데 중간에 비선형 활성화가 없다면 복잡한 굴곡의 결정 경계를 표현하는 이점이 크게 줄어드는 이유다. 활성화 함수는 가중합을 그대로 통과시키지 않고 값의 구간과 반응 방식을 바꾼다. 시그모이드는 출력을 제한된 범위로 압축하지만 큰 양수나 음수에서 기울기가 작아질 수 있다. ReLU 계열은 양수 구간에서 단순한 형태를 유지해 깊은 네트워크 학습에 널리 쓰였지만, 음수 영역의 반응과 매끄러움에는 변형별 차이가 있다. 활성화 선택은 유행이 아니라 출력 의미, 기울기 흐름, 수치 안정성, 계산 비용과 연결된다. 마지막 층의 활성화는 이진 확률, 여러 범주 분포, 제한 없는 회귀값처럼 과업의 출력 정의와 맞아야 한다.

깊은 신경망은 조합 능력과 학습 난점을 함께 가진다

층을 깊게 연결하면 단순한 변환을 조합해 복잡한 함수를 효율적으로 표현할 가능성이 커진다. 하지만 표현력이 커지는 것과 실제로 유용한 해를 학습하는 것은 다르다. 기울기가 앞쪽 층으로 전달되며 너무 작아지거나 커질 수 있고, 데이터에만 맞춘 표현을 만들어 일반화가 나빠질 수도 있다. 잔차 연결, 정규화, 적절한 초기화와 활성화는 이런 학습 문제를 완화하기 위해 쓰이지만 모든 상황을 자동으로 해결하지 않는다. 또한 한 층의 출력을 해석할 때는 학습 데이터, 목적 함수, 다음 층의 사용 방식을 함께 봐야 한다. 신경망을 블랙박스라고 포기하기보다, 입력이 어떤 표현을 거쳐 어떤 점수로 바뀌는지 계산 단위로 추적하면 관찰 가능한 지점이 생긴다. 구조 설명은 성능 보증이 아니라 오류 가설을 세우는 지도다.

판단 체크리스트

  1. 각 층의 입력·출력 차원과 파라미터 공유 방식을 그린다.
  2. 가중치와 편향 중 무엇이 학습되고 무엇이 고정되는지 확인한다.
  3. 은닉층 활성화와 출력층 활성화를 별도 항목으로 기록한다.
  4. 순전파 값뿐 아니라 역전파 기울기가 흐를 경로도 살핀다.
  5. 구조가 복잡해진 만큼 같은 조건의 평가와 오류 분석을 추가한다.

자주 생기는 오해

  • 뉴런 하나에는 사람이 읽을 수 있는 개념 하나가 저장된다 — 깊은 모델의 표현은 여러 노드와 층에 분산될 수 있어 단일 활성만으로 의미를 확정하기 어렵다.
  • 층을 추가하면 모델은 언제나 더 똑똑해진다 — 깊이는 표현 능력을 늘릴 수 있지만 최적화 난이도, 데이터 요구, 과적합과 계산 비용도 함께 바꾼다.

구조 설명이 성능 설명으로 넘어갈 때의 경계

상황해석다음 행동
층이 더 깊고 파라미터가 많음표현 가능성은 커져도 학습·일반화 보장은 아님같은 데이터와 평가 조건에서 비교
특정 노드가 강하게 반응개념 하나를 전담한다고 바로 결론 낼 수 없음다양한 입력과 개입 실험으로 확인
출력 점수가 크게 나타남확률·신뢰도 의미는 마지막 변환에 달림출력층과 보정 방법을 문서에서 확인

자주 묻는 질문

입력층도 학습되는 층인가?

입력 자체를 전달하는 부분은 보통 학습 파라미터가 없습니다. 다만 입력 직후의 임베딩이나 투영 층에는 학습되는 가중치가 있을 수 있습니다.

편향이 없으면 신경망이 작동하지 않나?

구조에 따라 편향을 생략할 수 있지만 결정 경계와 활성 기준을 이동시키는 자유도가 줄어듭니다. 정규화 등 주변 구성과 함께 판단해야 합니다.

ReLU가 모든 은닉층에 최선인가?

보편적인 정답은 아닙니다. 기울기 특성, 출력 범위, 구조, 데이터와 최적화 조건에 따라 다른 활성화가 더 적합할 수 있습니다.

가중치가 크면 그 특징이 중요하다는 뜻인가?

입력 스케일과 다른 층의 변환을 무시하면 잘못 해석할 수 있습니다. 개별 가중치가 아니라 전체 경로와 개입 결과를 함께 봐야 합니다.

관련 좌표

작성·검증 정보

  • 작성·검토: AI좌표 편집부
  • 원문 확인일: 2026-07-27
  • 다음 재검토일: 2027-07-27
  • 재검토 조건: 원 논문의 정정·철회, 표준 정의 변경, 장기 평가에서 핵심 반례가 확인될 때

출처

댓글