EN KO
← 전체 논문 목록

LLM 내부 지식 분석을 위한 표현 단위 비교: Neurons vs. SAEs

KCC 2026
Hyelim Lim, Ingyu Bang, Hwiyeong Lee, Taeuk Kim

한줄 요약

거대 언어 모델 내부에 저장된 지식을 분석하는 데 사용되는 기본 표현 단위(representation unit) — 개별 뉴런(Neurons) vs. 희소 오토인코더(Sparse Autoencoders, SAEs)가 추출한 특징(feature) — 을 비교 분석하여, 어느 단위가 모델 내부의 사실적·언어적 지식이 어떻게 부호화되는지에 대해 더 해석 가능하고, 분리되며, 충실한(faithful) 접근을 제공하는지 검토합니다.

배경 및 동기

거대 언어 모델 내부의 어디에, 어떻게 지식이 존재하는지를 이해하는 것은 기계론적 해석 가능성(mechanistic interpretability) 연구의 핵심 목표입니다. 모델이 암기한 지식을 탐침(probe)하거나, 위치를 특정(localize)하거나, 편집(edit)하려면, 연구자는 먼저 분석의 기본 단위 — 활성값을 관찰하고, 특정 지식에 귀인하며, 개입(intervention)의 대상이 되는 최소 구성 요소 — 를 선택해야 합니다. 오늘날 가장 유력한 두 후보는 모델 자체의 개별 뉴런(은닉 활성값의 차원)과, 그 활성값 위에서 학습된 희소 오토인코더(SAE)가 복원한 특징입니다.

뉴런은 별도의 학습 없이 곧바로 사용 가능한 고유(native) 단위로, "지식 뉴런(knowledge neuron)"에 관한 선행 연구는 특정 사실과 언어적 범주를 소수의 뉴런 집합에 귀인해 왔습니다. 그러나 뉴런은 다의적(polysemantic)이라는 점이 널리 관찰됩니다: 모델이 차원 수보다 더 많은 특징을 표현 공간에 압축(중첩, superposition)하기 때문에, 하나의 뉴런이 서로 무관한 여러 개념에 대해 발화하는 경우가 많습니다. 이러한 얽힘(entanglement)은 뉴런 단위의 귀인을 모호하게 만들고, 지식이 어떻게 조직화되어 있는지에 대해 오도된 그림을 낳을 수 있습니다.

SAE는 바로 이 문제를 해결하기 위해 제안되었습니다. 은닉 활성값을 과완비(over-complete) 특징 사전의 희소 선형 결합으로 재구성함으로써, SAE는 중첩된 개념을 단의적(monosemantic) 단위로 분리하여 각각이 이상적으로는 하나의 인간 해석 가능한 개념에 대응하도록 합니다. 다만 SAE 특징에는 대가가 따릅니다: 추가 학습이 필요하고, 재구성 오차가 발생하며, 모델의 실제 연산에 대한 충실성(faithfulness) 자체가 검증 대상입니다.

핵심 긴장 — 다의적 뉴런 vs. 희소 특징:

  • 뉴런은 고유하지만 얽혀 있음: 모델 연산의 직접적 일부이지만, 다의성과 중첩으로 인해 하나의 뉴런이 여러 개념을 혼합하여 지식 귀인을 흐립니다.
  • SAE 특징은 분리되지만 파생적: 서로 다른 지식을 분리하는 깨끗한 단의적 단위를 약속하지만, 모델 위에 덧씌워 학습된 근사치이므로 충실성과 재구성 정확도의 문제가 제기됩니다.
  • 열린 질문: LLM에 저장된 지식을 분석하려 할 때, 어느 단위가 더 해석 가능하고 분리되며 충실한 결론을 제공하는가 — 그리고 어떤 조건에서 그러한가?

본 연구는 LLM에서 내부 표현이 지식 접근과 검색을 어떻게 매개하는지를 묻는 연구실의 폭넓은 해석 가능성 연구 흐름(예: Query Lens, ICML 2026) 안에 위치합니다. 단일한 "정답" 단위를 가정하는 대신, 표현 단위의 선택을 경험적 질문으로 다루며 동일한 지식 분석 과제 위에서 뉴런과 SAE 특징을 체계적으로 비교합니다.

같은 표현에 대한 두 가지 관점

측면뉴런 (Neurons)SAE 특징 (SAE Features)
기원모델의 고유 은닉 차원활성값 위에서 학습된 사전(dictionary)
추가 학습?불필요레이어/지점별 SAE 학습 필요
해석 가능성다의적인 경우 많음 (개념 혼합)단의적 지향 (단일 개념)
분리 정도중첩으로 인해 제한적희소 분리를 명시적으로 유도
충실성 우려연산 경로 상에 직접 존재재구성 오차가 신호를 왜곡할 수 있음
비용 / 편의성저비용, 즉시 사용 가능고비용, 사전 크기 조정 필요

제안 방법

본 연구는 뉴런과 SAE 특징을 동일한 지식 탐침 질문에 대해 교체 가능한 분석 단위로 평가하는 통제된 정면 비교를 설계합니다. 이 설계는 단위 선택의 효과를 연구 대상 지식으로부터 분리합니다.

1
공통 지식 분석 환경 정의
모델이 암기했을 법한 사실적 연상과 언어적 속성으로 이루어진 공유 지식 탐침 집합을 고정하여, 두 후보 단위가 동일한 대상에 대해 평가되도록 합니다. 연구 대상 지식을 고정하면 이후 분석에서 나타나는 차이가 과제 변화가 아닌 표현 단위에 기인함을 보장할 수 있습니다.
2
동일 활성값에서 두 후보 단위 추출
선택된 모델 지점(예: 특정 레이어의 은닉 활성값)에서, 뉴런 관점은 원시 활성값 차원을 그대로 사용하고, SAE 특징 관점은 동일한 활성값을 학습된 희소 오토인코더에 통과시켜 희소·과완비 특징 기저를 얻습니다. 따라서 두 관점은 같은 기저 표현을 서술하며, 그것을 어떻게 단위로 분해하는지에서만 차이가 납니다.
3
지식을 단위에 위치 특정
각 지식 조각에 대해, 두 공간에서 가장 책임 있는 단위를 식별합니다 — 대상과 가장 강하게 연관된 뉴런과, 대상과 가장 강하게 연관된 SAE 특징입니다. 이로써 모든 탐침에 대해 뉴런 기반 위치 특정과 SAE 기반 위치 특정을 얻고, 귀인이 얼마나 집중적이고 깨끗하며 일관적인지를 직접 비교할 수 있습니다.
4
해석 가능성 및 분리 정도 평가
식별된 각 단위가 어떤 개념에 반응하는지 검토합니다. 단위가 하나의 일관된 개념에 대응하는지(단의적), 아니면 서로 무관한 여러 개념을 혼합하는지(다의적), 그리고 서로 다른 지식 조각이 공유·과부하된 단위로 붕괴되지 않고 서로 다른 단위에 매핑되는지를 분석합니다. 이는 각 표현 단위의 실질적 해석 가능성과 분리 정도를 포착합니다.
5
개입을 통한 충실성 검증
상관을 넘어서기 위해, 식별된 단위를 교란합니다 — 특정 대상과 연관된 뉴런 대 SAE 특징을 억제하거나 증폭하고 — 해당 지식의 모델 표현에 미치는 영향을 관찰합니다. 어떤 단위에 개입했을 때 무관한 행동을 광범위하게 훼손하지 않으면서 의도한 지식만 선택적으로 변화시키는 정도만큼 그 단위는 충실하다고 판단하며, 이는 단순한 서술이 아닌 인과적 비교를 제공합니다.

통제된 비교 원칙:

두 단위 유형 모두 동일한 활성값에서 파생되고 동일한 탐침 위에서 평가되므로, 해석 가능성·분리 정도·충실성의 차이는 표현 단위의 선택 자체에 귀인될 수 있습니다 — 이로써 서로 다른 과제나 모델의 교란이 아닌 순수한 "뉴런 vs. SAE" 검증이 가능해집니다.

핵심 내용

의의

표현 단위의 선택은 해석 가능성 연구의 상당 부분을 떠받치면서도 흔히 검토되지 않는 기초적 가정입니다. 본 연구는 그 선택 자체를 연구 대상으로 삼아, 뉴런과 SAE 특징을 통해 LLM 지식을 분석할 때 무엇을 얻고 잃는지를 명확히 합니다.

폭넓은 통찰: "LLM이 이 지식을 어떻게 저장하는가?"에 답하기 전에, 우리는 그 저장을 무엇을 기준으로 서술할지를 먼저 결정해야 합니다. 뉴런과 SAE 특징은 같은 표현에 대한 서로 다른 두 렌즈이며, 각각이 우리가 도출할 수 있는 결론을 형성합니다. 표현 단위를 주어진 것이 아닌 — 경험적 선택으로 다루는 것은, 거대 언어 모델의 지식에 대한 신뢰할 수 있고 재현 가능한 해석 가능성을 위한 전제 조건입니다.

Interpretability Representation Learning