초록
이 논문에서는 장난감 모델(toy models), 즉 희소 입력 특징(sparse input features)을 가진 합성 데이터로 학습한 작은 ReLU 네트워크를 사용해, 모델이 자신이 가진 차원보다 더 많은 특징을 어떻게 그리고 언제 표현하는지 조사한다. 우리는 이 현상을 중첩(superposition)이라고 부른다. 특징이 희소할 때, 중첩은 비선형 필터링(nonlinear filtering)이 필요한 "간섭(interference)"이라는 비용을 치르는 대신, 선형 모델이 수행할 수 있는 것 이상의 압축을 가능하게 한다.