Miscellaneous
[2026-2] 이루가 - KAN or MLP: A Fairer Comparison
wnfladl
2026. 9. 13. 13:53
논문링크: https://arxiv.org/abs/2407.16674
KAN or MLP: A Fairer Comparison
This paper does not introduce a novel method. Instead, it offers a fairer and more comprehensive comparison of KAN and MLP models across various tasks, including machine learning, computer vision, audio processing, natural language processing, and symbolic
arxiv.org
Abstract
- 새로운 방법론 제안이 아닌 KAN과 MLP의 공정하고 포괄적인 비교 연구
- Machine Learning, Computer Vision, Audio Processing, NLP, Symbolic Formula Representation 등 다양한 task에서 성능 비교
- 동일한 Parameter 수와 FLOPs를 기준으로 KAN과 MLP의 계산·모델 규모 통제
- Symbolic Formula Representation을 제외한 대부분의 task에서 MLP가 KAN보다 우수한 성능
- Ablation Study를 통해 Symbolic Formula Representation에서 나타나는 KAN의 강점 원인 분석
- KAN의 구조 자체보다 B-spline activation function이 주요 원인임을 확인
- MLP에 B-spline activation을 적용한 결과
- Symbolic Formula Representation 성능의 큰 향상
- KAN과 동등하거나 KAN을 능가하는 성능
- 기존에 MLP가 우세했던 다른 task에서는 유의미한 성능 향상 부재
- Class-Incremental Continual Learning 환경에서 KAN이 MLP보다 더 심각한 forgetting 현상을 보임
- 기존 KAN 논문에서 보고한 결과와 상반되는 관찰
- KAN 및 향후 MLP 대안 구조 연구를 위한 실증적 시사점 제시
1. Introduction
MLP의 특징과 한계
- Multi-Layer Perceptron (MLP)
- Fully-connected feedforward neural network의 대표적 구조
- 여러 개의 layer와 neuron으로 구성
- 각 neuron에서 입력의 weighted sum에 고정된 activation function 적용
- Universal Approximation Theorem에 기반한 폭넓은 비선형 함수 근사 능력
- Classification, Regression, Feature Extraction 등 다양한 딥러닝 task에서의 폭넓은 활용
- MLP의 주요 한계
- 학습된 representation에 대한 낮은 해석 가능성
- 네트워크 규모 확장 측면에서의 제한적인 유연성
KAN의 등장
- Kolmogorov-Arnold Representation Theorem을 기반으로 제안된 새로운 신경망 구조
- MLP의 node-based activation과 다른 구조적 특징
- MLP: node에 고정 activation function 배치
- KAN: edge에 learnable activation function 배치
- 기존 MLP의 scalar weight를 학습 가능한 univariate function으로 대체
- 해당 함수의 표현을 위해 spline 기반 parameterization 활용
- 기존 KAN 연구에서 MLP의 유망한 대안으로 제시
기존 비교 실험의 문제점
- 기존 KAN과 MLP 비교에서 서로 다른 parameter 수 및 FLOPs 사용
- 모델 크기와 계산 비용이 통제되지 않은 비교로 인한 공정성 문제
- KAN의 실제 잠재력을 평가하기 위한 동일한 조건에서의 재비교 필요성
본 논문의 접근
- KAN과 MLP의 parameter 수 또는 FLOPs 통제
- 다양한 domain에서의 성능 비교
- Symbolic Formula Representation
- Machine Learning
- Computer Vision
- Natural Language Processing
- Audio Processing
주요 관찰
- Symbolic Formula Representation에서만 KAN의 우위
- 대부분의 일반적인 task에서 MLP의 우수한 성능
- Symbolic task에서 KAN의 강점이 B-spline activation function에서 주로 기인
- MLP의 기존 activation을 B-spline으로 교체할 경우
- Symbolic task 성능의 큰 향상
- KAN과 동등하거나 우수한 성능
- Computer Vision 등 일반 task에서는 B-spline 적용에 따른 추가적인 성능 향상 부재
Continual Learning 재검증
- 기존 KAN 논문의 Continual Learning 실험
- 연속적인 1차원 함수 학습을 통한 평가
- 각 함수가 이전 함수의 number axis상 translation 형태
- 본 논문에서 보다 표준적인 Class-Incremental Continual Learning 환경 적용
- 동일한 training iteration 조건에서 KAN의 forgetting 문제가 MLP보다 심각함을 확인
- 기존 KAN 논문의 continual learning 결과와 상반되는 관찰
2. Formulation of KAN and MLP
KAN의 구조
- KAN은 크게 두 개의 branch로 구성
- B-spline branch
- Shortcut branch
- Shortcut branch
- 비선형 activation과 linear transformation의 결합
- 공식 구현에서는 SiLU activation → Linear transformation 구조
- B-spline branch
- 각 입력 요소에 대해 서로 다른 learnable spline function 적용
- 모든 spline이 동일한 함수 형태(template)를 공유하지만 서로 다른 parameter 학습
- Original KAN에서는 B-spline function 사용
- B-spline의 parameter 역시 다른 network parameter와 함께 학습
KAN과 MLP의 수식적 유사성
KAN의 spline branch:

Non-linearity를 먼저 적용하는 형태의 MLP:

- 두 식의 기본적인 구조는 동일
- 주요 차이는 적용되는 non-linear function의 종류
- KAN: learnable spline function
- MLP: ReLU, GELU 등의 fixed activation function
- 이러한 관점에서 KAN을 element-wise non-linearity 이후 linear transformation을 수행하는 fully-connected layer의 한 형태로 해석 가능
KAN과 MLP의 핵심 차이 ① Activation Function
- 일반적인 MLP
- ReLU, GELU 등 parameter가 없는 고정 activation
- 모든 입력 요소에 동일한 activation 적용
- KAN
- learnable spline activation
- 입력 요소별로 서로 다른 spline parameter 학습
- 저자들은 이러한 activation function의 차이를 KAN과 MLP를 구분하는 가장 중요한 요인으로 판단
KAN과 MLP의 핵심 차이 ② 연산 순서
- 일반적인 MLP 해석
- Linear → Non-linear
- KAN
- Non-linear → Linear
- 다만 MLP 역시 layer를 바라보는 방식에 따라 Non-linear → Linear 형태로 재해석 가능
- 따라서 저자들은 연산 순서보다 activation function의 차이에 더 큰 의미 부여
연구 가설
- KAN과 MLP의 서로 다른 activation function이 각 모델에 서로 다른 task suitability를 부여한다는 가설
- 다양한 task에서 KAN과 MLP를 비교하여 각 모델이 적합한 영역 분석
- 공정한 비교를 위해
- 동일한 parameter 수
- 또는 동일한 FLOPs
조건에서 성능 비교
3. Number of Parameters of KAN and MLP
Parameter 계산을 위한 기호
- d_in: neural network layer의 input dimension
- d_out: neural network layer의 output dimension
- K: spline의 order
- B-spline을 구성하는 polynomial basis의 차수와 관련된 값
- G: spline interval의 개수
- padding 이전 B-spline의 구간 수
- padding 이전 control point 수에서 1을 뺀 값
- Padding 이후 실제 사용되는 control point 수
- G + K
KAN의 Learnable Parameters
- KAN layer에서 학습되는 주요 parameter
- B-spline control points
- Shortcut weights
- B-spline weights
- Bias
- KAN 한 layer의 전체 parameter 수

MLP의 Learnable Parameters
- 각 input-output connection에 하나의 scalar weight 사용
- 각 output neuron에 bias 추가
- MLP 한 layer의 전체 parameter 수

핵심 차이
- MLP
- 각 connection당 사실상 1개의 weight parameter
- KAN
- 각 connection마다 spline function을 표현하기 위한 여러 개의 parameter 필요
- 동일한 d_in, d_out 조건에서 일반적으로 KAN의 parameter 수가 MLP보다 훨씬 많음
- KAN과 MLP의 공정한 비교를 위해 network width 등을 조절하여 전체 parameter 수 통제 필요
4. FLOPs of KAN and MLP
FLOPs 계산 기준
- 모델의 계산 비용 비교를 위한 FLOPs(Floating-Point Operations) 측정
- 하나의 sample에 대한 forward operation 기준
- Arithmetic operation
- 각 연산을 1 FLOP으로 계산
- Boolean operation
- 0 FLOPs로 계산
- De Boor-Cox algorithm의 order 0 연산
- Boolean operation으로 변환 가능하므로 이론적으로 0 FLOPs
- 공식 KAN 구현에서는 Boolean 값을 다시 Float로 변환하여 계산하므로 실제 구현과 이론적 FLOPs 사이의 차이 존재
KAN의 B-spline 연산량
- 공식 KAN의 De Boor-Cox iterative formulation 기준 B-spline 계산 비용

- K: B-spline order
- G: spline interval 수
- d_in × d_out: input-output connection 수
- K, G 증가에 따라 B-spline 계산량 증가
KAN Layer의 전체 FLOPs
- B-spline branch + shortcut branch + 두 branch 결합 과정의 연산량

- B-spline 계산으로 인해 connection당 다수의 추가 연산 발생
MLP Layer의 전체 FLOPs

- 2 d_in d_out
- Fully-connected layer에서의 multiplication 및 addition 연산
- FLOPs of non-linear function d_out
- output element에 적용되는 activation function의 계산량
동일한 입출력 차원에서의 FLOPs 차이

- 공정한 비교를 위해 parameter뿐만 아니라 FLOPs를 별도로 통제할 필요성
5. Experiments
Experimental Setup
- 목적
- 동일한 parameter 수 또는 FLOPs 조건에서 KAN과 MLP의 성능 비교
- 평가 영역
- Machine Learning
- Computer Vision
- Audio Processing
- Natural Language Processing
- Symbolic Formula Representation
- 공통 학습 설정
- Optimizer: Adam
- Batch size: 128
- Learning rate: 1e-3 또는 1e-4
- Hardware: RTX 3090 GPU 1장
- 다양한 network width, hidden layer 수, activation 및 spline 설정을 탐색한 후 성능 비교
- 동일 parameter 또는 FLOPs 조건에서의 최적 성능 envelope를 기반으로 비교
5.1 Performance Comparison
Machine Learning
실험 설정
- 총 8개의 machine learning dataset 사용
- KAN과 MLP 모두 1~2개의 hidden layer 사용
- Dataset에 따라 input/output dimension 조정
MLP
- Hidden width: 32, 64, 128, 256, 512, 1024
- Activation: GELU 또는 ReLU
- Normalization layer 사용
KAN
- Hidden width: 2, 4, 8, 16
- B-spline grid 수: 3, 5, 10, 20
- B-spline degree: 2, 3, 5
- Spline range:
- [-1,1]
- [-2,2]
- [-4,4]
- 모든 모델을 20 epochs 학습
- 학습 과정에서 test set의 최고 accuracy 기록
주요 결과
- 8개 dataset 중 6개에서 MLP가 KAN보다 우수
- 1개 dataset에서 두 모델의 성능이 거의 동일
- 1개 dataset에서 KAN이 MLP보다 우수
- KAN이 강점을 보인 dataset은 이후 architecture ablation study를 통해 원인 분석
- 전반적으로 일반적인 machine learning task에서는 MLP의 우위


Computer Vision
실험 설정
- 총 8개의 computer vision dataset 사용
- KAN과 MLP 모두 1~2 hidden layers
MLP
- Hidden width: 32 ~ 1024
- Activation: GELU 또는 ReLU
- Normalization layer 미사용
KAN
- Hidden width: 2, 4, 8, 16
- Grid: 3, 5, 10, 20
- B-spline degree: 2, 3, 5
- 모든 모델 20 epochs 학습
- Test set에서 가장 높은 accuracy 기록
주요 결과
- 동일 parameter 수 조건에서 MLP 우위
- 동일 FLOPs 조건에서도 MLP 우위
- 모든 CV dataset에서 KAN이 MLP의 성능에 미치지 못하는 결과
- KAN의 spline function이 제공하는 inductive bias가 computer vision task에서는 효과적이지 않음


Audio & Natural Language Processing
Audio Classification
실험 설정
- 2개의 audio classification dataset
- 일반적으로 20 epochs 학습
- UrbanSound8K만 40 epochs 학습
결과
- 두 audio dataset 모두에서 MLP가 KAN보다 우수
- Parameter 및 FLOPs 기준 모두에서 전반적인 MLP 우위
Text Classification
- 총 2개의 text classification dataset
- AG News
- CoLA
AG News
- MLP가 KAN보다 우수
- 일반적인 text classification에서도 MLP의 강점 확인
CoLA
- 두 모델 간 뚜렷한 우열 부재
- 동일 parameter 수 기준
- KAN이 상대적으로 우세
- 동일 FLOPs 기준
- KAN의 높은 spline 계산 비용으로 인해 장점 소멸
- 오히려 MLP가 상대적으로 우세
- 비교 기준에 따라 결과가 달라지는 dataset
- KAN 또는 MLP 중 하나의 명확한 우위를 판단하기 어려운 사례
전체 결과
- Audio 및 Text task에서는 전반적으로 MLP가 더 적합한 선택


Symbolic Formula Representation
실험 설정
- Original KAN paper Section 3.2의 8개 symbolic function fitting task 사용
- KAN과 MLP 모두 1~4 hidden layers
MLP
- Hidden width: 5, 50, 100
- Activation: GELU 또는 ReLU
- Normalization 미사용
KAN
- Hidden width: 5
- Grid: 3, 5, 10, 20
- B-spline degree: 2, 3, 5
- 500 epochs 학습
- Accuracy가 아닌 RMSE를 성능 지표로 사용
- Test set에서 가장 낮은 RMSE 기록
동일 Parameter 수 기준
- 8개 dataset 중 7개에서 KAN이 MLP보다 우수
- Symbolic function fitting에서 KAN의 명확한 강점 확인
동일 FLOPs 기준
- B-spline 계산의 높은 computational cost로 KAN의 상대적 이점 감소
- 전반적으로 KAN과 MLP가 비슷한 수준
- 일부 dataset에서는
- KAN 우위: 2개
- KAN 열위: 1개
전체 결과
- 계산 비용까지 고려할 경우 격차는 감소하지만
- Symbolic Formula Representation에서는 전체적으로 KAN이 MLP보다 우수


LBFGS Optimizer Experiment
실험 목적
- 기존 결과가 Adam optimizer에만 의존하는 현상인지 확인
- Optimizer를 LBFGS로 변경하여 재실험
변경된 설정
- Batch size: 128 → 1024
- 큰 batch를 사용하여 LBFGS의 Hessian approximation 정확도 향상
- Hidden layer 수
- MLP / KAN: 1, 2, 3, 5
- MLP hidden width
- 32, 64, 128
- KAN hidden width
- 4, 8, 16, 32
- 나머지 실험 설정은 기존 실험과 동일
결과
- Optimizer를 Adam에서 LBFGS로 변경해도 KAN과 MLP의 상대적인 성능 관계가 대부분 유지
- MNIST: MLP 우위
- CIFAR-10: MLP 우위
- Bean: MLP 우위
- Income: KAN 우위
- 주요 결론이 특정 optimizer 선택에 의한 결과가 아님을 확인

5.2 Architecture Ablation
목적
- 5.1 실험을 통해 KAN과 MLP 사이의 기능적 차이 확인
- KAN은 symbolic formula representation에 더 적합
- MLP는 machine learning, computer vision, NLP, audio에서 전반적 우위
- 이러한 차이가 구조 자체 때문인지, 특정 구성요소 때문인지를 확인하기 위한 architecture ablation study 수행
Ablation 대상
- 2개의 computer vision dataset
- 2개의 machine learning dataset
비교 대상 architecture
- 기본 KAN
- Fully-connected layer 없이 KAN layer만 순수하게 쌓은 구조
- B-spline activation을 사용하는 MLP
- Linear transformation 이전에 spline activation 적용
- Linear transformation 이후에 spline activation 적용
- Spline activation을
- 모든 input-output pair에 적용한 경우
- 입력 또는 출력에만 적용한 경우
주요 관찰 ① Computer Vision
- Computer vision dataset에서 MLP에 spline activation을 적용해도 성능 향상은 거의 없음
- 오히려 spline activation은 계산 비용(FLOPs) 만 증가시킴
- 따라서 CV task에서는
- ReLU / GELU 같은 일반 activation이 더 효율적
- spline activation은 실질적 이점이 거의 없음
해석
- KAN의 spline 기반 inductive bias가 computer vision에는 잘 맞지 않음
- CV에서는 B-spline이 유용한 표현력을 제공하지 못함
주요 관찰 ② Machine Learning
- 반대로 machine learning dataset에서는 MLP의 activation을 spline으로 바꾸면 성능이 크게 향상
- 원래는 MLP가 KAN보다 성능이 낮았던 dataset에서도
- MLP + spline activation은 KAN과 비슷한 성능 달성
- 즉, KAN이 일부 machine learning dataset에서 보인 성능 향상은
- KAN 구조 자체보다 spline activation 덕분임을 시사
해석
- KAN의 이점은 layer ordering이나 특수한 연결 구조보다
- B-spline activation의 함수 표현 능력에서 비롯된 것
추가 관찰: 연산 순서와 적용 범위의 영향
- Linear → Spline이든
- Spline → Linear이든
최종 성능 차이는 크지 않음 - 또한 spline activation을
- 모든 input-output pair에 적용하든
- 입력 또는 출력에만 적용하든
성능 차이는 크지 않음
의미
- KAN과 MLP의 핵심 차이는 연산 순서(order) 가 아님
- 핵심은 어떤 activation function을 쓰는가에 있음
Symbolic Formula Representation에서의 추가 검증
- MLP에 B-spline activation을 적용하여 symbolic formula representation 실험 추가 수행
- 이 실험에서는 B-spline이 추가하는 parameter/FLOPs를 고려하여
- MLP hidden width를 10 또는 20으로 설정
- 그 외 실험 조건은 기존 symbolic task 실험과 동일
결과
- 기존 실험에서는 KAN이 기본 MLP보다 전반적으로 우수
- 그러나 MLP + B-spline activation을 사용하면
- 모든 symbolic formula representation task에서
- KAN과 성능이 비슷하거나 더 우수


결론
- KAN과 MLP의 기능적 차이는 activation function 차이에서 주로 기인
- 특히 B-spline activation이
- symbolic formula representation
- 일부 machine learning dataset
에서 성능 향상을 유도
- 반면 computer vision 등에서는 spline activation의 효과가 미미
- 따라서 KAN과 MLP의 차이는 구조 전체보다 activation 선택의 문제로 해석 가능
- 서로 다른 activation function이 서로 다른 task suitability를 형성
5.3 Continual Learning
실험 목적
- Original KAN 논문에서 1차원 함수의 Continual Learning에서 KAN의 우수한 성능 보고
- 해당 장점이 보다 일반적인 Continual Learning 환경에서도 유지되는지 추가 검증
- Computer Vision 기반의 Class-Incremental Continual Learning 설정 적용
Experimental Setup
- MNIST dataset을 digit class에 따라 3개의 task로 분할
- Task 1: 0, 1, 2
- Task 2: 3, 4, 5
- Task 3: 6, 7, 8, 9
- KAN과 MLP를 Task 1 → Task 2 → Task 3 순서로 순차 학습
- Vision experiment와 동일한 training hyperparameter 사용
- 각 task당 1 epoch 학습
- Continual Learning 성능 평가
- 각 task별 최종 Accuracy
- Average Accuracy
- Backward Score
주요 결과
- Computer Vision 기반 Continual Learning에서 KAN의 우위 확인 실패
- KAN이 MLP보다 더 빠른 forgetting 현상을 보임
- 세 task 학습 완료 후 KAN
- Task 1 Accuracy → 0
- Task 2 Accuracy → 0
- 마지막 Task 3에서만 상대적으로 높은 성능 유지
- MLP
- 새로운 task 학습 이후에도 Task 1과 Task 2의 성능을 일정 수준 유지
- 표준적인 Class-Incremental setting에서는 KAN의 catastrophic forgetting이 MLP보다 심각

결론
- Original KAN 논문에서 보고된 Continual Learning의 장점이 보다 표준적인 Class-Incremental setting에서는 재현되지 않음
- KAN의 Continual Learning 성능이 task 및 evaluation setting에 크게 의존할 가능성
- KAN이 일반적으로 MLP보다 forgetting에 강하다는 주장에 대한 재검토 필요성
6. Related Works
KAN의 등장과 발전
- Original KAN 논문을 통해 Kolmogorov-Arnold Network 제안
- 유사한 아이디어에 대한 선행 연구 존재
- 기존 MLP의 fixed nonlinear activation을 B-spline 기반 learnable function으로 대체
- B-spline의 locality와 조절 가능한 grid 수를 활용한 유연한 함수 표현
- 이를 기반으로
- Dynamic network architecture
- Continual learning
가능성 제시
Activation Function의 확장
- Original KAN의 B-spline을 다른 basis function으로 대체하는 연구 진행
- Chebyshev Polynomial
- Wavelet Function
- Jacobi Polynomial
- Orthogonal Polynomial
- 서로 다른 basis function을 통해 KAN에 상이한 표현 특성 및 inductive bias 부여
기존 Network Architecture와의 결합
- KAN을 기존 딥러닝 architecture에 결합하는 다양한 연구 진행
- Computer Vision
- Convolutional Network + KAN
- Vision Transformer + KAN
- Classification 등 vision task 성능 개선 시도
- Medical Imaging
- U-Net + KAN
- Medical image segmentation 및 generation 적용
- Graph Learning
- GNN + KAN
- Graph-related task 적용
- 3D Vision
- NeRF + KAN
- 3D reconstruction 적용
본 논문의 차별점
- 새로운 KAN 변형이나 성능 개선 방법을 제안하는 연구가 아님
- 기존 연구들과 달리 KAN 자체를 개선하지 않고 MLP와의 공정한 비교에 집중
- Parameter 수와 FLOPs를 통제한 comprehensive empirical comparison
- 향후 KAN 및 MLP 대안 architecture 연구를 위한 실증적 기준 제시
7. Conclusion
KAN과 MLP의 구조적 해석
- KAN과 MLP의 forward process에 대한 수학적 비교
- KAN을 특수한 형태의 MLP로 해석 가능
- KAN의 핵심적인 구조적 특징
- 일반적인 fixed activation 대신 learnable B-spline function을 activation으로 사용
- KAN과 MLP의 기능적 차이를 만드는 주요 원인으로 activation function의 차이 제시
Fair Comparison
- 다양한 task에서 KAN과 MLP 비교
- Symbolic Formula Representation
- Machine Learning
- Computer Vision
- Natural Language Processing
- Audio Processing
- 공정한 비교를 위해
- 동일한 Parameter 수
- 또는 동일한 FLOPs
조건으로 실험 수행
주요 결과
- Symbolic Formula Representation
- KAN의 상대적인 성능 우위
- 그 외 대부분의 task
- MLP의 전반적인 성능 우위
- KAN의 범용적인 MLP 대체 가능성에 대한 제한적인 결과
B-spline Ablation
- MLP의 기존 activation을 learnable B-spline activation으로 교체
- MLP + B-spline이 모든 평가 task에서 KAN과 동등하거나 더 높은 성능 달성
- 특히 Symbolic Formula Representation에서 기존 MLP와 KAN의 성능 격차 해소
- KAN의 기능적 특성이 architecture 자체보다 B-spline activation과 밀접하게 연관됨을 확인
Continual Learning
- 표준적인 Class-Incremental Learning 환경에서 추가 평가
- KAN이 MLP보다 더 심각한 catastrophic forgetting을 보임
- Original KAN에서 제시된 continual learning 장점이 표준적인 classification setting에서는 재현되지 않음
최종 결론
- KAN을 MLP의 범용적 대체 architecture로 보기에는 제한적인 실증 결과
- KAN의 강점은 특정 architecture 자체보다는 learnable B-spline activation에서 주로 기인
- B-spline의 효과 역시 task-dependent
- Symbolic/function representation → 효과적
- CV 등 일반 task → 제한적 효과
- 새로운 MLP 대안 평가 시 architecture뿐 아니라 activation function과 computational cost를 함께 고려할 필요성