본문 바로가기
  • 책상 밖 세상을 경험할 수 있는 Playground를 제공하고, 수동적 학습에서 창조의 삶으로의 전환을 위한 새로운 라이프 스타일을 제시합니다.
Miscellaneous

[2026-2] 이루가 - KAN or MLP: A Fairer Comparison

by wnfladl 2026. 9. 13.

논문링크: https://arxiv.org/abs/2407.16674

 

KAN or MLP: A Fairer Comparison

This paper does not introduce a novel method. Instead, it offers a fairer and more comprehensive comparison of KAN and MLP models across various tasks, including machine learning, computer vision, audio processing, natural language processing, and symbolic

arxiv.org

 

Abstract 

  • 새로운 방법론 제안이 아닌 KAN과 MLP의 공정하고 포괄적인 비교 연구
  • Machine Learning, Computer Vision, Audio Processing, NLP, Symbolic Formula Representation 등 다양한 task에서 성능 비교
  • 동일한 Parameter 수와 FLOPs를 기준으로 KAN과 MLP의 계산·모델 규모 통제
  • Symbolic Formula Representation을 제외한 대부분의 task에서 MLP가 KAN보다 우수한 성능
  • Ablation Study를 통해 Symbolic Formula Representation에서 나타나는 KAN의 강점 원인 분석
    • KAN의 구조 자체보다 B-spline activation function이 주요 원인임을 확인
  • MLP에 B-spline activation을 적용한 결과
    • Symbolic Formula Representation 성능의 큰 향상
    • KAN과 동등하거나 KAN을 능가하는 성능
    • 기존에 MLP가 우세했던 다른 task에서는 유의미한 성능 향상 부재
  • Class-Incremental Continual Learning 환경에서 KAN이 MLP보다 더 심각한 forgetting 현상을 보임
    • 기존 KAN 논문에서 보고한 결과와 상반되는 관찰
  • KAN 및 향후 MLP 대안 구조 연구를 위한 실증적 시사점 제시

1. Introduction 

MLP의 특징과 한계

  • Multi-Layer Perceptron (MLP)
    • Fully-connected feedforward neural network의 대표적 구조
    • 여러 개의 layer와 neuron으로 구성
    • 각 neuron에서 입력의 weighted sum에 고정된 activation function 적용
  • Universal Approximation Theorem에 기반한 폭넓은 비선형 함수 근사 능력
  • Classification, Regression, Feature Extraction 등 다양한 딥러닝 task에서의 폭넓은 활용
  • MLP의 주요 한계
    • 학습된 representation에 대한 낮은 해석 가능성
    • 네트워크 규모 확장 측면에서의 제한적인 유연성

KAN의 등장

  • Kolmogorov-Arnold Representation Theorem을 기반으로 제안된 새로운 신경망 구조
  • MLP의 node-based activation과 다른 구조적 특징
    • MLP: node에 고정 activation function 배치
    • KAN: edge에 learnable activation function 배치
  • 기존 MLP의 scalar weight를 학습 가능한 univariate function으로 대체
  • 해당 함수의 표현을 위해 spline 기반 parameterization 활용
  • 기존 KAN 연구에서 MLP의 유망한 대안으로 제시

기존 비교 실험의 문제점

  • 기존 KAN과 MLP 비교에서 서로 다른 parameter 수 및 FLOPs 사용
  • 모델 크기와 계산 비용이 통제되지 않은 비교로 인한 공정성 문제
  • KAN의 실제 잠재력을 평가하기 위한 동일한 조건에서의 재비교 필요성

본 논문의 접근

  • KAN과 MLP의 parameter 수 또는 FLOPs 통제
  • 다양한 domain에서의 성능 비교
    • Symbolic Formula Representation
    • Machine Learning
    • Computer Vision
    • Natural Language Processing
    • Audio Processing

주요 관찰

  • Symbolic Formula Representation에서만 KAN의 우위
  • 대부분의 일반적인 task에서 MLP의 우수한 성능
  • Symbolic task에서 KAN의 강점이 B-spline activation function에서 주로 기인
  • MLP의 기존 activation을 B-spline으로 교체할 경우
    • Symbolic task 성능의 큰 향상
    • KAN과 동등하거나 우수한 성능
  • Computer Vision 등 일반 task에서는 B-spline 적용에 따른 추가적인 성능 향상 부재

Continual Learning 재검증

  • 기존 KAN 논문의 Continual Learning 실험
    • 연속적인 1차원 함수 학습을 통한 평가
    • 각 함수가 이전 함수의 number axis상 translation 형태
  • 본 논문에서 보다 표준적인 Class-Incremental Continual Learning 환경 적용
  • 동일한 training iteration 조건에서 KAN의 forgetting 문제가 MLP보다 심각함을 확인
  • 기존 KAN 논문의 continual learning 결과와 상반되는 관찰

2. Formulation of KAN and MLP 

KAN의 구조

  • KAN은 크게 두 개의 branch로 구성
    • B-spline branch
    • Shortcut branch
  • Shortcut branch
    • 비선형 activation과 linear transformation의 결합
    • 공식 구현에서는 SiLU activation → Linear transformation 구조
  • B-spline branch
    • 각 입력 요소에 대해 서로 다른 learnable spline function 적용
    • 모든 spline이 동일한 함수 형태(template)를 공유하지만 서로 다른 parameter 학습
    • Original KAN에서는 B-spline function 사용
    • B-spline의 parameter 역시 다른 network parameter와 함께 학습

KAN과 MLP의 수식적 유사성

KAN의 spline branch:

Non-linearity를 먼저 적용하는 형태의 MLP:

 

  • 두 식의 기본적인 구조는 동일
  • 주요 차이는 적용되는 non-linear function의 종류
    • KAN: learnable spline function
    • MLP: ReLU, GELU 등의 fixed activation function
  • 이러한 관점에서 KAN을 element-wise non-linearity 이후 linear transformation을 수행하는 fully-connected layer의 한 형태로 해석 가능

KAN과 MLP의 핵심 차이 ① Activation Function

  • 일반적인 MLP
    • ReLU, GELU 등 parameter가 없는 고정 activation
    • 모든 입력 요소에 동일한 activation 적용
  • KAN
    • learnable spline activation
    • 입력 요소별로 서로 다른 spline parameter 학습
  • 저자들은 이러한 activation function의 차이를 KAN과 MLP를 구분하는 가장 중요한 요인으로 판단

KAN과 MLP의 핵심 차이 ② 연산 순서

  • 일반적인 MLP 해석
    • Linear → Non-linear
  • KAN
    • Non-linear → Linear
  • 다만 MLP 역시 layer를 바라보는 방식에 따라 Non-linear → Linear 형태로 재해석 가능
  • 따라서 저자들은 연산 순서보다 activation function의 차이에 더 큰 의미 부여

연구 가설

  • KAN과 MLP의 서로 다른 activation function이 각 모델에 서로 다른 task suitability를 부여한다는 가설
  • 다양한 task에서 KAN과 MLP를 비교하여 각 모델이 적합한 영역 분석
  • 공정한 비교를 위해
    • 동일한 parameter 수
    • 또는 동일한 FLOPs
      조건에서 성능 비교

3. Number of Parameters of KAN and MLP 

Parameter 계산을 위한 기호

  • d_in: neural network layer의 input dimension
  • d_out: neural network layer의 output dimension
  • K: spline의 order
    • B-spline을 구성하는 polynomial basis의 차수와 관련된 값
  • G: spline interval의 개수
    • padding 이전 B-spline의 구간 수
    • padding 이전 control point 수에서 1을 뺀 값
  • Padding 이후 실제 사용되는 control point 수
    • G + K

KAN의 Learnable Parameters

  • KAN layer에서 학습되는 주요 parameter
    • B-spline control points
    • Shortcut weights
    • B-spline weights
    • Bias
  • KAN 한 layer의 전체 parameter 수 

MLP의 Learnable Parameters

  • 각 input-output connection에 하나의 scalar weight 사용
  • 각 output neuron에 bias 추가
  • MLP 한 layer의 전체 parameter 수

핵심 차이

  • MLP
    • 각 connection당 사실상 1개의 weight parameter
  • KAN
    • 각 connection마다 spline function을 표현하기 위한 여러 개의 parameter 필요
  • 동일한 d_in, d_out 조건에서 일반적으로 KAN의 parameter 수가 MLP보다 훨씬 많음
  • KAN과 MLP의 공정한 비교를 위해 network width 등을 조절하여 전체 parameter 수 통제 필요

4. FLOPs of KAN and MLP

FLOPs 계산 기준

  • 모델의 계산 비용 비교를 위한 FLOPs(Floating-Point Operations) 측정
  • 하나의 sample에 대한 forward operation 기준
  • Arithmetic operation
    • 각 연산을 1 FLOP으로 계산
  • Boolean operation
    • 0 FLOPs로 계산
  • De Boor-Cox algorithm의 order 0 연산
    • Boolean operation으로 변환 가능하므로 이론적으로 0 FLOPs
    • 공식 KAN 구현에서는 Boolean 값을 다시 Float로 변환하여 계산하므로 실제 구현과 이론적 FLOPs 사이의 차이 존재

KAN의 B-spline 연산량

  • 공식 KAN의 De Boor-Cox iterative formulation 기준 B-spline 계산 비용 

 

  • K: B-spline order
  • G: spline interval 수
  • d_in × d_out: input-output connection 수
  • K, G 증가에 따라 B-spline 계산량 증가

KAN Layer의 전체 FLOPs

  • B-spline branch + shortcut branch + 두 branch 결합 과정의 연산량
  • B-spline 계산으로 인해 connection당 다수의 추가 연산 발생

MLP Layer의 전체 FLOPs

 

  • 2 d_in d_out
    • Fully-connected layer에서의 multiplication 및 addition 연산
  • FLOPs of non-linear function d_out
    • output element에 적용되는 activation function의 계산량

동일한 입출력 차원에서의 FLOPs 차이

  • 공정한 비교를 위해 parameter뿐만 아니라 FLOPs를 별도로 통제할 필요성

5. Experiments 

Experimental Setup

  • 목적
    • 동일한 parameter 수 또는 FLOPs 조건에서 KAN과 MLP의 성능 비교
  • 평가 영역
    • Machine Learning
    • Computer Vision
    • Audio Processing
    • Natural Language Processing
    • Symbolic Formula Representation
  • 공통 학습 설정
    • Optimizer: Adam
    • Batch size: 128
    • Learning rate: 1e-3 또는 1e-4
    • Hardware: RTX 3090 GPU 1장
  • 다양한 network width, hidden layer 수, activation 및 spline 설정을 탐색한 후 성능 비교
  • 동일 parameter 또는 FLOPs 조건에서의 최적 성능 envelope를 기반으로 비교

5.1 Performance Comparison

Machine Learning

실험 설정

  • 8개의 machine learning dataset 사용
  • KAN과 MLP 모두 1~2개의 hidden layer 사용
  • Dataset에 따라 input/output dimension 조정

MLP

  • Hidden width: 32, 64, 128, 256, 512, 1024
  • Activation: GELU 또는 ReLU
  • Normalization layer 사용

KAN

  • Hidden width: 2, 4, 8, 16
  • B-spline grid 수: 3, 5, 10, 20
  • B-spline degree: 2, 3, 5
  • Spline range:
    • [-1,1]
    • [-2,2]
    • [-4,4]
  • 모든 모델을 20 epochs 학습
  • 학습 과정에서 test set의 최고 accuracy 기록

주요 결과

  • 8개 dataset 중 6개에서 MLP가 KAN보다 우수
  • 1개 dataset에서 두 모델의 성능이 거의 동일
  • 1개 dataset에서 KAN이 MLP보다 우수
  • KAN이 강점을 보인 dataset은 이후 architecture ablation study를 통해 원인 분석
  • 전반적으로 일반적인 machine learning task에서는 MLP의 우위

Computer Vision

실험 설정

  • 8개의 computer vision dataset 사용
  • KAN과 MLP 모두 1~2 hidden layers

MLP

  • Hidden width: 32 ~ 1024
  • Activation: GELU 또는 ReLU
  • Normalization layer 미사용

KAN

  • Hidden width: 2, 4, 8, 16
  • Grid: 3, 5, 10, 20
  • B-spline degree: 2, 3, 5
  • 모든 모델 20 epochs 학습
  • Test set에서 가장 높은 accuracy 기록

주요 결과

  • 동일 parameter 수 조건에서 MLP 우위
  • 동일 FLOPs 조건에서도 MLP 우위
  • 모든 CV dataset에서 KAN이 MLP의 성능에 미치지 못하는 결과
  • KAN의 spline function이 제공하는 inductive bias가 computer vision task에서는 효과적이지 않음

Audio & Natural Language Processing

Audio Classification

실험 설정

  • 2개의 audio classification dataset
  • 일반적으로 20 epochs 학습
  • UrbanSound8K만 40 epochs 학습

결과

  • 두 audio dataset 모두에서 MLP가 KAN보다 우수
  • Parameter 및 FLOPs 기준 모두에서 전반적인 MLP 우위

Text Classification

  • 2개의 text classification dataset
    • AG News
    • CoLA

AG News

  • MLP가 KAN보다 우수
  • 일반적인 text classification에서도 MLP의 강점 확인

CoLA

  • 두 모델 간 뚜렷한 우열 부재
  • 동일 parameter 수 기준
    • KAN이 상대적으로 우세
  • 동일 FLOPs 기준
    • KAN의 높은 spline 계산 비용으로 인해 장점 소멸
    • 오히려 MLP가 상대적으로 우세
  • 비교 기준에 따라 결과가 달라지는 dataset
  • KAN 또는 MLP 중 하나의 명확한 우위를 판단하기 어려운 사례

전체 결과

  • Audio 및 Text task에서는 전반적으로 MLP가 더 적합한 선택

 

Symbolic Formula Representation

실험 설정

  • Original KAN paper Section 3.2의 8개 symbolic function fitting task 사용
  • KAN과 MLP 모두 1~4 hidden layers

MLP

  • Hidden width: 5, 50, 100
  • Activation: GELU 또는 ReLU
  • Normalization 미사용

KAN

  • Hidden width: 5
  • Grid: 3, 5, 10, 20
  • B-spline degree: 2, 3, 5
  • 500 epochs 학습
  • Accuracy가 아닌 RMSE를 성능 지표로 사용
  • Test set에서 가장 낮은 RMSE 기록

동일 Parameter 수 기준

  • 8개 dataset 중 7개에서 KAN이 MLP보다 우수
  • Symbolic function fitting에서 KAN의 명확한 강점 확인

동일 FLOPs 기준

  • B-spline 계산의 높은 computational cost로 KAN의 상대적 이점 감소
  • 전반적으로 KAN과 MLP가 비슷한 수준
  • 일부 dataset에서는
    • KAN 우위: 2개
    • KAN 열위: 1개

전체 결과

  • 계산 비용까지 고려할 경우 격차는 감소하지만
  • Symbolic Formula Representation에서는 전체적으로 KAN이 MLP보다 우수

LBFGS Optimizer Experiment

실험 목적

  • 기존 결과가 Adam optimizer에만 의존하는 현상인지 확인
  • Optimizer를 LBFGS로 변경하여 재실험

변경된 설정

  • Batch size: 128 → 1024
  • 큰 batch를 사용하여 LBFGS의 Hessian approximation 정확도 향상
  • Hidden layer 수
    • MLP / KAN: 1, 2, 3, 5
  • MLP hidden width
    • 32, 64, 128
  • KAN hidden width
    • 4, 8, 16, 32
  • 나머지 실험 설정은 기존 실험과 동일

결과

  • Optimizer를 Adam에서 LBFGS로 변경해도 KAN과 MLP의 상대적인 성능 관계가 대부분 유지
  • MNIST: MLP 우위
  • CIFAR-10: MLP 우위
  • Bean: MLP 우위
  • Income: KAN 우위
  • 주요 결론이 특정 optimizer 선택에 의한 결과가 아님을 확인

5.2 Architecture Ablation

목적

  • 5.1 실험을 통해 KAN과 MLP 사이의 기능적 차이 확인
  • KAN은 symbolic formula representation에 더 적합
  • MLP는 machine learning, computer vision, NLP, audio에서 전반적 우위
  • 이러한 차이가 구조 자체 때문인지, 특정 구성요소 때문인지를 확인하기 위한 architecture ablation study 수행

Ablation 대상

  • 2개의 computer vision dataset
  • 2개의 machine learning dataset

비교 대상 architecture

  • 기본 KAN
  • Fully-connected layer 없이 KAN layer만 순수하게 쌓은 구조
  • B-spline activation을 사용하는 MLP
    • Linear transformation 이전에 spline activation 적용
    • Linear transformation 이후에 spline activation 적용
  • Spline activation을
    • 모든 input-output pair에 적용한 경우
    • 입력 또는 출력에만 적용한 경우

주요 관찰 ① Computer Vision

  • Computer vision dataset에서 MLP에 spline activation을 적용해도 성능 향상은 거의 없음
  • 오히려 spline activation은 계산 비용(FLOPs) 만 증가시킴
  • 따라서 CV task에서는
    • ReLU / GELU 같은 일반 activation이 더 효율적
    • spline activation은 실질적 이점이 거의 없음

해석

  • KAN의 spline 기반 inductive bias가 computer vision에는 잘 맞지 않음
  • CV에서는 B-spline이 유용한 표현력을 제공하지 못함

주요 관찰 ② Machine Learning

  • 반대로 machine learning dataset에서는 MLP의 activation을 spline으로 바꾸면 성능이 크게 향상
  • 원래는 MLP가 KAN보다 성능이 낮았던 dataset에서도
    • MLP + spline activation은 KAN과 비슷한 성능 달성
  • 즉, KAN이 일부 machine learning dataset에서 보인 성능 향상은
    • KAN 구조 자체보다 spline activation 덕분임을 시사

해석

  • KAN의 이점은 layer ordering이나 특수한 연결 구조보다
    • B-spline activation의 함수 표현 능력에서 비롯된 것

추가 관찰: 연산 순서와 적용 범위의 영향

  • Linear → Spline이든
  • Spline → Linear이든
    최종 성능 차이는 크지 않음
  • 또한 spline activation을
    • 모든 input-output pair에 적용하든
    • 입력 또는 출력에만 적용하든
      성능 차이는 크지 않음

의미

  • KAN과 MLP의 핵심 차이는 연산 순서(order) 가 아님
  • 핵심은 어떤 activation function을 쓰는가에 있음

Symbolic Formula Representation에서의 추가 검증

  • MLP에 B-spline activation을 적용하여 symbolic formula representation 실험 추가 수행
  • 이 실험에서는 B-spline이 추가하는 parameter/FLOPs를 고려하여
    • MLP hidden width를 10 또는 20으로 설정
  • 그 외 실험 조건은 기존 symbolic task 실험과 동일

결과

  • 기존 실험에서는 KAN이 기본 MLP보다 전반적으로 우수
  • 그러나 MLP + B-spline activation을 사용하면
    • 모든 symbolic formula representation task에서
    • KAN과 성능이 비슷하거나 더 우수

결론

  • KAN과 MLP의 기능적 차이는 activation function 차이에서 주로 기인
  • 특히 B-spline activation
    • symbolic formula representation
    • 일부 machine learning dataset
      에서 성능 향상을 유도
  • 반면 computer vision 등에서는 spline activation의 효과가 미미
  • 따라서 KAN과 MLP의 차이는 구조 전체보다 activation 선택의 문제로 해석 가능
  • 서로 다른 activation function이 서로 다른 task suitability를 형성

5.3 Continual Learning 

실험 목적

  • Original KAN 논문에서 1차원 함수의 Continual Learning에서 KAN의 우수한 성능 보고
  • 해당 장점이 보다 일반적인 Continual Learning 환경에서도 유지되는지 추가 검증
  • Computer Vision 기반의 Class-Incremental Continual Learning 설정 적용

Experimental Setup

  • MNIST dataset을 digit class에 따라 3개의 task로 분할
    • Task 1: 0, 1, 2
    • Task 2: 3, 4, 5
    • Task 3: 6, 7, 8, 9
  • KAN과 MLP를 Task 1 → Task 2 → Task 3 순서로 순차 학습
  • Vision experiment와 동일한 training hyperparameter 사용
  • 각 task당 1 epoch 학습
  • Continual Learning 성능 평가
    • 각 task별 최종 Accuracy
    • Average Accuracy
    • Backward Score

주요 결과

  • Computer Vision 기반 Continual Learning에서 KAN의 우위 확인 실패
  • KAN이 MLP보다 더 빠른 forgetting 현상을 보임
  • 세 task 학습 완료 후 KAN
    • Task 1 Accuracy → 0
    • Task 2 Accuracy → 0
    • 마지막 Task 3에서만 상대적으로 높은 성능 유지
  • MLP
    • 새로운 task 학습 이후에도 Task 1과 Task 2의 성능을 일정 수준 유지
  • 표준적인 Class-Incremental setting에서는 KAN의 catastrophic forgetting이 MLP보다 심각

결론

  • Original KAN 논문에서 보고된 Continual Learning의 장점이 보다 표준적인 Class-Incremental setting에서는 재현되지 않음
  • KAN의 Continual Learning 성능이 task 및 evaluation setting에 크게 의존할 가능성
  • KAN이 일반적으로 MLP보다 forgetting에 강하다는 주장에 대한 재검토 필요성

6. Related Works 

KAN의 등장과 발전

  • Original KAN 논문을 통해 Kolmogorov-Arnold Network 제안
  • 유사한 아이디어에 대한 선행 연구 존재
  • 기존 MLP의 fixed nonlinear activation을 B-spline 기반 learnable function으로 대체
  • B-spline의 locality와 조절 가능한 grid 수를 활용한 유연한 함수 표현
  • 이를 기반으로
    • Dynamic network architecture
    • Continual learning
      가능성 제시

Activation Function의 확장

  • Original KAN의 B-spline을 다른 basis function으로 대체하는 연구 진행
    • Chebyshev Polynomial
    • Wavelet Function
    • Jacobi Polynomial
    • Orthogonal Polynomial
  • 서로 다른 basis function을 통해 KAN에 상이한 표현 특성 및 inductive bias 부여

기존 Network Architecture와의 결합

  • KAN을 기존 딥러닝 architecture에 결합하는 다양한 연구 진행
  • Computer Vision
    • Convolutional Network + KAN
    • Vision Transformer + KAN
    • Classification 등 vision task 성능 개선 시도
  • Medical Imaging
    • U-Net + KAN
    • Medical image segmentation 및 generation 적용
  • Graph Learning
    • GNN + KAN
    • Graph-related task 적용
  • 3D Vision
    • NeRF + KAN
    • 3D reconstruction 적용

본 논문의 차별점

  • 새로운 KAN 변형이나 성능 개선 방법을 제안하는 연구가 아님
  • 기존 연구들과 달리 KAN 자체를 개선하지 않고 MLP와의 공정한 비교에 집중
  • Parameter 수와 FLOPs를 통제한 comprehensive empirical comparison
  • 향후 KAN 및 MLP 대안 architecture 연구를 위한 실증적 기준 제시

7. Conclusion 

KAN과 MLP의 구조적 해석

  • KAN과 MLP의 forward process에 대한 수학적 비교
  • KAN을 특수한 형태의 MLP로 해석 가능
  • KAN의 핵심적인 구조적 특징
    • 일반적인 fixed activation 대신 learnable B-spline function을 activation으로 사용
  • KAN과 MLP의 기능적 차이를 만드는 주요 원인으로 activation function의 차이 제시

Fair Comparison

  • 다양한 task에서 KAN과 MLP 비교
    • Symbolic Formula Representation
    • Machine Learning
    • Computer Vision
    • Natural Language Processing
    • Audio Processing
  • 공정한 비교를 위해
    • 동일한 Parameter 수
    • 또는 동일한 FLOPs
      조건으로 실험 수행

주요 결과

  • Symbolic Formula Representation
    • KAN의 상대적인 성능 우위
  • 그 외 대부분의 task
    • MLP의 전반적인 성능 우위
  • KAN의 범용적인 MLP 대체 가능성에 대한 제한적인 결과

B-spline Ablation

  • MLP의 기존 activation을 learnable B-spline activation으로 교체
  • MLP + B-spline이 모든 평가 task에서 KAN과 동등하거나 더 높은 성능 달성
  • 특히 Symbolic Formula Representation에서 기존 MLP와 KAN의 성능 격차 해소
  • KAN의 기능적 특성이 architecture 자체보다 B-spline activation과 밀접하게 연관됨을 확인

Continual Learning

  • 표준적인 Class-Incremental Learning 환경에서 추가 평가
  • KAN이 MLP보다 더 심각한 catastrophic forgetting을 보임
  • Original KAN에서 제시된 continual learning 장점이 표준적인 classification setting에서는 재현되지 않음

최종 결론

  • KAN을 MLP의 범용적 대체 architecture로 보기에는 제한적인 실증 결과
  • KAN의 강점은 특정 architecture 자체보다는 learnable B-spline activation에서 주로 기인
  • B-spline의 효과 역시 task-dependent
    • Symbolic/function representation → 효과적
    • CV 등 일반 task → 제한적 효과
  • 새로운 MLP 대안 평가 시 architecture뿐 아니라 activation function과 computational cost를 함께 고려할 필요성