본문 바로가기
  • 책상 밖 세상을 경험할 수 있는 Playground를 제공하고, 수동적 학습에서 창조의 삶으로의 전환을 위한 새로운 라이프 스타일을 제시합니다.
NLP

[2026-2] 정유림 - Neural Thickets:Diverse Task Experts Are Dense Around Pretrained Weights

by urmu 2026. 9. 13.

 

논문제목: Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights

링크: https://arxiv.org/pdf/2603.12228

2026년 3월 arXiv preprint

ICML 2026 Spotlight

핵심 요약

충분히 크고 잘 pretrain된 모델에서는 현재 pretrained weight 근처에 서로 다른 downstream task를 잘하는 task-specific weight solutions이 많이 존재한다. 저자들은 이런 weight-space 구조를 Neural Thicket이라고 부른다.

그래서 굳이 gradient descent나 RL로 수백 step에 걸쳐 좋은 weight를 찾아갈 필요 없이,

pretrained weight에 작은 random noise를 여러 번 추가 → 각 perturbation의 성능 평가 → 좋은 perturbation 선택 → ensemble

하는 RandOpt를 제안한다.

핵심 개념: weight space

  • 현재 pretrained model = weight space의 한 점
  • 약간 다른 weight = 그 주변의 다른 점
  • fine-tuning = 현재 점에서 좋은 방향으로 이동하는 과정

이라고 생각하면 된다.

일반적인 사고방식은 다음과 같다.

pretrained model → gradient descent → task-specific model

그런데 이 논문은 질문을 바꾼다.

gradient descent로 멀리 찾아갈 필요 없이, pretrained model 바로 주변에 이미 좋은 모델들이 많이 있는 것 아닐까?

Figure 1 — 논문의 전체 아이디어

Fig. 1(a): Small model vs Large model

검은 별 ★: pretrained model

주변의 파란색, 노란색, 분홍색 blob은 각각

  • chemistry를 잘하는 weight
  • math를 잘하는 weight
  • programming을 잘하는 weight

같은 task-specific solution 영역

→ a. (왼쪽) 작은 모델이라면? 이런 영역이 아주 작다.

즉 random하게 weight를 조금 바꾸면 대부분 성능이 나빠진다.

저자들은 이것을 Needle in a haystack(건초더미에서 바늘 찾기)이라고 표현한다.

그래서 작은 모델에서는 좋은 solution을 찾으려면

  • gradient descent
  • PPO
  • GRPO
  • evolutionary optimization

같은 방향성 있는 optimization이 필요

→ a. (오른쪽) 큰 몬델이라면?

검은 pretrained weight 주변에

  • GSM8K expert
  • MBPP expert
  • USPTO expert
  • ROCStories expert

영역들이 아주 크고 많이 존재한다.

즉 weight를 조금 random하게 움직였는데도 꽤 자주 좋은 모델이 나온다.

저자들은 이것을 Neural Thicket(주변 전체가 여러 task-specific solution으로 우거져 있다) 이라고 부른다.

 

Fig. 1(b): 모델이 커질수록 좋은 solution이 많아진다

x축: model size
y축: Solution Density.

쉽게 말하면:

pretrained weight 주변을 random perturbation했을 때, 성능 좋은 모델이 나오는 확률

결론: 모델이 커질수록 모든 task에서 solution density가 증가한다는 scaling law.

 

Fig. 1(c): 단순 random search에서도 좋은 결과

여기서 RandOpt(기존 weight에 random noise를 섞음)가 나온다.

중요한 것은 gradient가 없다는 점이다.

즉, gradient update를 반복하지 않고 한 번에 random perturbation들을 평가하는 방식이, GRPO나 ES처럼 수백 번 sequential update하는 방식과 비교해서 얼마나 잘 되나?

x축: Training Steps

GRPO와 ES는 training을 진행하면서 weight가 계속 바뀌기 때문에 step 수가 증가

RandOpt는 이에 반해, sequential update를 하지 않고 fully parallel

y축: Accuracy

K는 inference 때 사용하는 모델/샘플 수 (가장 좋은거 1개 / top50개 선택)

  1. GRPO/ES의 K=50은 논문에서 50-pass Test-Time Majority Vote(TT-MV)
  2. RandOpt: N개의 perturbation 생성→validation 성능 기준 top-K models 선택→K개 모델 ensemble

RandOpt K=1 → K=50에서 점수차이가 큼

  • random perturbation들이 모두 똑같은 model이 아니기 때문.
    → Neural Thicket의 diversity를 ensemble로 이용하는 것

같은 ensemble 수일때, RandOpt가 강함을 확인함.

오른쪽: Training Flops → training compute를 보여줌. efficient 함을 확인

즉, Neural Thicket에서는 pretrained weight 주변에 서로 다른 task에 특화된 좋은 weight solutions이 dense하고 diverse하게 존재함을 확인(figure 2-5)하고,

Figure 2–5에서는 Neural Thickets라는 현상 자체를 분석한다.

  • 큰 모델일수록 pretrained weight 주변에 좋은 solution이 많아지는지
  • 그 solution들이 서로 다른 task specialist인지
  • model scale에 따라 density와 diversity가 증가하는지
  • 이러한 현상이 다양한 pretraining을 통해 어떻게 나타날 수 있는지

를 확인

RandOpt라는 방식을 통해, 결과를 내면 더 효율적이고 성능을 높게 낼수있음을 확인

Figure 6–9에서는 이 현상을 실제로 활용한 RandOpt를 검증한다.

  • Fig. 6: 기존 post-training 방법과의 성능 비교
  • Fig. 7: random search population(N) 과 ensemble size(K)에 따른 scaling
  • Fig. 8: RandOpt가 작동하려면 충분한 pretraining과 model scale이 필요함
  • Fig. 9: 성능 향상이 reasoning improvement와 format correction 모두에서 발생함

 

 

Figure 2 — 실제 weight landscape를 직접 확인

Qwen2.5 모델을 0.5B부터 32B까지 비교하고, 각 pretrained model 주변에 1,000개의 random Gaussian weight perturbation을 생성한다.

색은 base model 대비 accuracy 변화를 나타낸다.

  • 파란색: 성능 감소
  • 흰색: 비슷함
  • 빨간색: 성능 향상

작은 모델: 0.5B

주변이 대부분 파란색이다.

즉 pretrained weight를 조금만 건드려도 성능이 나빠진다.

Needle in a Haystack

큰 모델: 7B, 32B

GSM8K, Countdown, OlympiadBench 등에서 노란색/빨간색 영역이 많아진다.

즉 pretrained weight 주변에 base model보다 좋은 weight가 많이 존재한다.

Neural Thicket

저자들은 작은 모델에서는 pretrained weight가 task-specific accuracy landscape의 peak에 가까운 반면, 큰 모델에서는 주변에 더 좋은 peak들이 많이 존재하는 구조가 나타난다고 해석

RGB column

세 task의 결과를 각각 RGB channel에 넣는다.

  • R = GSM8K
  • G = OlympiadBench
  • B = Countdown

큰 모델에서 색이 다양하게 나타난다는 것은,

어떤 perturbation은 GSM8K를 잘하고, 다른 perturbation은 Countdown을 잘하는 식으로 서로 다른 task specialist가 존재한다

는 의미

 

 

Figure 3 — Neural Thicket의 Scaling Law

Figure 3에서는 Neural Thicket을 두 가지 숫자로 정량화한다.

 

Fig. 3(a): Solution Density

Solution density는 random perturbation이 base model보다 일정 수준 이상 좋은 성능을 낼 확률

모델 크기가

0.5B → 1.5B → 3B → 32B

로 증가할수록 solution density가 증가한다.

즉 큰 모델일수록 pretrained weight 주변에 좋은 weight가 더 많다.

 

Fig. 3(b): Solution Diversity

저자들은 Spectral Discordance라는 metric으로 perturbation들이 얼마나 서로 다른 task specialization을 가지는지 측정한다.

직관적으로:

  • 모든 perturbation이 모든 task를 비슷하게 잘하면 → diversity 낮음
  • perturbation마다 잘하는 task가 다르면 → diversity 높음

모델이 커질수록 Spectral Discordance도 증가한다.

즉 큰 모델의 weight 주변에는 solution이 단순히 많아지는 것뿐 아니라, 서로 다른 종류의 specialist도 많아진다.

 

 

 

Figure 4 — 실제로 서로 다른 specialist들이 존재하는가?

왼쪽: Performance spectra

random perturbation 하나를 하나의 선으로 그린다.

x축은 여러 benchmark:

  • Countdown
  • GSM8K
  • MATH-500
  • OlympiadBench
  • MBPP
  • ROCStories
  • USPTO

이고, y축은 각 task에서의 percentile rank

선들이 평평하지 않고 크게 위아래로 움직인다.

즉 어떤 perturbation은 math에서는 매우 좋지만 programming에서는 나쁠 수 있고, 다른 perturbation은 chemistry에 강할 수 있다.

따라서 perturbation들이 generalist라기보다 specialist라는 것을 보여준다.

오른쪽: PCA

각 perturbation의 여러 task 성능을 하나의 performance vector로 만든 뒤 PCA한다.

그 결과 서로 다른 cluster가 생긴다.

이는 pretrained weight 주변에

서로 다른 capability profile을 가진 여러 종류의 expert solution

이 존재한다는 것을 시각적으로 보여준다.

 

 

 

Figure 5 — Neural Thicket은 왜 생기는가?

LLM보다 훨씬 단순한 1D signal prediction model을 이용해 Neural Thicket이 어떻게 생기는지 실험한다.

  • 파란 실선: 모델이 실제로 관찰한 앞부분, 즉 context
  • 파란 점선: 그 뒤에 이어져야 하는 정답, ground truth
  • 검은선: pretrained base model의 예측
  • 회색선: base model weight에 random perturbation을 준 여러 모델의 예측
  • 빨간선: random perturbation 중 ground truth를 잘 맞춘 top-K 모델

“현재 pretrained model의 weight를 조금씩 random하게 흔들었을 때, 주변에 정답을 잘 예측하는 모델이 얼마나 존재할까?”

Fig. 5(a): No pretraining

pretraining 없이 random initialization에서 시작한다.

weight를 random perturbation해도 target function을 잘 맞히는 solution을 거의 찾지 못한다.

Needle in a Haystack regime

Fig. 5(b): Mixed-signal pretraining

linear, sinusoidal, harmonic, sigmoid, sawtooth 등 여러 종류의 signal로 pretraining한다.

이 경우 pretrained weight 주변의 perturbation들이 다양한 형태의 prediction(회색선)을 만들고, 일부(빨간선)는 target function을 잘 맞춘다.

Thicket regime

Fig. 5(c): Linear-only pretraining

test task와 거의 같은 linear signal만 pretraining한다.

base model 자체가 이미 target을 거의 완벽하게 예측한다.

따라서 주변을 탐색해도 더 좋아질 여지가 적다.

Plateau regime

핵심 메시지:

Neural Thicket은 단순히 parameter 수가 많아서 생기는 것이 아니라, 다양한 pretraining을 통해 여러 가능한 기능이 weight 주변에 형성되는 것과 관련이 있다.

 

 

(a) Needle 없음 거의 쓸모없는 비슷한 예측 좋은 solution이 매우 희귀
(b) Thicket 다양한 signal 다양한 behavior가 나옴 주변에 여러 좋은 task-specific solution 존재
(c) Plateau test와 같은 linear signal 대부분 비슷하게 이미 잘함 base model이 이미 거의 최적

 

 

 

Figure 6 — RandOpt가 실제 post-training에서도 잘 작동하는가?

여기서부터는 Neural Thicket 현상을 실제 algorithm으로 활용한 RandOpt를 평가한다.

세 그래프 모두 y축은 RandOpt accuracy다.

왼쪽: RandOpt vs. Base

대부분의 점이 diagonal 위에 있다.

→ RandOpt가 base model보다 대부분의 setting에서 더 높은 성능을 보인다.

가운데: RandOpt vs. PPO/GRPO

많은 setting에서 RandOpt가 PPO/GRPO와 비슷하거나 더 높은 성능을 보인다.

오른쪽: RandOpt vs. ES + TT-MV

Evolution Strategy와 비교해도 경쟁력 있는 성능을 보인다.

둘 다 inference-time ensembling의 이득을 받게 했을 때도, 단순한 one-shot random weight search인 RandOpt가 iterative evolutionary optimization인 ES와 경쟁력이 있는가?를 확인.

결론: random search처럼 단순한 방법도 large pretrained model에서는 매우 잘 작동한다는 사실 자체가 Neural Thicket의 존재를 뒷받침한다.

 

figure 질문 핵심 결과
Fig. 7 RandOpt를 더 많이 search하면? N이 증가하면서 성능 향상 후 saturation
Fig. 8 아무 모델에서도 RandOpt가 되는가? 아님. 충분한 pretraining과 model scale이 필요
Fig. 9 성능 증가는 무엇 때문인가? 실제 reasoning 개선 + format correction이 모두 기여

 

 

large-scale pretraining 이후 weight landscape 자체가 어떻게 변하는지를 발견하고, RandOpt를 통해 그 현상이 실제로 활용 가능하다는 것을 보여준 논문