[2026-2] 정유림 - Neural Thickets:Diverse Task Experts Are Dense Around Pretrained Weights
논문제목: Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights
링크: https://arxiv.org/pdf/2603.12228
2026년 3월 arXiv preprint
ICML 2026 Spotlight
핵심 요약
충분히 크고 잘 pretrain된 모델에서는 현재 pretrained weight 근처에 서로 다른 downstream task를 잘하는 task-specific weight solutions이 많이 존재한다. 저자들은 이런 weight-space 구조를 Neural Thicket이라고 부른다.
그래서 굳이 gradient descent나 RL로 수백 step에 걸쳐 좋은 weight를 찾아갈 필요 없이,
pretrained weight에 작은 random noise를 여러 번 추가 → 각 perturbation의 성능 평가 → 좋은 perturbation 선택 → ensemble
하는 RandOpt를 제안한다.
핵심 개념: weight space
- 현재 pretrained model = weight space의 한 점
- 약간 다른 weight = 그 주변의 다른 점
- fine-tuning = 현재 점에서 좋은 방향으로 이동하는 과정
이라고 생각하면 된다.
일반적인 사고방식은 다음과 같다.
pretrained model → gradient descent → task-specific model
그런데 이 논문은 질문을 바꾼다.
gradient descent로 멀리 찾아갈 필요 없이, pretrained model 바로 주변에 이미 좋은 모델들이 많이 있는 것 아닐까?
Figure 1 — 논문의 전체 아이디어

Fig. 1(a): Small model vs Large model
검은 별 ★: pretrained model
주변의 파란색, 노란색, 분홍색 blob은 각각
- chemistry를 잘하는 weight
- math를 잘하는 weight
- programming을 잘하는 weight
같은 task-specific solution 영역
→ a. (왼쪽) 작은 모델이라면? 이런 영역이 아주 작다.
즉 random하게 weight를 조금 바꾸면 대부분 성능이 나빠진다.
저자들은 이것을 Needle in a haystack(건초더미에서 바늘 찾기)이라고 표현한다.
그래서 작은 모델에서는 좋은 solution을 찾으려면
- gradient descent
- PPO
- GRPO
- evolutionary optimization
같은 방향성 있는 optimization이 필요
→ a. (오른쪽) 큰 몬델이라면?
검은 pretrained weight 주변에
- GSM8K expert
- MBPP expert
- USPTO expert
- ROCStories expert
영역들이 아주 크고 많이 존재한다.
즉 weight를 조금 random하게 움직였는데도 꽤 자주 좋은 모델이 나온다.
저자들은 이것을 Neural Thicket(주변 전체가 여러 task-specific solution으로 우거져 있다) 이라고 부른다.

Fig. 1(b): 모델이 커질수록 좋은 solution이 많아진다
x축: model size
y축: Solution Density.
쉽게 말하면:
pretrained weight 주변을 random perturbation했을 때, 성능 좋은 모델이 나오는 확률
결론: 모델이 커질수록 모든 task에서 solution density가 증가한다는 scaling law.

Fig. 1(c): 단순 random search에서도 좋은 결과
여기서 RandOpt(기존 weight에 random noise를 섞음)가 나온다.
중요한 것은 gradient가 없다는 점이다.
즉, gradient update를 반복하지 않고 한 번에 random perturbation들을 평가하는 방식이, GRPO나 ES처럼 수백 번 sequential update하는 방식과 비교해서 얼마나 잘 되나?
x축: Training Steps
GRPO와 ES는 training을 진행하면서 weight가 계속 바뀌기 때문에 step 수가 증가
RandOpt는 이에 반해, sequential update를 하지 않고 fully parallel
y축: Accuracy
K는 inference 때 사용하는 모델/샘플 수 (가장 좋은거 1개 / top50개 선택)
- GRPO/ES의 K=50은 논문에서 50-pass Test-Time Majority Vote(TT-MV)
- RandOpt: N개의 perturbation 생성→validation 성능 기준 top-K models 선택→K개 모델 ensemble
RandOpt K=1 → K=50에서 점수차이가 큼
- random perturbation들이 모두 똑같은 model이 아니기 때문.
→ Neural Thicket의 diversity를 ensemble로 이용하는 것
같은 ensemble 수일때, RandOpt가 강함을 확인함.
오른쪽: Training Flops → training compute를 보여줌. efficient 함을 확인
즉, Neural Thicket에서는 pretrained weight 주변에 서로 다른 task에 특화된 좋은 weight solutions이 dense하고 diverse하게 존재함을 확인(figure 2-5)하고,
Figure 2–5에서는 Neural Thickets라는 현상 자체를 분석한다.
- 큰 모델일수록 pretrained weight 주변에 좋은 solution이 많아지는지
- 그 solution들이 서로 다른 task specialist인지
- model scale에 따라 density와 diversity가 증가하는지
- 이러한 현상이 다양한 pretraining을 통해 어떻게 나타날 수 있는지
를 확인
RandOpt라는 방식을 통해, 결과를 내면 더 효율적이고 성능을 높게 낼수있음을 확인
Figure 6–9에서는 이 현상을 실제로 활용한 RandOpt를 검증한다.
- Fig. 6: 기존 post-training 방법과의 성능 비교
- Fig. 7: random search population(N) 과 ensemble size(K)에 따른 scaling
- Fig. 8: RandOpt가 작동하려면 충분한 pretraining과 model scale이 필요함
- Fig. 9: 성능 향상이 reasoning improvement와 format correction 모두에서 발생함

Figure 2 — 실제 weight landscape를 직접 확인
Qwen2.5 모델을 0.5B부터 32B까지 비교하고, 각 pretrained model 주변에 1,000개의 random Gaussian weight perturbation을 생성한다.
색은 base model 대비 accuracy 변화를 나타낸다.
- 파란색: 성능 감소
- 흰색: 비슷함
- 빨간색: 성능 향상
작은 모델: 0.5B
주변이 대부분 파란색이다.
즉 pretrained weight를 조금만 건드려도 성능이 나빠진다.
→ Needle in a Haystack
큰 모델: 7B, 32B
GSM8K, Countdown, OlympiadBench 등에서 노란색/빨간색 영역이 많아진다.
즉 pretrained weight 주변에 base model보다 좋은 weight가 많이 존재한다.
→ Neural Thicket
저자들은 작은 모델에서는 pretrained weight가 task-specific accuracy landscape의 peak에 가까운 반면, 큰 모델에서는 주변에 더 좋은 peak들이 많이 존재하는 구조가 나타난다고 해석
RGB column
세 task의 결과를 각각 RGB channel에 넣는다.
- R = GSM8K
- G = OlympiadBench
- B = Countdown
큰 모델에서 색이 다양하게 나타난다는 것은,
어떤 perturbation은 GSM8K를 잘하고, 다른 perturbation은 Countdown을 잘하는 식으로 서로 다른 task specialist가 존재한다
는 의미
Figure 3 — Neural Thicket의 Scaling Law
Figure 3에서는 Neural Thicket을 두 가지 숫자로 정량화한다.

Fig. 3(a): Solution Density
Solution density는 random perturbation이 base model보다 일정 수준 이상 좋은 성능을 낼 확률
모델 크기가
0.5B → 1.5B → 3B → 32B
로 증가할수록 solution density가 증가한다.
즉 큰 모델일수록 pretrained weight 주변에 좋은 weight가 더 많다.
Fig. 3(b): Solution Diversity
저자들은 Spectral Discordance라는 metric으로 perturbation들이 얼마나 서로 다른 task specialization을 가지는지 측정한다.
직관적으로:
- 모든 perturbation이 모든 task를 비슷하게 잘하면 → diversity 낮음
- perturbation마다 잘하는 task가 다르면 → diversity 높음
모델이 커질수록 Spectral Discordance도 증가한다.
즉 큰 모델의 weight 주변에는 solution이 단순히 많아지는 것뿐 아니라, 서로 다른 종류의 specialist도 많아진다.

Figure 4 — 실제로 서로 다른 specialist들이 존재하는가?
왼쪽: Performance spectra
random perturbation 하나를 하나의 선으로 그린다.
x축은 여러 benchmark:
- Countdown
- GSM8K
- MATH-500
- OlympiadBench
- MBPP
- ROCStories
- USPTO
이고, y축은 각 task에서의 percentile rank
선들이 평평하지 않고 크게 위아래로 움직인다.
즉 어떤 perturbation은 math에서는 매우 좋지만 programming에서는 나쁠 수 있고, 다른 perturbation은 chemistry에 강할 수 있다.
따라서 perturbation들이 generalist라기보다 specialist라는 것을 보여준다.
오른쪽: PCA
각 perturbation의 여러 task 성능을 하나의 performance vector로 만든 뒤 PCA한다.
그 결과 서로 다른 cluster가 생긴다.
이는 pretrained weight 주변에
서로 다른 capability profile을 가진 여러 종류의 expert solution
이 존재한다는 것을 시각적으로 보여준다.

Figure 5 — Neural Thicket은 왜 생기는가?
LLM보다 훨씬 단순한 1D signal prediction model을 이용해 Neural Thicket이 어떻게 생기는지 실험한다.
- 파란 실선: 모델이 실제로 관찰한 앞부분, 즉 context
- 파란 점선: 그 뒤에 이어져야 하는 정답, ground truth
- 검은선: pretrained base model의 예측
- 회색선: base model weight에 random perturbation을 준 여러 모델의 예측
- 빨간선: random perturbation 중 ground truth를 잘 맞춘 top-K 모델
“현재 pretrained model의 weight를 조금씩 random하게 흔들었을 때, 주변에 정답을 잘 예측하는 모델이 얼마나 존재할까?”
Fig. 5(a): No pretraining
pretraining 없이 random initialization에서 시작한다.
weight를 random perturbation해도 target function을 잘 맞히는 solution을 거의 찾지 못한다.
→ Needle in a Haystack regime
Fig. 5(b): Mixed-signal pretraining
linear, sinusoidal, harmonic, sigmoid, sawtooth 등 여러 종류의 signal로 pretraining한다.
이 경우 pretrained weight 주변의 perturbation들이 다양한 형태의 prediction(회색선)을 만들고, 일부(빨간선)는 target function을 잘 맞춘다.
→ Thicket regime
Fig. 5(c): Linear-only pretraining
test task와 거의 같은 linear signal만 pretraining한다.
base model 자체가 이미 target을 거의 완벽하게 예측한다.
따라서 주변을 탐색해도 더 좋아질 여지가 적다.
→ Plateau regime
핵심 메시지:
Neural Thicket은 단순히 parameter 수가 많아서 생기는 것이 아니라, 다양한 pretraining을 통해 여러 가능한 기능이 weight 주변에 형성되는 것과 관련이 있다.
| (a) Needle | 없음 | 거의 쓸모없는 비슷한 예측 | 좋은 solution이 매우 희귀 |
| (b) Thicket | 다양한 signal | 다양한 behavior가 나옴 | 주변에 여러 좋은 task-specific solution 존재 |
| (c) Plateau | test와 같은 linear signal | 대부분 비슷하게 이미 잘함 | base model이 이미 거의 최적 |

Figure 6 — RandOpt가 실제 post-training에서도 잘 작동하는가?
여기서부터는 Neural Thicket 현상을 실제 algorithm으로 활용한 RandOpt를 평가한다.
세 그래프 모두 y축은 RandOpt accuracy다.
왼쪽: RandOpt vs. Base
대부분의 점이 diagonal 위에 있다.
→ RandOpt가 base model보다 대부분의 setting에서 더 높은 성능을 보인다.
가운데: RandOpt vs. PPO/GRPO
많은 setting에서 RandOpt가 PPO/GRPO와 비슷하거나 더 높은 성능을 보인다.
오른쪽: RandOpt vs. ES + TT-MV
Evolution Strategy와 비교해도 경쟁력 있는 성능을 보인다.
둘 다 inference-time ensembling의 이득을 받게 했을 때도, 단순한 one-shot random weight search인 RandOpt가 iterative evolutionary optimization인 ES와 경쟁력이 있는가?를 확인.
결론: random search처럼 단순한 방법도 large pretrained model에서는 매우 잘 작동한다는 사실 자체가 Neural Thicket의 존재를 뒷받침한다.
| figure | 질문 | 핵심 결과 |
| Fig. 7 | RandOpt를 더 많이 search하면? | N이 증가하면서 성능 향상 후 saturation |
| Fig. 8 | 아무 모델에서도 RandOpt가 되는가? | 아님. 충분한 pretraining과 model scale이 필요 |
| Fig. 9 | 성능 증가는 무엇 때문인가? | 실제 reasoning 개선 + format correction이 모두 기여 |
즉 large-scale pretraining 이후 weight landscape 자체가 어떻게 변하는지를 발견하고, RandOpt를 통해 그 현상이 실제로 활용 가능하다는 것을 보여준 논문