CV166 [2026-1] 김지원 - Learning Transferable Visual Models From Natural Language Supervision 논문: Learning Transferable Visual Models From Natural Language Supervision (OpenAI, 2021)저자: Alec Radford, Jong Wook Kim, Chris Hallacy, et al.링크: arXiv | GitHub 들어가며 기존의 이미지 분류 모델(ResNet, EfficientNet 등)은 미리 정의된 클래스 집합 안에서만 예측이 가능함. ImageNet으로 학습된 모델은 1,000개의 클래스만 알며, 새로운 클래스를 추가하려면 또 다시 대규모의 라벨링 데이터가 요구됨. 이러한 제약된 형태의 지도 학습은 모델의 일반화 능력과 활용성을 크게 제한함. CLIP(Contrastive Language-Image Pre-training) .. 2026. 4. 18. [2026-1] 정재훈 - AnEmpirical Evaluation of Geeric Convolutional and Recurrent Networksfor Sequence Modeling https://arxiv.org/abs/1803.01271 An Empirical Evaluation of Generic Convolutional and Recurrent Networks for Sequence ModelingFor most deep learning practitioners, sequence modeling is synonymous with recurrent networks. Yet recent results indicate that convolutional architectures can outperform recurrent networks on tasks such as audio synthesis and machine translation. Given aarxiv.org 1. In.. 2026. 3. 28. [2026-1] 김지은 - Image Super-Resolution via Iterative Refinement 본 글에서는 기존 GAN 기반의 Super-Resolution이 불안정하고 artifact가 생긴다는 문제를 해결하기 위해 DDPM을 활용해 저해상도 이미지를 Super-Resolution하는 새로운 방법을 제안한 SR3를 살펴본다.1. IntroductionSingle-image super-resolution은 하나의 저해상도 이미지에 대해 여러 개의 가능한 고해상도 결과가 존재하는 multi-modal inverse problem이다. 단순 regression 기반 방법은 평균을 예측하기 때문에 고배율에서 blur가 발생하며, GAN, VAE, AR 모델은 각각 학습 불안정성, 샘플 품질 한계, 높은 계산 비용 등의 문제를 가진다. SR3는 이러한 한계를 해결하기 위해 Diffusion Model 기.. 2026. 2. 28. [2026-1] 김지은 - Denoising Diffusion Implicit Models 본 글에서는 DDPM(NeurIPS 2020)의 Markovian diffusion 구조로 인해 reverse sampling이 순차적 과정을 요구하는 한계를 살펴보고, 이를 non-Markovian inference 구조로 일반화하여 빠른 deterministic sampling을 가능하게 한 DDIM(ICLR 2021)을 살펴본다. 1. IntroductionDDPM의 generative process는 forward diffusion을 거꾸로 따라가는 구조다. 따라서 1) sampling에 수천 번의 sequential iteration 필요하고 2) 병렬화가 어렵다. DDIM은 “Diffusion 모델의 샘플링을 더 빠르게 만들 수는 없을까?”의 문제 의식에서 출발한 논문이다. 이 논문은 DDPM.. 2026. 2. 7. 이전 1 2 3 4 5 ··· 42 다음