본문 바로가기

전체 글

(9)
Personalize-SAM Personalize Segment Anything Model with One Shot arxiv: https://arxiv.org/abs/2305.03048 github: https://github.com/ZrrSkywalker/Personalize-SAM Abstract 그림 1의 "나의 애완동물 강아지를 자동으로 segment 해줘!"와 같은 커스터마이징 SAM 모델인 PerSAM이다. 오직 한 장의 참고할 수 있는 이미지와 마스크 이미지가 주어진다면, SAM을 사용해 location prior로서 타겟에 대해 임베딩을 하고, 다른 이미지나 비디오 내에서 해당 객체를 segment 할 수 있게 주어진다. 세 가지 기술인 target-guided attention, target-semantic pro..
MaskGIT MaskGIT: Masked Generative Image Transformer PR-375 영상을 보고 정리한 내용입니다. 설명을 잘해주셔서 영상도 참고해 주시면 더욱 이해가 잘되실 겁니다!! 😆 (이미지는 모두 유튜브에서 가져왔습니다) 기존의 AR(Auto-Regressive) 모델 같은 경우 두 단계를 거쳐 모델이 예측을 진행한다. 1. 이미지 input을 받게 되면 VQ-VAE를 통해 각 위치별 discrete 한 토큰으로 낮은 차원의 벡터로 임베딩(압축, image compression with discretized codes)된다. 2. decoder를 통해 SOS 토큰을 시작으로 하나씩 다음 토큰을 예측하게 된다. VQ-VAE 개념이 나오는데, 그중 주요한 핵심인 codebook에 대해서 알..
SDXL SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis arxiv: https://arxiv.org/abs/2307.01952 github: https://github.com/Stability-AI/generative-models Abstract SDXL은 T2I latent diffusion 모델이다. Stable Diffusion과 비교하면, SDXL은 세 배 더 큰 규모의 UNet을 포함한다. 더 많은 attention 블록과 더 큰 cross attention context 가 SDXL에서 두 번째 text encoder로 사용되면서 모델 파라미터가 증가했다. 다수의 새로운 conditioning 방법과 다양한 비율에..
WGAN-GP WGAN-GP가 GAN을 학습시킬 때 안정적으로 빠르게 학습이 가능하다고 말로만 들었어서 제대로 공부하여 정리한 글이다. GAN GAN은 latent(noise) space를 정의하고 Generator, Discriminator가 학습을 진행해 실제 분포로 유사하게 만들고자 한다. 두 개의 네트워크의 균형을 맞추면서 학습하는 것은 굉장히 어려운 일이다. 예시로, 자주 발생하는 문제가 mode collapse인데, G가 비슷한 정보(mode)만 이용해 D를 속이고, 이 과정에서 전체 분포로 학습되지 않아 일부 분포만 표현할 수 있게 된다. WGAN GAN의 discriminator와 비슷한 역할을 하는 WGAN에서는 Critic이라 칭한다. 이는 진짜와 가짜를 구분하는 discriminator가 아니다. ..
아티팩트가 발생하는 이유 (feat. deconvolution) Deconvolution & Overlap 뉴럴 네트워크(모델)가 이미지를 생성할 때, 보통 작은 해상도에서 큰 해상도로 만들게 되는데, 모델은 전체적인 이미지를 생성하고, 그 안을 채운다. 일반적으로 deconvolution 방법을 통해 만들어내게 된다. 하지만 이는 고르게 겹쳐지지 않게 만들게 되는데, 어떤 부분은 다른 부분보다 더 많이 겹쳐지게 된다. 특히 커널 사이즈가 stride 사이즈로 나누어지지 않을 때 발생하게 된다. 원래 이런 부분을 모델이 학습을 하면서 가중치를 정하게 되는데, 실제로 완전히 이 문제를 피할 수 없다. 여러 레이어로 구성된 딥러닝 모델은 어느정도 아티팩트를 제거할 수 있지만, 앞서 말했듯이 완전히 제거하기는 힘들다. 이러한 아티팩트는 특이한 색상을 출력할 때 나타나는데,..
StyleDrop Abstract 사전 학습된 text-to-image 모델은 자연어 특성상 모호함을 띄고 있고, out-of-distribution과 같은 문제가 있어 이미지 스타일을 합성하기 힘들다. StyleDrop에서는 text-to-image 모델을 사용하면서 충실하게 특정 스타일을 따르는 이미지를 생성하게 만들었다. 제안 방법은 다양한 활용성을 지니고 있고 사용자의 스타일의 디테일, 예를 들어 색 구성표, 음영, 디자인 패턴 등을 잘 포착할 수 있다. 또한 매우 작은 학습 가능한 파라미터(모델 전체의 파라미터 중 1% 보다 적은)로 파인튜닝을 함으로써 새로운 스타일을 학습할 수 있고 사람 혹은 자동화된 피드백과 함께 반복적인 학습을 통해 퀄리티를 향상시켰다. 1. Introduction StyleDrop은 주어..
Prompt-Free Diffusion: Taking “Text” out of Text-to-Image Diffusion Models arxiv: https://arxiv.org/pdf/2305.16223.pdf github: https://github.com/shi-labs/prompt-free-diffusion GitHub - SHI-Labs/Prompt-Free-Diffusion: Prompt-Free Diffusion: Taking "Text" out of Text-to-Image Diffusion Models Prompt-Free Diffusion: Taking "Text" out of Text-to-Image Diffusion Models - GitHub - SHI-Labs/Prompt-Free-Diffusion: Prompt-Free Diffusion: Taking "Text" out of Text-to-Image D.....
Prior VS Posterior 생성 모델의 주 목적은 "타겟 분포를 학습한다" 라는 정의를 하게 되는데, 그 때 사용되는 분포의 개념인 사전 분포, 사후 분포에 대한 의미가 헷갈려 이번에 정리를 통해 완벽하게 이해하고자 한다. 우선 ChatGPT에게 물어봤다. 꽤나 정확하게 말해줬는데, 아직 대략적인 느낌이고, 확 와닫지는 않는다. 모수, 확률 분포, 베이지안 추론,, 이런 용어들이 아직은 낯설어 먼저 정의부터 알아보자. 모수: parameter, 모집단의 특성(예: 평균, 분산 등)을 나타내는 값으로, 좀 더 쉽게 풀어보자면 "모집단에 속해 있는 데이터들을 설명할때, 어떠한 숫자로 표현하고 싶다!" 라고 생각하면 될 것 같다. 확률 분포: 확률 변수(무작위 실험 결과, 특정 확률로 발생하는 각각의 결과를 숫자로 표현한 변수) X와 ..