본문 바로가기

전체 글20

Multi-Modal 학습이란 무엇일까? 오늘은 Multi-Modal 학습에 대해 알아보고, 어떤 분야가 있는지도 알아보려 한다. 먼저, Multi-Modal 학습이란 단순한 CNN, RNN처럼 이미지, 텍스트등 하나의 데이터만 사용해서 학습하는 것이 아니라, 여러 종류의 데이터를 이용해 학습하는 것으로, 예를 들어 이미지를 보고 텍스트를 생성하는 등의 task가 multi-modal task인 것이다. Multi-modal 학습은 잘 활용하면 강력한 도구가 될 수 있지만, 그만큼 학습에 어려운 점들이 있다. 이러한 난관은 크게 3가지로 나눠진다. 1. 데이터의 표현 방법이 다르다 audio는 1d data, image는 2d data등으로 표현 되는 등, 데이터들의 표현 방법이 달라 함께 사용하기에 어려운 점이 있다. 2. Data imbal.. 2023. 4. 11.
3d computer vision에 대해 흔히 컴퓨터 비전이라 하면 2d 이미지를 학습하고 판별하는 등의 생각을 하지만 컴퓨터 비전은 3d 분야에도 적용될 수 있다. 다만 현재 3d 컴퓨터 비전은 그저 사진을 찍으면 되는 2d 이미지와 달리 dataset을 전부 인간이 직접만들어야 하는 등, 어려움이 있어 2d 학습만큼 발전되지는 않았다고 볼 수 있다. 오늘은 이러한 3d computer vision 분야에 대해 아주 간단히 "이런것도 있다"라는 식으로 얘기해보려 한다. 먼저 3d 학습을 위해서는 3d 데이터를 만들어야 한다. 인간은 한눈으로는 2d이미지를, 두 눈으로는 일종의 삼각측량으로 3d 이미지를보고 있다. 그러나 컴퓨터는 인간의 방식을 이해할 수 없기 때문에 컴퓨터가 이해할 수 있는 데이터를 만들어야 하고, 이런 3d 데이터를 만드는 .. 2023. 4. 8.
CNN의 학습과정을 시각화하는 방법 전통적으로 CNN은 black box과정으로, CNN이 어떻게 학습되고 있는지, 왜 잘되는지, 무엇을 기준으로 CNN이 판단을 내리는지 알 수가 없어 어떻게 CNN을 발전시킬 수 있는지 알 수 없었다. 그러나 언제나 방법은 있는법. 이번에는 여러가지 CNN 시각화(CNN visualization) 방법에 대해 알아보려고 한다. 간단한 예시를 통해 시각화가 어떤 것인지부터 알아보자. 아래는 deconvolution을 통한 시각화의 일종이다 아래의 low level feature를 보면 점, 선과 같은 간단한 물체를 찾는 layer가 있음을 알 수 있고, high level feature에서는 좀 더 의미있는 물체를 찾는 layer가 있음을 볼 수 있다. 이를 이용한 것이 아래의 그림이다. Filter vi.. 2023. 4. 7.
문답지 - 2 1. 정규화(normalization)를 왜 해야할까요? 정규화의 방법은 무엇이 있나요? 정규화(Normalization)란, 머신러닝 모델에서 입력 데이터의 값을 일정한 범위로 조정하여 학습을 개선하는 기술이다. 다음은 정규화를 하는 이유와 5가지의 방법이다. 1. 학습 안정성 향상 입력 데이터의 범위가 크게 차이나면 학습이 불안정해질 수 있다. 이러한 경우 정규화를 통해 입력 데이터의 범위를 조정하여 학습 안정성을 향상시킬 수 있다. 2. 과적합 방지 과적합 문제는 학습 데이터에 대해 과도하게 학습된 모델이 새로운 데이터에 대해 일반화 능력이 떨어지는 문제이다. 이를 방지하기 위해서 정규화를 사용할 수 있다. 3. 모델 성능 개선 정규화를 통해 입력 데이터의 범위를 조정하면, 모델의 성능을 개선할 수.. 2023. 4. 7.