Loading the catalog…
Loading the catalog…
사람은 도로 사진을 보면 보행자, 자동차, 버스를 바로 알아본다. 하지만 컴퓨터에게 이미지는 픽셀의 숫자 덩어리일 뿐이다 컴퓨터 비전(Computer Vision) 은 컴퓨터가 이미지와 영상에서 의미 있는 정보를 이해하고 추론하도록 만드는 분야다. 이 글에서는 컴퓨터 비전의 대표 문제 세 가지와, 각각을 대표하는 모델을 하나씩 정리했다 1.같은 이미지, 다른 출력 같은 이미지라도 어떤 질문에 답하느냐에 따라 출력이 달라진다 1)Classification: 이미지 전체를 대표하는 클래스기 무엇인지 알아낸다 ->이미지 전체를 대표하는클래스 하나(예: 도심 도로) 2)Object Detection: 무엇이 어디에 있는지 알아낸다 -> 물체별 박스와 클래스 출력 3)Segmentation: 각 픽셀이 무엇인지 알아낸다 -> 픽셀별 클래스지도를 출력 2. CNN과 특징 추출 세 문제를 풀 때 공통으로 등장하는 단계가 특징 추출이다 이미지는 픽셀 숫자의 나열이라 그대로는 의미를 알기 어렵기 때문에, 먼저 물체를 구분하는 데 쓸 수 있는 특징을 뽑아내야 한다. 이 역할을 하는 대표 모델이 CNN(합성곱 신경망) 이다. 작은 필터(커널)가 이미지 위를 조금씩 이동하며 각 부분의 특징을 계산한다. 앞쪽 층에서는 선과 모서리 같은 단순한 특징을, 깊은 층으로 갈수록 눈,코,바퀴 같은 복잡한 특징을 학습한다 같은 필터를 이미지 전체에 재사용하기 때문에 파라미터가 적고, 물체가 이미지 어디에 있어도 찾아낼 수 있다 3. Classification와 ResNet 3-1)분류는 어떻게 이루어질까? 이미지 전체를 분석해 클래스별 점수를 계산하고 가장 높은 클래스를 선택한다 입력 이미지 → 특징 추출 → 클래스별 점수 → 가장 높은 클래스 선택 모델이 내놓은 점수(logits)는 그대로 비교하기 어렵기 때문에 softmax로 합이 100%인 확률로 바꾼다 예시에서는 golden retriever가 86%로 가장 높아 최종 답이 된다 3-2)ResNet과 Residual Connection 층을 깊게 쌓으면 성능이 좋아질 것 같지만 제로는 더 깊은 네트워크의 훈련 오차까지 증가하는 현상이 나타났다. 자료에서는 이를 degradation problem이라고 설명한다 그래프에서 56층 모델이 20층 모델보다 훈련 오차가 더 높다. 과적합이 아니라 학습 자체가 잘 안 되는 문제라는 점이 핵심 이다 -> 이때의 해결책이 Residual Connection (Shortcut Connection)이다 기존방식:원하는 출력 H(x)를 직접 학습한다 ResNet: 입력과 출력의 차이 F(x) = H(x) − x를 학습한다 최종 출력: H(x) = F(x) + x x는 이전 층에서 전달된 Feature Map이고, F(x)는 입력에서 필요한 변화량(Residual)이다 필요한 변화가 없다면 F(x)를 0에 가깝게 학습해 입력 x가 그대로 전달되도록 할 수 있다 문서를 처음부터 다시 쓰는 대신 고칠 부분만 수정하는 것과 비슷하다 층을 깊게 쌓아도 손해를 보지 않는 구조가 된다 4. 객체 탐지(Object Detection) 4-1) object Detection이란? 이미지 속 여러 물체의 종류와 위치를 함께 예측한다 입력 이미지 → 특징 추출 → 박스,래스,신뢰도 출력 4-2) Bounding Box와 Confidence Score 객체 탐지의 출력은 물체마다 박스, 클래스, 신뢰도 세 가지다 (1)Bounding Box: 물체를 둘러싸는 사각형이다. 보통 중심 좌표(x, y)와 너비·높이(w, h)로 위치를 나타낸다 (2)Confidence Score(신뢰도): 그 박스 안에 물체가 있다고 모델이 얼마나 확신하는지를 나타내는 값이다. 0~1 또는 %로 표시한다 (예: dog 82%, bicycle 91%) 5.YOLO YOLO(You Only Look Once)는 전체 이미지에서 물체의 위치와 클래스 확률을 * 하나의 네트워크로 동시에 예측한다 * (1) 이미지 크기 조정 : 입력 이미지를 네트워크가 처리할 수 있는 고정 크기로 변환한다 (2) 한 번의 Forward Pass : 하나의 CNN이 전체 이미지를 한 번 처리해 여러 박스와 클래스 확률을 동시에 예측한다 (3) NMS : 예측 이후 같은 물체를 가리키는 중복 박스를 정리한다 4-1)YOLOv1의 격자 방식 YOLOv1은 격자를 이용해 박스와 클래스를 예측하는 것이다 (1)이미지를 S×S 격자 칸으로 나눈다. (2)정답 박스의 중심점이 들어 있는 격자 셀 이 해당 물체를 담당한다. (3)각 셀은 여러 박스와 각 박스의 신뢰도, 그리고 객체의 클래스 확률을 예측한다. 6.이미지 분할(Segmentation)과 U-Net 6-1)이미지 분할이란? 분할의 출력은 원본 이미지와 대응되는 픽셀별 클래스 지도 다 감지는 물체를 사각형으로 찾고, 분할은 물체의 실제 모양을 픽셀 단위로 구분한다 6-2)U-Net과 Encoder–Decoder, Skip Connection U-Net은 이미지의 의미를 파악한 뒤, 해상도를 높여 픽셀별 분할 지도를 생성한다 Encoder : 해상도를 줄이며 넓은 문맥과 의미 특징을 학습한다 Decoder : 특징의 해상도를 높여 픽셀별 분할 지도를 생성한다 Skip Connection : Encoder의 고해상도 특징을 Decoder로 직접 전달해 결합한다. 줄이는 과정에서 사라진 세부 정보를 복원하는 역할이다 구조가 알파벳 U자 모양이라 U-Net이라는 이름이 붙었다
What RADAR observed and classified to build this opportunity. It is what the source published, not a verification that the offer is still active.
시냅스 3주차 세션. 사람은 도로 사진을 보면 보행자, 자동차, 버스를 바로 알아본다. 하지만 컴퓨터에게 이미지는 픽셀의 숫자 덩어리일 뿐이다 컴퓨터 비전(Computer Vision) 은 컴퓨터가 이미지와 영상에서 의미 있는 정보를 이해하고 추론하도록 만드는 분야다. 이 글에서는 컴퓨터 비전의 대표 문제 세 가지와, 각각을 대표하는 모델을 하나씩 정리했다 1.같은 이미지, 다른 출력 같은 이미지라도 어떤 질문에 답하느냐에 따라 출력이 달라진다 1)Classification: 이미지 전체를 대표하는 클래스기 무엇인지 알아낸다 ->이미지 전체를 대표하는클래스 하나(예: 도심 도로) 2)Object Detection: 무엇이 어디에 있는지 알아낸다 -> 물체별 박스와 클래스 출력 3)Segmentation:…
Open source