Загружаем каталог…
Загружаем каталог…
velog
Paper: Black-box Explanation of Object Detectors via Saliency Maps 🔍1. Introduction Object Detection과 Explainability 최근 Deep Neural Network(DNN) 의 발전으로 Object Detection의 성능이 크게 향상됨. 하지만 DNN은 복잡하고 직관적이지 않은 의사결정 과정을 가지는 Opaque Model 이기 때문에 모델의 판단을 이해하고, 디버깅하고, 개선하기 어렵다는 문제가 있음. 이를 해결하기 위해 다양한 Explanation Technique이 연구되어 왔고, 이러한 기법들은 하단과 같은 목적으로 활용됨. 학습된 모델의 Bias 발견 모델 Debugging 모델에 대한 사용자의 Trust 향상 그리고 대표적인 접근법 중 하나가 Attribution Technique . Attribution Technique 은 Saliency Map 을 생성해서 이미지의 각 Pixel이 모델의 Decision에 얼마나 영향을 미쳤는지를 Heatmap 형태로 표현함. 기존 Saliency Map 연구의 한계 기존 Attribution Technique은 주로 Image Classification 을 대상으로 연구되어 왔음. 반면 Object Detector를 위한 Saliency Map 연구는 상대적으로 충분히 이루어지지 않았다는 것. 또한 기존 Attribution Technique은 모델 구조와 관련 있기도 하고, Model Architecture에 대한 여러 가정을 필요 로 하는 경우가 있음. (ex. Grad-CAM 은 각 Feature Map이 특정 Concept과 연관되어 있다고 가정하고, Target Class에 대한 중요도에 따라 Feature Map에 Weight를 부여함.) 하지만 논문에서는 이런 가정이 Object Detection Model에서는 성립하지 않을 수 있고 , 이로 인해 좋은 품질의 Saliency Map을 생성하지 못할 수 있다 고 지적함. Object Detection에서는 Classification만 설명하면 부족함 Image Classification 에서는 하나의 이미지에 대해 특정 Class를 예측하기 때문에 Classification Decision 을 중심으로 설명하면 됨. 하지만 Object Detection 에서는 객체에 대해 어떤 Class인지 판단하는 Categorization 객체가 어디에 있는지 판단하는 Localization 을 동시에 수행함. 따라서 Object Detector를 설명하기 위해서는 Bounding Box의 Class뿐만 아니라 Bounding Box의 위치에 대한 설명도 필요함. 이런 이유로... 기존 Classification 용 Attribution Technique을 Object Detection 에 직접 적용하기 어려움. 그래서 등장한 D-RISE 위와 같은 문제를 해결하기 위해 논문에서 제안한 것이 바로 D-RISE(Detector Randomized Input Sampling for Explanation) . D-RISE 는 Object Detector의 Prediction에 대해 Saliency Map을 생성하고, Detection의 Localization과 Classification을 모두 설명하는 것 을 목표로 함. D-RISE 는 기존 RISE 에서 제안된 Input Masking Technique을 기반으로 함. 기존 RISE 에서는 Random Mask를 Input Image에 적용한 뒤, Mask 적용에 따라 Target Class Score가 어떻게 변하는지 관찰해서 중요한 영역을 찾았음. 그리고 D-RISE 는 이러한 아이디어를 Object Detection 으로 확장함. 또한 D-RISE 는 Gradient나 Object Detector 내부 구조에 의존하지 않는 _ Black-box Method _라는 것. 따라서 특정 Object Detector Architecture에 종속되지 않고 다양한 Detector에 적용할 수 있음. Bounding Box가 있는데 왜 Saliency Map이 필요한가? Object Detection에서는 이미 Bounding Box를 통해 객체의 위치를 출력함. 따라서 다음과 같은 의문이 생길 수 있음. Bounding Box가 이미 객체의 위치를 알려주는데 Saliency Map이 필요한가? 논문에서는 Object Detector가 Bounding Box 내부의 정보만을 이용하여 객체를 판단하지 않을 수 있음 을 보여줌. 실험 결과 DNN 기반 Object Detector는 객체를 검출할 때 Bounding Box 외부의 Contextual Region 도 활용하는 것으로 나타남. 예를 들어 Fig. 1에서는 Sink를 검출할 때 Sink의 Bounding Box 외부에 존재하는 Tap도 중요한 정보로 활용됨. 또한 Bounding Box 내부의 모든 영역이 동일하게 중요한 것도 아님. 예를 들어 cat 을 검출할 때 Cat의 몸 전체가 동일한 Importance를 가지는 것이 아니라, 얼굴 부분이 몸통보다 더 중요한 특징으로 사용될 수 있음. 따라서 Bounding Box와 Saliency Map은 서로 다른 정보를 제공함. Bounding Box : 모델이 객체가 존재한다고 예측한 위치 D-RISE Saliency Map : 해당 객체를 검출하기 위해 모델이 실제로 중요하게 활용한 이미지 영역 D-RISE의 주요 Contribution 논문에서 제시한 주요 Contribution은 다음과 같음. Object Detector를 Saliency Map으로 설명하기 위한 Black-box Attribution Technique인 D-RISE 를 제안함 이를 위해 새로운 Detection Similarity Metric 을 정의함 서로 다른 Architecture를 가지는 Object Detector에 D-RISE 를 적용해 Generalizability를 확인함 One-stage Detector : YOLOv3 Two-stage Detector : Faster R-CNN D-RISE 를 이용해서 Object Detector의 Error와 Bias의 원인을 분석함 MS-COCO Dataset으로 학습된 Detector가 학습한 공통적인 Data Pattern을 분석함 Classification Saliency에서 사용되는 Automated Metric과 User Study를 통해 D-RISE 를 평가함 추가로 Synthetic Marker를 이용해서 의도적으로 Model Bias를 생성하고, Saliency Method가 해당 Bias를 얼마나 잘 발견하는지 평가하는 방법을 제안함 ✅2. Related Work 2.1. Object Detection Object Detector는 크게 One-stage Detector 와 Two-stage Detector 로 구분할 수 있음. 대표적인 One-stage Detector 로는 YOLO, SSD, CornerNet 등이 있고, Two-stage Detector 로는 Faster R-CNN 이 있음. i) One-stage Detector One-stage Detector 는 별도의 Region Proposal Stage를 사용하지 않고, 하나의 Network에서 Object Detection을 수행함. ii) Two-stage Detector Two-stage Detector 는 먼저 Region Proposal Stage 에서 Object가 존재할 가능성이 높은 Region of Interest(ROI) 를 선택함. 이후 선택된 ROI에서 Feature를 추출하고, 두 번째 Stage에서 해당 Region의 Class를 분류함. Region Proposal → Feature Extraction → Classification 본 논문에서는 D-RISE 가 특정 Detector Architecture에 종속되지 않는다는 것을 확인하기 위해 두 종류의 Detector에 모두 적용해봄. 기존 Object Detector Explanation 연구 기존에도 DNN 기반 Object Detector를 설명하기 위한 연구들이 존재했음. ex. Feature Space Visualization Pedestrian의 Skin Color와 같은 Bias 분석 SSD Object Detector를 위한 Saliency 기반 Explanation 등 하지만 SSD Detector를 대상으로 한 기존 Saliency 연구들은 White-box Approach 를 사용함. = 모델 내부 구조나 Parameter에 접근해야 한다는 의미. 반면 ★ D-RISE 는 Object Detector의 내부 구조를 이용하지 않고 Black-box로 취급함. 따라서 특정 Object Detector의 내부 구조에 접근하지 않고도 Detection 결과를 설명하는 것을 목표로 함. 2.2. Visual Saliency Methods Visual Grounding Technique 은 이미 학습된 Computer Vision Model이 "어떤 근거를 이용"햐서 Prediction을 수행했는지를 사후적으로(Retrospectively) 설명 하는 데 사용됨. 기존 Image Classification Model을 설명하기 위한 Saliency Method는 크게 여러 방향으로 발전해왔음. i) Gradient-based Method 첫 번째는 Neural Network의 Output에서 Input Pixel 방향으로 Importance Score를 Backpropagation 하는 방법임. ex. Gradients Excitation Backprop Layer-wise Relevance Propagation 등 하지만 이러한 방법들은 Model Architecture에 맞게 수정되는 경우가 있음. 그렇기에 새로운 Network Architecture가 등장하면 새로운 Propagation Scheme을 구현해야 할 수 있음. ii) Grad-CAM Grad-CAM 은 CAM 을 일반화한 방법으로, 선택한 Intermediate Layer까지 Gradient를 계산함. 그리고 Gradient를 해당 Layer의 Activation과 결합해서 Low-resolution Saliency Map 을 생성함. Target Class에 대한 Gradient를 이용해서 Intermediate Feature Map의 Importance를 계산하는 방식. 논문에서는 Grad-CAM 의 변형들이 Adversarial Context Patch나 Single-shot Object Detector를 분석하는 데 사용되었지만, 대부분의 연구는 Classification Result를 설명하는 데 초점이 맞춰져 있었다고 설명함. iii) Perturbation-based Method 두 번째 계열은 Image의 특정 Region을 직접 변화시킨 뒤 Model Output이 어떻게 달라지는지 관찰하는 Perturbation-based Method . ex. Occlusion Noise 추가 Inpainting Blurring 등 특정 영역을 변경했을 때 Model Output이 크게 변한다면 해당 영역이 Prediction에 중요하다고 판단함. iv) Occlusion Occlusion 은 Image의 일부 Square Region을 가린 뒤 이를 Sliding Window 방식으로 이동시키면서 Class Score의 변화를 관찰함. 특정 영역을 가렸을 때 Class Score가 크게 감소하면 해당 영역이 Prediction에 중요했다고 판단하는 것. v) LIME LIME 은 Deep Model을 특정 Input 주변에서 Linear Classifier로 근사 함. 이를 위해 Superpixel을 포함하거나 제거한 Sample들을 생성하고, 이 Sample들을 이용해서 Local Linear Model을 학습함. 학습된 Linear Model의 Weight를 이용하여 각 Superpixel의 Importance를 측정함. vi) Meaningful Perturbation과 Real Time Image Saliency Meaningful Perturbation 과 Real Time Image Saliency 는 Input에 적용할 Perturbation Mask 자체를 Optimization함. 논문에서는 이 방법들이 Gradient Descent를 이용해서 Perturbation Mask를 최적화 한다고 설명함. = 미리 Random Mask를 생성하는 것이 아니라 Model의 Output을 변화시키는 Mask를 Optimization을 통해 찾는 방식. vii) RISE 마지막으로 본 논문의 직접적인 기반이 되는 RISE(Randomized Input Sampling for Explanation) 가 있음. RISE 는 Random Mask들을 생성한 뒤 각각의 Mask를 Input Image에 적용함. 이후 Masked Input을 Classifier에 입력하고, Predicted Class Probability를 각 Mask의 Weight로 사용함. 최종적으로 이러한 Mask들을 Weighted Sum해서 Saliency Map을 생성함. Random Mask 생성 → Input에 적용 → Class Probability 측정 → Mask의 Weight로 사용 → Weighted Sum 을 통해 Saliency Map을 생성함. 그리고 본 논문에서 이어서 제안하는 D-RISE 가 바로 이 Masking Technique을 Object Detector로 확장한 방법 !! 기존 Saliency Method를 Object Detection에 바로 적용하기 어려운 이유 논문에서는 앞에서 설명한 기존 Saliency Method들을 Object Detection 에 직접 적용하기 어렵다고 설명함. 우선 기존 방법들이 대부분 Classification을 설명하도록 설계되어 있기 때문. Image Classification에서는 Model Output이 하나의 Scalar 값으로 표현될 수 있음. ex. 특정 Class에 대한 $$P(c|I)$$와 같은 Class Probability 하나를 설명하면 됨. 따라서 Gradient-based Method에서는 해당 Scalar를 Backpropagation하면 되고, Perturbation-based Method에서는 Image를 변화시킨 뒤 해당 Scalar가 얼마나 변했는지를 측정하면 됨. 반면 Object Detector 는 단순히 Class Probability만 출력하지 않고 Bounding Box Location Object Class 여러 개의 Detection Proposal 을 함께 출력함. 또한 하나의 Image 안에 여러 Object가 존재할 수 있기 때문에 여러 Detection 결과가 동시에 생성됨. 따라서 Classification에서처럼 하나의 Scalar Class Probability만을 기준으로 기존 Saliency Method를 직접 적용하기 어려움. 논문에서는 이러한 차이 때문에 기존 Classification Saliency Method를 Object Detection 에 직접 적용하는 게 불가능하다고 설명함. Grad-CAM을 Object Detection에 적용했을 때의 문제 논문에서는 특히 Gradient-based Method가 Detection Vector 중 하나의 Probability Score를 설명할 때 좋은 품질의 Saliency Map을 생성하지 못한다 고 설명함. = Object Detection 에서는 Class Probability 하나만 설명해서는 Detection 전체의 판단을 충분히 설명하기 어려움. D-RISE 에서는 이러한 문제를 해결하기 위해 Input Masking을 이용해서 Object Detector 를 설명하는 Saliency Map을 생성함. D-RISE는 Black-box Method 우선 White-box Method 는 일반적으로 Model 내부 구조와 Parameter에 접근해야 함. 반면 Black-box Method 는 모델 내부 구조를 알 필요 없이 Input과 Output의 관계만을 이용해 Explanation을 생성함. D-RISE 는 Black-box Method 이기 때문에 Model Architecture에 대한 접근이 필요하지도 않고 Model 내부 Parameter에 접근할 필요가 없고 Proprietary Model이나 API처럼 내부 구조를 확인하기 어려운 Model에도 적용할 수 있음 논문에서는 Black-box Method 가 White-box Method 보다 일반적으로 Runtime은 느리지만, 높은 Generalizability와 적용의 용이성 때문에 개발 시간을 줄일 수 있다고 설명함. 또한 Input Ablation이 Model Output에 미치는 영향을 직접 측정하기 때문에, Importance Backpropagation을 위한 Rule과 같은 Heuristic에 의존하지 않는다는 특징도 있음. 반면 White-box Method 는 일반적으로 Large-scale 및 Real-time Application에 더 적합하다는 것. ✅3. Method D-RISE 의 목표 : 특정 Object Detection 결과에 대한 Saliency Map을 생성하는 것 . 높이 $H$, 너비 $W$인 Image $I$, DNN-based Object Detector $f$, Bounding Box와 Category Label로 정의된 특정 Detection 이 주어졌다고 가정함. D-RISE 는 해당 Detection을 설명하기 위해 Saliency Map $S$를 생성함. Saliency Map 역시 $H \times W$ 크기를 가지며, 각 Pixel의 값은 해당 Pixel이 Detector $f$가 Target Detection을 예측하는 데 얼마나 중요한지 를 나타냄. D-RISE 는 이 과정을 Black-box 방식 으로 수행함. : Model Weight , Gradient , Model 내부 Architecture 에 접근하지 않고, Input을 변화시켰을 때 Output Detection이 어떻게 변하는지만 관찰함. 기본 아이디어는 RISE 와 동일하게 Image에 Random Mask를 적용하는 것. : Image의 특정 영역을 Random하게 가렸을 때 Target Detection 결과가 얼마나 변하는지를 관찰하여 해당 영역의 Importance 측정. 하지만 기존 RISE 를 Object Detection에 그대로 적용할 수는 없음. : Classification Model은 보통 하나의 Class에 대한 Probability와 같은 Scalar Output을 가지지만, Object Detector는 하나의 Image에서 여러 개의 Detection Vector 를 출력하기 때문. 각 Detection에는 Class Probability , Bounding Box Location , Objectness Score 등의 정보가 포함되어 있음. 따라서 D-RISE 에서는 이러한 정보들을 이용해서 원래 Target Detection과 Masked Image에서 발생한 Detection이 얼마나 유사한지 측정해야 함. Detection Vector Faster R-CNN 이나 YOLO 와 같은 Object Detector는 많은 수의 Bounding Box Proposal 을 생성한 뒤, Confidence Thresholding 과 Non-Maximum Suppression(NMS) 을 적용하여 최종 Detection을 남김. 논문에서는 각각의 Bounding Box Proposal 을 다음과 같은 Detection Vector $d_i$ 로 표현함. $$ d_i = [L_i, O_i, P_i] $$ 이를 구체적으로 표현하면 하단과 같음. $$ d_i = [(x_1^i,y_1^i,x_2^i,y_2^i),O_i,(p_1^i,\cdots,p_C^i)] $$ 하나의 Detection Vector는 크게 세 가지 정보로 구성됨. 1. Localization Information $L_i$ $$ L_i=(x_1^i,y_1^i,x_2^i,y_2^i) $$ Bounding Box의
То, что RADAR обнаружил и классифицировал для этой возможности. Это опубликованный источником текст, а не подтверждение, что предложение ещё действует.
[논문 리뷰] D-RISE - Black-box Explanation of Object Detectors via Saliency Maps(2020). Paper: Black-box Explanation of Object Detectors via Saliency Maps 🔍1. Introduction Object Detection과 Explainability 최근 Deep Neural Network(DNN) 의 발전으로 Object Detection의 성능이 크게 향상됨. 하지만 DNN은 복잡하고 직관적이지 않은 의사결정 과정을 가지는 Opaque Model 이기 때문에 모델의 판단을 이해하고, 디버깅하고, 개선하기 어렵다는 문제가 있음. 이를 해결하기 위해 다양한 Explanation Technique이…
Открыть источник