Загружаем каталог…
Загружаем каталог…
velog
introduction 여기서 말하고자 하는것은 일반적인 컴퓨터비전은 입력이미지와 동일한 좌표계 내에서 예측을 출력한다. 근데 이 패러다임은 자율주행과는 맞지 않다. 그 이유는 자율주행에서는 여러종류의 센서데이터 값이 들어오기떄문에 좌표계 또한 다를수밖에 없다. 그래서 여기서 제안하는것은 여러 센서의 데이터를 BEV좌표계로 통합한다음에 이것을 기반으로 예측을 하겠다라는것이다. 또한 2D이미지를 분석하고 3D로 나중에 후처리 하려하면 역전파가 불가능해지기 때문에 가중치 조절을 할수없다는 문제가 있다. 그래서 본 논문에서는 2D이미지를 먼저 3D로 Lift한다음에, 각각의 특징카메라에서 나온것을 기반으로 BEV 좌표계에 Splat하겠다는것이다. 이렇게 되면 좌표계 통합 효과와 역전파 문제도 해결할수가있다. 2-1. Lift: Latent Depth Distribution 여기서는 첫단계인 Lift에 대해서 설명을 해주는데 우선 여기의 카메라 리그는 카메라의 특성으로 인해서 깊이 정보가 모호하다는 문제가 있다. 그래서 이것을 해결하기 위해서 각 픽셀마다의 거리 후보 집합을 설정하고 그 집합별로 각 픽셀마다 점을 찍는다. 이렇게 되면 거대한 Point cloud가 생성이 되고 여기서 이제 각 픽셀별로 예측한 Context vector와 거리확률분포인 Alpha를 곱하여 거리정보가 들어간 Context vector로 정의한다. 그런 다음에 one-hot vector로 정답만 나올수있도록 출력할수도 있고 거리가 모호할때는 확률분포로 spread할수도 있다. 이럼으로써 거리정보에 대한 lack을 해결한다. 그래서 BEV공간에서 Splat하기 전에 나온 부채꼴 모양의 3D Frustum을 이산적인 점들로 나누는 작업을 한다. 2-2. Splat: Pillar Pooling lift된 것을 가지고 이제 BEV 2D로 splat해야하는데 이때 쓰이는 기법이 pointpillars기법을 사용한다. point cloud의 점들을 가까운 pillar에 할당하고 기존에 빈공간을 패딩하여 sumpooling 하는 대신 빈공간을 없애고 packing하여 빈틈없이 붙힌다. 그런다음에 cumsum trick을 하게 되면 호율적이게 연산을 할 수 있게 된다. 2-3. Shoot: Motion Planning Splat에서 출력된 2D BEV 텐서를 가지고서 CNN에 넣으면 Cost map이 출력이 된다. 이는 궤적에 대한 비용맵이고 이전에 truth trajectory를 L2 손실함수를 가지고서 만들어놓는다. 이것을 cost map에 쏘면 궤적에 대한 비용들이 나오게 되고 여기에서 비교를 하여 cross entropy 손실함수로 학습을 시킨다. 그렇게 되면 궤적에 대한 비용들이 나오게 되고 여기에서 적은 비용을 선택하여 궤적을 planning하게 된다. 이 기법에서 야기하는것은 기존의 NMP에서는 hard-margin을 하기 때문에 튜닝하기가 빡빡했는데 이렇게 하면 data로부터 end-to-end planning이 가능해진다는 장점이 있다. 3-1. Architecture Details OFT와 비슷하게 여기서도 두개의 backbone을 사용하였는데, 하나는 이미지 각각에 대해서 생성된 포인트 클라우드를 특징화할때이고, 또 다른 하나는 splat된 이후에 bev에 대해서 사용하는 backbone이 있다. 또 다른것은 우리가 해상도를 위해서 하이퍼파라미터로 조정해야하는것이 있는데 첫번째는, 입력이미지의 HxW 사이즈이고 두번째는 bev 그리드의 격자 크기 이다. 그리고 나머지 하나는 깊이 집합인 D를 어느 간격으로 어디까지 설정할지이다. 3-2. Frustum Pooling Cumulative Sum Trick 포인트 클라우드의 점들을 패딩을 하여 pillar에 넣게 되면 연산도 늘어나고 불필요한 공간에 대한 연산이 추가가 되기 때문에 비효율적이다. 그래서 패딩을 하지 않고 그냥 id를 부여한다음에 일렬로 정렬을 한다. 그리고 이것을 순서대로 누적합을 하게 된다. 그리고 pillar마다 구분을 하기 위해서 경계선까지의 번호만큼을 빼주게 되면 해당 pillar에 대한 누적합만 구할수가 있다. 한번에 미분을 할수가 있어서 속도가 2배 향상되는 성능을 보였다. 결론 및 비교 분석 이 논문의 결론은 결국에는 ground truth depth data없이 bev표현으로 planning을 해냈고 또한 성능도 우수하게 나왔다는것이다. 하지만 추후에는 여러대의 카메라로 찍은 단일 영상 대신 연속적인 영상을 조건으로 하는 연구가 향후에 진행되어야 할것이다. [출처] : https://arxiv.org/abs/2008.05711
То, что RADAR обнаружил и классифицировал для этой возможности. Это опубликованный источником текст, а не подтверждение, что предложение ещё действует.
[논문리뷰] Lift, Splat, Shoot: Encoding Images From Arbitrary Camera Rigs by Implicitly Unprojecting to 3D. introduction 여기서 말하고자 하는것은 일반적인 컴퓨터비전은 입력이미지와 동일한 좌표계 내에서 예측을 출력한다. 근데 이 패러다임은 자율주행과는 맞지 않다. 그 이유는 자율주행에서는 여러종류의 센서데이터 값이 들어오기떄문에 좌표계 또한 다를수밖에 없다. 그래서 여기서 제안하는것은 여러 센서의 데이터를 BEV좌표계로 통합한다음에 이것을 기반으로 예측을 하겠다라는것이다. 또한 2D이미지를 분석하고 3D로 나중에 후처리 하려하면 역전파가 불가능해지기 때문에 가중치 조절을 할수없다는 문제가 있다. 그래서 본 논문에서는…
Открыть источник