전체 글(14)
-
[5분 SOTA 논문 컨트리뷰션 리뷰 #13] CVPR 2025, VIDCOMPOSITION: Can MLLMs Analyze Compositions in Compiled Videos?
본 포스팅에서는 VIDCOMPOSITION: Can MLLMs Analyze Compositions in Compiled Videos? (CVPR 2025) 논문을 간단히 리뷰하였습니다. 그림과 설명은 논문자료를 참고하였습니다. 원문 링크: https://arxiv.org/pdf/2411.10979 1. Motivation기존의 Multimodal Large Language Models(MLLMs) 평가 기준은 주로 추상적인 영상 이해에 집중되어 있어, video compositions을 이해하는 능력에 대한 구체적인 평가가 부족하다. 특히, 영상 내 시각적 요소들이 어떻게 결합되고 상호작용하는지를 미세하게 해석하는 능력에 대해서는 잘 다루어지지 않는다. 따라서 본 논문에서는 MLLMs 가 영상 구성..
2025.07.28 -
[5분 SOTA 논문 컨트리뷰션 리뷰 #12] ECCV 2020, End-to-End Object Detection with Transformers
본 포스팅에서는 End-to-End Object Detection with Transformers (ECCV 2020) 논문을 간단히 리뷰하였습니다. 그림과 설명은 논문자료를 참고하였습니다. 원문 링크: https://arxiv.org/abs/2005.12872 End-to-End Object Detection with TransformersWe present a new method that views object detection as a direct set prediction problem. Our approach streamlines the detection pipeline, effectively removing the need for many hand-designed components like ..
2024.11.19 -
[5분 SOTA 논문 컨트리뷰션 리뷰 #11] CVPR 2024, ESCAPE: Encoding Super-keypoints for Category-Agnostic Pose Estimation
본 포스팅에서는 ESCAPE: Encoding Super-keypoints for Category-Agnostic Pose Estimation (CVPR 2024) 논문을 간단히 리뷰하였습니다. 그림과 설명은 논문자료를 참고하였습니다. 원문 링크:https://openaccess.thecvf.com/content/CVPR2024/html/Nguyen_ESCAPE_Encoding_Super-keypoints_for_Category-Agnostic_Pose_Estimation_CVPR_2024_paper.html CVPR 2024 Open Access RepositoryESCAPE: Encoding Super-keypoints for Category-Agnostic Pose Estimation Khoi Du..
2024.10.28 -
[5분 SOTA 논문 컨트리뷰션 리뷰 #10] CVPR 2024, Open-World Semantic Segmentation Including Class Similarity
본 포스팅에서는 Open-World Semantic Segmentation Including Class Similarity (CVPR 2024) 논문을 간단히 리뷰하였습니다. 그림과 설명은 논문자료를 참고하였습니다. 원문 링크: https://arxiv.org/abs/2403.07532 Open-World Semantic Segmentation Including Class SimilarityInterpreting camera data is key for autonomously acting systems, such as autonomous vehicles. Vision systems that operate in real-world environments must be able to understand th..
2024.10.14 -
[5분 SOTA 논문 코드 및 성능 재현 리뷰] ICCV 2021, Learning Action Completeness from Points for Weakly-supervised Temporal Action Localization 코드 가상환경 이슈 해결
Troubleshooting the problem that does not support Nvidia GeForce RTX 3090해당 논문의 저자가 배포한 소스코드를 Nvidia GeForce RTX 3090 기반 시스템에서 구동시키고자 하였으나 다음과 같은 에러가 발생함.확인 결과, RTX 3090을 사용하는 경우 CUDA 11.0 이상만 지원됨.하지만 소스코드 구동에 있어서 저자가 권장하는 PyTorch와 Torchvision 버전은 각각 1.6.0과 0.7.0으로 CUDA 10.2까지만 호환이 되기 때문에 에러가 발생함. 따라서 CUDA 11.0까지 지원해주는 PyTorch 1.7.0과 Trochvision 0.8.0 이상으로 변경하여 설치해야 함.torch==1.6.0 → 1.7.1+cu110t..
2022.12.11 -
[5분 SOTA 논문 컨트리뷰션 리뷰 #9] ECCV 2020, SF-Net: Single-Frame Supervision for Temporal Action Localization
본 포스팅에서는 SF-Net: Single-Frame Supervision for Temporal Action Localization(ECCV 2020) 논문을 간단히 리뷰하였습니다. 그림과 설명은 논문자료를 참고하였습니다. 원문 링크: https://arxiv.org/abs/2003.06845 SF-Net: Single-Frame Supervision for Temporal Action Localization In this paper, we study an intermediate form of supervision, i.e., single-frame supervision, for temporal action localization (TAL). To obtain the single-frame superv..
2022.03.06