전체 글 64

[AAAI 2026] Learning Diffusion Policy from Primitive Skills for Robot Manipulation

[AAAI 2026] Learning Diffusion Policy from Primitive Skills for Robot Manipulation대부분의 기존 방법에서 high-level instruction은 너무 추상적 short-term action과 granularity mismatch 발생 (ex. “Pick up the lemon and put it into the pan” 와 같은 high-level task description은 “close the gripper” 같은 구체적 지시를 포함하지 않음)논문에서는 high-level instruction을 현재 observation 기반의 short-term skill로 분해, 해당 skill에 condition된 diffusion poli..

DL 2026.02.28

[CoRL 2025] Humanoid Policy ∼ Human Policy

[CoRL 2025] Humanoid Policy ∼ Human PolicyHumanoid robot의 manipulation policy를 더 robust하고 generalize되게 만들려면 다양한 데이터로 학습하는 게 도움이 됨. 하지만 robot demonstration만으로 학습하면 데이터 수집이 labor-intensive하고, tele-operation이 필요해서 확장이 어려움논문은 humanoid teleoperation을 인간 행동을 기하학적 변환이나 retargeting으로 로봇 동작에 매핑하는 과정으로 보고, robot을 human-centric representation으로 모델링하여 human action을 변환해 robot action을 얻는 관점을 제시egocentric tas..

DL 2026.02.22

Multi-Modal Manipulation via Multi-Modal Policy Consensus

Multi-Modal Manipulation via Multi-Modal Policy Consensus로봇은 다음과 같은 다양한 modality(RGB images, Point clouds, Tactile signals, Learned visual features)를 사용함. modality는 서로 보완적일 수 있고 (예: vision vs. touch), 중복될 수도 있음 (예: RGB-D vs. point cloud). 이를 효과적으로 통합하는 것은 여전히 어려운 문제기존 방법들은 각 modality의 feature를 하나의 큰 벡터로 이어붙이는 방식을 사용함. 하지만 다음과 같은 한계를 가짐modality 간 기여도를 균형 있게 조절하는 원리가 없음새로운 modality가 추가되거나 일부 modal..

DL 2026.02.16

[ICCV 2025] 6DOPE-GS: Online 6D Object Pose Estimation using Gaussian Splatting

[ICCV 2025] 6DOPE-GS: Online 6D Object Pose Estimation using Gaussian SplattingObject mesh가 필요없는 Template free 방식의 pose estimation 방식이 많이 나왔음BundleSDF는 object pose를 SDF를 학습해서 알아내지만 , SDF를 얻고 나서 pose tracking이 가능하기 때문에 실질적으로 tracking frequency가 ~0.4Hz 정도임.빠른 pose update가 중요한 상황에서는 SDF같은 neural object field를 학습하는거는 overhead가 큼논문에서는 Gaussian Splatting을 이용해서 model-free, live object tracking and reco..

DL 2026.02.07

[CVPR 2025] OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints

[CVPR 2025] OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial ConstraintsMovitation최근 LLM, VLM을 robotics에 사용하여 semantic reasoning같은 high-level task planning에 활용하는 연구가 진행됨. 다만, VLM은 2d 데이터에서만 학습이 되었기 때문에 precise, low-level manipulation tasks에 필요한 3D spatial understanding 능력이 떨어짐따라서 최근에는 VLM을 finetune해서 VLA로 전환하는 연구가 진행됨finetune을 위한 diverse, high-..

DL 2026.01.31

[CVPR 2025] Hand-held Object Reconstruction from RGB Video with Dynamic Interaction

[CVPR 2025] Hand-held Object Reconstruction from RGB Video with Dynamic Interaction기존 hand-held object reconstruction 방법들은 dynamic scene이나 texture-less / thin object 를 recon하는데 어려움을 겪음한손이나 양손으로 dynamic하게 manipulating되는 object의 정확한 recon을 위해서 generated 3D object priors, joint optimization for object poses, pose outlier voting을 도입Contribution한손/양손과 dynamic interaction 을 하는 hand-held object를 recon..

DL 2026.01.26

[ECCV 2024] Grounding Image Matching in 3D with MASt3R

MASt3R는 두개의 이미지가 주어졌을때 pairwise pixel correspondences (matches)를 만들어내는 파이프라인전통적인 Keypoint-based Matching 파이프라인은 보통 3단계로 구성됨:Sparse & repeatable keypoint detectionLocally invariant feature descriptionFeature space distance 기반 keypoint pairing→ 조명·시점 변화가 작을 때 정확, keypoint가 sparse하기 때문에 계산량이 적음, 조건이 좋으면 수 ms 내 매우 정확한 매칭 가능다만 이런 keypoint-based 방법들은 matching을 두 이미지간의 독립적인 keypoint들의 집합(bag-of-keypoin..

DL 2026.01.25

[ICCV 2025] MagicHOI: Leveraging 3D Priors for Accurate Hand-object Reconstruction from Short Monocular Video Clips

MotivationCasual monocular video(TikTok, Instagram Reels, YouTube Shorts 등 인터넷 영상)에는 손–물체 상호작용이 풍부하지만, hand-induced occlusion / object self-occlusion / 제한된 viewpoint 등 때문에 object의 전체 geometry가 관측되지 않음. 따라서, 기존 3D reconstruction 방법들이 실패하거나 심각한 artifact 발생.→ 짧은 monocular interaction video에서, partial visibility + occlusion 상황에서 hand와 object의 3D geometry를 동시에 reconstruction하는 task를 제안하고 수행Contributi..

DL 2026.01.25

[Paper Review] Grounded Language-Image Pre-training(GLIP) 논문 정리

NT 컴퓨터비전 스터디에서 이번주에는 Grounded Language-Image Pre-training(GLIP) 논문을 정리하기로 했다. **틀린내용 다수 존재합니다. Abstract - 본 논문은 grounded language-image pre-training(GLIP)을 제안 - GLIP은 object detection과 pretraining을 위한 phrase grounding을 통합, 이것은 두가지 장점이 있음 1) GLIP이 object detection과 grounding data로 부터 두 task를 모두 개선하도록 학습을 함 2) GLIP은 grounding box를 만들면서 image-text 쌍을 만들수있음 - GLIP은 2천7백만개의 이미지-텍스트 쌍 데이터로 학습 - 다양한 객체..

DL 2023.11.14

[Paper Review] Learning Open-vocabulary Semantic Segmentation Models From Natural Language Supervision 논문 정리

TNT 컴퓨터비전 스터디에서 이번주에는 Learning Open-vocabulary Semantic Segmentation ModelsFrom Natural Language Supervision 논문을 정리하기로 했다. **틀린내용 다수 존재합니다. **2023.11.06 기준 내용 추가/보강 예정.. Abstract - 논문에서는 open-vocabulary semantic segmentation(OVS)의 문제에 대해서 고찰함 *OVS: 미리 정해진 카테고리 이외에 무작위 카테고리의 객체를 segmentation하는 task 1. 논문에서는 OVSegmentor라고 불리는 transformer에 기반한 OVS 모델을 제안 -> OVSegmentor는 웹에서 크롤링한 image-text 쌍을 사전학습하..

DL 2023.11.06