Posted in X-Review

[arXiv 2026] ActiveMimic: Egocentric Video Pretraining with Active Perception

안녕하세요, 이번주 리뷰는 egocentric video pretraining에 대한 연구입니다. 최근 egocentric human video의 pretraining을 다루는 연구들이 늘어나고, 대부분 cam의 움직임을 노이즈로 다루는데, 오히려 해당 부분을 살리는…

Continue Reading
Posted in X-Review

[CVPR 2025] FineLIP: Extending CLIP’s Reach via Fine-Grained Alignment with Longer Text Inputs

Abstract CLIP이 다양한 분야에서 성공적으로 적용이 되고있으나, 기존의 CLIP은 77 token이라는 한정된 숫자의 text를 처리할 수 있으며, 디테일한 시각·언어 정보를 파악하는 데는 어려움이 있다고 알려져있습니다….

Continue Reading
Posted in X-Review

[Arxiv 2026] Revisiting Compositionality in Dual-Encoder Vision-Language Models: The Role of Inference

지난주에 리뷰한 [ICLR 2026] CLIP Behaves like a Bag-of-Words Model Cross-modally but not Uni-modally 와 비슷한 계열의 의문을 제기한 페이퍼를 한번 리뷰해보겠습니다 Venue: Arxiv 2026 Authors:…

Continue Reading
Posted in X-Review

[CVPR 2026] PoseGAM: Robust Unseen Object Pose Estimation via Geometry-AwareMulti-View Reasoning

안녕하세요 손우진입니다. 이번에 리뷰할 논문은 6D pose estimation 입니다. 그동안 thermal이나 VLA, 멀티센서 쪽을 주로 봤는데, 오랜만에 unseen object pose estimation 논문을 가져와봤습니다. 제목은 PoseGAM:…

Continue Reading
Posted in X-Review

[arxiv 2026′] VLA-JEPA Enhancing Vision-Language-Action Model with Latent World Model

안녕하세요. 이번 x-review는 기존 VLA 아키텍쳐에 JEPA 기반 video world model 과의 결합을 다룬 논문입니다. 요즘 제가 다루는 LeJEPA기반 LeWM이 real-world robotic task나 흔히 사용되던…

Continue Reading
Posted in Paper X-Review

[arXiv2025]Agent-Omni: Test-Time Multimodal Reasoning via Model Coordination for Understanding Anything

본 논문은 특별한 학습없이 다양한 모달리티의 foundation model을 에이전트 구조로 통합하여 모달리티 통합 시스템(omni-modal reasoning)을 세팅할 수 있음을 보인 연구입니다. 본 내용에 대해서는 이어서 더욱…

Continue Reading
Posted in X-Review

[HRI 2026] CareEval: Evaluating Large Language Models for Decision-Making in Physical Robot Caregiving

안녕하세요. 이번에는 물리적 로봇 돌봄에서 LLM을 얼마나 믿을 수 있는지 평가한 논문을 읽어보게 되었습니다. 쉽게 말하면, 로봇이 사람을 실제로 들어주고, 씻겨주고, 옷 입히는 상황에서 LLM이…

Continue Reading
Posted in X-Review

[CoRL 2025] CoRI: Communication of Robot Intent for Physical Human-Robot Interaction

안녕하세요. 최근에 부쩍 HRI(Human Robot Interaction)에 관심이 많아져 이런 저런 논문을 찾아보고 있는데요. 마침 재밌는 논문을 찾아 읽어보게 되었습니다. 사람과 로봇이 상호작용할 때 로봇이 어떤…

Continue Reading
Posted in Paper X-Review

[NeurIPS 2025] Don’t Just Chase “Highlighted Tokens” in MLLMs: Revisiting Visual Holistic Context Retention

안녕하세요 이번에 들고온 논문도 마찬가지로 VLM 에서의 Token pruning 논문입니다. Abstract 대형 Vision-Language Models (LVLMs) 는 일반적으로 텍스트 토큰보다 훨씬 많은 수의 시각 토큰을 포함하고…

Continue Reading
Posted in X-Review

[IROS 2025] FSGlove: An Inertial-Based Hand Tracking System with Shape-Aware Calibration

안녕하세요 최인하입니다. 로봇 데이터를 취득하기 위해서 사용되는 방법들 중 Teleoperation은 로봇을 시연자가 직접 조작하기 때문에 로봇 embodiment에 맞는 정교한 데이터를 취득할 수 있습니다. 하지만 시연자가…

Continue Reading