[arXiv 2026] Modular Sensory Stream for Integrating Physical Feedback in Vision-Language-Action Models

안녕하세요 최인하입니다. 최근들어 진행하는 과제에 핏한 논문만 읽다가 RLWRLD에서 논문이 나와 읽어보게 되었습니다. 리뷰 시작하겠습니다.

사람은 시각 정보만 가지고 작업을 수행하지 않습니다. 키보드를 사용할 때도 키캡에 접촉해 있다는 촉각 정보, 내가 키캡을 누른다는 토크 정보 다양한 정보를 가지고 사람은 작업을 수행합니다. 다양한 감각 기관을 골고루 사용하는 사람처럼 로봇도 여러 센서 정보를 활용하여 physical feedback을 받으며 작업을 수행하면 어떨까? 이것이 이 논문의 motivation입니다. 또한 기존의 이러한 motivation을 가지고 연구된 VLA model 들은 하나의 센서 정보만을 사용하였다고 합니다. 하지만 이 논문은 기존 방식과는 다르게 다양한 센서 정보를 활용하여 action prediction에 사용합니다. 많이 간단하게 설명했는데 이 논문의 contribution은 다음과 같습니다.

  • decoupled modality stream과 joint cross-modal attention 방식을 활용해서 다양한 센서 정보 사용
  • future sensor 정보를 예측함으로써 model의 physical interaction dynamic representation 성능을 올리고 action을 생성하는데 도움을 준다고 합니다.
  • two-stage learning 방식을 사용하며 이를 통해 VLA의 prior를 유지하며 다양한 센서 정보를 통합할 수 있다고 합니다.

이를 통해서 다른 baseline VLA model 보다 성능 향상을 이루었다고 합니다.

Method

논문의 motivation과 novelty에 대한 설명을 하였으니 방법론에 대해서 설명해보겠습니다. MoSS(Modular Sensory Stream)-VLA의 전체 구조는 위와 같습니다. Pretrained VLA 구조는 기존 VLA 방식들과 비슷하게 task instruction과 image가 VLM backbone을 통하여 unified representation 이 되고, flow matching 기반 action expert를 통해 action을 생성하는 구조입니다.

Multimodal sensory streams

Multimodal sensory streams은 action expert 구조와 동일한 flow matching 기반의 transformer 구조를 가져가며, 파라미터는 랜덤으로 init 해준다고 합니다. 위의 식 (3)을 보면 action prediction은 VLM backbone으로 부터 나온 unified representation 과 physical sensor 정보 M을 condition으로 사용하며, physical prediction은 자기 자신을 제외한 센서 정보와 unified representation action, state 정보를 condition으로 활용합니다. 또한 Joint cross modal self attention 을 적용하여 cross model reasoning이 가능하게 한다고 합니다. 이 때 각각의 모달리티의 Q,K,V를 concat 하고 dot prodcut attention을 적용한다고 합니다.

Two-Stage Training Strategy

논문에서는 two stage training 방식을 활용하여 기존 VLA의 prior를 유지하며 physical sensory 모달리티를 잘 표현할 수 있도록 한다고 합니다.

  • Stage 1 (Physical alignment) : stage 1에서는 기존의 pre-trained VLA 부분은 freeze한 상태로 physical stream 부분만 scratch 학습을 진행한다고 합니다. 이를 통해 추가된 stream이 기존 VLA의 action representation과 잘 통합되도록 합니다.
  • Stage 2 (Joint fine-tuning): 그 후 action expert를 unfreeze하여 fine-tuning을 진행합니다. 이를 통해 최종적으로 생성되는 action이 physical feedback을 고려한 action이 되도록 합니다.

Training Objective

Action은 flow matching loss를 사용합니다.

physical sensory loss도 flow matching loss를 사용하며 action chunk horizon과 맞춰주기 위해서 physical prediction horizon 형태로 되어있습니다.

최종적인 loss 식은 위와 같으며 stage 1에서는 L(phy)만 optimization하며 stage 2에서는 둘 다 optimization 한다고 합니다.

Experiments

논문에서 확인하고자 하는 바는 다음과 같습니다.

  • 기존의 VLA 구조의 제안한 MoSS 구조를 적용했을 때 contact rich manipulation task에서 기존 VLA 보다 우수한 성능을 보이는가?
  • MoSS 구조는 multiple sensor 구조를 얼마나 잘 효과적으로 표현하는가?
  • 각각의 component가 성능에 어떠한 영향을 미치는가?

Task는 contact rich manipulation task로 위와 같이 정해졌습니다. Hardware로는 Panda robot arm이 사용되었으며, tactile sensor로는 AnySkin sensor가 사용되었다고 합니다. Baseline VLA로는 GR00T N1.5와 pi0가 사용되었다고 하네요.

정량적인 task 성공률에 대한 평가는 위와 같습니다. 결과적으로 기존의 VLA 구조는 위와 같은 tactile, torque 정보가 필요한 contact rich manipulation task는 어려워 한다는 것을 알 수 있습니다. 또한 하나의 modality를 추가한 기존 방식들과 비교했을 때 MoSS 방식의 성능이 좋은 것을 확인할 수 있었고, 두개의 모달리티를 결합했을 때 높은 성능이 나오는 것을 확인할 수 있습니다. 따라서 저자들이 제안한 방식이 효과적이라는 것을 입증했습니다.

Analysis and Ablation Study

저자들은 VLA model이 언제 physical feedback에 attention을 두는가에 대해서 실험을 진행했습니다. 위의 그림에서 보는 것처럼 grasping 순간에 tactile과 torque에 대한 attention score가 올라가는 것을 확인하였고, 이를 통해 contact에 대한 제어가 필요할 때 MoSS 구조가 실제로 이러한 physical 적인 signal을 활용한다는 것을 입증했습니다.

또한 논문에서는 decoupling stream 즉 모듈화 된 sensory stream 구조가 physical 적인 정보를 DiT에서 action과 함께 예측하는 기존 VLA 구조에 비해서 얼마나 좋은 성능을 내는지와, two-stage training, physical future prediction이 model에게 얼마나 도움이 되는지를 확인하였습니다.

이러한 모달리티의 도입이 연산량을 늘려 inference시 latenct를 증가시키지는 않을까?라는 질문에 실험을 추가적으로 진행하였는데요. 위와 같이 두 모달리티를 사용했을 때 2.4ms 만큼 미세하게 증가하였다고 합니다. 따라서 논문에서는 latency를 많이 증가시키지 않으면서도 성능은 크게 올린다는 것을 강조하네요.

제가 생각하는 이 논문의 핵심은 서로 이질적인 모달리티의 정보를 모듈화를 이용하여 분리하고 이에 맞는 학습 전략을 활용하여 physical에 대한 정보를 model이 받아들일 수 있게 하며, 필요할 때 이러한 sensor 정보를 활용할 수 있도록 joint self attention을 활용한 것이라고 생각합니다. 뭔가 딱 하나를 콕 집어서 말할 수 없이 너무 제시한 방법이 유기적으로 잘 연결되어 있는 느낌을 받았습니다. 읽어주셔서 감사합니다.

Author: 최 인하

3 thoughts on “[arXiv 2026] Modular Sensory Stream for Integrating Physical Feedback in Vision-Language-Action Models

  1. 안녕하세요 인하님, 좋은 리뷰감사합니다.
    뭔가 제가 최근에 읽은 논문이랑 아키텍쳐가 유사하고 흐름도 비슷해서 재밋게 읽었습니다.
    제가 이해를 잘 못해서 질문드립니다. action prediction이 physical sensor 정보 M을 condition으로 사용한다고 하셨는데 여기서 M이 현재 센서값에 대한 건지 과거 history에 대한 건지, 아니면 future prediction까지를 포함한건지 궁금합니다.
    그리고 future sensor prediction은 inference 때 실제로 action 생성에 쓰이는 건지 아니면 단순히 represent 학습용 auxiliary task로만 사용하는건지 궁금합니다. 감사합니다.

  2. 안녕하세요 인하님, 좋은 리뷰 감사합니다.
    Two-stage learning의 Stage 1에서 기존 VLA의 prior를 유지하면서 새로운 센서 stream만 scratch로 학습해 align한다고 하셨ㅅ습니다. 여기서 prior(visual+text)와 tactile/torque 정보라는 완전히 이질적인 물리적 시퀀스를 어떻게 align시키는지 궁금합니다. 단순히 CLIP처럼 임베딩 공간에서 align시키는걸까요?

  3. 안녕하세요 인하님 좋은 리뷰 감사합니다.

    궁금한것이 한가지 생겨 질문드립니다. table 3에 제시한 latency 실험인데 이 같은 경우에 latency를 고려한 모델ㅂ부분에서의 설계는 보이지못했던거 같은데 갑자기 latency ? 라는 생각이 듭니다 혹시 저자들이 따로 latency에 대한 모델 설계나 저자들의 언급이 있나요 그렇지 않다면 인하님 생각에 어떤 부분이 latency를 고려했는지 설명주실 수 있나요 ?

    감사합니다

Leave a Reply