Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks,...
Embodied intelligence is often studied through specialized models for individual tasks such as manipulation or navigation, resulting in fragmented capabilities and limited generalization across...
https://arxiv.org/abs/2605.30280


Seonglae Cho