Zetao Cai
Dexterous manipulation requires modeling both visual dynamics and fine-grained hand-object interactions. We propose a Hand-Skeleton-Conditioned World Action Model that uses hand keypoints as an explicit structural condition for jointly predicting future observations and robot actions. By providing interaction-relevant motion cues, hand-skeleton conditioning improves action prediction and manipulation performance, demonstrating its value as a compact representation for world-action modeling.