ROCKET-1: Master Open-World Interaction with Visual-Temporal Context Prompting https://
arxiv.org/pdf/2410.17856
a low-level policy that predicts actions based on concatenated visual observations and segmentation masks, with real-time object tracking provided by SAM-2.
ROCKET-1: Visual-Temporal Prompting for Open-World Robot Interaction
By
–