simmediumroboticsmetric · varies

Memory Over Maps: 3D Object Localization Without Reconstruction

Description

Target localization is a prerequisite for embodied tasks such as navigation and manipulation. Conventional approaches rely on constructing explicit 3D scene representations to enable target localization, such as point clouds, voxel grids, or scene graphs. While effective, these pipelines incur substantial mapping time, storage overhead, and scalability limitations. Recent advances in vision-language models suggest that rich semantic reasoning can be performed directly on 2D observations, raising

Source

http://arxiv.org/abs/2603.20530v1