Tagged articles

risk-aware reward

1 articles · Page 1 of 1
Amap Tech
Amap Tech
Sep 23, 2026 · Artificial Intelligence

From Street View to Navigation: Post-Training Multimodal LLMs for Reliable Landmark Extraction

Amap details its system for extracting navigation landmarks from street-view imagery using multimodal large models, covering data annotation standards, a three-stage training pipeline (SFT, DPO, GRPO with a risk-aware reward), bounding-box-free evaluation, offline production, online integration, and A/B tests showing 23.5% faster user departure.

DPOGRPOSFT
0 likes · 26 min read
From Street View to Navigation: Post-Training Multimodal LLMs for Reliable Landmark Extraction