LingBot-Mapは、連続映像ストリームからリアルタイムに密な3D空間を再構成するTransformerベースのオープンソースモデルです。フィードフォワード処理により約20 FPSの推論速度を維持し、FlashInferを用いたKVキャッシュにより、1万フレームを超える長時間の動画シーケンスでも精度を落とさず連続処理します。従来の反復最適化手法と比べて高速かつドリフトを抑えた推論が可能で、自律走行や拡張現実(AR)、具現化AI(Embodied AI)の開発者を対象としています。対話型可視化にはviserデモを提供します。