传统机器人导航就像拿着地图找路——先通过激光雷达或摄像头扫描环境,生成离散地图,再根据预设路径点规划动作。但港大联合上海AI Lab提出的VLN-R1框架,直接让机器人“用眼睛思考”:通过第一人称视频流输入,模型能实时输出连续动作(如“左转30度”“减速绕过茶几”),无需依赖离散地图。这种突破体现在两大核心机制上:一是“两阶段训练+时间衰减奖励”,模🍒电子型先通过专家演示学习基础动作,再通过强化学习优化决策——比如在Habitat模拟器中,模型会同时生成8种走法,通过比较方案优劣动态调整策略;二是“时间衰减奖励(TDR)”,模型对当前动作赋予更高权重,确保先避开眼前障碍再规划后续路径。实验数据显示,在63万R2R和120万RxR训练样本中,VLN-R1的导航成功率比传统方法提升42%,且2B参数模型性能直逼7B大模型,为家用机器人落地提供了可能。
传统机器人摄像头就像“戴着眼罩”,只能看到前方30度视野,而港科大郑旭团队提出的PANORAMA系统,通过等距矩形投影或多鱼眼镜头组合,让机器人拥有120°×90°超大视野,甚至能通过“多平面同步”技术从一张照片“脑补”出360度环境。这一突破解决了三大难题:数据瓶颈上,团队采用生成对抗网络(如Dream360)和扩散模型(如PanoDiffusion),生成高质量全景图像;模型能力上,球面卷积神经网络和变换器架构适应了全景图像的扭曲特征;应用场景上,在森林火灾监测中,全景视觉能让机器人同时捕捉多个火点的空间关系,导航效率提升3倍。更关键的是,PANORAMA系统通过“长短时记忆采样策略”,高频采🎲电子样最近5步的短期记忆(如沙发位置),低频抽取初始方向的长期记忆,确保机器人在复杂环境中既不迷失方向,又能对突发情况(如突然出现的宠物)快速反应。
传统机器人性能提升靠“堆数据、堆算力”,但港大提出的GPC框架另辟蹊径:通过“策略组合”在测试时动态融合多个预训练模型的决策分数。比如,一个基于视觉-动作(VA)的策略擅长避障,另一个基于视觉-语言-动作(VLA)的策略擅长理解指令,GPC框架会通过凸组合方式,将两者的“决策分数”按最优权重融合,生成比单一策略更精准的动作。实验中,在Robomimic仿真平台上,GPC策略使机器人完成“清理桌面”任务的成功率提升7.55%;在真实场景中,PiPER机器人使用GPC后,任务成功率比单一基线模型高5-10%。这一框架的突破性在于“即插即用”——无需重新训练模型,只需调整组合权重,就能让机器人快速适应新任务。比如,在工业物流场景中,机器人可以通过组合“抓取策略”和“路径规划策略”,同时完成分拣和运输任务,效率比传统方法提升40%。
尽管港大团队在算法和框架上取得突破,但机器人视觉的商业化仍面临三大挑战:一是“数据-场景”错配,实验室训练的数据(如干净室内环境)与真实场景(如强光、弱光交替的工厂)差异大,导致模型泛化能力不足;二是“算力-成本”平衡,高精度全景视觉需要GPU加速,但家用机器人成本需控制在千元级;三是“安全-效率”矛盾,在医疗手术机器人场景中,0.1毫米的视觉误差就可能导致手术失败,而实时决策又要求模型响应速度低于100毫秒。不过,随着RoboSense推出的AC2传感器(集成dToF+RGB双目+IMU,8米内精度±5mm)和AI-Ready生态(开源姿态估计、人体骨架识别算法),机器人视觉的硬件-软件协同正在加速。比如,在2025武汉自动化展上,多家企业展示了结合港大算法和AC2传感器的工业检测机器人,能实时识别0.1毫米级的零件缺陷,检测🔋速度比传统方法快3倍。
从VLN-R1的“直觉导航”到PANORAMA的“全景感知”,再到GPC的“策略融合”,港大团队正在推动机器人视觉从“看懂世界”向“理解世界”跨越。这些突破不仅为工业自动化、家庭服务、医疗健康等领域带来变革,更让我们看到:未来的机器人或许不再需要“先看地图再走路”,而是像人类一样,用眼睛观察、用大脑思考、用身体行动。正如清华大学孙富春教授所言:“当机器人拥有超越人类的感知能力🅾时,它们将真正成为我们的‘智能伙伴’。”