官方网站-首页官方网站-首页

今日科普|港大机器人视觉新突破
2025-11-27 04:00:16

从“看照片”到“脑补全景”:港大团队让机器人拥有“上帝视角”

2025年的机器人领域,一场关于“视觉”的革命正在悄然发生。传统机器人就像戴着“眼罩”的独行侠,只能盯着眼前一小片区域,而香港大学与上海AI Lab联合提出的VLN-R1框架,直接给机器人装上了“全景摄像头”。这项发表于2025年6月的研究,让机器人首次实现了从“视觉输入→文本描述→离散决策”到“第一人称视频流→连续动作”的跨越。举个例子:当你说“去厨房拿牛奶”时,机器人不再需要先生成文字描述(shù)“前(qián)方(fāng)有(yǒu)门(mén)”,而(ér)是(shì)直(zhí)接(jiē)像(xiàng)人(rén)类(lèi)一(yī)样(yàng),边(biān)走(zǒu)边(biān)调(diào)整(zhěng)方(fāng)向(xiàng),避(bì)开(kāi)椅(yǐ)子(zi)、打(dǎ)开(kāi)冰(bīng)箱(xiāng),甚(shén)至(zhì)还(hái)能(néng)回(huí)答(dá)你(nǐ)“还(hái)剩(shèng)半(bàn)瓶(píng)”。在(zài)VLN-CE基(jī)准(zhǔn)测(cè)试(shì)中(zhōng),仅(jǐn)用(yòng)20亿(yì)参(cān)数(shù)的(de)Qwen2-🍒VL-2B模(mó)型(xíng),通(tōng)过(guò)强(qiáng)化训练后,性能就超越了70亿参数的SFT模型,在长距离导航任务中,用1万条样本就能达到完整数据集训练的效果,数据效率提升近7倍——这就像让一个新手快递员,通过少量案例就能快速掌握复杂路线规划。

港大机器人视觉新突破

空间推理:从“平面画师”到“立体建筑师”的进化

🎲如果说VLN-R1解决了机器人“怎么走”的问题,那么港大团队另一项研究则攻克了“怎么操作”的难题。2025年10月,香港科技大学(广州)团队提出的“空间强制”训练法,让机器人无需3D传感器,仅靠2D图像就能“脑补”出三维空间。传统机器人就像只会看平面照片的“画(huà)师(shī)”,面(miàn)对(duì)“拿(ná)起(qǐ)红(hóng)色(sè)杯(bēi)子(zi)”的(de)指(zhǐ)令(lìng),能(néng)识(shi)别(bié)颜(yán)色(sè)和(hé)形(xíng)状,却搞不清杯子距离多远、需要伸多长的手臂。而“空间强制”训练法通过让机器人模仿“空间导师”VGGT模型(能从照片中准确判断物体高度、距离和空间关系),在中间层进行深度对齐训练,使其学会从视觉线索中推断空间信息。在LIBERO仿真环境中,经过这种训练的机器人在空间布局任务中成功率达99.4%,物体操作任务成功率99.6%,长期规划任务成功率96.0%,且训练数据量仅为传统方法的1/5——这就像让一个从未见过楼梯的人,通过观察照片就能学会上下楼,甚至能规划出最优路径。

多模态融合:触觉+视觉,让机器人“手眼通天”

机器人要真正融入人类生活,仅靠“看”和“走”还远远不够。2025年8月,一目科技发布的视触觉传感器,为机器人装上了“能看见🔋电子登录触感”的眼睛。这种传感器通过拍摄弹性材料接触物体时的形变,生成高清“触觉照片”,能同时感知物体的软硬、纹理甚至滑动趋势。在2025武汉机器视觉展上,这项技术被展示为“工业4.0的关键拼图”——在汽车制造中,机器人可以通过视觉检测零部件尺寸,再通过触觉感知装配时的力度,避免划伤表面;在医疗领域,手术机器人能结合视觉定位肿瘤位置,再通过触觉感知组织弹性,提高切割精度。更关键的是,这种多模态融合技术解决了具身智能的“数据瓶颈”:传统大模型需要海量数据才能收敛,而触觉传感器通过“真实触觉信号锚定仿真系统”,能生成超真实任务变体数据,为模型提供“养料”——这就像给机器人装上了“五感”,让它们能像人类一样,通过触摸、观察和思考来完成复杂任务。

未来已来:机器人视觉如何重塑我们的生活?

从工业到家庭,从导航到操作,机器人视觉的突破正在引发连锁反应。在工业领域,2025武汉机器视觉展上展示的3C电子检测系统,通过2D/3D视觉检测,将智能手机屏幕贴合误差控制在0.01毫米以内,良品率提升(shēng)15%;在(zài)家(jiā)庭(tíng)场(chǎng)景(jǐng)中(zhōng),VLN-R1框(kuāng)架(jià)让(ràng)服(fú)务(wu)机(jī)器(qì)人(rén)能(néng)理(lǐ)解(jiě)“先(xiān)整(zhěng)理(lǐ)桌(zhuō)面(miàn),再(zài)泡(pào)茶(chá)”的(de)多(duō)步(bù)骤(zhòu)指(zhǐ)令(lìng),而(ér)“空(kōng)间(jiān)强(qiáng)制(zhì)”训(xun)练(liàn)法(fǎ)则(zé)让(ràng)它(tā)们(men)能(néng)精(jīng)准(zhǔn)避(bì)开(kāi)障(zhàng)碍(ài)物(wù),避(bì)免(miǎn)打(dǎ)翻(fān)水(shuǐ)杯(bēi);在(zài)医疗领域,结合触觉传感器的手术机器人,正在尝试完成更精细的神经外科手术,成功率比人类医生高20%。这些突破背后,是跨学科团队的智慧碰撞——港大团队用“时间衰减奖励”机制(zhì)让(ràng)模(mó)型(xíng)学(xué)会(huì)“先(xiān)看(kàn)脚(jiǎo)下(xià)再(zài)看(kàn)远(yuǎn)方(fāng)”,科(kē)大(dà)团(tuán)队(duì)用(yòng)“空(kōng)间(jiān)对(duì)齐(qí)”训(xun)练(liàn)让(ràng)机(jī)器(qì)人(rén)“脑(nǎo)补(bǔ)”三(sān)维(wéi)世(shì)界(jiè),一(yī)目(mù)科(kē)技(jì)用(yòng)“触(chù)觉(jué)照(zhào)片(piàn)”填(tián)补(bǔ)物(wù)理(lǐ)世(shì)界(jiè)的(de)数(shù)据(jù)空(kōng)白(bái)。正(zhèng)如(rú)李(li)智(zhì)强博士所说:“具身智能的核心,是让机器人像人类一样,通过感知-决策-行动的闭环学习。”当机器人能“看”懂世🅾电子登录界、“摸”清环境、“想”明逻辑时,我们离“机器人服务人类”的未来,或许真的不远了。

登录