深圳新闻网2026年7月7日讯(记者 王睿)如果给机器人戴上一副沾满油污的眼镜,它还能准确抓取杯子吗?对人类来说,镜头模糊、反光、昏暗都不算难题,但对最先进的机器人AI模型而言,答案并不乐观。
7月6日,第43届国际机器学习大会(ICML)在首尔开幕。在这场全球顶级的AI学术盛会上,深圳具身智能企业星尘智能联合北京大学、清华大学等机构,正式发布并开源了机器人视觉鲁棒性架构——StableVLA。
机器人为何会“看花眼”?
VLA(视觉-语言-动作)模型是当前具身智能的核心路线:机器人通过摄像头“看见”环境,经大模型“理解”任务,再“输出”动作。然而现实世界充满镜头油污、光照突变、反光遮挡等干扰,而训练数据无法覆盖所有可能。研究发现,即便最先进的VLA模型,遭遇未见过的视觉干扰时性能也会大幅下降。
问题出在哪?团队系统诊断后发现:视觉编码器和大语言模型都不是主因,真正的薄弱环节是连接两者的投影器(Projector)。好比一个跨国团队,投影器是中间的翻译官。目前主流投影器采用MLP结构,像个“全通滤波器”——不区分目标信息还是噪声,一股脑送入决策系统,导致误判。
给机器人装“智能降噪器”
找到病根,团队提出IB-Adapter(信息瓶颈适配器) ,核心理念是“信息不是越多越好,关键要保留最有价值的”。它相当于在视觉特征进入决策层前加装一层筛选器:保留物体轮廓、空间结构等有用特征,同时压制噪点、反光、模糊等冗余信息。
这套“关联分析+智能门控+特征重构”机制,为每个特征通道安装独立开关,重要通道开启,噪声通道关闭。整个模块新增参数不足1000万,对于动辄数十亿的大模型来说几乎可以忽略。
5亿参数挑战70亿,效果超预期
在不增加训练数据、不做数据增强的情况下,IB-Adapter平均带来约30%的性能提升。更令人瞩目的是:搭载IB-Adapter的StableVLA,即便只使用5亿(0.5B)参数的模型,也能达到接近70亿(7B)参数级VLA模型的鲁棒性表现——规模相差14倍。
在LIBERO、CALVIN等权威基准测试中,StableVLA在多数子任务中取得最优或次优成功率。真实机器人测试中,团队在Astribot S1平台上进行抓取、倒水、玩偶装箱等任务,并人为制造图像噪声、模糊、镜头油污等干扰。结果显示:在玩偶装箱任务中,StableVLA(0.5B)达到50%成功率,远超同参数的VLA-Adapter(20%)和参数更高的OpenPI 0.5(3B,40%)。
深圳企业站上全球舞台
星尘智能(Astribot)成立于2022年,创始人兼CEO来杰拥有超17年AI与机器人研发经验,曾任腾讯机器人实验室1号员工。今年6月,公司完成B轮系列融资,三个月内融资超10亿元,估值突破百亿元。公司自研Lumo基座模型与绳驱本体技术,构建了“AI模型—具身OS—绳驱本体”全栈自研体系,已在科研、商业、工业等领域实现落地。
从学术到产业,StableVLA回答了一个现实问题:机器人如何离开实验室走进真实世界?工厂、商场、家庭永远不会拥有完美的光照和干净的镜头。机器人未必需要更大的模型,但一定需要更稳定的视觉理解能力。这或许是具身智能从“能工作”迈向“可靠工作”的关键一步。