近年来,大模型的发展经历了一个反复验证的成功路径:首先通过海量数据进行预训练,然后通过对齐技术提升其实用性,最后在广泛部署过程中不断迭代优化。随着这一成功模式的逐步深入,具身智能领域也开始思考,能否在物理世界重温这一过程。当前,具身智能正面临类似于大模型时期的“鸿沟”:在仿真环境中的表现实在出色,然而一旦转向不同的现实场景,往往需要重新收集数据与再训练,造成无法灵活应用。
最近,具身智能公司亮源新创通过两轮技术发布,提供了对这一问题的解决方案。首次发布的开源通用导航模型LightNav-0,着眼于“对齐”;而紧接着推出的机器人韧性控制技术Light REACT,则关注“部署”,这两者均与大模型的三个发展阶段相对应。
亮源新创的创始人姜旭,曾在OpenAI任职并专注于强化学习与人类反馈(RLHF),因此他提出了“规模化预训练、对齐和部署”的三段范式。这一策略强调普适性优先于专一性,先实现全场景泛化,再致力于精确化,相较于主流的逐步精化方式,这是一条显著不同的路线。 qy球友会官网
姜旭在OpenAI的经历使他对“能力”与“可用性”的转化有了深刻理解,正是基于此,他在技术设计时展现了独特的信心。LightNav-0的开发以严格的训练流程为基础,而Light REACT更是将偏好对齐直接融入机器人控制中,展现出高效的学习策略。
LightNav-0作为首个发布的模型,解决了导航功能,它以开源的视觉语言模型为基础,无需专门的导航模块,能够在多种机器人平台上实现零样本部署,轻松理解自然语言指令并自主导航。其技术报告显示,该模型在多个公开评测中表现优异,不仅超过了依赖多传感器系统的竞争者,还展示了独特的数据处理方式,结合真实场景和仿真生成的训练数据,成功克服了冷启动问题。
在设计中,团队也考虑到了模型的记忆结构,通过借鉴人类的遗忘曲线来分配注意力,确保模型在处理信息时既能保持效率,又不至于因历史数据的占用而造成负担。这种方法论和技术细节的结合,彰显了具身智能在大模型进化过程中所追求的全新高度。 qy球友会官网
Copyright © qy球友会.千亿球友会 版权所有 网站地图
留言框-