当前位置: 首页 > 新闻动态
新闻动态

tqb谈球吧:国产最大端侧模型独角兽进军具身智能发布开源首个具身系列模型

谈球吧真人:

  大会“智在终端惠及千行”分论坛,发布并开源了其首个具身智能技术成果——MiniCPM-Robot系列模型,包含一个视觉-言语-动作模型和一个盯梢导航模型,将团队长时间主导的多模态才能初次从手机、

  在具身智能范畴,“金鱼回忆”是困扰视觉-言语-动作模型的长时间痛点。想要让记住前史操作并实时决议计划,推理推迟就会急剧攀升,动作随即卡顿。

  此次发布的视觉-言语-动作模型Manip正是为处理这一对立而生。它根据面壁智能多模态端侧大模型MiniCPM-V 4.6 练习,该系列模型累计下载量已打破2000万次,其独家的视觉词元极致紧缩技术,为本次具身打破埋下了要害伏笔。

  在操作评测基准(RMBench)中,美国闻名模型π0.5仅得到10分,Manip拿到53分,跻身榜首队伍。Manip不光能够连接地“做三明治”,其单步决议计划推迟仅120毫秒。

  不依赖任何云端算力,此次发布的盯梢导航模型Track,仅靠机身原装摄像头和本地芯片,即可在拔掉网卡的状况下,听懂自然言语指令并继续追寻方针。这是业界首个支撑实在本地、纯无网布置的追寻模型。

  在未做下流强化学习优化的情况下,Track在实在场景评测中追寻率最高达89.8%,比较全域追寻视觉-言语-动作模型(OmTrackVLA)三项目标均匀提高超9个百分点。

  现在,不少具身智能团队遵从“从点到面”的道路:先在特定场景中练习专用技术,再逐渐扩展才能鸿沟。面壁智能挑选的是从通用模型动身,将视觉了解、言语指令、状况判别和动作输出放进一致结构,再落到具体任务。

  跟着机器人进入家庭、办公室和工厂,仅依托云端难以一起满意实时呼应、牢靠运转和隐私维护。面壁智能多模态首席科学家、清华大学学院助理教授姚远以为,将感知、决议计划与履行布置在本地硬件设备上,既能保证及时呼应,也能下降隐私危险。

  据悉,面壁智能正与乐聚、吉祥轿车等协作,将展厅导览、园区巡检、工业仓储等场景作为端侧具身智能的试验场。

推荐新闻

tqb谈球吧 版权所有 苏ICP备14034006号