UCLA博士回国创业半年融5个亿:做人形机器人的"大脑",让机器人真正看懂三维空间

5次阅读

UCLA博士回国创业,做出了一套能让机器人"看懂"三维空间的智能系统,半年融了近5个亿。

这家公司叫德塔智能(Delta Intelligence),成立刚满半年,已经完成了第六轮融资。投资方名单很长:智元机器人、乐聚机器人、星海图、宇树这些国内头部人形机器人厂商全部在列,财务机构也有高瓴创投、联想创投、复星锐正这样的熟面孔。

三位创始人都是UCLA博士,清华本科出身,曾在Google Robotics、NVIDIA Research、DeepMind、Meta干过。团队研究横跨机器人学习、大规模机器学习、具身智能,参与过美国DARPA和NSF机器人项目。

他们正在解决一个很具体的问题:现在的人形机器人,看世界还是"平面"的。

绝大多数具身智能模型依赖二维视觉。当机器人走进工厂、家庭、楼梯间这类复杂环境,二维表征的问题就暴露了——门把手距离多远?往哪边开?身体怎么转才能让出开门空间?这些判断一旦出错,动作误差会不断累积,最终长时序任务根本完不成。

德塔智能的打法是从底层重建三维感知能力。他们自研了一套"原生三维世界引擎",让机器人直接处理点云、高斯泼溅等三维场景数据,实现原生的三维理解、推理和对未来状态的推演。

光有感知不够。人类做一个开门动作,大脑发出指令,小脑负责全身几十个关节的毫秒级协同发力,维持平衡、调整重心、驱动手部动作——这一切同时发生,缺一不可。但现在的人形机器人,中间层是断的,高层指令直接下发给底层控制器,面对高自由度本体,平衡控制和精细发力根本跟不上。

德塔智能的三层架构就把这个断层补上了:大脑负责环境感知和长时序规划;小脑是强化学习训练的神经网络,把高层指令转化为数百赫兹的全身电机控制信号,实时调重心、协调四肢发力;力位混合层输出柔顺控制。三层各管一段,闭环联动。

数据怎么来?他们自研了一套全身全景数采设备,纯视觉采集架构,同步捕捉手、脚、腰、肩全维度人体骨架关节运动轨迹,配合第一视角视频流实时重建全局三维场景。这套设备支持两种采集模式:一种需要实体机器人遥操作,另一种无需本体,直接用动捕数据训练。后者成本更低、效率更高,可以大规模积累通用全身交互样本。

目前德塔智能已与智元、乐聚、星海图、宇树等头部人形机器人厂商建立了长期合作,模型在不同硬件平台间可以快速迁移。商业模式很清楚:不做机器人本体,只做基础模型供应商,给各类本体输出可部署的全身智能底座。

具身智能今年依然很热,但真正跑出来的公司正在从"展示运动"转向"完成物理作业"。德塔智能融到的这笔钱,很大一部分会用于自研数采设备的量产和数据闭环建设——谁先解决数据问题,谁就拿到了下一轮的门票。

正文完
 0