内容简介:“请把杯子拿起来”。这句话对你来说轻而易举。因为你看到了杯子,理解了“拿起来”的含义,手自然地伸过去、捏住、提起。但对一个 AI 系统来说,这中间隔着数道几乎不可逾越的鸿沟:语言到动作、动作到视觉、视觉到空间、空间到执行。传统做法是强迫模型学会直接映射,通过输入一段文字或一组动作参数,让其直接输出像...
用户评论
热门文章