为什么机器人能看见玻璃却仍然不知道如何拿起它


机器人可以看着一只玻璃杯并立刻识别出来。它能够识别形状,估计其位置,归类材质,并计算它的手与物体之间的距离,但这些都不能告诉机器人究竟应该如何握住它。
需要多大的力才够?如果玻璃是湿的会怎样?如果杯子是空的,和装满时握持方式应该如何改变?如果物体在运动进行到一半时开始滑落呢?
正是在这里,“看见一个物体”和“理解如何与之交互”的区别变得清晰。
视觉提供描述,但物理智能决定响应。要成功拿起一个简单的玻璃杯,机器人必须协调握持力度、运动方式、时序、平衡以及触觉反馈。它需要检测自己的初始动作是否产生了错误结果,并在杯子掉落之前进行调整。
仅靠图像和文字单独学习这些行为非常困难。它们是在与真实物理世界交互中逐渐涌现的。
这也是为什么 𝗛𝘂𝗺𝗮𝗻 𝗧𝗲𝗹𝗲𝗼𝗽𝗲𝗿𝗮𝘁𝗶𝗼𝗻 对具身 AI 的发展如此重要。人类操作者已经具备处理不可预测条件下物体所需的物理直觉。通过 @InvLambda 的 𝗧𝗲𝗹𝗲𝗼𝗽𝗲𝗿𝗮𝘁𝗶𝗼𝗻 基础设施,人类的操作可以变成有价值的训练数据,捕捉动作如何转化为物理后果。
操作者知道如何适应。机器人会记录交互。随后,AI 系统可以从这些演示中学习,并逐步形成能够以更少的人类指导应对类似情况的策略。
摄像头可以告诉机器人:“那是一只玻璃杯”,但经验会教它:“你该怎样拿起它。”
#InvertedLambdaTheBreach #InvertedLambda #Robotics #Teleoperation #SecondContact #SecondContactTheBreach
查看原文
此页面可能包含第三方内容,仅供参考(非陈述/保证),不应被视为 Gate 认可其观点表述,也不得被视为财务或专业建议。详见声明
  • 赞赏
  • 评论
  • 转发
  • 分享
评论
请输入评论内容
请输入评论内容
暂无评论