大疆具身智能面试,居然考了一道LLM微调题

发布时间:2026/7/27 5:27:20
大疆具身智能面试,居然考了一道LLM微调题 前面八篇把大疆的传统强势方向都聊了一遍,从飞控到视觉到导航,基本覆盖了他们过去十年的核心技术栈。但这第九篇要聊的方向跟前面画风完全不同——具身智能算法工程师,这是大疆近一两年新开的岗位,面试内容直接跳到了VLA模型、多模态大模型和机器人学习的交叉地带。说白了,大疆也看到了RT-2、OpenVLA这些工作带来的范式变革。传统的感知-规划-控制pipeline正在被端到端的大模型方案挑战,大疆不可能不布局。这个岗位的面试既有传统机器人学的底子,又有深度学习和LLM的内容,混合度非常高。VLA模型:从RT-1到OpenVLA的技术脉络具身智能的核心是VLA(Vision-Language-Action)模型,面试里这是必考方向。面试官问:"RT-1、RT-2和OpenVLA这三个模型的核心区别是什么?它们分别解决了什么问题?"RT-1(Robotics Transformer 1)是Google在2022年发的工作,思路是把机器人的动作(机械臂末端位姿、夹爪开合)tokenize成离散的动作token,然后用一个Transformer模型以图像和语言指令为输入自回归预测动作token。本质上就是把机器人控制变成了一个"看图说话+做动作"的多模态序列预测问题。RT-2的关键改进是把动作token空间和VLM(Vision-Language Model)的词汇表统一了。RT-2用的是PaLI-X或者PaLM-E这种已经预训练好的视觉语言模型做底座,把机器人动作token直接嵌入到VLM的token空间里。这样模型不仅继承了VLM的视觉