AI产业链 / L5-AI应用与智能体 / 具身智能与AI机器人 · 2026-09-10

📅 2026-09-10🏷 AI产业链 / L5-AI应用与智能体 / 具身智能与AI机器人

机器人的"大脑"该放在哪:设备端推理 vs 数据中心推理(SemiAnalysis 2026-09-10)

核心命题:LLM 是"硬件屈从模型",机器人反过来 —— 机器人硬件是固定的,模型必须被设计得能装进去。原因有二:① 时间(机器人跑实时控制回路,不能错过 deadline;LLM 慢一点不影响最终输出);② 成本(算力要由制造商每台预付,十亿台量级意味着万亿级 capex)。因此模型能力被"能在可负担的实时硬件上跑什么"卡住,智能成了要按延迟与单位经济性配给的资源。

一、前沿机器人模型仍然很小

  • 参数量约 5-14B:Physical Intelligence π0.7 = 5B,NVIDIA DreamZero = 14B(基于视频扩散骨干的"世界动作模型"WAM)
  • 对比 LLM 已进入万亿参数。数据曾是约束,现在靠世界模型 + 具身人类数据收集缓解,但"scaling 是否同样有效"仍是开放问题

二、三条路线已经分叉

公司 / 模型部署方式
Figure Helix完全在机器人本体上运行
Physical Intelligence π0.7机器人外部,单张 H100
NVIDIA DreamZero(14B WAM)外部,需要 2 张 GB200 才能实时

三、为什么"规划层"该搬进数据中心

  • 层级式模型分两层:规划层(慢、重、每秒只更新几次、与控制回路异步)+ 动作层(快、数百 Hz、不能容忍任何抖动)
  • 这种解耦让规划层可以吸收无线往返的延迟甚至抖动 → 规划层天然适合放进数据中心,快速控制回路留在本地
  • 通用性越高,规划越重:通用型机器人正是数据中心级算力的必要场景;专用型(单一重复工位)整机小到能全放在本体上
  • 本质是 FLOPs 饥渴:VLA 的视觉 + 语言阶段在任何强 GPU 上都是计算密集;WAM 更重(迭代去噪,一个动作要多次完整前向)

四、边缘芯片跟不上

  • Jetson Thor 算力约为单张 B200 的 1/10、B300 的 1/14;DreamZero 需要约 20 倍于单颗 Thor 的算力,若放 Thor 上会掉到 1Hz 的几分之一,远不够实时控制
  • 与 LLM 的负载形态截然不同:LLM 是突发大 token、KV cache 持续增长 → 带宽/内存受限;机器人是每秒几次、每帧被 ISP 与编解码 ASIC 压成几十到几百 token 的稳态小流 → FLOPs 受限

五、卸载的工程约束

  • 电源:单张 Blackwell 约 1.2-1.4kW 且需液冷;人形机器人电池仅约 2kWh,正常运动几百 W、峰值一两 kW,机载"大脑"是 40-130W 的 Thor。卸载后机器人只需携带 20-30W 的感知 + 无线板卡
  • 上行链路:移动芯片历来优先下行速度,机器人需要大上行容量(高保真遥测)。要多发射天线、多 RF 频段、并优化 AP 间与 WiFi/5G 间快速切换 —— 抖动才是最大的敌人
  • 成像链路要为模型优化、而非为人眼优化:噪声是压缩的敌人,光学、低光性能、传感器 SNR、热管理、ISP 都要为压缩服务,并像 WebRTC 一样实时自适应码率与 ISP
  • 安全底线:本地必须保留保底控制回路 + 延迟看门狗、心跳超时、远程动作时效约束;网络可用率需达 99.99%,否则卸载部署不成立(今天仓库 AGV 断网即安全停机)

六、供应链:算力往哪走,供应就往哪走

  • NVIDIA 加速器产出几乎全是数据中心芯片,Jetson 是底部那条细红线,即便 2026 年也几乎看不见;毛利率数据中心 GPU 约 75-80% vs Jetson 约 65%
  • Jetson 正收敛到数据中心争夺的同一批节点:Orin 用三星 SF8 → Thor 改用 TSMC N4(与 Blackwell 同节点) → 后续 N3(与 Rubin)、N2(与 Feynman)→ 低量低毛利的 Jetson 永远排在后队
  • 但晶圆本身不是瓶颈:2030 年 100 万颗 Jetson 级芯片(每颗约 400mm²)全年仅约 1 万片晶圆,相对数据中心 GPU 扩张是舍入误差。真问题是硅效率:给定机器人车队,哪种方式消耗更少先进制程硅
  • 交叉点:每 GPU 对应 7 台机器人(晶圆口径)、每 GPU 对应 5 台机器人(DRAM 口径)—— 超过该比例,共享 GPU 服务认知更省硅、更省 DRAM
  • DRAM 侧:Jetson Xavier 32GB → AGX Orin 64GB → Thor 128GB LPDDR5X,而新增 DRAM 产能大部分被 HBM 吸收 → LPDDR 在抢日益缩减的非 HBM 晶圆份额

七、TCO:一台 B300 服务器 vs 56 台 Thor(本报告分量最重的部分)

  • 假设网络 RTT 10ms(GPU 就近部署)、每次推理换来 1.6 秒动作 → 延迟预算 1.6 秒
  • 实测:单张 B300 在延迟预算内最多服务 7 台机器人(p99 = 1.16 秒,全程无丢帧)→ 对应 56 台机器人需要 一台 B300 NVL8
口径卸载(B300 NVL8 + 56 块无线板)端侧(56 × Jetson Thor @$3,500)
资本开支约 $542K约 $230K
TCO(未计利用率)$18.32/hr$6.58/hr
每 PFLOP(未计利用率)$0.15/hr$0.11/hr
每 PFLOP(计利用率后)$0.17/hr$0.28/hr
  • 利用率是胜负手:GPU 服务器池化后约 90% 利用;端侧芯片高度依赖场景 —— 家庭机器人每天只跑 1-2 小时(4-8%),趋势走向 4-5 小时(17-21%)且有硬上限(家务终究会做完);工业以 Figure 在宝马约 1,250 小时/11 个月、每天约 10 小时、40% 利用率为基准
  • 计利用率后,卸载约为端侧的 60%;家庭场景可低至 约 15%
  • 敏感性:只有"低 GPU 利用率 + 高端侧利用率"的右下角才会反转;批量 ≥4 台机器人 / GPU 起,卸载就开始占优

八、什么场景不能用卸载

  • 不可能:洞穴、废墟、灾害现场(网络无法可靠存在)
  • 有条件:开放农田 / 偏远田地(Starlink 覆盖但延迟与抖动更高);家庭(墙体盲区、家用路由器不做切换优化、共享光纤拥塞)
  • 最恶劣但最可控:工厂与仓库 —— RF 多径、电磁噪声、视线遮挡都极严重,但可用 URLLC + 私有 5G 做到 <10ms,GPU 就近放在同楼几百英尺,彻底去掉互联网传输层
  • 监管维度:执行深度包检测的国家防火墙会显著恶化延迟与抖动 → 作者推测美国更适合卸载,中国等更倾向端侧

九、投资 / 产业视角

  • 对 NVIDIA 是真利好:认知算力从"每台机器人一颗芯片"变成"共享 GPU 池",抬高数据中心 GPU 的 TAM,同时把低毛利 Jetson 的放量往后推 —— 与其自身产能与毛利结构完全一致
  • 对机器人整机厂是成本解的钥匙:剔除每台的芯片 BOM 是价格下探、走向大众市场的杠杆;也解决了"芯片先买、机器人后卖"的死资本问题(一万台待售机器人 = $30M 在仓库里折旧)
  • 存储与晶圆的分配逻辑:HBM 与数据中心吃掉先进产能 → 边缘/消费级 LPDDR 相对更紧张。与其博 Jetson 放量,不如跟踪非 HBM 晶圆的紧张程度
  • 网络与工业无线是隐藏受益方向:私有 5G / URLLC、多频段射频、波束成形、AP 快速切换 —— 这轮军备竞赛由机器人驱动
  • 对"机器人 = 下一个 token 海啸"要打折:机器人负载是 FLOPs 受限的稳态小流,与 LLM 带宽受限的突发流是两套算力模式;且大量认知最终落在共享 GPU 上,单位算力效率反而更高

来源:SemiAnalysis《Where Does a Robot Think – On-device vs Datacenter Inference》,2026-09-10,Ivan Chiam 等