8 月 27 日,Hugging Face 旗下 Pollen Robotics 正式开放 Microduck 预订。这是一只 25 cm 高的双足机器鸭,定价 399 美元,圣诞节前发货。但别被外形骗了:它不是玩具,而是一套把 sim2real 强化学习流水线打包进消费级硬件的开发平台。
对普通开发者来说,Microduck 最吸引人的不是它能用喙捡东西、摔倒后自己爬起来,甚至不是溜冰——而是你可以在一台普通 PC 上训练策略,再把它部署到 399 美元的实体机器人上。这个闭环过去只属于资金雄厚的机器人实验室或创业公司。
本文先带你完成预订,再把 SDK 和仿真环境在本地跑起来。即使机器鸭还要等几个月才到,你的开发环境已经可以开始迭代。
一、Microduck 是什么:先看硬件与软件边界
Microduck 由 Hugging Face 在 2025 年 4 月收购的法国机器人公司 Pollen Robotics 出品。硬件规格在这个价位相当慷慨:
| 项目 | 规格 |
|---|---|
| 身高 | 25 cm |
| 重量 | 约 800 g |
| 电机 | 15 个执行器 |
| 视觉 | 广角摄像头 |
| 深度感知 | 8×8 ToF LiDAR |
| 姿态 | 双 IMU |
| 交互 | 麦克风、扬声器、NFC |
| 连接 | Wi-Fi、蓝牙 |
| 计算 | 1 GB RAM / 32 GB 存储 |
| 电池 | 2600 mAh,续航约 1 小时 |
软件栈完全开源(Apache 2.0),核心包含:
- microduck:机器人端软件,用 Rust 编写,包含控制循环
robotd、更新系统、蓝牙服务、游戏手柄处理、WebRTC 摄像头流、ToF 深度服务。 - MuJoCo / MuJoCo Warp 仿真环境:在 GPU 上并行跑数千只虚拟鸭子。
- RL 训练脚本:基于 PPO,训练好的策略导出为 ONNX,再部署到真机。
需要注意的边界:机械和电子设计文件未开源(非商业授权),所以你能 clone 的是软件、策略与训练流程,不是完整硬件图纸。
二、预订:现在该做什么
当前 Microduck 只在 Pollen Robotics 官网开放预订,定价 399 美元为税前和运费前价格,首批预计 2026 年圣诞节前发货。建议操作:
- 访问 Pollen Robotics Microduck 页面 确认所在地区是否在首批销售范围(北美、欧洲、英国为主)。
- 下单时留意关税与运费,最终到手价通常会明显高于 399 美元。
- 保留订单确认邮件,后续固件更新、SDK 版本绑定可能用到序列号。
如果你在中国内地,还要额外确认:电源适配器、Wi-Fi 频段(2.4 GHz / 5 GHz)、以及跨境物流是否稳定。这些现在不用解决,但建议加入待办清单。
三、本地开发环境搭建:仿真先行
Pollen Robotics 的 GitHub 仓库已经把训练环境放出来了。即使机器还没到,你也可以先在仿真里训练策略。推荐环境:
- Ubuntu 22.04 / WSL2 / macOS(M 系列需确认 MuJoCo Warp 兼容性)
- NVIDIA GPU,CUDA 12.x(PPO 训练用 GPU 会快很多)
- Python 3.10+
1. 克隆仓库并安装依赖
# 假设官方主仓库为 pollen-robotics/microduck(实际以 GitHub 页面为准)
git clone https://github.com/pollen-robotics/microduck.git
cd microduck
# 建议用 conda 隔离
conda create -n microduck python=3.10 -y
conda activate microduck
pip install -e .
pip install mujoco mujoco-warp onnxruntime-gpu
如果仓库还依赖 Hugging Face 的 lerobot 或 gymnasium 封装,按 README 补充安装即可。
2. 验证仿真能跑
python -m microduck.sim.run --scene flat_ground --render
如果窗口里出现一只鸭子站在平地上,说明 MuJoCo 场景加载成功。没有 GPU 的话,把 --render 去掉,用 CPU 跑小规模训练。
3. 跑第一条 PPO 训练
官方通常提供一个最小训练脚本:
python train_ppo.py \
--env MicroduckWalk-v0 \
--num-envs 4096 \
--total-timesteps 50_000_000 \
--device cuda \
--output ./policies/walk_v0.onnx
在 4096 个并行环境下,一个基础步态大约需要 1–2 小时。训练完成后会输出一个 ONNX 策略文件,这就是将来要部署到真机上的东西。
四、理解 sim2real 流水线:训练 → 导出 → 部署
Microduck 的真正价值在于把下面的流程标准化:
[MuJoCo 仿真] --PPO--> [ONNX 策略] --部署--> [Microduck 真机]
每一步都有讲究:
- 仿真训练:在 MuJoCo / MuJoCo Warp 里定义奖励函数。例如走路任务的奖励可能包含:前进速度、躯干高度、能量消耗、摔倒惩罚。奖励函数设计比算法选择更决定成败。
- 域随机化:为了让仿真策略在真机上不翻车,训练时通常会对质量、摩擦、电机延迟、传感器噪声做随机扰动。Microduck 的开源训练脚本里应该包含默认随机化参数,但你仍需根据地面材质微调。
- ONNX 导出:策略网络导出为 ONNX 后,机器人端用轻量运行时推理。注意输入输出维度要和真机上的 61 维观测契约对齐。
- 热替换部署:真机运行
robotd,可以通过工具把新策略推上去替换,不用重新刷机。
五、没有真机之前,你能练什么
等货的这段时间足够做很多事:
- 改奖励函数:在仿真里试不同权重,看鸭子能不能走出更稳定的步态。
- 做新任务:比如转弯、蹲下、用喙触碰目标。只要奖励函数设计合理,PPO 会在仿真里自动探索。
- 学习 Rust 端架构:读
robotd、mediad、tofd的源码,理解传感器数据如何流进策略、动作指令如何发给电机。 - 准备数据集:如果你计划做视觉策略(用摄像头输入),现在就可以开始收集或生成训练数据。
注意事项与常见问题
Q:399 美元是全部成本吗? 不是。税费、国际运费、可能的关税会让最终价格上浮。另外,本地训练 PPO 最好有一块 NVIDIA GPU,如果电脑没有,可以考虑按小时租用云 GPU。
Q:没有机器人背景能玩吗? 能,但要有心理准备。强化学习调奖励函数、处理 sim2real gap 都需要耐心。建议先从官方示例脚本跑通,再逐步改参数。
Q:硬件没开源,会不会以后被锁死? 机械和电子图纸确实没开源,但软件栈和策略格式是开放的。只要 Hugging Face 继续维护 SDK,社区就能自己训练新行为。最坏情况下,你也可以把学到的 RL 流程迁移到其他 MuJoCo 机器人模型上。
Q:隐私方面要注意什么? Microduck 带摄像头和麦克风,数据默认留在本地(开源代码可审计)。但如果你在机器人上安装第三方应用,要检查它们是否把音视频上传到云端。Hugging Face CEO Clem Delangue 也强调,开源本地运行比黑盒系统更可控。
小结
Microduck 的突破性不在于它会溜冰或捡东西,而在于它把一套完整的 sim2real 强化学习开发流程压到了 399 美元。对开发者来说,正确的打开方式是:今天就把仿真环境搭好,在等货的这几个月里把奖励函数、训练脚本、部署流程摸熟。等机器鸭到货那天,你要做的只是把 ONNX 文件推上去,看它摇摇晃晃地走出第一步。
