Microduck за $399: открытый двуногий робот Pollen Robotics и Hugging Face, которого можно обучить самому
На этой неделе компания открыла предзаказы на Microduck — двуногого робота высотой 25 см, у которого каждое движение — ходьба, сидение, удары ногой, катание на роликах, подъём после падения — это нейросетевая политика, обученная в физическом симуляторе и перенесённая на реальное железо. Стоимость — $399. Среды обучения, функции вознаграждения, настройки рандомизации окружения и рецепт переноса «симуляция → реальность» полностью опубликованы на GitHub.
Microduck продолжает линию Reachy Mini, разошедшегося тиражом более 10 000 экземпляров, но переворачивает его концепцию: если Reachy Mini создавался, чтобы сидеть на столе и взаимодействовать с человеком, то Microduck создан, чтобы покинуть стол, падать и самостоятельно вставать.
Железо
Microduck имеет 25 см в высоту, 14 см в ширину и весит менее 800 г. В нём установлено 15 моторов, распределённых по ногам, шее и голове, плюс подвижный клюв, которым робот подбирает предметы с пола. Вычисления выполняет Rockchip RK3566 с ИИ-ускорителем, 1 ГБ оперативной памяти и 32 ГБ накопителя.
Набор сенсоров для такой цены необычно полный. Фронтальная камера расположена за отдельным индикатором использования. Установлены два инерциальных датчика — один в корпусе, другой в голове. Дальномер представлен компактным LiDAR и матрицей времени пролёта 8×8. Есть микрофоны и динамик, две NFC-антенны, а также Wi-Fi и Bluetooth. Питание — от съёмной батареи NP-F550 ёмкостью 2600 мА·ч, которой хватает примерно на час работы.
В коробке — семь готовых обученных движений, управляемых прилагаемым игровым контроллером ещё до того, как вы начнёте писать код: ходьба, приседание и вставание, удар, захват, катание на роликах и самостоятельное восстановление после падения. Робот не разговаривает. При первом включении каждый экземпляр генерирует собственную звуковую идентичность и сохраняет этот голос навсегда.
Как на самом деле обучаются поведенческие модели
Политики обучаются в репозитории microduck_rl, построенном на базе mjlab (MuJoCo Warp) с алгоритмом PPO. По данным Pollen, на CUDA-видеокарте при 4096 параллельных средах на пригодную походку уходит примерно один-два часа. Если локальной видеокарты нет, добавление флага —hf-jobs запускает ту же команду на инфраструктуре Hugging Face Jobs.
Ключевая часть переноса «симуляция → реальность» — модель привода. Каждый сервопривод использует модель BAM M6 от Dynamixel XL330 — с законом управления по напряжению, противо-ЭДС и кулоновским, стрибековским и нагрузочным трением — вместо идеального PD-контроллера. Рандомизация окружения охватывает напряжение батареи, просадку напряжения под нагрузкой, задержку команд и величину трения. Варианты с люфтом обучаются против ±1° игрового зазора шестерён (2° суммарно) последовательно с каждым из 14 сервоприводов в RL-конфигурации. Поскольку реальный энкодер расположен на выходной стороне этого люфта, наблюдения читаются через него.
Обученные политики экспортируются в ONNX с нормализатором наблюдений, встроенным прямо в граф. Pollen предупреждает: разворачивать вручную сконвертированные чекпоинты нельзя именно по этой причине.
На самом роботе Rust-рантайм управляет циклом 50 Гц и шиной моторов. Каждая политика использует общее 61-мерное наблюдение актора: 48 измерений проприоцепции плюс команды для поворота (3), положения головы (4) и положения корпуса (6). Именно этот общий контракт позволяет политикам ходьбы, восстановления и трюков горячо подменять друг друга на лету. Среды, игнорирующие какой-то слот команды, дополняют его нулями, а не отбрасывают.
Опубликованный реестр охватывает 13 задач: отслеживание скорости, вставание, цикл «сидя–стоя», подбор с пола, удар по мячу (мяч 70 мм, 15 г, актор «слеп» к мячу), кувырок и пять сред для катания на роликах.
Ключевые выводы
- Двуногий робот с открытым ПО за $399, предзаказы открыты с 27 августа 2026 года, поставки планируются до Рождества.
- 15 моторов, камера, LiDAR, два IMU, NFC, Wi-Fi/Bluetooth, RK3566, около часа автономной работы.
- Политики обучаются в mjlab/MuJoCo Warp с PPO, на походку уходит 1–2 часа при 4096 средах.
- Перенос «симуляция → реальность» опирается на модель привода BAM плюс рандомизацию напряжения, задержки, трения и люфта ±1°.
- ПО распространяется по лицензии Apache-2.0; файлы механической и электронной конструкции не открыты.
