09.10.2026

Microduck за $399: открытый двуногий робот Pollen Robotics и Hugging Face, которого можно обучить самому

Microduck за $399: открытый двуногий робот Pollen Robotics и Hugging Face, которого можно обучить самому

На этой неделе компания открыла предзаказы на Microduck — двуногого робота высотой 25 см, у которого каждое движение — ходьба, сидение, удары ногой, катание на роликах, подъём после падения — это нейросетевая политика, обученная в физическом симуляторе и перенесённая на реальное железо. Стоимость — $399. Среды обучения, функции вознаграждения, настройки рандомизации окружения и рецепт переноса «симуляция → реальность» полностью опубликованы на GitHub.

Microduck продолжает линию Reachy Mini, разошедшегося тиражом более 10 000 экземпляров, но переворачивает его концепцию: если Reachy Mini создавался, чтобы сидеть на столе и взаимодействовать с человеком, то Microduck создан, чтобы покинуть стол, падать и самостоятельно вставать.

Железо

Microduck имеет 25 см в высоту, 14 см в ширину и весит менее 800 г. В нём установлено 15 моторов, распределённых по ногам, шее и голове, плюс подвижный клюв, которым робот подбирает предметы с пола. Вычисления выполняет Rockchip RK3566 с ИИ-ускорителем, 1 ГБ оперативной памяти и 32 ГБ накопителя.

Набор сенсоров для такой цены необычно полный. Фронтальная камера расположена за отдельным индикатором использования. Установлены два инерциальных датчика — один в корпусе, другой в голове. Дальномер представлен компактным LiDAR и матрицей времени пролёта 8×8. Есть микрофоны и динамик, две NFC-антенны, а также Wi-Fi и Bluetooth. Питание — от съёмной батареи NP-F550 ёмкостью 2600 мА·ч, которой хватает примерно на час работы.

В коробке — семь готовых обученных движений, управляемых прилагаемым игровым контроллером ещё до того, как вы начнёте писать код: ходьба, приседание и вставание, удар, захват, катание на роликах и самостоятельное восстановление после падения. Робот не разговаривает. При первом включении каждый экземпляр генерирует собственную звуковую идентичность и сохраняет этот голос навсегда.

Как на самом деле обучаются поведенческие модели

Политики обучаются в репозитории microduck_rl, построенном на базе mjlab (MuJoCo Warp) с алгоритмом PPO. По данным Pollen, на CUDA-видеокарте при 4096 параллельных средах на пригодную походку уходит примерно один-два часа. Если локальной видеокарты нет, добавление флага —hf-jobs запускает ту же команду на инфраструктуре Hugging Face Jobs.

Ключевая часть переноса «симуляция → реальность» — модель привода. Каждый сервопривод использует модель BAM M6 от Dynamixel XL330 — с законом управления по напряжению, противо-ЭДС и кулоновским, стрибековским и нагрузочным трением — вместо идеального PD-контроллера. Рандомизация окружения охватывает напряжение батареи, просадку напряжения под нагрузкой, задержку команд и величину трения. Варианты с люфтом обучаются против ±1° игрового зазора шестерён (2° суммарно) последовательно с каждым из 14 сервоприводов в RL-конфигурации. Поскольку реальный энкодер расположен на выходной стороне этого люфта, наблюдения читаются через него.

Обученные политики экспортируются в ONNX с нормализатором наблюдений, встроенным прямо в граф. Pollen предупреждает: разворачивать вручную сконвертированные чекпоинты нельзя именно по этой причине.

На самом роботе Rust-рантайм управляет циклом 50 Гц и шиной моторов. Каждая политика использует общее 61-мерное наблюдение актора: 48 измерений проприоцепции плюс команды для поворота (3), положения головы (4) и положения корпуса (6). Именно этот общий контракт позволяет политикам ходьбы, восстановления и трюков горячо подменять друг друга на лету. Среды, игнорирующие какой-то слот команды, дополняют его нулями, а не отбрасывают.

Опубликованный реестр охватывает 13 задач: отслеживание скорости, вставание, цикл «сидя–стоя», подбор с пола, удар по мячу (мяч 70 мм, 15 г, актор «слеп» к мячу), кувырок и пять сред для катания на роликах.

Ключевые выводы

  • Двуногий робот с открытым ПО за $399, предзаказы открыты с 27 августа 2026 года, поставки планируются до Рождества.
  • 15 моторов, камера, LiDAR, два IMU, NFC, Wi-Fi/Bluetooth, RK3566, около часа автономной работы.
  • Политики обучаются в mjlab/MuJoCo Warp с PPO, на походку уходит 1–2 часа при 4096 средах.
  • Перенос «симуляция → реальность» опирается на модель привода BAM плюс рандомизацию напряжения, задержки, трения и люфта ±1°.
  • ПО распространяется по лицензии Apache-2.0; файлы механической и электронной конструкции не открыты.

Подписывайтесь на наш канал Дзен и группу ВК

MarkTechPost

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *