← 返回开源专栏最新文章
跟踪观察、动作、物理、奖励、终止和策略更新。
microduck_rl architecturemjlab RL looprobot reward design
开始阅读 →01·阅读约 15 分钟·搜索意图: 知识学习
跟踪观察、动作、物理、奖励、终止和策略更新。
microduck_rl architecturemjlab RL looprobot reward design
→02·阅读约 15 分钟·搜索意图: 知识学习
按保真度、吞吐、资产、迁移和安全成本选择。
microduck_rl comparisonrobot simulator selectionmjlab vs real robot
→03·阅读约 14 分钟·搜索意图: 知识学习
覆盖固定环境、GPU 隔离、产物和硬件交接。
microduck_rl deploymentrobot RL GPU setupsim-to-real deployment
→04·阅读约 13 分钟·搜索意图: 知识学习
固定 mjlab 环境并检查观察、奖励、终止和轨迹。
microduck_rl quickstartMicroduck RL tutorialmjlab environment
→05·阅读约 17 分钟·搜索意图: 知识学习
以任务清单、策略卡、遥测和分阶段硬件门设计项目。
microduck_rl projectsim-to-real labrobot policy card
→06·阅读约 12 分钟·搜索意图: 知识学习
介绍 mjlab 环境、实验循环和 sim-to-real 安全门。
microduck_rlMicroduck reinforcement learningmjlab robotics
→07·阅读约 15 分钟·搜索意图: 知识学习
基准吞吐、显存、并行环境、检查点和策略审核。
microduck_rl performancerobot simulation benchmarkRL training cost
→08·阅读约 16 分钟·搜索意图: 知识学习
治理资产、检查点、遥测、控制接口和事件恢复。
microduck_rl securityrobotics RL safetysim-to-real operations
→09·阅读约 16 分钟·搜索意图: 知识学习
用确定性夹具追踪注册、重置、动作、奖励和导出。
microduck_rl source coderobot RL implementationmjlab environment internals
→