
MMPose 133点全身姿态估计一张图出全身关键点【免费下载链接】mmposeOpenMMLab Pose Estimation Toolbox and Benchmark.项目地址: https://gitcode.com/GitHub_Trending/mm/mmposeMMPose 是 OpenMMLab 开源的 PyTorch 姿态估计工具箱RTMW 系列模型在一张图里同时标出 133 个全身关键点身体 17 个关节、足部 10 个、面部 68 个、双手 42 个。它解决的是只检测躯干关节手脸脚全丢的问题适合做动作分析、虚拟形象驱动、AI 生图姿态参考的开发者新手也能跑通。H2 场景引入为什么 17 个关节不够用先说结论多数项目卡在手脸脚没检测这一步而不是身体检测不准。做舞蹈教学的产品会碰到这个情况模型能认出胳膊腿但手指位置全空动作像不像没法量化对比。做 AI 生图姿态参考的工程师也一样——ControlNet 的全身姿态参考需要 133 个点只有 17 点的模型直接不够用再拼一个手势模型又引入两次推理和坐标对齐的麻烦。还有一个隐性成本身体、手、脸、脚分开训练四个模型四个数据流水线、四份部署代码。MMPose 的 WholeBody 路线把这件事合成一条流水线一套配置、一次推理、一套 133 点输出。H2 核心能力一览能力解决的问题适合人群133 点全身姿态RTMW 系列一次推理出身体足脸双手免去多模型拼接产品开发者、生图/虚拟人管线17 点实时身体姿态RTMPose 系列单 CPU 上跑 90 FPS75.8 AP实时交互、资源受限设备手/脸/动物等 20 任务开箱即用不用自己造数据转换轮子多任务研究者完整部署链路ONNX/TensorRT/ncnn从 .pth 权重到边缘端可执行部署工程师配置模板全部放在 configs/ 下按任务分目录直接改参数就能训。H2 原理说人话给全身拍一次全身片把推理过程想象成体检。第一步人体检测器用 MMDetection 的检测模型先找出画面里每个人相当于护士把病人领进来第二步RTMW 模型在每个人框内输出 133 个关键点的坐标相当于拍一次片拿到全身报告——而不是像传统做法那样先拍四肢、再拍脸、再拍手三次排队还容易对不齐。RTMW 的关键设计是 SimCC 定位不直接回归坐标而是把关键点在 x 方向和 y 方向各落在第几个网格变成两个分类问题。分类比回归好训、更稳小模型也能拿到不错的精度这是它能做到轻量实时的主要原因。H2 快速上手三步跑通全身关键点第一步装。装 pip 包或源码安装pip install mmpose第二步选配置。全身模型配置在 configs/wholebody_2d_keypoint/rtmpose/按 m/l/x 选尺寸输入 256x192 或 384x288。第三步跑验证。用仓库自带的 demo 脚本demo/inferencer_demo.py对一张图做推理终端直接出带骨架标注的图python demo/inferencer_demo.py tests/data/coco/000000196141.jpg --pose2d rtmw-m如果要用自己的数据微调只需把 tools/train.py 配好数据根路径一条命令启动训练细节留给实际场景再研究。H2 真实性能数据RTMW 在 COCO-WholeBody 的实测下表数字全部来自仓库文档projects/rtmpose/benchmark/README.md 与 configs/wholebody_2d_keypoint/rtmpose/cocktail14/rtmw_cocktail14.mdCOCO-WholeBody val 集、133 个关键点整体精度模型输入分辨率Whole APWhole ARFLOPS实测时延RTMW-m256x19258.267.32.22 G13.5 msi7-11700 CPURTMW-l256x19266.074.6-23.4 msi7-11700 CPURTMW-l384x28870.178.04.52 G256x192 版1.44 msRTX 3090TRT FP16RTMW-x384x28870.278.1-1.75 msRTX 3090TRT FP16几点实用结论同一模型上 GPU TensorRT FP16 比 CPU 快一个数量级RTMW-l 256x192 从 23.4 ms 降到 1.44 ms约 16 倍。分辨率是精度和速度的直接开关256x192 升到 384x288Whole AP 从 66.0 提到 70.1代价是时延翻倍以上。仓库未标注参数量选型时建议以 FLOPS 为准测速可用 MMDeploy 的tools/profiler.py基准文档里附了完整命令。H2 实战场景三个典型用法舞蹈动作评分。项目目录下的 projects/just_dance 给出了现成方案用 133 点全身关键点抽帧把用户视频和教学视频的关键点序列做相似度计算输出跟跳得分。133 点里手指和脚尖是评分敏感项只有 17 点模型在这里明显不够用。AI 生图的姿态控制。DWPose 蒸馏的 133 点全身模型在 SD WebUI 的 ControlNet 里被广泛用作dw_openpose_full预处理器详见 projects/mmpose4aigc 里的 OpenPose 可视化脚本。输入一张参考图输出可被扩散模型消费的骨架图链路是单模型推理。健身动作纠错。健身教练场景需要肘膝等关节角度和重心偏移。MMPose 输出的关键点带置信度可以实时算关节夹角足部 10 点让重心和步态分析成为可能。配合 demo/webcam_api_demo 的摄像头 API 写法本地就能搭一套。H2 部署与进阶服务器和边缘两条路云端/服务器端仓库提供 Docker 镜像方案构建命令docker build -f docker/serve/Dockerfile -t mmpose-serve .服务参数在 docker/serve/config.properties 里配置模型路径与批次大小。边缘设备RTMPose 系列在 Jetson AGX Orin 上 TRT FP16 时延 2.79 msRTMW-m 133 点在骁龙 865 上 ncnn 时延 9 ms 级移动端可用 RTMPose-t/s 的 17 点模型。部署教程见 docs/zh_cn/user_guides/how_to_deploy.md。生态上多目标姿态可以接 RTMO 一阶段模型3D 方向有 projects/rtmpose3d视频场景可配合 MMTracking 做姿态跟踪。H2 常见问题选型和踩坑该选 RTMW 还是 RTMPoseRTMW 输出 133 个全身点RTMPose 输出 17 个身体点但更小更快。需要手脸脚选 RTMW只要躯干关节、追求极限帧率选 RTMPose。133 个关键点具体怎么分身体 17 足部 10 面部 68 双手 42。COCO-WholeBody 标准定义标注工具可看 tools/dataset_converters/labelstudio2coco.py 的实现。检测结果不准姿态也跟着飘是的top-down 管线里检测框就是输入。换更准的检测器demo/mmdetection_cfg/ 下有多个人体检测配置通常比调姿态模型见效快。小结MMPose 把身体、手、脸、脚分开测的老路合成了一条流水线133 点全身一次推理RTMW-l 在 COCO-WholeBody 拿到 70.1 Whole APGPU 上 1.44 ms。入门从demo/inferencer_demo.py一条命令开始进阶看 configs/wholebody_2d_keypoint/rtmpose/ 的训练配置。下一步值得看的是 3D 全身方向 RTMW3D2D 关键点直接喂给它就能重建三维姿态。【免费下载链接】mmposeOpenMMLab Pose Estimation Toolbox and Benchmark.项目地址: https://gitcode.com/GitHub_Trending/mm/mmpose创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考