OpenPose人体姿态识别项目输出格式详解
概述
OpenPose是一个开源的实时多人2D/3D姿态估计库,能够检测图像或视频中的人体、手部、面部关键点。本文将详细介绍OpenPose项目的输出格式,包括可视化界面、JSON数据结构、关键点排序以及高级功能等。
可视化界面输出
OpenPose的可视化界面会显示原始图像与检测到的姿态叠加的效果。如下图所示,系统能够实时追踪人体的各种姿态动作:

JSON数据结构与可视化映射
OpenPose的JSON输出文件包含一系列关键点,这些关键点的排序与可视化界面的显示位置直接对应。以下是不同身体部位的关键点格式说明:
BODY_25姿态关键点格式
BODY_25模型包含25个身体关键点,是COCO模型的扩展版本,增加了脚部关键点:

COCO姿态关键点格式
COCO模型包含18个身体关键点:

面部关键点格式
面部关键点模型包含70个关键点:

手部关键点格式
每只手包含21个关键点:

JSON输出格式详解
OpenPose提供两种保存输出数据的方式:
-
标准JSON格式(使用
--write_json参数):- 每个JSON文件对应一帧图像
- 包含
people数组,每个元素代表一个检测到的人体 - 主要字段:
pose_keypoints_2d:2D姿态关键点(x,y,置信度)face_keypoints_2d:2D面部关键点hand_left_keypoints_2d:左手2D关键点hand_right_keypoints_2d:右手2D关键点- 3D关键点字段(需启用3D模式)
part_candidates:候选关键点(高级功能)
-
OpenCV格式(使用
--write_keypoint参数,已弃用):- 仅保存2D身体关键点
- 使用OpenCV的FileStorage格式(JSON/XML/YML)
关键点编程接口
C++/Python中的关键点排序
在编程接口中,关键点的排序与可视化显示一致。可以通过API获取不同模型的关键点映射关系:
C++接口示例
#include <openpose/pose/poseParameters.hpp>
const auto& poseBodyPartMappingBody25 = getPoseBodyPartMapping(PoseModel::BODY_25);
Python接口示例
poseModel = op.PoseModel.BODY_25
print(op.getPoseBodyPartMapping(poseModel))
Datum中的关键点格式(高级)
对于使用C++ API的高级开发者,Datum类中存储关键点的三种数据结构:
poseKeypoints:姿态关键点faceKeypoints:面部关键点handKeypoints:手部关键点(左手和右手)
访问示例:
// 访问姿态关键点
const auto x = poseKeypoints[{person, part, 0}];
const auto y = poseKeypoints[{person, part, 1}];
const auto score = poseKeypoints[{person, part, 2}];
读取保存的结果
OpenPose使用标准格式(JSON, PNG, JPG等)保存结果,可以使用各种编程语言的库来读取。对于C++开发者,可以使用fileStream.hpp中的工具函数:
#include <openpose/filestream/fileStream.hpp>
const auto data = loadData("result.json"); // 加载JSON数据
const auto image = loadImage("output.png"); // 加载图像
高级功能
相机矩阵输出格式
使用相机标定或3D模块时,相机矩阵的输出格式遵循特定规范,详细说明见相关文档。
热图输出
热图(heatmaps)是OpenPose内部使用的一种中间表示,可用于高级应用场景。热图的详细说明见相关文档。
总结
本文详细介绍了OpenPose项目的输出格式,包括可视化界面、JSON数据结构、编程接口以及高级功能。理解这些输出格式对于开发基于OpenPose的应用程序至关重要,无论是进行简单的姿态分析还是开发复杂的动作识别系统。
Kimi-K2.5Kimi K2.5 是一款开源的原生多模态智能体模型,它在 Kimi-K2-Base 的基础上,通过对约 15 万亿混合视觉和文本 tokens 进行持续预训练构建而成。该模型将视觉与语言理解、高级智能体能力、即时模式与思考模式,以及对话式与智能体范式无缝融合。Python00
GLM-4.7-FlashGLM-4.7-Flash 是一款 30B-A3B MoE 模型。作为 30B 级别中的佼佼者,GLM-4.7-Flash 为追求性能与效率平衡的轻量化部署提供了全新选择。Jinja00
VLOOKVLOOK™ 是优雅好用的 Typora/Markdown 主题包和增强插件。 VLOOK™ is an elegant and practical THEME PACKAGE × ENHANCEMENT PLUGIN for Typora/Markdown.Less00
PaddleOCR-VL-1.5PaddleOCR-VL-1.5 是 PaddleOCR-VL 的新一代进阶模型,在 OmniDocBench v1.5 上实现了 94.5% 的全新 state-of-the-art 准确率。 为了严格评估模型在真实物理畸变下的鲁棒性——包括扫描伪影、倾斜、扭曲、屏幕拍摄和光照变化——我们提出了 Real5-OmniDocBench 基准测试集。实验结果表明,该增强模型在新构建的基准测试集上达到了 SOTA 性能。此外,我们通过整合印章识别和文本检测识别(text spotting)任务扩展了模型的能力,同时保持 0.9B 的超紧凑 VLM 规模,具备高效率特性。Python00
KuiklyUI基于KMP技术的高性能、全平台开发框架,具备统一代码库、极致易用性和动态灵活性。 Provide a high-performance, full-platform development framework with unified codebase, ultimate ease of use, and dynamic flexibility. 注意:本仓库为Github仓库镜像,PR或Issue请移步至Github发起,感谢支持!Kotlin07
compass-metrics-modelMetrics model project for the OSS CompassPython00