Pandas 数据分析:计算工具详解
2025-05-31 04:44:31作者:邬祺芯Juliet
概述
Pandas 作为 Python 数据分析的核心库,提供了丰富的计算工具来处理数据。本文将深入介绍 Pandas 中的各种计算功能,包括统计函数、窗口计算等高级特性,帮助数据分析师更好地利用 Pandas 进行数据处理。
统计函数
百分比变化计算
在时间序列分析中,计算百分比变化是一项常见需求。Pandas 提供了 pct_change() 方法:
import pandas as pd
import numpy as np
# 创建Series示例
ser = pd.Series(np.random.randn(8))
print(ser.pct_change())
# DataFrame示例
df = pd.DataFrame(np.random.randn(10, 4))
print(df.pct_change(periods=3)) # 计算3个周期后的变化
pct_change() 方法支持 periods 参数指定计算变化的周期数,以及 fill_method 参数处理缺失值。
协方差计算
协方差衡量两个变量的联合变化程度:
s1 = pd.Series(np.random.randn(1000))
s2 = pd.Series(np.random.randn(1000))
print(s1.cov(s2)) # 两个Series的协方差
# DataFrame协方差矩阵
frame = pd.DataFrame(np.random.randn(1000, 5),
columns=['a', 'b', 'c', 'd', 'e'])
print(frame.cov())
注意事项:
- 默认排除缺失值
- 结果矩阵可能不是正定的
- 支持
min_periods参数指定最小观测数
相关性计算
Pandas 支持多种相关性计算方法:
frame = pd.DataFrame(np.random.randn(1000, 5),
columns=['a', 'b', 'c', 'd', 'e'])
# 三种相关计算方法
print(frame['a'].corr(frame['b'])) # 默认Pearson
print(frame['a'].corr(frame['b'], method='spearman')) # Spearman
print(frame.corr()) # 整个DataFrame的相关矩阵
支持的相关方法:
- pearson(默认):标准相关系数
- kendall:Kendall Tau 相关系数
- spearman:Spearman 秩相关系数
高级特性:Pandas 0.24.0+ 支持自定义相关函数:
def histogram_intersection(a, b):
return np.minimum(np.true_divide(a, a.sum()),
np.true_divide(b, b.sum())).sum()
frame.corr(method=histogram_intersection)
数据排名
rank() 方法提供数据排名功能:
s = pd.Series(np.random.randn(5), index=list('abcde'))
s['d'] = s['b'] # 创建平局
print(s.rank()) # 默认平均排名
df = pd.DataFrame(np.random.randn(10, 6))
df[4] = df[2][:5] # 创建平局
print(df.rank(axis=1)) # 按行排名
排名方法选项:
- average:平局取平均(默认)
- min:平局取最小排名
- max:平局取最大排名
- first:按出现顺序排名
窗口函数
窗口函数是时间序列分析的重要工具,Pandas 提供了强大的窗口计算功能。
基本窗口操作
s = pd.Series(np.random.randn(1000),
index=pd.date_range('1/1/2000', periods=1000))
s = s.cumsum()
# 创建60天的滚动窗口
r = s.rolling(window=60)
print(r.mean()) # 计算滚动均值
窗口函数支持参数:
- window:窗口大小
- min_periods:最小非空观测数
- center:是否居中标签
窗口统计方法
Pandas 提供丰富的窗口统计方法:
| 方法 | 描述 |
|---|---|
| count() | 非空观测数 |
| sum() | 求和 |
| mean() | 均值 |
| median() | 中位数 |
| min() | 最小值 |
| max() | 最大值 |
| std() | 标准差 |
| var() | 方差 |
| skew() | 偏度 |
| kurt() | 峰度 |
| quantile() | 分位数 |
| apply() | 自定义函数 |
| cov() | 协方差 |
| corr() | 相关系数 |
高级窗口应用
自定义窗口函数:
def mad(x): # 平均绝对偏差
return np.fabs(x - x.mean()).mean()
s.rolling(window=60).apply(mad, raw=True)
加权窗口:
ser = pd.Series(np.random.randn(10),
index=pd.date_range('1/1/2000', periods=10))
# 三角加权窗口
print(ser.rolling(window=5, win_type='triang').mean())
# 高斯加权窗口
print(ser.rolling(window=5, win_type='gaussian').mean(std=0.1))
支持多种窗口类型:boxcar, triang, blackman, hamming, bartlett 等。
时间感知滚动窗口
Pandas 支持基于时间的滚动窗口:
dft = pd.DataFrame({'B': [0, 1, 2, np.nan, 4]},
index=pd.date_range('20130101 09:00:00',
periods=5,
freq='s'))
print(dft.rolling('2s').sum()) # 2秒滚动窗口
端点控制:
df = pd.DataFrame({'x': 1},
index=[pd.Timestamp('20130101 09:00:01'),
pd.Timestamp('20130101 09:00:02'),
pd.Timestamp('20130101 09:00:03'),
pd.Timestamp('20130101 09:00:04'),
pd.Timestamp('20130101 09:00:06')])
# 不同端点控制方式
df["right"] = df.rolling('2s', closed='right').x.sum() # 默认
df["both"] = df.rolling('2s', closed='both').x.sum()
df["left"] = df.rolling('2s', closed='left').x.sum()
df["neither"] = df.rolling('2s', closed='neither').x.sum()
居中窗口
ser.rolling(window=5).mean() # 默认右对齐
ser.rolling(window=5, center=True).mean() # 居中
总结
Pandas 的计算工具为数据分析提供了强大支持,从基本的统计函数到高级的窗口计算,覆盖了数据分析的常见需求。掌握这些工具可以显著提高数据处理效率和分析深度。
关键要点:
- 百分比变化、协方差和相关函数是基础统计分析的核心
- 窗口函数为时间序列分析提供灵活的计算方式
- 时间感知窗口和端点控制增强了时间序列处理的精确性
- 自定义函数扩展了分析的可能性
通过合理组合这些工具,可以构建复杂的数据分析流程,满足各种业务场景的需求。
登录后查看全文
热门项目推荐
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0153- DDeepSeek-V4-ProDeepSeek-V4-Pro(总参数 1.6 万亿,激活 49B)面向复杂推理和高级编程任务,在代码竞赛、数学推理、Agent 工作流等场景表现优异,性能接近国际前沿闭源模型。Python00
LongCat-Video-Avatar-1.5最新开源LongCat-Video-Avatar 1.5 版本,这是一款经过升级的开源框架,专注于音频驱动人物视频生成的极致实证优化与生产级就绪能力。该版本在 LongCat-Video 基础模型之上构建,可生成高度稳定的商用级虚拟人视频,支持音频-文本转视频(AT2V)、音频-文本-图像转视频(ATI2V)以及视频续播等原生任务,并能无缝兼容单流与多流音频输入。00
auto-devAutoDev 是一个 AI 驱动的辅助编程插件。AutoDev 支持一键生成测试、代码、提交信息等,还能够与您的需求管理系统(例如Jira、Trello、Github Issue 等)直接对接。 在IDE 中,您只需简单点击,AutoDev 会根据您的需求自动为您生成代码。Kotlin03
Intern-S2-PreviewIntern-S2-Preview,这是一款高效的350亿参数科学多模态基础模型。除了常规的参数与数据规模扩展外,Intern-S2-Preview探索了任务扩展:通过提升科学任务的难度、多样性与覆盖范围,进一步释放模型能力。Python00
skillhubopenJiuwen 生态的 Skill 托管与分发开源方案,支持自建与可选 ClawHub 兼容。Python0112
热门内容推荐
最新内容推荐
项目优选
收起
暂无描述
Dockerfile
733
4.75 K
Ascend Extension for PyTorch
Python
647
795
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
434
395
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
1.01 K
1.01 K
Claude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed.
Get Started
Rust
1.18 K
152
deepin linux kernel
C
30
16
华为昇腾面向大规模分布式训练的多模态大模型套件,支撑多模态生成、多模态理解。
Python
146
237
暂无简介
Dart
984
252
昇腾LLM分布式训练框架
Python
166
198
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
1.68 K
989