新闻中心
利用Pandas pivot 函数实现多值列的水平透视

本教程详细阐述如何使用Pandas `DataFrame.pivot` 函数对包含多个值列的数据进行水平转置。通过将特定的分类列(如财务比率)与原有的年份值列结合,创建新的、扁平化的列标题,从而将长格式数据转换为宽格式。文章将通过示例代码演示如何处理`pivot`操作后产生的多级列,并将其重命名为更具可读性的单一列名,最终实现数据结构的高效重塑。
在数据分析和处理中,经常需要对数据表进行重塑(Reshaping),其中一种常见的需求是将“长格式”数据转换为“宽格式”,特别是在处理具有多个度量值(value columns)和分类维度(category columns)时。本教程将专注于如何使用Pandas库中的pivot函数,有效地实现这种带有多个值列的水平转置,并解决由此产生的多级列(MultiIndex columns)问题。
原始数据结构分析
我们通常会遇到以下形式的数据,其中包含一个或多个标识符列(如Ticker)、一个分类列(如Financial Ratio)以及多个代表不同时间点或度量值的列(如2001, 2002, 2003):
Ticker Financial Ratio 2001 2002 2003 ARKR Net Profit Margin -0.1931 0.052 -0.0187 ARKR Return on Assets 0 0 0 ARKR Current Ratio 1.3419 1.2096 0.7031 ARMK Net Profit Margin -0.1931 0.052 -0.0187 ARMK Return on Assets 0 0 0 ARMK Current Ratio 1.3419 1.2096 0.7031
在这个例子中,Ticker是唯一的标识符,Financial Ratio是需要转置为新列名的分类信息,而2001, 2002, 2003则是我们希望保留并与Financial Ratio结合作为新列值的数据。
目标数据结构
我们的目标是将上述数据转换为以下宽格式:
Ticker 2001 Current Ratio 2001 Net Profit Margin 2001 Return on Assets 2002 Current Ratio ... 0 ARKR 1.3419 -0.1931 0.0 1.2096 ... 1 ARMK 1.3419 -0.1931 0.0 1.2096 ...
可以看到,Ticker仍然作为唯一的标识符,而年份(如2001)和财务比率(如Net Profit Margin)被组合成新的列标题,每个单元格包含对应的值。
使用 pandas.DataFrame.pivot 实现水平转置
Pandas的DataFrame.pivot函数是实现这种转置的核心工具。它接受三个主要参数:index、columns和可选的values。
- index: 指定哪些列应该成为新的DataFrame的索引。
- columns: 指定哪些列的唯一值应该成为新的DataFrame的列标题。
- values: 指定哪些列的值应该填充到新的DataFrame中。
关键在于,当原始数据中存在多个值列(本例中的2001, 2002, 2003)且我们希望它们全部参与转置时,可以省略values参数。此时,pivot函数会自动将所有未被指定为index或columns的列视为值列进行处理,并生成一个多级列(MultiIndex columns)的DataFrame。
让我们通过一个示例来演示这个过程。首先,模拟原始数据:
import pandas as pd import io # 模拟原始数据 data = """Ticker,Financial Ratio,2001,2002,2003 ARKR,Net Profit Margin,-0.1931,0.052,-0.0187 ARKR,Return on Assets,0,0,0 ARKR,Current Ratio,1.3419,1.2096,0.7031 ARMK,Net Profit Margin,-0.1931,0.052,-0.0187 ARMK,Return on Assets,0,0,0 ARMK,Current Ratio,1.3419,1.2096,0.7031 """ df = pd.read_csv(io.StringIO(data)) print("原始DataFrame:") print(df) # 执行pivot操作,不指定values参数 pivoted_df = df.pivot(index="Ticker", columns="Financial Ratio") print("\n经过pivot操作后的DataFrame (带有MultiIndex列):") print(pivoted_df)
执行上述代码后,pivoted_df的输出将显示一个多级列结构:
Musho
AI网页设计Figma插件
76
查看详情
经过pivot操作后的DataFrame (带有MultiIndex列): Financial Ratio Current Ratio Net Profit Margin Return on Assets Current Ratio Net Profit Margin Return on Assets Current Ratio Net Profit Margin Return on Assets Ticker ARKR 1.3419 -0.1931 0.0 1.2096 0.052 0.0 0.7031 -0.0187 0.0 ARMK 1.3419 -0.1931 0.0 1.2096 0.052 0.0 0.7031 -0.0187 0.0
可以看到,列名现在是两级的:第一级是原始的值列(2001, 2002, 2003),第二级是Financial Ratio的各个唯一值。
扁平化多级列
为了达到目标数据结构,我们需要将这些多级列扁平化为单一的、有意义的列名,例如“2001 Net Profit Margin”。这可以通过遍历pivoted_df.columns并使用f-string(或str.format)来组合列名实现。
# 扁平化多级列
# pivoted_df.columns 是一个MultiIndex对象,包含 (年份, 财务比率) 的元组
pivoted_df.columns = [f"{year} {ratio}" for year, ratio in pivoted_df.columns]
print("\n扁平化列名后的DataFrame:")
print(pivoted_df)输出结果:
扁平化列名后的DataFrame:
2001 Current Ratio 2001 Net Profit Margin 2001 Return on Assets 2002 Current Ratio 2002 Net Profit Margin 2002 Return on Assets 2003 Current Ratio 2003 Net Profit Margin 2003 Return on Assets
Ticker
ARKR 1.3419 -0.1931 0.0 1.2096 0.052 0.0 0.7031 -0.0187 0.0
ARMK 1.3419 -0.1931 0.0 1.2096 0.052 0.0 0.7031 -0.0187 0.0现在,列名已经符合我们的要求。
最终调整:重置索引
如果希望将Ticker列从索引中移出,使其成为一个普通的列,可以使用reset_index()方法。
# 重置索引,将'Ticker'从索引变为普通列
final_df = pivoted_df.reset_index()
print("\n最终重塑的DataFrame:")
print(final_df)最终输出:
最终重塑的DataFrame: Ticker 2001 Current Ratio 2001 Net Profit Margin 2001 Return on Assets 2002 Current Ratio 2002 Net Profit Margin 2002 Return on Assets 2003 Current Ratio 2003 Net Profit Margin 2003 Return on Assets 0 ARKR 1.3419 -0.1931 0.0 1.2096 0.052 0.0 0.7031 -0.0187 0.0 1 ARMK 1.3419 -0.1931 0.0 1.2096 0.052 0.0 0.7031 -0.0187 0.0
这正是我们期望的最终数据结构。
完整代码示例
import pandas as pd
import io
# 模拟原始数据
data = """Ticker,Financial Ratio,2001,2002,2003
ARKR,Net Profit Margin,-0.1931,0.052,-0.0187
ARKR,Return on Assets,0,0,0
ARKR,Current Ratio,1.3419,1.2096,0.7031
ARMK,Net Profit Margin,-0.1931,0.052,-0.0187
ARMK,Return on Assets,0,0,0
ARMK,Current Ratio,1.3419,1.2096,0.7031
"""
df = pd.read_csv(io.StringIO(data))
# 1. 执行pivot操作,将'Ticker'设为索引,'Financial Ratio'设为列
# 由于未指定values,所有剩余的年份列将作为值列,导致MultiIndex列
pivoted_df = df.pivot(index="Ticker", columns="Financial Ratio")
# 2. 扁平化MultiIndex列名
# 遍历MultiIndex的每一对 (年份, 财务比率),并组合成新的字符串
pivoted_df.columns = [f"{year} {ratio}" for year, ratio in pivoted_df.columns]
# 3. 重置索引,将'Ticker'从索引变为普通列
final_df = pivoted_df.reset_index()
print("最终重塑的DataFrame:")
print(final_df)注意事项与最佳实践
-
pivot vs pivot_table:
- df.pivot() 要求index和columns的组合必须是唯一的,否则会引发ValueError。它不执行任何聚合操作。
- df.pivot_table() 更通用,即使index和columns的组合不唯一,它也会通过aggfunc参数指定的聚合函数(默认为mean)来处理重复值。如果你的数据可能存在重复组合且需要聚合,应优先考虑pivot_table。
- 数据完整性: 确保用于index和columns的列没有缺失值,否则可能导致意外结果。
- 列名生成灵活性: 扁平化多级列时,你可以根据具体需求自定义列名的生成逻辑。例如,如果希望年份在后,可以写成f"{ratio} {year}"。
- 性能考量: 对于非常大的DataFrame,pivot操作可能会消耗较多的内存和计算资源。在处理大数据时,应注意优化。
总结
通过本教程,我们学习了如何利用Pandas的DataFrame.pivot函数,结合对多级列的扁平化处理,高效地将包含多个值列的长格式数据转换为宽格式。这种数据重塑技术在财务分析、报告生成以及其他需要多维度展示数据的场景中非常实用。掌握这一技巧,能显著提升数据处理的灵活性和效率。
以上就是利用Pandas pivot 函数实现多值列的水平透视的详细内容,更多请关注其它相关文章!
# 可以看到
# 会议推广营销方案
# 下沙抖音关键词排名公司
# 网站建设项目怎么写
# seo查询工具网址
# 怎么搜品牌网站推广商品
# 南山企业网站建设推广
# 推特自拍关键词排名
# 服装热点营销推广
# 网站推广运作方法
# 品牌营销推广著作有哪些
# 如何使用
# 成新
# go
# 设为
# 遍历
# 原始数据
# 转换为
# 扁平化
# 数据结构
# 多个
# 聚合函数
# csv
# 工具
# 大数据
相关栏目:
【
科技资讯46185 】
【
网络学院92790 】
相关推荐:
mysql通配符支持数字匹配吗_mysql通配符能否用于数字匹配的解析
css子元素高度不一致导致布局错位怎么办_使用align-items:stretch解决高度差异
Node.js CSV 数据处理:基于字段值条件过滤整条记录的策略
Win11怎么查看电脑配置_Win11硬件配置检测工具使用
“音游” × “怪文书” 题材的节奏冒险游戏 《晕晕电波症候群》确定于2026年4月发售!
SteamMachine定价或为699美元 大家想入手吗?
c++中的std::basic_string的SSO优化_c++短字符串优化深度解析
在J*a中如何在J*a中使用异常机制记录错误日志_异常日志实践经验
快手极速版在线观看 官方网页版登录地址
2026春节假期票务安排_2026春节放假购票指南
期待已久:小米17 Ultra、小米首款NAS本月登场
小红书怎么解除第三方平台绑定_小红书多平台登录解绑方法介绍
如何有效阻止外部脚本意外修改内联样式的高度属性
厨房不锈钢水槽发黑生锈怎么处理_水槽用可乐+锡纸2分钟抛亮如新
铁路12306改签能改到更早的车次吗_铁路12306改签提前车次规则
抖音未来赚钱的新趋势 2025年值得关注的变现风口分析
QQ官网正版登录链接 QQ在线登录入口最新
QQ邮箱登录平台入口 QQ邮箱网页版邮箱官方入口
Win10怎么制作U盘启动盘 Win10系统安装U盘制作教程【详解】
Go与Ruby之间实现AES加密互通:CFB模式下的密钥长度匹配策略
微博网页版首页入口 微博电脑端官网登录链接
Go语言中动态执行代码字符串的策略与实践
在J*a中如何隐藏复杂性_使用门面模式组织对象交互
2025俄罗斯Yandex最新入口 官方网站地址及浏览器下载指南
顺丰快件物流信息 官方网站查询入口
J*a里如何使用N*igableMap进行导航操作_可导航Map操作技巧解析
Python中高效且防溢出的双曲正弦计算:基于对数空间的优化策略
Win10快速启动功能利弊分析 Win10开启或关闭快速启动教程【技巧】
AO3官方在线访问地址 Archive of Our Own最新镜像合集
QQ邮箱网页版快速登录 QQ邮箱邮箱账号官方入口地址
不会效仿卡普空!《铁拳》制作人澄清:不采取赛事付费|直播|
JUnit5/Mockito:优雅测试内部依赖与异常处理的实践
c++中的std::launder有什么实际用途_c++对象生命周期与指针优化
Tabulator表格日期时间排序问题及自定义解决方案
UE5.7引擎表现爆炸优化无敌!5090跑4K稳定60FPS
拼多多赚钱渠道_拼多多收益来源
ExcelARRAYTOTEXT函数怎么自定义分隔符输出数组文本_ARRAYTOTEXT实现动态生成SQL语句
Tailwind CSS line-clamp 布局问题解析与修复指南
Python多版本共存与虚拟环境管理深度指南
C++编译期如何执行复杂计算_C++模板元编程(TMP)技巧与应用
windows10怎么关闭系统提示音_windows10彻底静音设置方法
微博网页版主页入口 微博官方网站免登录访问
解决Django多数据库/多Schema环境下外键迁移问题
Golang如何实现微服务鉴权与权限控制_Golang微服务鉴权与权限管理实践
MongoDB聚合管道:正确匹配对象数组中_id的方法
c++ 命名空间怎么用 c++ namespace使用指南
学习通网页版快速入口 学习通官网网页版直接打开
响应式CSS Grid布局:优化网格项在小屏幕下的堆叠与宽度适配
CSS Flexbox与媒体查询:实现响应式布局中元素的并排与堆叠
126邮箱手机版登录官网2026_126手机邮箱免费入口最新


2025-10-31
浏览次数:次
返回列表
quot;""
df = pd.read_csv(io.StringIO(data))
print("原始DataFrame:")
print(df)
# 执行pivot操作,不指定values参数
pivoted_df = df.pivot(index="Ticker", columns="Financial Ratio")
print("\n经过pivot操作后的DataFrame (带有MultiIndex列):")
print(pivoted_df)