详解python pandas 分组统计的方法

2023-01-18 15:36:36 好代码

冬天是美丽的，冬天的雪花是雪白的，；冬天，是快乐的。冬天迈着轻盈的脚步向我们走来，秋天挥挥手向我们告别。冬天的雪花，它是大地妈妈最好的装饰品，是树姐姐的快乐精灵。

首先，看看本文所面向的应用场景：我们有一个数据集df，现在想统计数据中某一列每个元素的出现次数。这个在我们前面文章《如何画直方图》中已经介绍了方法，利用value_counts()就可以实现（具体回看文章）

但是，现在，我们考虑另外一个场景，我们假如要想统计其中两列元素出现次数呢？举个栗子：

在df数据集中，如果我们想统计A、B两列的元素的出现情况，也就是说，得到如下表。

从上面的最后一列可以看到，在A、B两列中，1 2 出现了2次，1 4 出现1次，1 6出现1次，2 3出现了2次， 2 4 出现1次， 3 1出现了1次

具体实现的代码：

import pandas as pd
df=pd.DataFrame([[1,2,2],[1,4,5],[1,2,4],[1,6,3],[2,3,1],[2,4,1],[2,3,5],[3,1,1]],columns=['A','B','C'])

gp=df.groupby(by=['A','B'])
gp.size()

所以，如果想统计更多列，只要在groupby()中的by参数添加就可以，例如统计3列。

gp=df.groupby(by=['A','B','C'])

由gp.size()得到的是可以mulitiindex Series。

下面，要转化成DataFrame的结构。

newdf=gp.size()
newdf.reset_index(name='times')

其中name中参数就是我们可以为最后一列添加新的名字，例如这里的“times”

这个时候newdf已经是DataFrame的类型了。

到此这篇关于详解python pandas 分组统计的方法就介绍到这了。信对了人，是快乐，是欣慰，是骄傲，是无言的幸福；信错了人，是悲伤，是愤怒，是委屈，甚至致命。更多相关详解python pandas 分组统计的方法内容请查看相关栏目，小编编辑不易，再次感谢大家的支持！

全站频道