熊猫：根据条件在数据框组的末尾删除行

gorjan 发表于 Dev

戈尔扬

假设我有以下数据框：

df = pd.DataFrame({"id": [1, 1, 1, 2, 2, 2, 3, 3, 3, 3], "date": [pd.Timestamp(2002, 2, 2), pd.Timestamp(2003, 3, 3), pd.Timestamp(2004, 4, 4), pd.Timestamp(2005, 5, 5), pd.Timestamp(2006, 6, 6), pd.Timestamp(2007, 7, 7), pd.Timestamp(2008, 8, 8), pd.Timestamp(2009, 9, 9), pd.Timestamp(2010, 10, 10), pd.Timestamp(2011, 11, 11)], "numeric": [0.9, 0.4, 0.2, 0.6, np.nan, 0.8, 0.7, np.nan, np.nan, 0.5], "nominal": [0, 1, 0, 1, 0, 0, 0, 1, 1, 1]})

我要实现的是在每个组的末尾剥离行（假设行按分组id），这样行将被删除，直到non-nan该numeric列出现一个值为止。此外，每个组的最后一行将始终具有non-nan该numeric列的值，并且应始终删除最后一行。因此，结果数据帧为：

result_df = pd.DataFrame({"id": [1, 1, 2, 3], "date": [pd.Timestamp(2002, 2, 2), pd.Timestamp(2003, 3, 3), pd.Timestamp(2005, 5, 5), pd.Timestamp(2008, 8, 8)], "numeric": [0.9, 0.4, 0.6, 0.7], "nominal": [0, 1, 1, 0]})

关于如何获得结果数据帧的更多说明：

对于id == 1只有自上次一个存在的值前行中的最后一行被删除numeric列。
对于id == 2最后两行，因为默认情况下会删除最后一行，所以最后一行之前的行具有nan值，因此将其删除。
对于id == 3最后三行，因为默认情况下删除了最后一行，并且第一个non-nan值在从下往下数的第四行，所以将其删除。

此外，我目前正在做的是：

df.groupby("id", as_index=False).apply(lambda x: x.iloc[:-1]).reset_index(drop=True)

但是，这只会删除每个组的最后一行，我想N根据上述条件删除最后一行。

如果您需要更多信息，请告诉我，期待您的答复！

克尔科罗夫

对于特定示例，您刚刚发布了在分组操作之前删除NaN的方法：

df = df.dropna().groupby('id').apply(lambda x: x.iloc[:-1]).reset_index(drop=True)

df
Out[58]: 
   id       date  numeric  nominal
0   1 2002-02-02      0.9        0
1   1 2003-03-03      0.4        1
2   2 2005-05-05      0.6        1
3   3 2008-08-08      0.7        0

如果您具有不连续的NaN，并且只想删除NaN的最后一块：

def strip_rows(X):    
    X = X.iloc[:-1, :]
    while pd.isna(X.iloc[-1, 2]):        
        X = X.iloc[:-1, :]
    return X

df_1 = pd.DataFrame({"id": [1, 1, 1, 2, 2, 2, 3, 3, 3, 3, 3, 3],
                   "date": [pd.Timestamp(2002, 2, 2),
                            pd.Timestamp(2003, 3, 3), 
                            pd.Timestamp(2004, 4, 4), 
                            pd.Timestamp(2005, 5, 5), 
                            pd.Timestamp(2006, 6, 6),
                            pd.Timestamp(2007, 7, 7),
                            pd.Timestamp(2008, 8, 8),
                            pd.Timestamp(2009, 9, 9),
                            pd.Timestamp(2010, 10, 10), 
                            pd.Timestamp(2011, 11, 11),
                            pd.Timestamp(2011, 12, 12),
                            pd.Timestamp(2012, 1, 1)],
                    "numeric": [0.9, 0.4, 0.2, 0.6, np.nan, 0.8, 0.7, np.nan, np.nan, 0.5, np.nan, 0.3],
                    "nominal": [0, 1, 0, 1, 0, 0, 0, 1, 1, 1, 0, 1]})

df_2 = df_1.groupby('id').apply(strip_rows).reset_index(drop=True)

df_1
Out[151]: 
    id       date  numeric  nominal
0    1 2002-02-02      0.9        0
1    1 2003-03-03      0.4        1
2    1 2004-04-04      0.2        0
3    2 2005-05-05      0.6        1
4    2 2006-06-06      NaN        0
5    2 2007-07-07      0.8        0
6    3 2008-08-08      0.7        0
7    3 2009-09-09      NaN        1
8    3 2010-10-10      NaN        1
9    3 2011-11-11      0.5        1
10   3 2011-12-12      NaN        0
11   3 2012-01-01      0.3        1

df_2
Out[152]: 
   id       date  numeric  nominal
0   1 2002-02-02      0.9        0
1   1 2003-03-03      0.4        1
2   2 2005-05-05      0.6        1
3   3 2008-08-08      0.7        0
4   3 2009-09-09      NaN        1
5   3 2010-10-10      NaN        1
6   3 2011-11-11      0.5        1

本文收集自互联网，转载请注明来源。

如有侵权，请联系 [email protected] 删除。

编辑于 2020-12-28

我来说两句

0 条评论

登录后参与评论

上一篇：如何将输入字段包装在自定义元素中？

熊猫：根据条件在数据框组的末尾删除行

熊猫：根据条件在数据框组的末尾删除行

Linux的官方Adobe Flash存储库是否已过时？

在 Python 2.7 中。如何从文件中读取特定文本并分配给变量

如何检查字符串输入的格式

如何使用HttpClient的在使用SSL证书，无论多么“糟糕”是

Modbus Python施耐德PM5300

错误TS2365：运算符'！=='无法应用于类型'“（”'和'“）”'

用日期数据透视表和日期顺序查询

检查嵌套列表中的长度是否相同

Java Eclipse中的错误13，如何解决？

ValueError：尝试同时迭代两个列表时，解包的值太多（预期为 2）

如何监视应用程序而不是单个进程的CPU使用率？

如何自动选择正确的键盘布局？-仅具有一个键盘布局

ES5的代理替代

在令牌内联程序集错误之前预期为 ')'

有什么解决方案可以将android设备用作Cast Receiver？

套接字无法检测到断开连接

如何在JavaScript中获取数组的第n个元素？

如何将sklearn.naive_bayes与（多个）分类功能一起使用？

应用发明者仅从列表中选择一个随机项一次

在Windows 7中无法删除文件（2）

ggplot：对齐多个分面图-所有大小不同的分面