如何将行添加/追加到DaskDataFrame中的特定分区?

问题描述

我想将一行追加到DaskDataFrames中的特定分区。我试过很多方法,但没有一个是可行的。有人能帮我这个忙吗。提前感谢

我试过-

first_partition = df.partitions[0]
new_dd = first_partiton.append(row)
df.partitions[0] = new_dd

这不起作用

我甚至尝试使用map_artitions(),但即使是这个函数也不能真正帮助获取分区的元数据来修改特定分区。

是否可以将数据帧保存为拼图文件,然后只修改特定的拼图文件并将其保存回来?-我尝试了这个方法,但似乎也不起作用。


解决方案

使用map_partitions可以修改该特定分区。

然后通过切换到延迟对象来替换数据帧中已修改的分区来创建新帧,将延迟对象替换到列表中,然后切换回DaskDataFrame。


def append_row_dict(df, row_dict):
    small_df = pd.DataFrame(row_dict)
    return df.append(small_df)
    
p_df = pd.DataFrame({'a':np.arange(0,10)})

dask_df = dd.from_pandas(p_df,npartitions=4)
part_to_change = 1

new_partion = dask_df.get_partition(part_to_change).map_partitions(append_row_dict,{'a':[-1]})
list_of_delayed = dask_df.to_delayed()

## we only have 1 delayed object for 1 partition
assert new_partion.npartitions==1
list_of_delayed[part_to_change]=new_partion.to_delayed()[0]

new_dask_df = dd.from_delayed(list_of_delayed, meta=dask_df._meta)
new_dask_df.get_partition(part_to_change).compute()
    a
3   3
4   4
5   5
0   -1

相关文章