python - 保存到 Parquet 会在 Dask.dataframe 中引发错误
问题描述
执行操作时:Dask.dataframe.to_parquet(data)
,如果data
通过给定数量的分区读取Dask
,并且您在删除一些列后尝试以镶木地板格式保存它,它会失败,例如以下错误:
FileNotFoundError: [Errno 2] No such file or directory: part.0.parquet'
有人遇到过同样的问题吗?
这是一个最小的示例 - 请注意方式 1 可以按预期工作,而方式 2 则不会:
import numpy as np
import pandas as pd
import dask.dataframe as dd
# -------------
# way 1 - works
# -------------
print('way 1 - start')
A = np.random.rand(200,300)
cols = np.arange(0, A.shape[1])
cols = [str(col) for col in cols]
df = pd.DataFrame(A, columns=cols)
ddf = dd.from_pandas(df, npartitions=11)
# compute and resave
ddf.drop(cols[0:11], axis=1)
dd.to_parquet(
ddf, 'error.parquet', engine='auto', compression='default',
write_index=True, overwrite=True, append=False)
print('way 1 - end')
# ----------------------
# way 2 - does NOT work
# ----------------------
print('way 2 - start')
ddf = dd.read_parquet('error.parquet')
# compute and resave
ddf.drop(cols[0:11], axis=1)
dd.to_parquet(
ddf, 'error.parquet', engine='auto', compression='default',
write_index=True, overwrite=True, append=False)
print('way 2 - end')
解决方案
overwrite=True
哦,太好了,由于选项,您发现了一个错误。因此,当设置选项时会发生什么overwrite=True
,dask 删除路径,请参阅这些行。现在,在您的示例ddf
中是懒惰的,因此当需要写入数据时,dask 会尝试读取文件,但它们现在已经消失了。
因此,一种解决方法是将新数据框保存到不同的路径中,然后删除旧文件夹并将新数据框的文件夹移动到旧文件夹(一些选项在这里)。
另一种选择是加载ddf
内存(如果适合),然后使用您的代码:
print('way 2 - start')
ddf = dd.read_parquet('error.parquet')
# # compute and persist in memory (note do not use
# # .compute because the dataframe will turn into
# # pandas data frame
ddf = ddf.drop(cols[0:11], axis=1)
ddf = ddf.persist()
dd.to_parquet(
ddf, 'error.parquet', engine='auto', compression='default',
write_index=True, overwrite=True, append=False)
# print('way 2 - end')
作为旁注,当您运行时ddf.drop(cols[0:11], axis=1)
,如果您希望在数据框中更改它,您需要分配它:
ddf = ddf.drop(cols[0:11], axis=1)
更新:这里有一些相关的讨论
推荐阅读
- sql - 提取测试运行历史记录的 TFS 数据仓库问题 - FactTestResult 表中的额外行(PointID、ChangeNumber)
- flutter - Flutter Forms:有没有办法根据某些条件更改输入文本的颜色?
- javascript - 我该怎么做才能让 Storage 中的图像知道它属于 Cloud Firestore 中的哪个文档?反应
- c - 是否将 for 循环中的一系列嵌套 if 语句统称为单个语句?
- postgresql - 尝试使用 psycopg2 undefinedTable 问题在 Heroku 上部署 Flask 应用程序
- opengl - 是否可以使用 GPU Grid 驱动程序在 Google Compute Engine 上将 OpenGL 升级到 4.3 版?
- node.js - Mongoose 查询中的嵌套 async/await
- erlang - 在 Zig 中实施 ERTS NIF 的工作流程是什么?
- fullpage.js - fullpage.js 动态添加部分:如何在部分内滚动
- php - SELECT SUM 内循环