python - 如果字符串行与列表匹配,则根据行重新移动特定列
问题描述
好的,这是我想要执行的真实数据框,用于使用列表对特定值进行重塑。所以我有这个数据框来重塑。
[Out] = df
Keterangan Q2 2019 Q2 2018
0 Kas 22686796.0 27421625.0
1 Giro pada bank indonesia 68409507.0 71159442.0
2 Giro pada bank lain 15675129.0 12584938.0
3 Giro pada bank lain pihak ketiga 88548.0 92417.0
4 Giro pada bank lain pihak berelasi 41391653.0 84668151.0
5 Penempatan pada bank indonesia dan bank lain 1825890.0 2349900.0
6 Penempatan pada bank indonesia dan bank lain pihak ketiga 28443695.0 30264303.0
7 Penempatan pada bank indonesia dan bank lain pihak berelasi 144798482.0 154020507.0
8 Efek-efek yang diperdagangkan -758.0 -758.0
9 Efek-efek yang diperdagangkan pihak ketiga 24081797.0 9396553.
10 Efek-efek yang diperdagangkan pihak berelasi 20253524.0 20584035.0
11 Cadangan kerugian penurunan nilai pada efek-efek 2713267.0 6858655.0
12 Efek yang dibeli dengan janji dijual kembali 7014696.0 10165310.0
13 Wesel ekspor dan tagihan lainnya 573030.0 1477693.0
14 Wesel ekspor dan tagihan lainnya pihak ketiga 335008.0 485810.0
15 Wesel ekspor dan tagihan lainnya pihak berelasi 748120507.0 709223043.0
16 Tagihan akseptasi 113999397.0 110787114.0
17 Tagihan akseptasi pihak ketiga -38848157.0 -35017982.0
18 Tagihan akseptasi pihak berelasi NaN NaN
19 Tagihan derivatif NaN NaN
20 Tagihan derivatif pihak ketiga NaN NaN
21 Pinjaman yang diberikan NaN NaN
22 Pinjaman yang diberikan pihak ketiga NaN NaN
23 Pinjaman yang diberikan pihak berelasi NaN NaN
24 Cadangan kerugian NaN NaN
我想用我以前的特定列表来重塑它,这是我的列表。
my_list = ['Giro pada bank lain', 'Penempatan pada bank indonesia dan bank lain', 'Efek-efek yang diperdagangkan', 'Wesel ekspor dan tagihan lainnya', 'Tagihan akseptasi', 'Tagihan derivatif', 'Pinjaman yang diberikan']
因此,如果列 ['Keterangan'] 上的字符串与列表中的项目字符串匹配,它将重塑特定列 [Q2 2019] 和 [Q2 2018] 向下。所以,这是我想要的数据框。
[Out] : df1
Keterangan Q2 2019 Q2 2018
0 Kas 22686796.0 27421625.0
1 Giro pada bank indonesia 68409507.0 71159442.0
2 Giro pada bank lain Nan Nan
3 Giro pada bank lain pihak ketiga 15675129.0 12584938.0
4 Giro pada bank lain pihak berelasi 88548.0 92417.0
5 Penempatan pada bank indonesia dan bank lain Nan Nan
6 Penempatan pada bank indonesia dan bank lain pihak ketiga 41391653.0 84668151.0
7 Penempatan pada bank indonesia dan bank lain pihak berelasi 1825890.0 2349900.0
8 Efek-efek yang diperdagangkan Nan Nan
9 Efek-efek yang diperdagangkan pihak ketiga 28443695.0 30264303.0
10 Efek-efek yang diperdagangkan pihak berelasi 144798482.0 154020507.0
11 Cadangan kerugian penurunan nilai pada efek-efek -758.0 -758.0
12 Efek yang dibeli dengan janji dijual kembali 24081797.0 9396553
13 Wesel ekspor dan tagihan lainnya Nan Nan
14 Wesel ekspor dan tagihan lainnya pihak ketiga 20253524.0 20584035.0
15 Wesel ekspor dan tagihan lainnya pihak berelasi 2713267.0 6858655.0
16 Tagihan akseptasi Nan Nan
17 Tagihan akseptasi pihak ketiga 7014696.0 10165310.0
18 Tagihan akseptasi pihak berelasi 573030.0 1477693.0
19 Tagihan derivatif NaN NaN
20 Tagihan derivatif pihak ketiga 335008.0 485810.0
21 Pinjaman yang diberikan NaN NaN
22 Pinjaman yang diberikan pihak ketiga 748120507.0 709223043.0
23 Pinjaman yang diberikan pihak berelasi 113999397.0 110787114.0
24 Cadangan kerugian -38848157.0 -35017982.0
我必须尝试一些代码来重塑它,将 df.index 移动到另一列并将列 ['Keterangan'] 切换为索引。
match = df['Keterangan'].str.fullmatch('|'.join(entry for entry in my_list))
df['shift'] = match.cumsum()
df['index'] = df.index
df.set_index('Keterangan', drop=True, inplace=True)
及其制作 shift 和 swith 索引的工作。
Q2 2019 Q2 2018 shift index
Keterangan
Kas 22686796.0 27421625.0 0 0
Giro pada bank indonesia 68409507.0 71159442.0 0 1
Giro pada bank lain 15675129.0 12584938.0 1 2
Giro pada bank lain pihak ketiga 88548.0 92417.0 1 3
Giro pada bank lain pihak berelasi 41391653.0 84668151.0 1 4
Penempatan pada bank indonesia dan bank lain 1825890.0 2349900.0 2 5
Penempatan pada bank indonesia dan bank lain pihak ketiga 28443695.0 30264303.0 2 6
Penempatan pada bank indonesia dan bank lain pihak berelasi 144798482.0 154020507.0 2 7
Efek-efek yang diperdagangkan -758.0 -758.0 3 8
Efek-efek yang diperdagangkan pihak ketiga 24081797.0 9396553.0 3 9
Efek-efek yang diperdagangkan pihak berelasi 20253524.0 20584035.0 3 10
Cadangan kerugian penurunan nilai pada efek-efek yang 2713267.0 6858655.0 3 11
Efek yang dibeli dengan janji dijual kembali 7014696.0 10165310.0 3 12
Wesel ekspor dan tagihan lainnya 573030.0 1477693.0 4 13
Wesel ekspor dan tagihan lainnya pihak ketiga 335008.0 485810.0 4 14
Wesel ekspor dan tagihan lainnya pihak berelasi 748120507.0 709223043.0 4 15
Tagihan akseptasi 113999397.0 110787114.0 5 16
Tagihan akseptasi pihak ketiga -38848157.0 -35017982.0 5 17
Tagihan akseptasi pihak berelasi NaN NaN 5 18
Tagihan derivatif NaN NaN 6 19
Tagihan derivatif pihak ketiga NaN NaN 6 20
Pinjaman yang diberikan NaN NaN 7 21
Pinjaman yang diberikan pihak ketiga NaN NaN 7 22
Pinjaman yang diberikan pihak berelasi NaN NaN 7 23
Cadangan kerugian NaN NaN 7 24
接下来,我想要一个执行最后一个代码来重新移动列,
df = df.apply(lambda row: df.shift(row.at['shift']).iloc[row.at['index']],
axis='columns')
df[list(match)] = np.nan
但是,它发生了一个问题..它是这样说的。但是,我已经检查过 df['index'] 类型是 int64。为什么这个专栏不能应用 iloc?
TypeError Traceback (most recent call last)
<ipython-input-67-0f4a937e0002> in <module>()
----> 1 df = df.apply(lambda row: df.shift(row.at['shift']).iloc[row.at['index']],
axis='columns')
2 df[list(match)] = np.nan
/usr/local/lib/python3.6/dist-packages/pandas/core/indexing.py in _getitem_axis(self, key, axis)
1491 key = item_from_zerodim(key)
1492 if not is_integer(key):
-> 1493 raise TypeError("Cannot index by location index with a non-integer key")
1494
1495 # validate the location
TypeError: Cannot index by location index with a non-integer key
如何解决问题并获得我希望的 df1 ?任何人都可以解决它?
解决方案
我现在明白是什么导致了这个问题。如果你看一下结果
match = df['Keterangan'].str.fullmatch('|'.join(entry for entry in my_list))
df['shift'] = match.cumsum()
df['index'] = df.index
columns = df.columns
df = df.apply(lambda row: print(row), axis='columns')
你会看到类似的东西
Q2 2019 22686796.0
Q2 2018 27421625.0
shift 0.0
index 0.0
Name: Kas, dtype: float64
Q2 2019 68409507.0
Q2 2018 71159442.0
shift 0.0
index 1.0
Name: Giro pada bank indonesia, dtype: float64
Q2 2019 15675129.0
Q2 2018 12584938.0
shift 1.0
index 2.0
Name: Giro pada bank lain, dtype: float64
...
这些行是具有统一类型的系列,在float64
这里。
从文档:
传递给函数的对象是Series对象...
一些进一步的观点。如果你看简单的例子
df = pd.DataFrame({'A': [1, 2], 'B': [1., 2.]})
print(df.iloc[0], 'w')
df = pd.DataFrame({'A': ['a', 'b'], 'B': [1., 2.]})
print(df.iloc[0])
您将看到以下输出
A 1.0
B 1.0
Name: 0, dtype: float64
A a
B 1
Name: 0, dtype: object
两者都是系列。首先,Pandas 看到所有类型都是数字的,因此它选择了最好的数字类型来适应这两个值的类型,即float
. 其次,由于字符串的原因,Pandas 选择了object
,它几乎可以容纳所有类型。
在您的其他问题的DataFrame中,2. 和 3. 列中有一个字符串('Nan'
不是NaN
!),它导致类型object
,以下也导致. 此处的 DataFrame 在2. 和 3. 列中有 tpye(类型is ),因此也在变量中。这就是为什么原始代码适用于第一个示例但不适用于此处的原因。(至少我是这么认为的,我可能是错的。)object
row
apply
float
NaN
float
float
row
我已经相应地调整了我的建议中的代码(int
演员表)。
推荐阅读
- spring-boot - 由于解析错误,未调用 Spring-Kafka 消费者的侦听器方法
- angular - 如何保持与角度的连接
- python-3.x - 无法将列表添加到 pandas DataFrame 列
- python - 如何找出列表中的第一个重复数字?
- sql - Presto - 返回数组行的 1 个元素
- javascript - 从 javascript 列表中仅删除一个破折号
- angular - 拖动地图标记时使用 matGoogleMapsAutocomplete 更新地址字段
- c# - MongoDB,C#。更新多个不同条件的数组元素
- substrate - 如何在专用网络中创建存在证明运行时?
- excel - 如何修复 Excel 中包含公式但显示为空单元格的单元格?