- 微信
- 微博
  
  分享文章到微博
- 复制链接
  
  复制链接到剪贴板

使用Python如何快速打开一个百万行级别的超大Excel文件？

天元浪子发表于 2021/07/26 22:59:22 2021/07/26

【摘要】知乎上有同学求助说，当他试图打开一个20M左右的excel文件时，无论是使用pandas的read_excel，还是直接使用xlrd或者openpyxl模块，速度都慢到无法忍受的程度，耗时大约1分钟左右。真的会这样吗？第一感觉是，这位同学在使用openpyxl模块时没有设置只读模式。为便于测试，先用下面的代码生成一个一百万行数据的excel文件。 >>...

知乎上有同学求助说，当他试图打开一个20M左右的excel文件时，无论是使用pandas的read_excel，还是直接使用xlrd或者openpyxl模块，速度都慢到无法忍受的程度，耗时大约1分钟左右。

真的会这样吗？第一感觉是，这位同学在使用openpyxl模块时没有设置只读模式。为便于测试，先用下面的代码生成一个一百万行数据的excel文件。

>>> from openpyxl import Workbook
>>> wb = Workbook()
>>> sh = wb.active
>>> sh.append(['id', '语文', '数学', '英语', '物理'])
>>> for i in range(1000000): # 写入100万行数据
	sh.append([i+1, 90, 100, 95, 99]) >>> wb.save(r'd:\bigxlsx.xlsx')
>>> import os
>>> os.path.getsize(r'd:\bigxlsx.xlsx') # 文件大小：20M字节
20230528

  
 
  1
  2
  3
  4
  5
  6
  7
  8
  9
  10
  11
  12

接下来定义了一个使用openpyxl模块打开文件的函数，分别考察关闭和开启只读模式的时间消耗。

>>> from openpyxl import load_workbook
>>> import time
>>> def read_xlsx(read_only):
	t0 = time.time()
	wb = load_workbook(r'd:\bigxlsx.xlsx', read_only=read_only)
	t1 = time.time()
	print(wb.sheetnames)
	print(sh.cell(row=1, column=1).value)
	print(sh.cell(row=100, column=3).value)
	print('耗时%0.3f秒钟'%(t1-t0)) >>> read_xlsx(True)
['Sheet']
id
100
耗时0.404秒钟
>>> read_xlsx(False)
['Sheet']
id
100
耗时67.817秒钟

  
 
  1
  2
  3
  4
  5
  6
  7
  8
  9
  10
  11
  12
  13
  14
  15
  16
  17
  18
  19
  20
  21
  22

运行测试，果然，不开启只读的话，真的需要1分多钟，而使用只读模式的话，则仅需0.4秒钟。

不过，也别高兴得太早，openpyxl模块并没有提供像pandas.read_excel()那样把全部数据读入一个数据结构的功能，只能定位到行、列或格子以后再读取数据。要想使用openpyxl模块把全部数据读入到数组或DataFrame中，需要遍历所有的行和列，这仍然是一个非常耗时的操作。

那么，pandas.read_excel()是否也支持只读模式呢？遗憾的是，read_excel()并没有类似read_only这样的参数。尽管read_excel()可以接受文件路径、文件对象、类文件对象，甚至是二进制数据，但即使将文件内容传入，read_excel()解析这100万行数据仍然需要大约80秒钟。下面的代码验证了这一点。

>>> import pandas as pd
>>> def read_excel_by_pandas():	
	with open(r'd:\bigxlsx.xlsx', 'rb') as fp:
		content = fp.read()
		t0 = time.time()
		df = pd.read_excel(content, engine='openpyxl')
		t1 = time.time()
	print(df.head())
	print(df.tail())
	print('耗时%0.3f秒钟'%(t1-t0)) >>> read_excel_by_pandas() id  语文   数学  英语  物理
0   1  90  100  95  99
1   2  90  100  95  99
2   3  90  100  95  99
3   4  90  100  95  99
4   5  90  100  95  99 id  语文   数学  英语  物理
999995   999996  90  100  95  99
999996   999997  90  100  95  99
999997   999998  90  100  95  99
999998   999999  90  100  95  99
999999  1000000  90  100  95  99
耗时81.369秒钟

  
 
  1
  2
  3
  4
  5
  6
  7
  8
  9
  10
  11
  12
  13
  14
  15
  16
  17
  18
  19
  20
  21
  22
  23
  24
  25
  26

结论：处理超大的Excel文件时，使用openpyxl模块的只读模式，可以快速打开并取得指定格子的数据，但不要尝试将全部数据读入到自己定义的数据结构中，这将花费漫长的时间。对此，pandas也无能为力。

文章来源: xufive.blog.csdn.net，作者：天元浪子，版权归原作者所有，如需转载，请联系作者。

原文链接：xufive.blog.csdn.net/article/details/112984406

点赞
收藏
关注作者

0/1000

抱歉，系统识别当前为高风险访问，暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称，即可参与社区互动！

*长度不超过10个汉字或20个英文字符，设置后3个月内不可修改。

确认取消

加入云驻计划，成为创作者

华为云周边好礼
免费体验产品
特殊身份标识
线下官方门票
内部专家零距离
与10000+优质创作者共同成长

立即加入

使用Python如何快速打开一个百万行级别的超大Excel文件？

全部回复

设置昵称

关于作者

目录

加入云驻计划，成为创作者

使用Python如何快速打开一个百万行级别的超大Excel文件？

全部回复

设置昵称

关于作者

目录

热门推荐查看更多

相关文章

加入云驻计划，成为创作者

相关产品