Windows下Python使用Pandas模块操作Excel文件的教程

时间：2021-05-22

安装Python环境
ANACONDA是一个Python的发行版本，包含了400多个Python最常用的库，其中就包括了数据分析中需要经常使用到的Numpy和Pandas等。更重要的是，不论在哪个平台上，都可以一键安装，自动配置好环境，不需要用户任何的额外操作，非常方便。因此，安装Python环境就只需要到ANACONDA网站上下载安装文件，双击安装即可。
ANACONDA官方下载地址：https://mended.
• matplotlib: for plotting
• statsmodels
– Needed for parts of pandas.stats
• openpyxl, xlrd/xlwt
– openpyxl version 1.6.1 or higher, but lower than 2.0.0
– Needed for Excel I/O
• XlsxWriter
– Alternative Excel writer.
• boto: necessary for Amazon S3 access.

）

导入pandas模块：

import pandas as pd

使用import读入pandas模块，并且为了方便使用其缩写pd指代。

读入待处理的excel文件：

df = pd.read_excel('log.xls')

通过使用read_excel函数读入excel文件，后面需要替换成excel文件所在的路径。读入之后变为pandas的DataFrame对象。DataFrame是一个面向列(column-oriented)的二维表结构，且含有列表和行标，对excel文件的操作就转换为对DataFrame操作。另外，如果一个excel含有多个表，如果你只想读入其中一个可以：

df = pd.read_excel('log.xls', sheetname=1)

增加了一个参数sheetname，表示的是第几个表，从0开始计数。我上面设置的是1，也就是第二个表。

读入之后，可以先查看表头信息和每一列的数据类型：

df.dtypes输出如下：Member objectUnnamed: 1 float64Unnamed: 2 float64Unnamed: 3 float64Unnamed: 4 float64Unnamed: 5 float64家内外活动类型 objectUnnamed: 7 objectactivity objectdtype: object

提取每个member连续出现的最后一行数据：

new_df = df.drop_duplicates(subset='Member', keep='last')

以上语句的意思是根据Member字段去除掉多余的行，并且保留相同行的最后一行数据。这些就得到了每一个member最后一行的数据了，返回了经过筛选后的DataFrame。

接下来需要将处理后的结果，保存为excel文件：

out = pd.ExcelWriter('output.xls')new_df.to_excel(out)out.save()

output.xls是你要保存的文件名，可以任取；然后将DataFrame的内容保存到该文件，最后保存该文件到系统的磁盘上。

接下来，你就可以在当前目录看到一个新的文件，可以直接使用excel打开查看。

Pandas还提供了很多的API，可以根据具体的任务，查找API文档，找到合适的函数来完成任务。

附：一个完整的示例

#coding=utf-8import pandas as pd# 读入excel文件中的第2个表df = pd.read_excel('log.xls', sheetname=1)# 查看表的数据类型print df.dtypes# 查看Member列的数据print df['Member']'''# 新建一列，每一行的值是Member列和activity列相同行值的和for i in df.index: df['activity_2'][i] = df['Member'][i] + df['activity'][i]'''# 根据Member字段去除掉多余的行，并且保留相同行的最后一行数据new_df = df.drop_duplicates(subset='Member', keep='last')# 导出结果out = pd.ExcelWriter('output.xls')new_df.to_excel(out)out.save()

Windows下Python使用Pandas模块操作Excel文件的教程

相关文章

对Python 2.7 pandas 中的read_excel详解

python使用xlrd模块读取xlsx文件中的ip方法

python读取excel数据绘制简单曲线图的完整步骤记录

python pandas合并Sheet,处理列乱序和出现Unnamed列的解决

python简单操作excle的方法