当前位置:

首页 > 编程开发 > Python实现Excel多表合并与自动化报表生成

Python实现Excel多表合并与自动化报表生成

使用Python的pandas、openpyxl等库,可批量读取多个Excel文件并垂直合并,剔除销售额为空的行,按城市分组统计总销售额与订单数,将明细和汇总结果导出至新文件,并对统计表头进行加粗和黄色背景美化,实现自动化报表生成。

案例背景与需求分析

想象一下这个场景:你是一名数据运营,每个月各个城市的分公司都会发来一张当月的销售明细表,存在sales_reports文件夹下。

Python实现Excel多表合并与自动化报表生成

文件的命名很规则,比如北京_202310.xlsx、上海_202310.xlsx、广州_202310.xlsx。但数量可能多达几十个,每个都得手动打开。

老板的要求也很明确:

  1. 把文件夹里所有的Excel数据合并成一张大表。
  2. 清洗数据:剔除“销售额”为空的无效记录。
  3. 统计出各个城市的总销售额和订单数量。
  4. 把合并后的明细和统计结果导出到一个新的Excel文件里。
  5. (加分项)把统计结果的表头加粗,背景标黄。

手动操作?打开几十个文件,复制粘贴,不仅容易出错,而且每个月都得重复这一套流程。现在,我们用Python一键解决。

核心模块引入

除了大家熟悉的pandas和openpyxl,还需要用到Python的内置库os和glob,它们专门处理文件和路径,是自动化流程的得力助手。

import os
import glob
import pandas as pd
from openpyxl import load_workbook
from openpyxl.styles import Font, PatternFill

第一步:批量读取与合并数据

# 1. 定义文件夹路径
folder_path = "sales_reports"

# 2. 使用 glob 匹配文件夹下所有的 .xlsx 文件
# 假设当前目录下有 sales_reports 文件夹
file_paths = glob.glob(os.path.join(folder_path, "*.xlsx"))

# 用于存放每个读取出来的 DataFrame
df_list = []

print("开始批量读取文件...")
for file in file_paths:
    print(f"正在读取: {file}")
    # 读取 Excel
    temp_df = pd.read_excel(file)
    
    # 【小技巧】可以从文件名中提取城市名,作为新的一列加上去
    # 比如从 "sales_reports\北京_202310.xlsx" 中提取 "北京"
    basename = os.path.basename(file) # 获取文件名: 北京_202310.xlsx
    city_name = basename.split("_")[0] # 以下划线分割,取第一部分: 北京
    temp_df["文件来源城市"] = city_name 
    
    df_list.append(temp_df)

# 3. 使用 concat 将所有数据上下拼接合并
master_df = pd.concat(df_list, ignore_index=True)
print(f"合并完成,共计 {len(master_df)} 条数据。")

第二步:数据清洗与统计分析

# 1. 数据清洗:剔除销售额为空的行
master_df.dropna(subset=["销售额"], inplace=True)

# 2. 统计分析:按“文件来源城市”分组,计算总销售额和订单数
summary_df = master_df.groupby("文件来源城市").agg({
    "销售额": "sum",
    "订单号": "count" # 假设原始表有订单号这一列,计数即可代表订单数量
}).reset_index()

summary_df.rename(columns={"订单号": "订单总数", "销售额": "总销售额"}, inplace=True)

第三步:导出数据并使用 openpyxl 调整格式

为了同时写入多个Sheet并进行格式美化,分两步走:先用 pandas 保存基础数据,再用 openpyxl 打开进行格式渲染。

output_file = "月度汇总报告.xlsx"

# 1. pandas 写入数据
with pd.ExcelWriter(output_file) as writer:
    summary_df.to_excel(writer, sheet_name="城市汇总", index=False)
    master_df.to_excel(writer, sheet_name="所有明细", index=False)

# 2. openpyxl 修改格式
wb = load_workbook(output_file)
ws_summary = wb["城市汇总"]

# 定义样式:加粗,黄色背景
header_font = Font(bold=True)
header_fill = PatternFill(fill_type="solid", start_color="FFFF00")

# 遍历第一行(表头),设置样式
for cell in ws_summary[1]:
    cell.font = header_font
    cell.fill = header_fill

# 调整列宽使数据显示更完整
ws_summary.column_dimensions['A'].width = 15
ws_summary.column_dimensions['B'].width = 15
ws_summary.column_dimensions['C'].width = 15

# 保存最终结果
wb.sa ve(output_file)
print("自动化报表生成完毕,格式已美化!")

方法补充

使用 Python 将 Excel 多表合并并生成自动化报表,主要分为四个阶段:批量读取 → 数据合并 → 数据清洗 → 报表生成与样式美化。

核心合并函数:concat 与 merge

在具体实现前,快速了解一下 pandas 中两个核心合并函数的区别:

函数用途适用场景
pd.concat()垂直拼接(行追加)或水平拼接,把多个框架按轴堆叠在一起多份格式相同的 Excel 文件需要上下拼接成大表(最常用)
pd.merge()类似 SQL 的 JOIN,基于共同列进行数据关联两个表需要根据某一列(如用户ID)进行左右匹配

对于大多数日常场景(合并同结构的多份报表),pd.concat() 是首选。

批量读取与垂直合并

基础版:合并多个同结构 Excel 文件

import pandas as pd
from pathlib import Path
folder_path = "./sales_reports"
# 用 Path.glob 批量获取所有 xlsx 文件
files = list(Path(folder_path).glob("*.xlsx"))
# 收集所有 DataFrame 到列表
dataframes = []
for file in files:
    df = pd.read_excel(file)
    # 【可选】从文件名提取标识列,如月份/城市
    df["来源文件"] = file.stem   # 提取文件名不含扩展名
    dataframes.append(df)
# 一次性垂直合并,性能远优于逐行 append
merged = pd.concat(dataframes, ignore_index=True, sort=False)
# 保存结果
merged.to_excel("合并结果.xlsx", index=False)

进阶版:兼容多场景的成熟方案

在实际生产中,直接逐文件读取有两个隐患:

  • 丢数据风险:pd.concat(dataframes, ignore_index=True) 是标准做法。必须注意如果你用老写的 df_total = df_total.append(df),新版本 pandas 会警告性能问题。
  • 格式不统一:需要提前处理数据类型、排除损坏文件:

以下是带进度监控和错误容错的生产级脚本:

import pandas as pd
from pathlib import Path
from tqdm import tqdm   # pip install tqdm

def merge_excels(folder_path, output_name="merged_output.xlsx"):
    print(f"正在扫描: {folder_path}")
    files = list(Path(folder_path).rglob("*.xlsx"))  # 递归查找子文件夹中的文件
    if not files:
        print("未找到 Excel 文件")
        return

    print(f"发现 {len(files)} 个文件")
    all_data = []
    error_files = []

    for file in tqdm(files, desc="处理进度"):
        try:
            df = pd.read_excel(file, dtype=str)       # 统一先按字符串读取,避免类型冲突
            all_data.append(df)
        except Exception as e:
            error_files.append((file.name, str(e)))  # 记录错误文件

    if not all_data:
        print("没有成功读取任何文件")
        return

    # 一次性合并
    merged = pd.concat(all_data, ignore_index=True, sort=False)
    merged.to_excel(output_name, index=False)

    print(f"合并完成!共 {len(merged)} 行。")
    if error_files:
        print(f"警告:{len(error_files)} 个文件读取失败")

同工作簿内多 Sheet 合并

import pandas as pd

file_path = "同一个工作簿.xlsx"
sheets = pd.read_excel(file_path, sheet_name=None)   # sheet_name=None 读取所有 sheet

all_dfs = []
for sheet_name, df in sheets.items():
    all_dfs.append(df)

result = pd.concat(all_dfs, ignore_index=True)
result.to_excel("合并后.xlsx", index=False)

数据清洗与预处理

从不同来源合并的数据通常很“脏”,必需先做四大基本清洗才能保证报表质量。

清洗任务常用代码注意事项
去重df.drop_duplicates(inplace=True)默认整行判断为重复才删除;可用 subset=["列名"] 指定列去重
删除缺行df.dropna(subset=["关键列"])不强删全局,只删某列缺失的行;若某列如手机号为空的确实可删除
填充缺值df["列"].fillna(value)数字类用 0 或均值,分类用 "未知"「保持数据量」——切勿随意删掉太多行,会使统计基数错位
类型纠正df["日期"] = pd.to_datetime(df["日期"], errors="coerce") + 清理非标准条目先转 datetime 能自动将非法日期转成 NaT;再检测是否为 NaT,把明显错误的行剔除,统一日期格式

【注意】所有清洗必须按去重 → 填缺 → 修类型 → 删不可用行的顺序:删完重复和空字段后再修正类型最省事。

水平关联合并

在合并“不同维度的信息”(例如销售明细 + 城市信息)时,使用 pd.merge():

# 左表:明细表,右表:城市分类映射表
merged_df = pd.merge(sales_detail, city_mapping, on="城市", how="left")

how 参数选择:

  • inner:两张表都匹配的记录才保留
  • left:以左表为主,右表匹配不到的显示 NaN
  • outer:保留所有记录(少用)

自动生成汇总与透视表

# 1. 分组汇总
summary = merged.groupby("城市")["销售额"].agg(["sum", "mean", "count"]).reset_index()

# 2. 数据透视表
pivot = pd.pivot_table(merged, values="销售额", index="城市", columns="季度", aggfunc="sum", fill_value=0)

导出与样式美化(pandas + openpyxl 两步走)

df.to_excel() 能保存数据,但导出的格式存在明显的样式缺陷:

问题现象原因
格式丢失列宽显示异常、日期显示为数字、长文本被截断to_excel 不保留原表任何样式
索引误写第一列出现 0, 1, 2...(当成真实数据列)忘记使用 index=False

推荐做法:用 pandas 写数据,再用 openpyxl 加格式。

写入数据(pandas)

with pd.ExcelWriter("报表.xlsx") as writer:
    merged.to_excel(writer, sheet_name="明细", index=False)
    summary.to_excel(writer, sheet_name="汇总", index=False)

美化格式(openpyxl)

from openpyxl import load_workbook
from openpyxl.styles import Font, PatternFill

wb = load_workbook("报表.xlsx")
ws = wb["汇总"]   # 或 "明细"

# 设置表头样式:加粗 + 黄色背景
header_font = Font(bold=True)
header_fill = PatternFill(fill_type="solid", start_color="FFFF00")  # 黄色

for cell in ws[1]:   # 第一行是表头
    cell.font = header_font
    cell.fill = header_fill

# 调整列宽
for col in ws.columns:
    max_length = 0
    col_letter = col[0].column_letter
    for cell in col:
        try:
            if len(str(cell.value)) > max_length:
                max_length = len(str(cell.value))
        except:
            pass
    adjusted_width = min(max_length + 2, 30)
    ws.column_dimensions[col_letter].width = adjusted_width

wb.sa ve("报表_美化.xlsx")

总结

回顾整个系列的核心路径:从环境搭建开始,到用openpyxl精细控制单元格,再到pandas的高效筛选与排序,最后完成这个包含批量文件读取、数据清洗、分组统计、多表页导出及自动化排版的终极实战案例。

这套代码完全可以作为“模板”保存下来。未来遇到类似需求,只需要简单修改一下字段名,就能帮你节省成百上千个小时的重复劳动。这才是自动化的真正魅力。

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系bd@zhengruan.com
作者最新文章
编程开发 Python
相关文章 更多
ServBay安装配置详细教程与操作指南
ServBay安装配置详细教程与操作指南

新手入门 ServBay 本地开发环境,详解安装包下载、Dashboard 状态监控、Packages 组件安装、Services 服务控制及 Websites 项目配置。掌握 .servbay.config 版本管理与日志排查技巧,快速搭建稳定的 PHP、Node.js 等多语言开发环境。

codekit环境配置指南从安装到环境搭建完整教程
codekit环境配置指南从安装到环境搭建完整教程

详解 CodeKit 在 macOS 下的安装步骤、项目导入方法、Sass与JavaScript编译设置及浏览器自动刷新功能,助您快速搭建高效的前端开发环境。

codex安装windows 命令行完整操作教程
codex安装windows 命令行完整操作教程

详解Windows环境下安装OpenAI Codex CLI的步骤,包括WSL环境检查、Node.js/npm配置、npm全局安装命令及首次启动验证,适合开发者快速上手。

NativeRest环境配置要求与完整操作教程
NativeRest环境配置要求与完整操作教程

学习如何配置 NativeRest REST API 客户端。涵盖 Windows/macOS/Linux 安装后的工作区创建、环境变量管理、请求编辑及响应查看步骤,帮助开发者快速完成基础环境搭建与连通性测试。

CSS设置透明度的注意事项有哪些?opacity属性详解
CSS设置透明度的注意事项有哪些?opacity属性详解

深入解析CSS中设置透明度的核心属性opacity,剖析子元素继承、事件穿透、层叠上下文等关键注意事项,并提供与rgba、hsla的实用选型对比。

flutter页面传值到后台的方法及示例代码
flutter页面传值到后台的方法及示例代码

flutter页面传值到后台的完整实现方法及示例代码,帮助读者快速掌握相关技术要点。

Java 8至21新特性代码写法对比:Lambda、Record与Switch
Java 8至21新特性代码写法对比:Lambda、Record与Switch

本文通过具体的旧版与新版代码对比,详细剖析Java 8引入的Lambda表达式、Java 14/16引入的Record类,以及Java 12至21逐步演进完善的Switch表达式与模式匹配,展示代码简化路径与避坑要点。

AI智能体开发培训课程学什么及实战内容介绍
AI智能体开发培训课程学什么及实战内容介绍

系统梳理AI智能体开发培训的核心知识模块、技术栈选型与典型实战项目,解析低代码平台与纯代码框架的差异,提供从零构建可落地智能体的完整学习与实施路径。

Java子类未实现抽象方法编译错误修复指南
Java子类未实现抽象方法编译错误修复指南

针对Java开发中常见的“子类未实现抽象方法”编译错误,深入分析报错原因,提供重写实现、声明抽象子类两种标准修复路径,并总结参数签名、访问修饰符等典型避坑要点。

解决PHP递归报错:max_nesting_level限制与内存溢出处理
解决PHP递归报错:max_nesting_level限制与内存溢出处理

遇到PHP递归报错时,不要盲目调大max_nesting_level。本文教你区分Xdebug限制、内存耗尽和正则递归错误,提供代码级的终止条件优化与迭代替代方案,彻底解决栈溢出问题。

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

PDF教程
PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
Shapr3D macOS版
Shapr3D macOS版
Mac

Shapr3D是一款面向工业设计、机械工程、建筑概念和三维打印工作流的CAD软件。Mac版采用Parasolid建模内核,支持草图约束、实体建模、工程图、可视化渲染及常见CAD格式交换,并可通过账户在多台设备之间同步项目。

REAPER macOS版
REAPER macOS版
Mac

REAPER是Cockos开发的数字音频工作站,提供多轨音频与MIDI录制、剪辑、处理、混音和母带制作工具。Mac版兼容Intel与Apple芯片,支持AU、VST、VST3、CLAP等插件格式,并提供高度可定制的工作流程。

Ableton Live macOS版
Ableton Live macOS版
Mac

Ableton Live 是面向音乐制作人与现场表演者的数字音频工作站,提供编曲视图、独具特色的现场视图、音频录制、MIDI创作、实时变速、乐器及效果器。Mac版原生支持Apple芯片,并可连接音频接口、MIDI控制器和第三方插件。

WINDOWS 更多
3dmax(3ds max)
3dmax(3ds max)
Windows

Autodesk 3ds Max 是一款专业的三维建模、动画与渲染软件,广泛应用于建筑可视化、游戏开发、影视动画、广告设计和产品展示等领域。

photoshop
photoshop
Windows、macOS 、 iPad

Photoshop 2026 是 Adobe 推出的专业图像处理与视觉设计软件,支持 Windows、macOS 和 iPad 等平台,广泛应用于摄影修图、电商设计、平面海报、数字绘画及视觉合成等创作场景。

Blender
Blender
Windows、macOS 和 Linux

Blender 是一款免费开源、跨平台的专业 3D 创作软件,集建模、动画、渲染、视频编辑与视觉合成等功能于一体,广泛应用于影视动画、游戏设计和建筑可视化等领域。软件支持 Cycles 物理渲染器与 Eevee 实时渲染引擎,并提供多边形建模、骨骼绑定、物理模拟等专业工具。Blender 兼容 Windows、macOS 和 Linux 系统,安装包轻巧、运行流畅,依托活跃的全球开发者社区持续更新,是从初学者到专业创作者都值得选择的正版 3D 创作工具。