商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 编程开发 > Python批量处理PDF表单与合并的实战指南

Python批量处理PDF表单与合并的实战指南

  发布于2026-07-13 阅读(0)

扫一扫,手机访问

处理PDF表单(PDF Form)是办公自动化中一个有点门槛的活儿——但也是真正能提升效率、减少重复劳动的那种。批量填写合同模板、生成大量报表、提取表单数据,这些需求在职场里太常见了。今天直接上两个完整案例,帮大家把这事儿吃透。

Python批量处理PDF表单与合并的实战指南

一、案例一:批量填写 PDF 表单

说个最典型的场景:你手头有一份PDF合同模板,里面预设了姓名、金额、日期这些表单字段,现在要根据Excel数据批量生成合同。怎么做?一步步来看。

1. 准备工作

先装好两个库:

pip install pdfplumber PyPDF2

2. 查看 PDF 表单字段

不知道模板里有哪些字段?别急,先写个脚本扫一遍:

import pdfplumber

def inspect_form_fields(pdf_path):
    """查看 PDF 中的表单字段信息"""
    with pdfplumber.open(pdf_path) as pdf:
        for i, page in enumerate(pdf.pages):
            annotations = page.annots
            if annotations:
                print(f"第 {i+1} 页表单字段:")
                for ann in annotations:
                    print(f"  - {ann.get('name', '未命名')}: "
                          f"类型={ann.get('subtype', '')}")

3. 批量填写

搞清楚字段有哪些后,就可以批量填写了。核心逻辑在下面这个函数里——它接受模板、输出路径、字段数据字典,然后自动填写并保存。

from PyPDF2 import PdfReader, PdfWriter
import pandas as pd

def fill_pdf_form(template_path, output_path, data_dict):
    """
    填写 PDF 表单
    template_path: 模板 PDF
    output_path: 输出 PDF
    data_dict: 字段名→值的字典
    """
    reader = PdfReader(template_path)
    writer = PdfWriter()

    page = reader.pages[0]
    writer.add_page(page)
    writer.update_page_form_field_values(
        writer.pages[0], data_dict
    )

    with open(output_path, "wb") as f:
        writer.write(f)

def batch_fill_forms(template_path, excel_path, output_dir):
    """根据 Excel 数据批量生成 PDF 合同"""
    import os
    os.makedirs(output_dir, exist_ok=True)

    df = pd.read_excel(excel_path)
    for _, row in df.iterrows():
        data = {
            "name": row["客户名称"],
            "amount": str(row["金额"]),
            "date": str(row["签订日期"]),
            "contract_no": row["合同编号"],
        }

        output = os.path.join(
            output_dir,
            f"合同_{row['客户名称']}.pdf"
        )
        fill_pdf_form(template_path, output, data)
        print(f"已生成: {output}")

二、案例二:提取 PDF 表单数据

填好了表单,下一步可能就是提取数据了。这里分两种情况:提取已填写的表单字段,以及从扫描件或不可填写的PDF中提取表格。

1. 提取已填写的表单

def extract_form_data(pdf_path):
    """提取 PDF 表单中的填写数据"""
    reader = PdfReader(pdf_path)
    fields = reader.get_form_text_fields()

    print("表单字段提取结果:")
    for field_name, value in fields.items():
        print(f"  {field_name}: {value}")
    return fields

def batch_extract(pdf_dir, output_excel):
    """批量提取多个 PDF 表单到 Excel"""
    import os
    all_data = []

    for f in os.listdir(pdf_dir):
        if f.endswith(".pdf"):
            fields = extract_form_data(
                os.path.join(pdf_dir, f)
            )
            fields["来源文件"] = f
            all_data.append(fields)

    if all_data:
        df = pd.DataFrame(all_data)
        df.to_excel(output_excel, index=False)
        print(f"共提取 {len(all_data)} 份表单: {output_excel}")

2. 提取不可填写的表格数据

如果PDF里没有可编辑的表单字段,但内容是以表格形式呈现的,那就要用pdfplumber来提取了。

def extract_table_from_scanned(pdf_path):
    """
    从扫描件或不可填写的 PDF 中提取表格
    适用于文字型 PDF 中的表格数据
    """
    import pdfplumber
    import pandas as pd

    with pdfplumber.open(pdf_path) as pdf:
        all_tables = []
        for i, page in enumerate(pdf.pages):
            tables = page.extract_tables()
            for table in tables:
                if table and len(table) > 1:
                    df = pd.DataFrame(
                        table[1:],
                        columns=table[0]
                    )
                    all_tables.append(df)
                    print(f"第{i+1}页找到表格: {len(table)}行")

        if all_tables:
            result = pd.concat(
                all_tables, ignore_index=True
            )
            return result
    return None

3. 完整工作流

把上面几个环节串起来,就是一个完整的PDF处理流水线。

def daily_pdf_pipeline():
    """每日 PDF 处理流水线"""
    print("开始 PDF 处理...")

    form_data = extract_form_data("日报表.pdf")
    print(f"提取到 {len(form_data)} 个字段")

    table_df = extract_table_from_scanned("明细.pdf")
    if table_df is not None:
        table_df.to_excel("提取数据.xlsx", index=False)
        print(f"导出 {len(table_df)} 行数据")

    # 生成汇总报告等其他操作
    # ...

    print("处理完成!")

三、注意事项

几点提醒:

  • PDF表单需要是 AcroForm 格式,不是扫描件
  • 拍照或扫描件需要先做 OCR 识别
  • 批量处理前务必先测试一个样本
  • 中文字体在PDF中必须嵌入,否则显示会变成方框
本文转载于:https://www.jb51.net/python/3672732uh.htm 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注