发布于2026-07-13 阅读(0)
扫一扫,手机访问
处理PDF表单(PDF Form)是办公自动化中一个有点门槛的活儿——但也是真正能提升效率、减少重复劳动的那种。批量填写合同模板、生成大量报表、提取表单数据,这些需求在职场里太常见了。今天直接上两个完整案例,帮大家把这事儿吃透。

说个最典型的场景:你手头有一份PDF合同模板,里面预设了姓名、金额、日期这些表单字段,现在要根据Excel数据批量生成合同。怎么做?一步步来看。
先装好两个库:
pip install pdfplumber PyPDF2
不知道模板里有哪些字段?别急,先写个脚本扫一遍:
import pdfplumber
def inspect_form_fields(pdf_path):
"""查看 PDF 中的表单字段信息"""
with pdfplumber.open(pdf_path) as pdf:
for i, page in enumerate(pdf.pages):
annotations = page.annots
if annotations:
print(f"第 {i+1} 页表单字段:")
for ann in annotations:
print(f" - {ann.get('name', '未命名')}: "
f"类型={ann.get('subtype', '')}")搞清楚字段有哪些后,就可以批量填写了。核心逻辑在下面这个函数里——它接受模板、输出路径、字段数据字典,然后自动填写并保存。
from PyPDF2 import PdfReader, PdfWriter
import pandas as pd
def fill_pdf_form(template_path, output_path, data_dict):
"""
填写 PDF 表单
template_path: 模板 PDF
output_path: 输出 PDF
data_dict: 字段名→值的字典
"""
reader = PdfReader(template_path)
writer = PdfWriter()
page = reader.pages[0]
writer.add_page(page)
writer.update_page_form_field_values(
writer.pages[0], data_dict
)
with open(output_path, "wb") as f:
writer.write(f)
def batch_fill_forms(template_path, excel_path, output_dir):
"""根据 Excel 数据批量生成 PDF 合同"""
import os
os.makedirs(output_dir, exist_ok=True)
df = pd.read_excel(excel_path)
for _, row in df.iterrows():
data = {
"name": row["客户名称"],
"amount": str(row["金额"]),
"date": str(row["签订日期"]),
"contract_no": row["合同编号"],
}
output = os.path.join(
output_dir,
f"合同_{row['客户名称']}.pdf"
)
fill_pdf_form(template_path, output, data)
print(f"已生成: {output}")填好了表单,下一步可能就是提取数据了。这里分两种情况:提取已填写的表单字段,以及从扫描件或不可填写的PDF中提取表格。
def extract_form_data(pdf_path):
"""提取 PDF 表单中的填写数据"""
reader = PdfReader(pdf_path)
fields = reader.get_form_text_fields()
print("表单字段提取结果:")
for field_name, value in fields.items():
print(f" {field_name}: {value}")
return fields
def batch_extract(pdf_dir, output_excel):
"""批量提取多个 PDF 表单到 Excel"""
import os
all_data = []
for f in os.listdir(pdf_dir):
if f.endswith(".pdf"):
fields = extract_form_data(
os.path.join(pdf_dir, f)
)
fields["来源文件"] = f
all_data.append(fields)
if all_data:
df = pd.DataFrame(all_data)
df.to_excel(output_excel, index=False)
print(f"共提取 {len(all_data)} 份表单: {output_excel}")如果PDF里没有可编辑的表单字段,但内容是以表格形式呈现的,那就要用pdfplumber来提取了。
def extract_table_from_scanned(pdf_path):
"""
从扫描件或不可填写的 PDF 中提取表格
适用于文字型 PDF 中的表格数据
"""
import pdfplumber
import pandas as pd
with pdfplumber.open(pdf_path) as pdf:
all_tables = []
for i, page in enumerate(pdf.pages):
tables = page.extract_tables()
for table in tables:
if table and len(table) > 1:
df = pd.DataFrame(
table[1:],
columns=table[0]
)
all_tables.append(df)
print(f"第{i+1}页找到表格: {len(table)}行")
if all_tables:
result = pd.concat(
all_tables, ignore_index=True
)
return result
return None把上面几个环节串起来,就是一个完整的PDF处理流水线。
def daily_pdf_pipeline():
"""每日 PDF 处理流水线"""
print("开始 PDF 处理...")
form_data = extract_form_data("日报表.pdf")
print(f"提取到 {len(form_data)} 个字段")
table_df = extract_table_from_scanned("明细.pdf")
if table_df is not None:
table_df.to_excel("提取数据.xlsx", index=False)
print(f"导出 {len(table_df)} 行数据")
# 生成汇总报告等其他操作
# ...
print("处理完成!")几点提醒:
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
7
8