当前位置:

首页 > 编程开发 > Python开发FastAPI怎么读取并校验上传的Excel文件_结合Pandas与Pydantic进行入参验证

Python开发FastAPI怎么读取并校验上传的Excel文件_结合Pandas与Pydantic进行入参验证

FastAPI接收Excel需用UploadFile配合BytesIO和pandas.read_excel解析,再通过Pydantic模型逐行校验字典化数据,不可直接校验DataFrame;注意文件类型、编码、空值及大文件处理。 FastAPI里怎么接收Excel文件上传 想在FastAPI里处理E

FastAPI接收Excel需用UploadFile配合BytesIO和pandas.read_excel解析,再通过Pydantic模型逐行校验字典化数据,不可直接校验DataFrame;注意文件类型、编码、空值及大文件处理。

Python开发FastAPI怎么读取并校验上传的Excel文件_结合Pandas与Pydantic进行入参验证

FastAPI里怎么接收Excel文件上传

想在FastAPI里处理Excel文件?首先得明确一点:框架本身并不直接支持Excel的解析。无论是File还是UploadFile,拿到的都只是原始字节流。接下来的重头戏,得交给pandas.read_excel来完成。别指望FormBody能自动帮你转换成DataFrame——它们连Excel格式都识别不了。

整个流程的关键点很清晰:上传接口必须使用POST方法,Content-Type设置为multipart/form-data。后端用UploadFile接收文件后,核心操作是用BytesIO把文件内容包装起来,再喂给pandas.read_excel

  • 参数类型别用File(...),得用UploadFile
  • 注意,UploadFile.filename只是客户端提供的文件名,并非服务器路径,所以千万别直接把它当路径传给read_excel
  • 务必通过await file.read()file.file.read()获取字节数据,再用BytesIO包装。
from io import BytesIO
import pandas as pd

@app.post("/upload-excel/")
async def upload_excel(file: UploadFile):
    content = await file.read()  # 必须先读取
    df = pd.read_excel(BytesIO(content))  # BytesIO才能被pandas读

用Pydantic模型校验Excel每行数据是否合法

Pydantic本身并不校验DataFrame,但校验单行数据却是它的强项。诀窍在于,先把DataFrame通过df.to_dict("records")转换成Python字典列表,再批量交给Pydantic模型处理。在v1版本中,可以使用parse_obj_list;而v2版本则推荐使用model_validate。一旦校验失败,会抛出ValidationError

有个细节值得注意:对于Pydantic v2用户,更推荐使用MyModel.model_validate(row)进行逐行校验,这比parse_obj_list更容易捕获具体的行号。v1用户则需要自己加上enumerate来追踪索引。

立即学习“Python免费学习笔记(深入)”;

  • 字段名必须和Excel列名完全一致(区分大小写),否则ValidationError会提示“field required”。
  • 日期列如果包含空值,Pydantic默认不接受NaT,需要设置default=None或使用Optional[date]类型。
  • 数值列中如果混入了文本(比如“N/A”、“-”),会导致float校验失败。建议先用pd.to_numeric(..., errors="coerce")将其转为NaN
from pydantic import BaseModel, field_validator
from datetime import date

class ExcelRow(BaseModel):
    name: str
    age: int
    join_date: date

    @field_validator("join_date")
    def parse_date(cls, v):
        if isinstance(v, str):
            return date.fromisoformat(v)
        return v

校验逻辑示例(v2)

rows = df.to_dict("records")
validated = []
for i, row in enumerate(rows):
    try:
        validated.append(ExcelRow.model_validate(row))
    except ValidationError as e:
        raise HTTPException(422, f"第{i+1}行校验失败: {e}")

为什么不能直接用Pydantic的@validator校验整个DataFrame

原因在于,@validator作用于Pydantic模型的实例化过程,而DataFrame是pandas对象,并非Pydantic模型——它没有__pydantic_core_schema__。如果强行把DataFrame传进去,会直接报错TypeError: unsupported type

当然,也有人尝试过自定义__get_pydantic_core_schema__来绕过限制,但代价高、维护难,而且会失去Pydantic对嵌套结构、类型转换、错误聚合的原生支持。相比之下,老老实实转换成字典再校验,反而是更稳妥、更高效的选择。

  • 不要在Pydantic模型里定义df: pd.DataFrame这样的字段——Pydantic根本不认识pd.DataFrame
  • 别想着用pd.DataFrame.model_validate——这个方法根本不存在。
  • 对于整表级别的约束(比如“name列不能有重复值”),需要在所有行都校验完之后,单独编写逻辑处理,这不在Pydantic的职责范围内。

常见报错和绕过方式

在实际操作中,你可能会遇到各种“坑”:上传大Excel文件(>10MB)容易触发client disconnectedRequest body too large;读取加密的Excel会报Unsupported format;中文列名乱码显示为Unnamed: 0……需要明确的是,这些问题通常出在IO或pandas层,而不是Pydantic的锅。

  • 遇到xlrd.biffh.XLRDError: Excel xlsx file; not supported?升级openpyxl库,并在read_excel中显式指定engine="openpyxl"
  • UnicodeDecodeError(常因误将CSV文件当作XLSX上传导致)?可以先检查file.content_type,确认是否是application/vnd.openxmlformats-officedocument.spreadsheetml.sheet
  • 出现MemoryError?可以尝试使用chunksize参数分块读取文件。不过要注意,这样一来Pydantic校验也得改成流式处理,不能一次性to_dict了。
  • 列名带有空格或换行符?用df.columns = df.columns.str.strip()预处理一下即可。

从上传到最终校验,整个Excel处理链路比较长,每个环节都可能出问题。排查时建议按这个顺序来:先检查file.content_typedf.shape,再看df.dtypes——别一上来就急着调用Pydantic的model_dump

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
编程开发 Python
相关文章 更多
Python安装后怎么打开:使用IDLE或命令行启动解释器
Python安装后怎么打开:使用IDLE或命令行启动解释器

刚在Windows安装好Python却不知道如何启动?本文详细演示如何通过开始菜单找到并打开IDLE集成开发环境,以及如何在PowerShell或命令提示符中使用python和py命令启动交互式解释器、运行.py脚本文件。包含退出解释器的方法及常见启动问题排查,帮助初学者快速验证安装成功并开始编写代码。

Windows系统Python安装教程:下载、勾选PATH及环境变量配置
Windows系统Python安装教程:下载、勾选PATH及环境变量配置

针对Windows初学者的Python安装实战指南。详细讲解如何从Python官网下载匹配架构的安装包,重点演示安装首屏勾选“Add python.exe to PATH”的关键操作,并提供使用python --version和py命令验证环境变量的具体步骤,帮助新手快速搭建开发环境并排查路径问题。

麒麟OS如何查看Python进程的运行状态
麒麟OS如何查看Python进程的运行状态

要想确认麒麟OS中Python程序的运行状态以及资源占用情况,我们可以这样做:用ps -ef | grep python来筛选进程;通过top命令,按P键排序查看实时负载;使用pgrep -f "script.py"精准获取PID;借助lsof -p PID验证文件打开状态。另外,还可以结合syst

Python在Debian上如何配置SSL证书
Python在Debian上如何配置SSL证书

在Debian系统上配置SSL证书通常涉及以下几个步骤:安装Web服务器:首先,你需要一个Web服务器,比如Apache或Nginx。这里以Apache为例。sudo apt updatesudo apt install apache2获取SSL证书:你可以从Let’s Encrypt免费获取SSL

统信UOS怎么安装Python开发环境
统信UOS怎么安装Python开发环境

要想让Python项目在统信UOS上正常运行,得先安装python3、python3-pip、python3-venv、python3-dev以及build-essential等组件。具体操作就是执行sudo apt install命令来一步到位完成安装,同时别忘了配置清华镜像源来给pip加速哦。在

纯Python方案实现中英文全文搜索
纯Python方案实现中英文全文搜索

在互联网上的各类网站中,无论大小,基本上都会有一个搜索框,用来给用户对内容进行搜索,小到站点搜索,大到搜索引擎搜索。从简单的来说,搜索功能确实很简单,一个简单的select语句就可以实现数据的搜索。而从复杂的来看,无论是搜索的精度还是搜索的效率,都是有很深的研究范围的。对于简单的搜索功能来说,一个s

Mac如何取消通过Python脚本运行的关机程序
Mac如何取消通过Python脚本运行的关机程序

立即在终端输入sudo shutdown -c取消倒计时关机,成功后显示“Shutdown cancelled”;若存在pmset重复任务,需再执行sudo pmset repeat cancel清除。Mac因Python脚本执行了os.system("sudo shutdown -h +10")或

Pythonasyncio异步并发与多固定出口IP调度实战
Pythonasyncio异步并发与多固定出口IP调度实战

之前写过一篇同步场景下用 Python 管理多个固定出口 IP 的实践(ExitPool + requests/httpx),覆盖了健康检查、故障转移和连接池复用。但在实际业务中,越来越多的场景用 asyncio 做高并发采集或批量接口调用——异步事件循环下多出口的管理方式和同步场景完全不同:单线程

Python在静态出口IP产品中的实战:从地址漂移巡检到多IP故障切换
Python在静态出口IP产品中的实战:从地址漂移巡检到多IP故障切换

写在前面:为什么静态出口 IP 不是"买了就行"不少团队在引入静态出口 IP 产品时,第一反应往往是:“地址配上去,这事就算完了。”可真到了真实业务里,静态出口 IP 真正能体现价值的地方,往往不在分配这一步,而在分配之后怎么管:地址有没有漂移,质量是否达标,某一条线路突然不可用时怎么切换,连接层又

using namespace 使用中遇到的问题怎么解决
using namespace 使用中遇到的问题怎么解决

命名空间的基本概念与常见引入问题在C++等编程语言中,命名空间(namespace)是一种将代码标识符(如变量、函数、类名)封装在特定名称下的机制,其主要目的是避免命名冲突,尤其是在大型项目或使用多个第三方库时。使用“using namespace”指令可以将指定命名空间中的所有名称引入当前作用域,

查看更多
精品专题 更多
装机必备
装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows
Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件
macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

Mac软件 更多
灵活计算器
灵活计算器
macOS/iOS/Android

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师
macOS

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

WINDOWS 更多
Windows 10
Windows 10
Windows

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式
Windows/macOS/Linux

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘
Windows/macOS/iOS/Android

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。