发布于2026-07-15 阅读(0)
扫一扫,手机访问
很多数据工程师都会遇到这样的场景:文件按分区结构层层嵌套,比如 /folder1/.../folder4/folder4X/year=2023/*.csv,想一次性读入所有符合条件的CSV文件,却不想写一堆循环去遍历子目录。其实,PySpark 的通配符路径匹配功能,正好能干净利落地解决这个问题。
在大规模数据处理中,文件按分区结构组织是常态——比如按 Year=2023 这类子目录存放。手动遍历子目录不仅低效,还违背了Spark 声明式、分布式设计的初衷。PySpark 的 spark.read.csv() 原生支持 Hadoop 兼容文件系统的路径通配符(glob pattern),直接通过灵活的路径表达式就能批量匹配目标文件,无需任何循环。
下面直接给出几种推荐路径写法,按匹配精度从高到低排列,可以根据实际目录结构灵活选用。
精准匹配数字编号子目录(推荐用于结构明确的场景):
path = "/folder1/folder2/folder3/folder4/folder4[1-9]*/year=2023/*.csv"
df = spark.read.option("header", "true").csv(path)
这里folder4[1-9]*可以匹配 folder41、folder42、folder410 等,有效避免误匹配 folder40(如果存在的话);末尾显式加上/*.csv更安全,确保只加载 CSV 文件。
宽松匹配所有 folder4* 子目录(通用性强):
path = "/folder1/folder2/folder3/folder4/folder4*/year=2023/*.csv"
最简层级通配(适用于 folder4 下直接为年份目录,或子目录命名不规则):
path = "/folder1/folder2/folder3/folder4/*/year=2023/*.csv"
使用过程中有几个关键点需要留意:
*、[1-9]、?)由底层文件系统(如 HDFS、S3A、本地文件系统)解析,不是 Shell 层面展开的,所以必须确保运行环境对目标存储支持 glob 操作。.option("header", "false");如果包含引号或特殊分隔符,建议同步配置 .option("quote", '"').option("escape", '"'),避免解析出错。s3a://bucket-name/... 格式,并确认已配置好对应的凭证与文件系统实现。spark.sql.adaptive.enabled=true(Spark 3.2+)来加速元数据发现。小结一下:善用通配符路径是 PySpark 批量读取分区数据的核心技巧——既能保持代码简洁,又完全兼容分布式执行引擎,是替代显式 for 循环的最佳实践。下次遇到类似场景,直接拿路径表达式试一下,往往比写循环快得多。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
7
8