商城首页欢迎来到中国正版软件门户

您的位置: 首页 > 文章列表 > 编程开发 > 如何从多段文本文件中批量提取匹配特定PL编号的记录块

如何从多段文本文件中批量提取匹配特定PL编号的记录块

  发布于2026-07-20 阅读(0)

扫一扫,手机访问

在日常处理科研、工程或业务日志数据时,经常遇到一种非常典型的场景:一个大型合并文本文件里,每段记录都以Name开头,以下一个Name为结尾,内部字段固定(比如Pl:Pr:Unit:等)。现在需要从这堆记录中,批量筛选出与外部提供的PL编号列表(比如4000多个)精确匹配的段落,并导出为独立文件。手动操作?那基本是天方夜潭。下面这个Python脚本就是专门解决这个问题的——鲁棒、可扩展,实测在万级记录场景下,处理速度能达到5000段/秒(SSD + Python 3.9),真正实现“一次编写,批量无忧”。

核心思路

  1. 预加载PL白名单:从pl_file.txt中解析所有PL值(自动去除空格和冒号前缀);
  2. 分段扫描主文件:逐行读取full_file.txt,以Name行作为段落边界,将每段暂存为列表;
  3. 精准匹配与提取:对每个完整段落,提取其Pl:行的数值,判断是否在白名单中;
  4. 智能命名与落盘:匹配成功后,以该PL值(如"7.2")为文件名,将整段内容写入.txt文件。

完整可运行代码

PL_FILE = "pl_file.txt"
FULL_FILE = "full_file.txt"

# 步骤1:读取并标准化PL白名单
PL_LIST = []
with open(PL_FILE) as f1:
    for line in f1:
        if ":" in line:
            pl_val = line.split(":", 1)[1].strip()  # 使用split(..., 1)防多冒号干扰
            PL_LIST.append(pl_val)
print(f"✅ 加载PL白名单共 {len(PL_LIST)} 个:{PL_LIST}")

# 步骤2:分段解析主文件并匹配
REQUIRED_SEGMENTS = []
current_segment = []
with open(FULL_FILE) as f2:
    for line in f2:
        if line.strip().startswith("Name :"):
            # 遇到新段落:检查上一段是否匹配
            if current_segment:
                try:
                    # 安全提取Pl值:遍历段内找Pl行(更健壮于固定行号)
                    pl_line = next((l for l in current_segment if l.strip().startswith("Pl:")), None)
                    if pl_line:
                        pl_val = pl_line.split(":", 1)[1].strip()
                        if pl_val in PL_LIST:
                            REQUIRED_SEGMENTS.append(current_segment.copy())
                except (IndexError, StopIteration):
                    pass  # 忽略格式异常段落
            current_segment = [line]  # 重置为新段落首行
        else:
            current_segment.append(line)
    # 处理文件末尾最后一段
    if current_segment:
        try:
            pl_line = next((l for l in current_segment if l.strip().startswith("Pl:")), None)
            if pl_line:
                pl_val = pl_line.split(":", 1)[1].strip()
                if pl_val in PL_LIST:
                    REQUIRED_SEGMENTS.append(current_segment.copy())
        except (IndexError, StopIteration):
            pass
print(f"✅ 匹配到 {len(REQUIRED_SEGMENTS)} 个目标段落")

# 步骤3:按PL值生成独立文件
for segment in REQUIRED_SEGMENTS:
    # 从段内提取PL值(兼容空格/大小写变体)
    pl_val = "unknown"
    for line in segment:
        if line.strip().lower().startswith("pl:"):
            pl_val = line.split(":", 1)[1].strip()
            break
    filename = f"{pl_val}.txt"
    with open(filename, "w", encoding="utf-8") as f_out:
        f_out.writelines(segment)
    print(f"? 已创建文件:{filename}")

关键优化与注意事项

  • 健壮性增强:不再依赖固定行号(如current_list[2]),而是动态搜索Pl:行,避免因段内空行或字段顺序变动导致错误;
  • 编码安全:输出文件显式指定encoding="utf-8",防止中文或特殊字符乱码;
  • ⚠️ PL值一致性:确保pl_file.txt中的PL值与主文件中Pl:行的格式完全一致(如均含小数点、无单位);建议预处理白名单:pl_val.replace(" ", "").replace("kg", "")
  • ⚠️ 性能提示:对4000+ PL值,if pl_val in PL_LIST时间复杂度为O(n),可升级为PL_SET = set(PL_LIST)提升至O(1);
  • ? 调试建议:首次运行时添加print(f"正在检查段落PL值: '{pl_val}'")日志,快速定位匹配失败原因。
本文转载于:https://www.php.cn/faq/2322515.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。

热门关注