发布于2026-07-04 阅读(0)
扫一扫,手机访问
本文介绍如何将无序的标题列表(含数字编号与非编号项)自动解析为具有父子关系的树状结构,通过两步法识别编号层级、建立父子引用,并输出可读性强的嵌套字典或可视化树形表示。
在文档解析、目录生成,甚至是知识图谱构建这样的场景里,我们经常要跟一堆扁平化的标题列表打交道。别小看这个需求——无论是从PDF里提取的文本,还是Markdown文件的章节标题,它们往往杂乱无章,编号格式还经常混着来。想要把它们组织成有层次、有结构的树形数据,其实是个挺讲究的事。
这篇内容分享的是一个纯Python实现的方案,最大的特点就是不依赖任何第三方库,逻辑简单直接,而且可扩展性足够好。最关键的是,它能同时处理那些既有数字编号(比如“13.3. Risk”这种标准编号),又有后续缩进式子项(比如“SubStrategy”)的混合型标题序列。
整个方案拆成两个步骤来做,核心逻辑就是“分离解析”之后再“层级聚合”。这样设计的好处很明显:绕开那些复杂的正则匹配和递归陷阱,每一步做了什么、结果是什么,都一清二楚。调试起来也友好得多。
第一阶段:按编号提取主干节点,挂载同级子项
具体怎么做呢?先遍历整个标题列表。如果某个标题的开头是数字(直接用title[0].isnumeric()判断),那就把它编号的部分提取出来,比如“13.3.1”这串数字,用作字典的唯一键,然后创建一个初始节点。而那些不以数字开头的标题,比如“SubStrategy”,就直接挂到最近那个有编号的节点的children列表里。这一步等于先把骨架搭好,再把那些零散的子项暂时归位。
第二阶段:基于编号前缀推导父子关系
这一步才是建立真正层级关系的关键。对每个已经建立好的编号节点,截取它的父级编号。举个例子,“13.3.1”的父级就是“13.3”。如果这个父编号在字典里存在,那当前节点就作为子节点挂上去;如果不存在,那它就自动成为根节点。逻辑简单粗暴,但非常有效。
import json
titles = [
"13.3. Risk",
"13.3.1. Strategy",
"SubStrategy",
"13.3.2. Token",
"Material",
"Impact",
"Aling"
]
# Step 1: 构建编号节点字典,挂载直接子项(非编号标题)
results = {}
current_parent = None
for title in titles:
if title and title[0].isnumeric():
# 提取编号(去除末尾点号)
prefix, name = title.split(" ", 1)
key = prefix.strip(".")
current_parent = results.setdefault(key, {"name": title, "children": []})
elif current_parent is not None:
# 将非编号项挂载到最近的编号节点下
current_parent["children"].append(title)
# Step 2: 建立父子层级关系
roots = []
for key, node in results.items():
# 获取父级编号(如 "13.3.1" → "13.3")
parent_key = ".".join(key.split(".")[:-1])
if parent_key in results:
# 父节点存在:当前节点作为其子节点
results[parent_key]["children"].append(node)
else:
# 父节点不存在:当前节点为根
roots.append(node)
# 输出结构化树(JSON格式,便于验证)
print("生成的树形结构(JSON):")
print(json.dumps(roots[0], indent=2, ensure_ascii=False))
运行之后,你得到的就是一个标准的嵌套字典:
{
"name": "13.3. Risk",
"children": [
{
"name": "13.3.1. Strategy",
"children": ["SubStrategy"]
},
{
"name": "13.3.2. Token",
"children": ["Material", "Impact", "Aling"]
}
]
}
如果需要用那种“|_”格式的可视化树形文本,很简单,加一个递归打印函数就行:
def print_tree(node, indent=0):
prefix = " " * indent + "|_"
if isinstance(node, dict) and "name" in node:
print(f"{prefix}'{node['name']}'")
for child in node.get("children", []):
if isinstance(child, dict):
print_tree(child, indent + 1)
else:
print(f"{' ' * (indent + 1)}|____'{child}'")
else:
print(f"{' ' * indent}|____'{node}'")
print("n可视化树形结构:")
print_tree(roots[0])
说几个实践中的要点,能帮你少踩几个坑:
results.keys()预存起来,加速查找过程。这套方法在简洁性和可维护性之间找到了一个很好的平衡点,算得上是处理混合编号标题结构的一种实用范式。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
7
8