发布于2026-05-21 阅读(0)
扫一扫,手机访问

本文介绍如何利用 langchain 高效加载、切分和检索结构化 json 数据(含页面内容与对应 url),构建一个能根据用户自然语言查询精准返回相关网页链接的轻量级问答系统。
当你手头的知识库是一堆结构清晰的 JSON 文件,比如每个条目都包含页面内容和对应的 URL,想把它变成一个能“听懂人话”、并精准返回链接的问答系统时,直接套用标准的 RAG 流程往往会掉进坑里。最常见的问题就是:经过文本切分和向量化后,原始的 URL 信息莫名其妙就丢了,导致系统虽然能回答问题,却给不出正确的来源链接。
问题的核心在于方法。正确的思路其实很明确:在保证文本语义完整性的同时,必须将 URL 作为关键元数据显式地绑定到每一段文本上,并通过精准的检索来驱动最终的 URL 输出。下面,我们就来拆解这个端到端的实现方案。
第一步是数据加载,这里的关键是“原汁原味”地保留结构。LangChain 提供的 JSONLoader 是这个环节的利器。它能够将 JSON 中的键值对转化为携带元数据的 Document 对象,确保 URL 不会在加载阶段就被丢弃。
from langchain.document_loaders import JSONLoader
import os
# 假设 data.json 内容为 { “about”: {“data”: “This site...”, “url”: “/about”}, ... }
loader = JSONLoader(
file_path=“data.json”,
jq_schema=“.[] | {page_name: .page_name, data: .data, url: .url}”, # 自定义提取逻辑
text_content=False, # 关键!禁用自动转字符串,避免破坏结构
metadata_func=lambda record, metadata: {
“url”: record.get(“url”, “”),
“page_name”: record.get(“page_name”, “”)
})
docs = loader.load()
这里有个技术要点:`jq_schema` 参数让你能用灵活的 jq 语法提取所需字段;而 `metadata_func` 则负责将 URL 等信息作为元数据注入每个 Document 对象,为后续的检索铺平道路。
加载后的文档需要切分以适应模型的上下文窗口,但切记,元数据必须跟随文本片段一起走。使用 RecursiveCharacterTextSplitter 时,我们的目标是只对内容部分(如 `page.data`)进行切分,并确保每个切分后的 chunk 都完整继承了原始的 URL 和页面名称。
from langchain.text_splitter import RecursiveCharacterTextSplitter
text_splitter = RecursiveCharacterTextSplitter(
chunk_size=300,
chunk_overlap=50,
separators=[“\n\n”, “\n”, “. “, “! “, “? “])
# 仅对 .page.data 切分,但保留元数据
for doc in docs:
doc.page_content = doc.metadata.pop(“data”, “”) # 将 data 提升为 page_content
splits = text_splitter.split_documents(docs)
完成这一步后,每个 Document 对象的 `page_content` 是纯文本片段,而其 `metadata` 字典里则稳稳地保存着对应的 `“url”`。这正是后续能够精准返回 URL 的基石。
接下来进入检索与生成环节。你可以选择 Chroma 作为向量数据库,搭配 GoogleGenerativeAIEmbeddings 或其他嵌入模型。但这个环节的重中之重,在于设计一个强约束的提示词(Prompt),用以“管教”大语言模型,让它只输出我们想要的 URL。
from langchain.vectorstores import Chroma
from langchain_google_genai import GoogleGenerativeAIEmbeddings
from langchain.chains import RetrievalQA
from langchain.prompts import PromptTemplate
embeddings = GoogleGenerativeAIEmbeddings(
model=“models/embedding-001”,
google_api_key=GOOGLE_API_KEY)
vectordb = Chroma.from_documents(splits, embeddings, persist_directory=“./chroma_url_db”)
retriever = vectordb.as_retriever(search_kwargs={“k”: 3})
# 强约束 prompt:只返回 URL,不编造、不解释
prompt_template = “”“You are a precise URL lookup assistant.
Given the user‘s question and relevant document snippets (each with ’url‘ metadata), return ONLY the most relevant URL as a plain string (e.g., ’/contact‘), nothing else.
Question: {question}
Context:{context}
Answer (URL only):”“”
PROMPT = PromptTemplate(template=prompt_template, input_variables=[“question”, “context”])
qa_chain = RetrievalQA.from_chain_type(
llm=llm,
chain_type=“stuff”,
retriever=retriever,
return_source_documents=True,
chain_type_kwargs={“prompt”: PROMPT},
verbose=True)
# 使用示例
result = qa_chain.invoke({“question”: “How do I contact support?”})
print(result[“result”]) # 输出类似:“/contact”
为了让系统更稳健,这里有几个细节值得你关注:
遵循以上设计,你最终得到的是一个轻量、可控且过程可解释的 JSON 驱动 URL 检索系统。它既充分利用了大语言模型的语义理解能力,又严格保障了 URL 这类关键结构化元数据在流程中的端到端无损传递。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
7
8