展开菜单
首页 精品内容 本月促销 装机必备 Windows macOS软件 IOS软件 Android AI PDF教程 专题
全部分类

当前位置:

首页 > 编程开发 > 如何使用 LangChain 构建基于 JSON 文档的 URL 检索问答系统

如何使用 LangChain 构建基于 JSON 文档的 URL 检索问答系统

介绍如何利用LangChain构建基于JSON文档的URL检索问答系统。核心在于加载JSON时通过元数据绑定URL,确保切分和向量化过程中不丢失链接信息。随后构建检索增强问答链,使用强约束提示词使模型仅返回相关URL,从而精准响应用户的自然语言查询。

如何使用 LangChain 构建基于 JSON 文档的 URL 检索问答系统

本文介绍如何利用 langchain 高效加载、切分和检索结构化 json 数据(含页面内容与对应 url),构建一个能根据用户自然语言查询精准返回相关网页链接的轻量级问答系统。

当你手头的知识库是一堆结构清晰的 JSON 文件,比如每个条目都包含页面内容和对应的 URL,想把它变成一个能“听懂人话”、并精准返回链接的问答系统时,直接套用标准的 RAG 流程往往会掉进坑里。最常见的问题就是:经过文本切分和向量化后,原始的 URL 信息莫名其妙就丢了,导致系统虽然能回答问题,却给不出正确的来源链接。

问题的核心在于方法。正确的思路其实很明确:在保证文本语义完整性的同时,必须将 URL 作为关键元数据显式地绑定到每一段文本上,并通过精准的检索来驱动最终的 URL 输出。下面,我们就来拆解这个端到端的实现方案。

步骤一:用 JSONLoader 加载并结构化解析

第一步是数据加载,这里的关键是“原汁原味”地保留结构。LangChain 提供的 JSONLoader 是这个环节的利器。它能够将 JSON 中的键值对转化为携带元数据的 Document 对象,确保 URL 不会在加载阶段就被丢弃。

from langchain.document_loaders import JSONLoader
import os

# 假设 data.json 内容为 { “about”: {“data”: “This site...”, “url”: “/about”}, ... }
loader = JSONLoader(
    file_path=“data.json”,
    jq_schema=“.[] | {page_name: .page_name, data: .data, url: .url}”,  # 自定义提取逻辑
    text_content=False,  # 关键!禁用自动转字符串,避免破坏结构
    metadata_func=lambda record, metadata: {
        “url”: record.get(“url”, “”),
        “page_name”: record.get(“page_name”, “”)
    })
docs = loader.load()

这里有个技术要点:`jq_schema` 参数让你能用灵活的 jq 语法提取所需字段;而 `metadata_func` 则负责将 URL 等信息作为元数据注入每个 Document 对象,为后续的检索铺平道路。

步骤二:合理切分 + 向量化(保留元数据)

加载后的文档需要切分以适应模型的上下文窗口,但切记,元数据必须跟随文本片段一起走。使用 RecursiveCharacterTextSplitter 时,我们的目标是只对内容部分(如 `page.data`)进行切分,并确保每个切分后的 chunk 都完整继承了原始的 URL 和页面名称。

from langchain.text_splitter import RecursiveCharacterTextSplitter

text_splitter = RecursiveCharacterTextSplitter(
    chunk_size=300,
    chunk_overlap=50,
    separators=[“\n\n”, “\n”, “. “, “! “, “? “])

# 仅对 .page.data 切分,但保留元数据
for doc in docs:
    doc.page_content = doc.metadata.pop(“data”, “”)  # 将 data 提升为 page_content
splits = text_splitter.split_documents(docs)

完成这一步后,每个 Document 对象的 `page_content` 是纯文本片段,而其 `metadata` 字典里则稳稳地保存着对应的 `“url”`。这正是后续能够精准返回 URL 的基石。

步骤三:构建检索增强问答链(RetrievalQA),定制输出格式

接下来进入检索与生成环节。你可以选择 Chroma 作为向量数据库,搭配 GoogleGenerativeAIEmbeddings 或其他嵌入模型。但这个环节的重中之重,在于设计一个强约束的提示词(Prompt),用以“管教”大语言模型,让它只输出我们想要的 URL。

from langchain.vectorstores import Chroma
from langchain_google_genai import GoogleGenerativeAIEmbeddings
from langchain.chains import RetrievalQA
from langchain.prompts import PromptTemplate

embeddings = GoogleGenerativeAIEmbeddings(
    model=“models/embedding-001”,
    google_api_key=GOOGLE_API_KEY)
vectordb = Chroma.from_documents(splits, embeddings, persist_directory=“./chroma_url_db”)
retriever = vectordb.as_retriever(search_kwargs={“k”: 3})

# 强约束 prompt:只返回 URL,不编造、不解释
prompt_template = “”“You are a precise URL lookup assistant.
Given the user‘s question and relevant document snippets (each with ’url‘ metadata), return ONLY the most relevant URL as a plain string (e.g., ’/contact‘), nothing else.

Question: {question}
Context:{context}
Answer (URL only):”“”
PROMPT = PromptTemplate(template=prompt_template, input_variables=[“question”, “context”])

qa_chain = RetrievalQA.from_chain_type(
    llm=llm,
    chain_type=“stuff”,
    retriever=retriever,
    return_source_documents=True,
    chain_type_kwargs={“prompt”: PROMPT},
    verbose=True)

# 使用示例
result = qa_chain.invoke({“question”: “How do I contact support?”})
print(result[“result”])  # 输出类似:“/contact”

注意事项与优化建议

为了让系统更稳健,这里有几个细节值得你关注:

  • 避免 URL 丢失的陷阱:切勿简单地将 URL 字符串拼接到 `page_content` 里(比如写成‘URL: /about Data: ...’)。这样做会污染文本的语义向量,反而降低检索的准确性。
  • 元数据过滤(进阶用法):如果只需要在特定范围的页面内检索(例如仅搜索 `/docs/` 路径下的内容),可以在构建检索器时添加过滤条件,如 `search_kwargs={“filter”: {“url”: {“$regex”: “^/docs/”}}}`。
  • 零样本微调提示:对于数据量很小(比如少于100条记录)的简单场景,可以考虑跳过向量检索,直接使用 StuffDocumentsChain 配合一个精心设计的提示词来提取和总结 URL。
  • 评估验证必不可少:在投入实际使用前,务必用真实的查询语句测试 `retriever.get_relevant_documents(...)` 返回的 Document 是否包含了正确的 `metadata[“url”]`。这是整个流程可靠性的根本。

遵循以上设计,你最终得到的是一个轻量、可控且过程可解释的 JSON 驱动 URL 检索系统。它既充分利用了大语言模型的语义理解能力,又严格保障了 URL 这类关键结构化元数据在流程中的端到端无损传递。

本文内容来源于互联网,如有侵权请联系删除。
作者最新文章
编程开发 AI JSON
相关文章 更多
精品专题 更多
本月促销

正软商城本月促销专区,汇集办公、设计、安全、影音、系统工具及AI软件等正版软件优惠活动,提供限时折扣、特价授权和优惠购买信息,活动库存及价格以页面实时展示为准。

装机必备

正软商城装机必备专区,精选办公、浏览器、安全防护、影音播放、压缩解压、设计创作和系统工具等电脑常用正版软件,帮助用户快速完成新电脑软件配置。

Windows

正软商城Windows软件专区,汇集适用于Windows电脑的办公、设计、安全防护、影音播放、开发工具和系统优化软件,提供软件介绍、系统要求、正版授权及购买下载服务。

macOS软件

正软商城macOS软件专区,精选适用于Mac电脑的办公、设计、影音、效率、开发和系统工具,提供软件功能介绍、macOS兼容版本、正版授权及购买下载服务。

IOS软件

正软商城iOS软件专区,精选适用于iPhone和iPad的办公、学习、影音、设计、效率及AI应用,提供功能介绍、适用设备、系统要求和正版获取方式等信息。

AI

正软商城AI软件专区,汇集AI写作、AI绘画、AI视频、AI办公、AI编程、AI翻译、智能客服和数据分析等人工智能工具,提供功能介绍、适用平台、收费方式及正版购买信息。

PDF教程

正软商城PDF教程频道提供PDF编辑、转换、合并、拆分、压缩及格式处理方法,同时介绍常用PDF软件和工具的使用技巧。

Mac软件 更多
灵活计算器
灵活计算器

灵活计算器是一款笔记式算数应用,支持实时计算、动态关联和云端同步功能。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

赤友清理大师
赤友清理大师

赤友清理大师是一款为 Mac 设计的智能清理优化工具,可精准扫描垃圾、大文件、重复文件等,释放磁盘空间。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

图几
图几

图几是一款适用于 macOS 的截图、标注与美化工具,支持离线操作保障隐私。界面整理和高频系统操作被放到一起考虑,桌面或窗口内容一多时,管理起来会更省心。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Menuist
Menuist

Menuist 是一款面向 macOS 的 Finder 右键菜单增强工具,主要用来补充新建文件、快捷导航等常用操作,让日常文件管理和访问路径时更高效、更顺手。

Mole
Mole

Mole 是一款专为 Mac 设计的深度清理优化工具,涵盖缓存清理、应用管理及实时状态监控等功能。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

WINDOWS 更多
Windows 10
Windows 10

Windows 10 是一款微软推出的经典操作系统,拥有硬件兼容性与多任务处理能力。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

极度公式
极度公式

极度公式是一款跨平台专业LaTeX公式识别编辑软件,支持OCR公式识别和多平台编辑。和使用说明,避免使用,享受完整功能与稳定支持。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

密码键盘
密码键盘

密码键盘是一款兼具安全性与便捷性的高效密码管理器。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

思源笔记
思源笔记

思源笔记是一款本地笔记软件,提供所见即所得的编辑方式,为长文写作带来顺滑的体验。记录、整理和输出之间的过渡会更自然,适合长期写作、做笔记或持续沉淀个人内容。

傲梅轻松备份
傲梅轻松备份

傲梅轻松备份是一款专业易用的数据备份软件,为重要数据提供安全保障。日常使用里的持续防护和信息管理会更突出,适合把安全控制放进长期使用流程中的场景。

Office 365 简体中文
Office 365 简体中文

一款文字处理软件,一种订阅式的跨平台办公软件,基于云平台提供多种服务,通过将 Excel 和 Outlook 等应用与 OneDrive 和 Microsoft Teams 等强大的云服务相结合,Office 365 可让任何人使用任何设备随时随地创建和共享内容。

Wise Folder Hider Pro
Wise Folder Hider Pro

Wise Folder Hider Pro 是一款专业级文件和文件夹隐藏加密软件,为私密数据添加多重保护。高频操作更强调就近处理,浏览、整理和跨目录移动文件时,来回切换和重复点击都会少很多。

WALTR PRO
WALTR PRO

WALTR是一款电脑至iOS文件传输转换工具,操作简单,快速实现文件识别与传送。做扫描整理、文字提取和表格转换时,它能把识别后的处理步骤接得更顺,资料录入这类场景会省下不少时间。

CodeExpander
CodeExpander

CodeExpander 是一款快捷短语输入增强工具,通过键入缩写自动展开为自定义文段,提升工作效率。任务管理和过程控制会更完整,持续下载、批量同步或需要稳定传输流程的场景会更适合它。

PinStack
PinStack

PinStack是一款轻量级的Windows平台剪贴板管理工具,优化您的剪贴板使用体验。它更偏向把系统状态查看和常用调节动作放在一起,适合需要持续观察和微调设备状态的场景。

Mountain Duck
Mountain Duck

Mountain Duck 是一款能将多个网盘挂载到本地的工具,像本地磁盘一样使用网盘。清理链路的完整性会更好一些,做应用卸载、残留处理和空间整理时,通常能少走很多手动排查步骤。

Seer
Seer

Seer是一款在Win平台下的空格键功能增强效率工具,只需轻敲空格键,就能预览几乎任何格式的文件。它更适合把零散的小功能集中起来使用,处理高频琐碎任务时会更省事。