← 返回全部项目

世界杯百科智能问答 BOT

基于 Dify 与 RAG 搭建的世界杯主题知识库问答应用,将分散的赛事资料整理为可检索内容,并围绕文档预处理、知识库切片、检索配置、Prompt 优化、多场景问答和嵌入方式完成实践。

项目背景

世界杯相关信息覆盖赛程、球队、球员、历届赛果、赛事规则和比赛场馆等多个主题,资料来源分散,时间跨度也很长。用户如果依赖普通搜索,需要在不同页面之间反复查找;直接询问通用大模型,又可能遇到资料滞后、事实混淆或脱离来源作答的问题。

这个项目使用 Dify 搭建世界杯百科智能问答 BOT,并配置专属 RAG 知识库,希望把分散资料整理为可检索的内容集合,再通过检索增强生成让模型优先依据知识库回答。项目重点不是制作一个固定问答列表,而是实践从资料处理、知识库配置到问答调试和应用发布的完整流程。

问题与目标

  • 组织主题资料:对世界杯相关文档进行整理和预处理,使不同主题、不同格式的内容能够进入统一知识库。
  • 改善检索上下文:通过文档切片和检索配置,让系统能够找到与问题相关的资料片段,并把有效上下文交给模型生成回答。
  • 减少事实偏离:利用 RAG 约束回答依据,降低模型在赛事数据、历史结果和规则类问题上脱离资料自由生成的风险。
  • 覆盖多类问题:围绕赛程、球队战绩、球员信息、历届赛果、赛事规则和球场资料等场景进行问答调试,并关注连续追问时的上下文表现。
  • 验证交付方式:在 Dify 中完成应用编排,并验证通过网页或公众号嵌入方式向实际访问入口提供问答能力的可行性。

个人职责

  1. 资料整理与预处理:梳理世界杯主题资料,处理不利于检索的排版和内容结构,为后续切片与入库做准备。
  2. 知识库配置:在 Dify 中建立知识库,调整文档切片方式与检索设置,观察不同配置对召回内容和回答完整度的影响。
  3. Prompt 设计:编写并迭代问答提示词,明确回答范围、资料优先级和表达方式,减少模型偏离世界杯主题或忽略检索内容。
  4. 场景调试:针对赛程、球队、球员、历史赛果、赛事规则和球场等不同类型的问题进行测试,并检查单轮回答和连续追问的表现。
  5. 应用呈现:完成 Dify 应用编排,生成并验证网页或公众号嵌入方式,了解从知识库配置到用户访问入口的交付链路。

方案与技术栈

  • Dify 应用编排:用于创建知识库、配置检索、连接大模型、组织对话流程,并提供应用调试和嵌入能力。
  • RAG 检索增强生成:在生成回答前从世界杯专属资料中检索相关内容,让回答尽量建立在已有知识文档之上。
  • Embedding 向量检索:把用户问题与知识分块转换为可比较的语义表示,用于召回主题相关的资料片段。
  • 知识库切片与检索策略:围绕段落完整性、主题边界和检索上下文调整分片与召回配置,减少信息被切断或无关内容混入。
  • Prompt Engineering:约束回答角色、主题范围和回答方式,引导模型结合检索结果完成赛事信息问答和多轮追问。
  • 网页与公众号嵌入:验证 Dify 应用从配置界面走向用户入口的轻量化接入方式,为后续部署和展示积累经验。

成果与证据

  • 完成世界杯主题资料的整理、预处理和知识库导入,形成可用于检索问答的内容基础。
  • 完成 Dify 知识库、应用流程、检索策略和 Prompt 的组合配置,跑通从用户提问、资料召回到模型回答的基本链路。
  • 覆盖赛程、球队、球员、历届赛果、赛事规则和球场信息等多类问答场景,并对连续追问进行调试。
  • 验证网页或公众号嵌入方式,确认应用可以通过轻量入口向用户提供问答能力。
  • 沉淀了资料质量、文档切片、检索结果和提示词之间相互影响的实践经验,为后续代码型 RAG 项目提供了基础。

目前项目缺少可公开复核的标准测试集、原始测试结果和统一统计口径,因此不展示未经验证的准确率与响应时间数字。现阶段证据以经过审核的项目说明和实际配置流程为主。

复盘

这个项目让我第一次完整理解 RAG 应用并不是“上传文档后直接提问”。资料本身的质量、切片是否保留完整语义、检索能否召回正确上下文、Prompt 是否真正使用检索结果,都会影响最终回答。Dify 降低了应用编排门槛,但效果判断仍然需要清晰的测试场景和持续调试。

项目当前更能证明 Dify、RAG 知识库配置和 Prompt 调试的实践过程,还不能替代严格的效果评测。下一阶段需要补充固定问题集、失败案例、检索参数记录以及调优前后的对比结果,使回答质量能够被重复验证,而不是只依赖主观体验。

公开链接

当前公开内容以经过审核的项目说明为主,Dify 应用截图、独立演示入口和相关配置记录仍在整理。由于现阶段还没有完成公开环境复核,不提供无法持续访问或缺少说明的临时链接。

后续将在确认知识库资料可公开、应用配置不包含敏感信息,并完成基础问答回归测试后,再补充可复验的演示材料。