新闻资讯
多咖AI

AI 问答应用答非所问?排查知识库建设的 6 个常见问题

AI 问答应用上线后,最让人头疼的不是“回答得不够好”,而是“答非所问”。用户问报销标准,它讲公司愿景;用户问产品参数,它背了一遍企业文化。换模型、调提示词,折腾一圈,效果依旧。问题往往不在模型,而在知识库建设。以下六个常见问题,是“答非所问”的高频根源。

AI 问答应用答非所问?排查知识库建设的 6 个常见问题

问题一:源文档质量差,垃圾进垃圾出。 知识库里躺着扫描件 OCR 错字、多版本冲突、过期制度、页眉页脚混杂的 PDF。检索系统召回的就是这些噪声,模型只能基于错误信息生成答案。排查方法:随机抽取 20 份高频文档,人工检查解析准确率和内容时效性。如果源数据不过关,先做文档治理,再谈 AI。

问题二:分块策略一刀切。 所有文档按固定字数切分,导致一条完整制度被切成三段,或一个表格被拦腰截断。用户问“年假天数”,检索到的只是半句话。正确做法是按文档类型分块:制度按条款,手册按章节,会议纪要按议题,表格保留结构。分块不合理,检索再强也拼不出完整答案。

问题三:检索策略单一,只做向量召回。 向量检索擅长语义相似,但对专有名词、编号、精确条款不敏感。用户问“ISO 27001 第 8.2 条”,向量检索可能返回一堆泛泛的安全文档。需要混合检索:向量召回+关键词召回,再加重排序模型。单一检索策略是“答非所问”的常见技术原因。

问题四:缺少元数据,检索无法过滤。 文档没有部门、版本、生效日期、权限标签,检索时无法按“最新版”“本部门”“有权限”等条件过滤。用户问“最新差旅标准”,系统可能召回三年前的旧规。元数据是检索的导航仪,没有它,模型只能在信息海洋里盲游。

问题五:没有评测集,凭感觉调优。 “我觉得回答得还行”不是评测。没有标准问题集、标准答案和命中率指标,就无法判断问题出在检索还是生成,也无法验证优化是否有效。建议先建 50—100 条评测集,覆盖高频问题和边界情况,定期跑分。没有评测,调优就是碰运气。

问题六:场景太宽,追求“万能问答”。 一上来就让 AI 回答所有问题,结果每个领域都浅尝辄止。用户问 HR 政策,系统用产品文档回答;问技术问题,系统用营销话术应付。正确做法是选一个高频、边界清晰的场景,做到 90 分,再横向扩展。场景越聚焦,知识库越精准,回答越靠谱。

排查“答非所问”,建议按这个顺序:先看源文档质量,再看分块和元数据,然后检查检索策略和重排,最后看评测和场景设计。模型是最后一步,不是第一步。把知识库的地基打牢,AI 问答才能从“答非所问”变成“答有所据”。