
套壳 API 的问题在于:通用模型只有公共知识,没有企业私有知识;只有语言能力,没有业务上下文。要让它真正解决企业问题,必须基于私有知识库搭建一套完整的检索增强生成(RAG)系统。但 RAG 也不是“向量数据库+大模型”这么简单。
一个可落地的私有知识库 AI 应用,至少包含六层:
第一层,文档接入。 来源包括 OA、CRM、ERP、网盘、邮件、工单、Wiki、PDF、Word、Excel、PPT、图片、音视频。不同来源的接入方式不同,需要统一采集和增量同步。
第二层,解析与清洗。 文档解析要处理版式、表格、扫描件、多栏排版、页眉页脚。清洗要去重、去广告、去失效内容、统一术语。这一步做不好,后面全是垃圾进垃圾出。
第三层,分块与元数据。 分块不是简单按字数切。制度文件适合按条款切,产品手册适合按章节切,会议纪要适合按议题切。每个块要带上来源、部门、版本、生效日期、权限标签等元数据,供检索时过滤。
第四层,索引与检索。 单一向量检索容易漏掉关键词和精确匹配。实践中常用混合检索:向量召回+关键词召回,再加重排序模型。对于复杂问题,还可以引入多跳检索、GraphRAG 或 Agent 式检索,让模型先规划再查找。
第五层,生成与引用。 模型生成答案时,必须附带引用来源。如果检索结果不足以回答,系统应明确拒答,而不是让模型“编一个”。拒答能力比回答能力更能体现企业 AI 的成熟度。
第六层,评测与运营。 建评测集,测检索命中率、回答准确率、引用正确率、拒答准确率。上线后收集用户反馈,把“点踩”的问题转化为新的测试用例和知识补充任务。
场景选择同样关键。不要一上来做“万能企业大脑”,先从高频、高价值、边界清晰的场景切入:客服问答、销售支持、研发文档检索、HR 政策咨询、合规审查。一个小场景跑通闭环,比十个半成品更有价值。
大模型应用不是套壳 API,而是“私有知识+检索工程+生成控制+持续运营”的组合。模型只是发动机,知识库是燃料,检索和评测是方向盘和刹车。缺了任何一环,车都跑不远。