错误样本
保留原始问题、回答、引用来源、正确依据和业务影响,才能定位问题环节。


保留原始问题、回答、引用来源、正确依据和业务影响,才能定位问题环节。
制度、产品、报价和流程资料要有来源、负责人、适用范围和版本状态。
核对召回的文件与片段是否真正支持答案,不把相近内容当成同一结论。
资料不足、无权限或需要人工判断时,应说明边界或转人工,不编造答案。
不同部门和角色能检索到的资料应按实际授权划分,敏感资料不能因为提问方式改变而被暴露。
用岗位测试题、人工纠正和未命中记录持续复盘,不以单次演示代替上线验收。
每次发现回答不准,先记录原始问题、提问人角色、回答全文、引用文件或页面、正确依据、发生日期和业务影响。没有样本就很难判断是偶发生成、资料过期、检索偏差,还是提问本身超出了知识库范围。
测试题不要只挑容易命中的标准问法。应覆盖产品参数、制度流程、售后边界、价格与交期、跨部门问题、没有答案的问题和不同角色的权限问题。这样才能看清系统在哪些真实场景中可靠,哪些问题需要补资料或转人工。
知识库中的制度、产品手册、报价规则、售后说明和流程文件,应有明确来源、负责人、生效范围和版本状态。旧版与新版同时存在、不同部门口径冲突、扫描件表格解析缺失,都会让系统拿到相互矛盾或不完整的依据。
对高风险或高频问题,建议把关键结论整理为可核验的问答、流程说明或结构化字段,并保留原始文件位置。涉及价格、合同、财务、人事、客户资料和安全边界时,不能把未确认内容写成统一结论。
回答不准不等于模型一定有问题。先检查系统召回了哪些文件和片段:是否命中了无关内容、是否漏掉了正确版本、是否把多个相近产品或制度混在一起。能查看引用来源时,应让业务人员核对引用原文是否支持回答。
不同平台会提供全文、语义或混合检索,以及召回数量、匹配分等设置。调整前要先用同一批测试题记录现状,再一次只改变一个因素并复测,避免同时改资料、检索和提示要求后无法判断是哪一步带来了变化。
企业知识库适合回答有明确来源的制度、产品、流程和常见问题。遇到资料没有覆盖、信息已经失效、需要人工判断或用户没有权限查看的问题,系统应提示资料不足、给出可核验来源或转交对应人员,而不是补全猜测。
对客服、售后、报价和审批等场景,应明确哪些内容只可提供说明,哪些必须由人工确认。这样既减少错误承诺,也能让团队把高频未命中问题回收到资料治理和业务流程中。
上线前可按岗位建立测试题集,并记录正确依据、允许的回答范围、是否必须引用来源、是否需要人工转接和验收结果。上线后继续跟踪未命中、低评价、人工纠正和高频追问,把问题按资料、检索、权限、流程或模型表达分类。
企业AI项目的目标不是让所有问题都自动回答,而是让有依据的问题更容易找到,让没有依据的问题不被伪装成确定答案。猪运赢可协助梳理场景、资料结构、试点测试和培训边界;具体系统、数据接入、权限与交付范围以书面方案为准。
不一定。先核对资料是否过期或冲突、系统是否检索到正确来源、问题是否超出知识库范围,以及答案是否需要人工确认。没有完成这些检查前,直接换模型很难判断问题是否真的解决。
先保存原始问题和回答,再查看是否有引用文件或片段。随后核对正确资料是否已经入库、是否是当前版本,以及提问是否包含足够的产品、角色或场景信息。
应明确说明没有找到可用依据,并提示用户补充信息、查看指定资料或转交人工处理。对价格、合同、审批、财务和敏感资料等场景,不宜生成看似确定但没有来源的结论。
按岗位和真实业务场景建立测试题,记录正确依据、回答范围、是否必须展示来源、是否需要人工转接及每次结果。上线后继续复盘未命中、低评价和人工纠正的问题。
数量不能替代资料质量。可能原因包括文件解析缺失、命名和分类混乱、版本冲突、问题表达与资料不匹配,或检索策略没有召回正确片段。应从错误样本出发逐项验证。
可协助梳理业务场景、资料结构、试点测试、培训和验收边界。具体系统选择、资料接入、权限、接口、部署和持续维护范围,以双方确认的书面方案为准。