ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AI自动出题为什么会出错?企业考试系统如何用知识库约束、题目质检与人工审核控制“幻觉题”

AI自动出题为什么会出错?企业考试系统如何用知识库约束、题目质检与人工审核控制“幻觉题” 一、企业考试中的AI出题和普通AI问答不是一回事很多人第一次设计AI出题功能时思路通常比较直接。例如把培训资料发送给大模型然后使用类似下面的提示词根据以下培训资料生成20道单选题每道题包含题干、4个选项、标准答案和解析。模型很快就可以返回20道题。如果只是内部练习这种方式可能已经够用。但是如果这些题目要进入正式考试题库问题就复杂得多。企业考试通常具有几个明显特点答案必须以企业提供的资料为准题目可能直接影响员工培训成绩部分考试与岗位资格、安全培训、制度考核相关题目和答案必须能够追溯来源同一道题可能被几百甚至几千名员工使用错误答案可能导致大批成绩需要重新计算。所以企业考试系统不能只关注“AI能不能生成题目”而应该关注“AI生成的题目能不能安全进入正式题库”这两个问题完全不同。二、AI自动出题最容易出现哪些问题实际设计AI命题功能时至少要重点防范以下几类问题。1. AI补充了培训资料中不存在的内容假设企业培训资料中写的是“新员工进入生产区域前应完成三级安全教育。”如果模型自身知识中包含大量安全生产相关资料它可能在生成题目时加入“三级安全教育分别由公司级、车间级、班组级组织。”这一描述在某些场景中可能成立。但问题在于用户上传的培训资料里并没有这句话。对于企业考试来说这就是一个非常重要的边界。AI不能因为“知道更多”就自动把外部知识加入企业内部考试。否则就可能出现培训资料讲的是AAI根据通用知识生成了B员工按照培训资料选择A系统却按照AI答案判错。因此企业AI命题的第一条原则应该是答案必须来自指定培训资料而不是来自模型自身的通用知识。三、为什么会产生所谓的“幻觉题”从大模型工作机制来看它更擅长做的是根据上下文生成概率上最合理的文本。而不是传统数据库意义上的查询一个已经确定的唯一答案。因此在企业AI命题过程中如果没有知识边界约束大模型可能会补全材料中没有说明的信息将常识当成企业制度把两个章节内容组合到一起根据上下文推导出一个“看起来正确”的答案将过期资料与当前资料混用对模糊内容进行自行解释。在普通聊天中这些问题有时并不严重。但一旦进入考试题库就会变成题目错误、答案错误和评分争议。因此正式AI命题系统不能只使用Prompt还需要引入知识库和审核机制。四、正确的AI命题架构应该是什么样一个相对完整的企业AI命题链路可以设计为培训资料上传↓文档解析↓章节拆分↓知识点提取↓企业知识库↓指定知识范围↓AI生成候选题↓题目结构校验↓答案一致性校验↓重复题检测↓难度与题型检查↓人工审核↓正式题库这里有一个很重要的概念AI首先生成的应该是“候选题”而不是“正式题”。只有通过规则校验和人工审核后才允许进入正式题库。这个设计看似增加了几个步骤实际上可以大幅降低后期考试纠错成本。五、第一道防线知识库约束AI命题最重要的一步是建立资料边界。例如企业上传《员工安全培训手册.pdf》《2026年度生产管理制度.docx》《设备操作规范.pdf》系统首先不要直接要求AI出题而应该先进行文档解析。例如拆分为文档员工安全培训手册 第一章安全管理基本要求 1.1 员工入厂要求 1.2 劳动防护用品 1.3 危险区域管理 第二章事故处理 2.1 事故报告 2.2 应急响应 2.3 事故复盘随后进一步形成知识片段。例如knowledge_idK202608090001 document 员工安全培训手册.pdf chapter 1.2 劳动防护用品 content 员工进入指定生产区域前应按照岗位要求正确佩戴安全帽、 防护服及其他规定的劳动防护用品。AI生成试题时不再把整个互联网知识作为答案依据而是明确要求只能根据指定knowledge_id对应的内容生成试题。六、RAG在AI出题中的作用是什么这里就可以引入RAG也就是检索增强生成。简单理解就是先找资料再让AI根据资料生成。例如管理员选择岗位设备维护人员知识点设备检修安全题型单选题数量10道系统不是直接告诉AI请生成10道设备检修安全题。而是先从企业知识库中检索与“设备检修安全”最相关的知识片段。例如K001设备检修前必须切断电源。 K002检修前应悬挂警示标识。 K003特殊设备检修需要执行双人确认制度。 K004检修完成后需要填写检修记录。然后将这些知识片段与命题要求一起发送给模型。这样模型生成内容的范围会明显缩小。换句话说不是让AI自己想应该考什么而是告诉AI只能根据哪些内容出题。七、只做RAG还不够还需要强制“来源绑定”企业考试系统最好进一步要求每一道AI题必须绑定来源。例如一道人机生成的题目题干 设备检修前首先应该进行哪项操作 A. 填写检修总结 B. 切断设备电源 C. 更换操作人员 D. 启动备用设备 答案 B 知识点 设备检修安全 来源文档 设备安全管理制度.pdf 来源章节 第三章 设备检修 来源知识片段 K202608090025这种设计有两个好处。第一管理员审核题目时可以直接查看原文。第二如果后续员工对题目提出异议可以快速追溯这道题到底根据哪一段培训资料生成。这比只保存题干和标准答案要可靠得多。八、第二道防线题目结构校验大模型返回内容之后首先不要校验知识而应该先检查数据结构。例如系统要求AI必须返回{ questionType: single, stem: 题干, options: [ 选项A, 选项B, 选项C, 选项D ], answer: [B], analysis: 答案解析, knowledgePoint: 知识点, sourceId: K202608090025 }系统收到数据后可以首先进行程序校验。例如单选题是否只有一个答案多选题是否至少有两个正确答案答案是否存在于选项中是否缺少题干是否存在空选项是否存在完全相同的选项判断题答案是否只能为“正确/错误”这些问题完全没有必要交给人工发现。程序就可以直接拦截。九、第三道防线答案一致性校验这是AI题目质检中非常关键的一步。一种比较实用的方法是生成模型和校验模型分离。第一阶段模型A负责出题。第二阶段模型B重新根据原始知识片段独立回答这道题。例如AI第一次生成题目 设备检修前首先应该做什么 AI答案 B. 切断电源系统随后把原始知识片段题目选项重新交给验证流程。验证模型需要回答根据提供的资料重新判断正确答案。 如果资料无法确定答案请返回 UNSURE如果第二次得到的答案仍然是B说明一致性相对较高。如果第二次得到C或者UNSURE这道题就不应该自动进入题库而应该进入人工复核队列。十、为什么一定要允许模型回答“不确定”很多AI系统容易忽略一个非常重要的设计允许AI不知道。如果Prompt要求必须从ABCD中选择一个正确答案。那么即使资料不足大模型也必须选择一个。这就非常容易制造错误答案。更合理的设计应该是如果当前资料不足以唯一确定标准答案 禁止猜测。 返回 UNSURE企业AI命题系统应该把“无法出题”视为一个正常结果。而不是强迫AI“必须出一道题。”从系统设计角度来说少生成一道题没有什么问题生成一道错误题进入正式考试问题反而更大。十一、第四道防线检测“多个正确答案”单选题最常见的问题并不是完全没有正确答案而是存在两个看起来都正确的答案。例如发生设备异常时应该 A. 立即停止相关操作 B. 根据规定报告负责人 C. 继续观察设备运行 D. 删除运行记录如果培训资料同时要求立即停止操作并报告负责人。那么A和B实际上都可能成立。但AI却可能把这道题生成成单选题。因此题目审核时可以增加选项唯一性检查。让验证模型分别判断A是否正确 B是否正确 C是否正确 D是否正确如果检测结果为A正确 B正确 C错误 D错误那么这道单选题就应该直接标记为答案不唯一。系统可以选择自动改为多选题返回AI重新生成进入人工审核。十二、第五道防线重复题检测AI一次生成几十甚至几百道题时很容易出现一种情况文字不同但考察的是同一件事情。例如题目1设备检修前首先应该做什么题目2进行设备检修作业之前操作人员应优先执行哪一步这两个题目文字不同但本质高度相似。传统字符串匹配可能发现不了。这时可以使用Embedding向量进行语义相似度检测。例如将新题与题库现有试题进行向量比较。如果similarity 0.92则标记高度相似如果0.82 similarity 0.92则标记疑似重复最终交给管理员确认是否入库。需要注意的是这里的阈值不能机械固定不同行业、题库规模和题型都可以单独调优。十三、第六道防线控制题目难度AI出题还有一个很常见的问题管理员要求生成10道中等难度题。最后可能出现8道几乎直接从原文抄答案2道需要复杂推理。所以题目难度不能只依赖模型自己标记。企业考试系统可以采用多个维度评估1. 知识层级是简单记忆还是理解和应用2. 答案显著程度答案是否可以直接从题干中推断出来3. 干扰项质量错误选项是不是一眼就能排除4. 推理步骤是否需要结合两个以上知识点5. 历史作答数据题目正式使用以后还可以根据真实答题数据重新计算难度。例如某道题1000人作答950人答对。那么即使AI最初将它标记为“困难”实际上它也更可能是一道简单题。所以长期来看AI预测难度 历史作答数据应该结合使用。十四、人工审核为什么仍然不能取消做到这里可能会有人问既然已经进行了这么多自动校验还需要人工审核吗答案仍然是正式考试建议保留人工审核。原因很简单。程序可以判断答案格式是否正确是否重复是否缺少选项是否存在明显歧义是否超出资料范围。但是企业内部还有很多业务语义AI并不了解。例如某项制度已经发布新版本但旧文件还存在知识库某个岗位实际执行的是集团补充规定某项政策只适用于特定分公司某个安全要求在不同生产区域执行标准不同。这些情况仅靠模型很难完全判断。因此更合理的设计不是AI替代命题人员。而是AI完成80%左右的机械工作人工完成最后的业务确认。十五、正式题库最好增加“AI题目状态”传统题库通常只有启用停用。如果加入AI命题建议增加更加细化的生命周期。例如AI生成 ↓ 自动质检中 ↓ 质检失败 或 待人工审核 ↓ 审核通过 ↓ 正式题库 ↓ 已用于考试甚至可以增加字段AI生成时间 生成模型 来源资料 知识片段ID 自动质检结果 人工审核人 审核时间 修改记录 正式入库时间这样以后无论是系统管理员还是技术人员都能够知道这道题是怎么来的。十六、AI题目修改后为什么要保留版本还有一个容易被忽略的问题。AI生成一道题以后管理员可能修改题干选项答案解析。如果直接覆盖原数据后面就很难知道到底是AI原始答案错了还是人工修改以后出现错误。因此可以设计Question QuestionVersion例如QuestionID10086 Version 1 AI原始生成 Version 2 管理员第一次修改 Version 3 审核人员修改答案 Version 4 正式发布版本对于正式考试系统来说版本控制不仅适用于试卷同样适用于题目。十七、宏远培训考试系统中的AI命题可以怎样设计以企业培训考试系统的实际应用场景为例AI命题不应该成为一个孤立功能。更合理的方式是让它与已有培训业务结合。例如宏远培训考试系统中可以按照这样的业务链路组织AI命题企业上传培训资料↓系统识别课程章节↓建立知识点↓选择课程或知识范围↓AI生成单选、多选、判断等候选题↓自动检查题目结构↓检查答案与资料一致性↓检测重复题↓管理员人工审核↓进入正式题库↓参与固定组卷或随机组卷↓员工正式考试↓根据答题结果分析知识点掌握情况这样AI就不再只是一个“点击按钮生成20道题”的小工具。而是进入课程 → 知识点 → 题库 → 试卷 → 考试 → 数据分析整个培训考试体系。对于企业来说这种AI能力才更有实际价值。十八、真正有价值的不是“AI一次生成多少题”现在很多系统介绍AI命题时会重点强调“一分钟生成100道题。”从技术上看生成100道题并不困难。真正困难的问题其实是这100道题里有多少可以直接使用多少题答案唯一多少题与企业资料一致多少题没有重复多少题难度合理多少题可以安全用于正式考试假设AI一次生成100道题最终只有40道能够使用。那么表面上生成速度很快管理员实际上仍然需要大量时间审核。因此评价企业AI命题能力不能只看生成速度。更应该看有效题目率。十九、可以建立AI题目质量评分为了方便管理员快速审核还可以给每一道AI题生成一个质量评分。例如资料一致性30分 答案唯一性20分 题目完整性15分 重复度15分 干扰项质量10分 难度匹配10分满分100。例如题目A 资料一致性30 答案唯一性20 完整性15 重复度14 干扰项9 难度匹配8 综合评分96系统可以设置90分以上 优先审核 70-90分 普通审核 70分以下 建议重新生成这样管理员就不需要从几百道AI试题中无差别逐题检查。二十、AI命题最终应该形成完整证据链如果AI未来大量参与企业正式考试那么题目本身也应该具备一定的可追溯能力。理想情况下一道AI题应该能够追溯谁上传了培训资料 ↓ 使用了哪个版本的资料 ↓ 引用了哪个知识片段 ↓ 什么时候调用AI生成 ↓ AI最初生成了什么内容 ↓ 经过哪些自动检查 ↓ 检查结果是什么 ↓ 哪个管理员进行了人工审核 ↓ 管理员修改了哪些内容 ↓ 什么时候进入正式题库 ↓ 参加过哪些正式考试这实际上和在线考试中的答题日志、交卷日志、考试版本控制思路非常类似。考试系统发展到一定阶段以后真正重要的能力往往不是有没有这个功能。而是出了问题以后能不能解释清楚。二十一、一个更完整的AI命题技术架构如果把整个方案整理成技术架构大致可以分成五层。第一层资料层包括WordPDFPPT培训制度岗位手册产品资料安全规程课程资料。第二层知识处理层负责文档解析章节识别文本切片知识点提取Embedding向量检索版本管理。第三层AI生成层负责Prompt模板RAG知识召回题型控制难度控制知识点控制结构化输出。第四层AI质检层负责结构检查答案一致性答案唯一性资料范围检测重复题检测敏感内容检测难度分析。第五层业务审核层负责人工审核题目修改版本记录正式入库试卷组卷正式考试考后统计。这五层组合起来以后AI出题才真正从大模型Demo变成可以进入企业生产环境的考试系统能力。二十二、结语AI确实正在改变企业考试系统的命题方式。过去一个管理员可能需要花几个小时阅读资料、整理知识点、编写几十道题。现在借助大模型同样的初步工作可能很快就可以完成。但对于正式考试来说“生成出来”不等于“可以使用”。真正可靠的AI命题系统必须解决四个核心问题第一AI只能基于指定企业知识出题第二每一道题都应该能够追溯原始资料第三AI生成以后必须经过自动质量检测第四正式进入题库之前仍然要保留人工审核。因此未来企业培训考试系统中真正有竞争力的AI命题能力不会只是一个“AI出题”按钮。而应该是一套完整的知识库约束 AI生成 自动质检 人工审核 版本追溯的题目生产体系。只有把这些环节真正串起来AI才能从提高命题效率的辅助工具逐渐成为企业培训考试数字化体系中真正可靠的一部分
返回列表