RAG 评估表达
RAG 项目怎么在简历里写评估方法与结果?
RAG 项目中的结果需要带有评估口径。写明评估什么、样本来自哪里、怎样判断,以及你做了什么改动。检索到相关文档与生成正确答案是不同目标,简历中应区分。样本较少时,明确为小规模验证。
先明确评估对象
检索阶段可以检查相关来源是否出现在返回结果中;回答阶段可以检查答案是否符合来源、是否完整、是否在资料不足时说明限制。你实际检查的是哪一项,就写清哪一项。
仅凭几个回答看起来不错,不能得出通用准确率。自动评分、人工检查和规则校验各有范围,使用哪种方式都要能解释判断规则。
说明样本与判断方法
保留问题来源、样本数量、资料版本和预期来源。例如从课程文档整理常见问题,为每个问题标注支持片段,再检查检索返回与答案引用。简历可以简写方法,面试材料保留记录。
使用自建问题集时,应说明它覆盖的范围。若问题都来自已知文档且表达相近,结果不能代表所有真实用户提问。修改前后比较需要固定问题集和其他条件。
把无依据结论改成可解释工作
没有完整指标时,也能展示整理评估样本、分析失败和修正流程的工程工作。
选择一个失败案例深入说明
失败可以来自文档解析、分段、检索、排序或生成。例如表格内容没有正确进入索引,回答缺少关键条件;或相似标题造成来源混淆。先定位环节,再说明自己采取的处理和复查。
只修改提示词而没有验证,不写效果已改善。复查仍有未解决问题时,在项目材料中保留局限。简历选最能说明个人贡献的一例即可。
按三部分放进项目正文
先写场景与职责:使用什么资料、解决什么问题、你负责哪部分。再写关键实现:具体分析与改动。最后写验证:相同问题集下检查什么以及有哪些局限。不要把整份评估报告塞进技能栏。
- 评估目标区分检索与回答。
- 题目、资料版本和判断方式可解释。
- 前后比较条件一致。
- 指标有分母和样本范围。
- 没有把原型测试写成线上用户效果。
把准备好的内容,放进合适的版式
适合这类内容的模板
先看要展示的内容,再决定版式
按用途继续选择
把经历写清楚,再选一个喜欢的版式