返回SkillsSkills

RAG-Evaluation

Prompt/模型/知识库变更后必跑同一批样本,关键指标低于阈值不发布。

RAG-Evaluation

  • 分类04-AI-Delivery
  • 成熟度usable
  • 一句话:RAG 评估驱动开发(EDD)与 Golden Dataset

适用场景

  • RAG PoC
  • 知识库上线前
  • 效果争议
  • 版本升级回归

问题定义

RAG 项目凭感觉调参,无法证明效果,客户不信任。

方法论框架

EDD 五层指标

质量/效率/体验/风险/业务 → 可采集指标。

Golden Dataset

输入+期望+引用+风险等级+评分标准;含边界样本和失败样本。

回归门禁

Prompt/模型/知识库变更后必跑同一批样本,关键指标低于阈值不发布。

输入 / 输出

输入

  • 业务指标定义
  • 历史问题样本
  • 知识库范围

输出

  • 评估指标表
  • Golden Dataset
  • 评测报告
  • 回归门禁规则

执行步骤

  1. 业务指标转评估指标
  2. 采集 20-50 样本
  3. 定义评分标准
  4. 建立基线
  5. 每轮迭代回归
  6. 上线门禁对齐

常见误区

  • ❌ 样本无代表性
  • ❌ 只评生成不评检索
  • ❌ 无回归门禁
  • ❌ 忽略引用准确率

交付物清单

  • 指标表
  • Golden Dataset
  • 评测报告

与国内 FDE 生态关联

EDD 评估驱动开发落地;外部 rag-architect/langchain-rag 可参考。

阶段门控

阶段进入条件退出标准
PoC 准备干系人识别、场景卡草稿、数据/权限前置条件确认范围与验收指标书面确认
PoC/Beta 执行方法论对齐、AIBP 双签场景卡核心交付物初稿 + 周度 Demo ≥1 次
生产门禁RBAC/评估/人审/日志检查通过evaluation.md 指标 ≥80%
复盘资产化阶段结束或里程碑完成可复用模板/评估集沉淀至 10-Templates_catalog

协作接口

角色本 Skill 中的职责交接物
FDE主导本 Skill 执行与交付过程文档 + 验收材料
AIBP提供业务口径、Ground Truth、验收反馈场景卡 / 样本 / 指标定义
业务 Owner决策优先级与范围签字确认的范围与验收
IT/安全评审权限、部署、信创/等保边界评审意见与整改清单

关联 Skill

推荐组合

外部工程参考

  • .agents/skills/rag-architect
  • .agents/skills/langchain-rag
  • .agents/skills/rag-implementation

场景深潜

场景 1:RAG PoC

触发信号:PoC/Beta/生产任一阶段出现「RAG PoC」相关诉求、阻塞或复盘需求。

关键动作:业务指标转评估指标

FDE 注意:避免 样本无代表性

成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。

场景 2:知识库上线前

触发信号:PoC/Beta/生产任一阶段出现「知识库上线前」相关诉求、阻塞或复盘需求。

关键动作:采集 20-50 样本

FDE 注意:避免 只评生成不评检索

成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。

场景 3:效果争议

触发信号:PoC/Beta/生产任一阶段出现「效果争议」相关诉求、阻塞或复盘需求。

关键动作:定义评分标准

FDE 注意:避免 无回归门禁

成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。

场景 4:版本升级回归

触发信号:PoC/Beta/生产任一阶段出现「版本升级回归」相关诉求、阻塞或复盘需求。

关键动作:建立基线

FDE 注意:避免 忽略引用准确率

成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。

术语表

术语含义
FDEForward Deployed Engineer,嵌入客户现场的技术交付角色
AIBPAI Business Partner,业务效果与 Ground Truth 负责人
PoCProof of Concept,验证核心假设的最小可运行版本
Beta小范围试点,验证采纳与流程嵌入
信创信息技术应用创新,国产化软硬件与合规要求
EDDEvaluation Driven Development,评估驱动开发
Ground Truth业务真值样本,用于评估与验收
场景卡FDE 与 AIBP 对场景范围、指标、边界的共同协议
周度 Demo按周演示进展、收集反馈的项目节奏控制器
上线门禁生产发布前对权限、评估、人审、日志的检查关卡

常见问题 FAQ

Q1:执行【RAG-Evaluation】时如何避免「样本无代表性」?

A:按 README 方法论逐步执行,在周度 Demo 展示阶段性交付物;若 PoC 材料不齐,先输出「待验证清单」再推进。

Q2:私有化/信创/等保环境下有哪些额外约束?

A:在 prompt 约束段明确部署形态;涉及数据不出域、国产化组件、审计日志时同步引用 Private-Deployment-Gateway 与 RBAC-Audit。

Q3:与 AIBP 分工边界不清怎么办?

A:回到 AIBP-Collaboration-Playbook 更新 RACI;AIBP 负责 Ground Truth 与业务验收,FDE 负责可交付技术资产。

Q4:PoC 通过后如何衔接到 Beta/生产?

A:输出物中标注下一阶段 Skill(如 RAG-Evaluation→Private-Deployment-Gateway→FDE-Adoption-Growth),并在 checklist 触发上线门禁。

案例片段(示意)

以下为示意性片段,实际项目请替换为客户真实信息(数据脱敏)。

背景:知识库 PoC。

应用本 Skill 前:凭感觉调参,客户质疑效果。

应用本 Skill 后

  1. 按【RAG-Evaluation】方法论输出核心交付物
  2. 在周度 Demo 展示进展,AIBP 共审 Ground Truth/指标
  3. 对照 evaluation.md 自评,触发上线门禁(如适用)

结果:Beta 引用准确率 78% 达上线阈值。

版本记录

版本日期变更
v1.12026-07-12FDE 场景增强:交叉引用、场景深潜、FAQ
v1.02026-07-12目录重组后首次充实版

下载完整技能包

打包「RAG-Evaluation」的全部资源,可直接导入 Claude / Cursor / Codex 等支持 Agent Skills 的工具,或作为团队方法论模板复用。

4 个文件ZIP · 7 KB

技能包内容

  • checklist.md
  • evaluation.md
  • prompt.md
  • README.md

如何使用

  1. 下载并解压 ZIP 到本地技能目录。
  2. 阅读 SKILL.md 了解触发条件与整体流程。
  3. workflow / prompt 分步执行,用 templates examples 产出交付物。
  4. checklist / evaluation 做自检与质量校验。
下载技能包(.zip)

本技能包用于方法论学习与交付参考,请结合企业实际数据、权限与合规要求使用。