首页 / 资源中心 / AI落地实践

AI落地实践

Demo好看上线拉胯?FDE的质量阀门:评估驱动开发(EDD)与黄金数据集

标手Top · FDE 工业AI落地2026-07-30阅读 7 分钟

上个月我见了个做制造业跟单的团队。他们的 AI Demo 在我面前跑得漂亮——自动跟单、智能催货、异常预警,一套一套的。我问他:"上线三个月,业务方用得怎么样?"他沉默了。"其实……基本没人用。"再追问为什么,他也说不清楚,只感觉"好像还行,但说不上哪里别扭"。

这恰恰是所有 AI 项目最容易栽的坑:我们验收软件看接口返回 200、测试用例通过,但 AI 是概率性的——同一个问题,今天答得对,明天可能答偏。没有"标准答案"可对照,你就永远说不清它到底行不行。

前九讲我们武装了从认知到工具、从架构到规模化的全链路,但始终悬着一个核心问题:你怎么知道你的 AI 系统是"好"的?这一讲,FDE 给出它的答案——评估驱动开发(EDD)配上黄金数据集,作为交付体系里那道质量阀门

一、传统测试,到了 AI 这儿彻底不好使

在传统软件工程里,测试是开发之后的一个环节:写代码 → 功能测试 → 修 bug → 上线。这套流程在确定性软件里运转良好,因为输出可预期。

但到了大模型时代,这套体系直接崩了。AI 的输出是概率性的,根本没有"标准答案"。我见过太多项目陷在"Demo 好看、上线不好用"的怪圈里——现场演示天衣无缝,真放到业务里,三天两头出岔子。

根子上的原因,往往是缺一套端到端的评估体系。FDE 的态度很明确:评估机制不是项目快结束时才补的课,而必须在项目启动的第一天就立起来。否则你连"现在到底差多远"都量不出来,更别提向业务方证明系统达标了。

▎ 管 AI 的前提是可测量——量不出来,就优化不了,也交付不了。

二、EDD:先画靶,再射箭

EDD 全称 Evaluation-Driven Development,评估驱动开发。核心理念一句话:在写任何一行 Prompt 之前,先把评估样本、业务指标和验收标准定义清楚,让评估反馈成为迭代的唯一导航

它有三道铁律,少一条都不行:

样本先于代码。 在配置第一个 Prompt 之前,先攒出黄金数据集。没有数据,评估就无从谈起,你写的每一版都只能靠"我觉得"。

指标先于功能。 在定义"这个 Agent 能干什么"之前,先定义"怎样才算干得好"。这里有个关键判断——业务指标(采纳率、首解率)永远比技术指标(准确率)重要。业务方不在乎你检索多准,只在乎活儿干完没有。

回归先于发布。 每次改了 Prompt、知识库或模型,必须重跑一遍回归测试集,确认老能力没被新改动搞坏。

三、黄金数据集:四类样本撑起评估底座

黄金数据集(Golden Dataset)是 EDD 的基石,它是一组经过人工标注、代表真实业务场景的"输入—输出"对。这东西不是一次性建成的,得随项目推进持续扩充。

一个高质量的黄金数据集,必须包含四类样本:

真实样本(Typical Cases)——从业务日志里随机抽样,覆盖日常八成场景。比如制造业跟单里那些正常订单的跟进记录,量大、基础,但最容易被忽略。

边界样本(Edge Cases)——少见但合法的情况,比如客户用特殊话术催单、夹带表格的异常订单。这些恰恰是 AI 最容易翻车的地方。

失败样本(Failure Cases)——历史上人工处理出错、或 AI 曾经答错的案例,专门拿来压测系统底线。

高风险样本(High-Risk Cases)——涉及退款、删单、改价这类高危操作,必须严格验证 AI 在这些场景下的行为是否正确,错一次就是事故。

💡 划重点

攒数据集分四步:业务访谈(和 AIBP 一起梳理最频繁、最耗时、最易错的场景)→ 数据采集(从系统日志、聊天记录抽取并脱敏)→ 人工标注(标"理想输出/可接受输出/禁止输出"并写依据)→ 版本管理(和代码库、Prompt 库同步迭代)。

四、业务指标才是真指标

评估体系不能只盯着准确率、召回率这些技术指标。业务方只关心一件事:AI 到底帮他省了钱、省了时间、还是降了风险。

技术指标层能告诉你检索精度够不够、答案相关性打几分、工具调用对不对、多步任务跑完没跑完。但往上一层,业务指标才是落地的语言:

  • 用户采纳率:业务方是直接用 AI 的输出,还是改了半天才用?
  • 人工接管率:多少场景还得人兜着?
  • 错误逃逸率:AI 答错的里面,有多少已经流到客户那边了?
  • 工时效用:辅助之后,单位任务处理时间砍掉了多少?

FDE 交作业的时候,翻译这一步不能省。"准确率 95%"这句话对老板没冲击力;换成"跟单员每天省 2 小时、错漏率降 80%",决策层才听得懂、才肯掏钱

五、LLM as Judge:让模型评模型,但别无脑信

黄金数据集一大,人工评估成本就扛不住了。FDE 会启用"LLM as Judge"——让一个更强的模型当评委,给候选答案打分。

但这招不是万能的,流程必须严谨:

给评分量规(Rubric)。 明明白白告诉评委,什么样的答案算高分。比如"若答案未引用给定上下文,扣 2 分",越具体,评分越稳。

双盲交叉评估。 用不同模型互相评:Claude 评 DeepSeek,GPT 评 Qwen,抵消单一模型的系统性偏差。

人工抽检校准。 定期抽 10% 的机器评分由人工复核,确保机器判断和人的标准对得上。

✎ 互动提问

如果评委模型本身也会犯 hallucination,我们拿什么保证它打的分是可信的?

六、回归门禁:挡住"偷偷变差"的那道闸

AI 系统最招人烦的问题之一,叫"退化"——昨天还好好的,今天更新了知识库或 Prompt,某个能力莫名其妙就垮了。没有回归测试,这种退化能在没人察觉的情况下烂很久。

回归门禁的机制很硬:每次部署新版本前,自动在黄金数据集上跑一遍全部用例,确保指标不低于预设阈值。只要某个指标掉超过 2%,就直接拦住这次发布并触发告警。这道闸,是 AI 能力不被悄悄侵蚀的护城河。

七、课堂实训:亲手攒出你的第一套评估资产

两人一组,完成三件事:

  1. 从自身业务抽 15 条样本,分别标成真实 / 边界 / 失败 / 高风险,写明理想输出。
  2. 用 LLM 当评委给这 15 条打分,对比机器分和人工分的差异,分析为什么差。
  3. 设计一份含技术与业务指标的评估看板,标清每个指标的阈值和告警规则;再写一份回归门禁配置草案。

交付物是《黄金数据集构建规范》和《EDD 评估指标卡模板》——这是能带去下一个项目的可复用资产。


第十讲到这儿。你手里现在有了一道质量阀门:EDD 方法论加黄金数据集,让 AI 交付从"感觉还行"走进"量化可验收"。没有它,项目就永远卡在 Demo 阶段,推不开业务方那扇门

下一讲,我们进 PoC 验证与敏捷迭代,聊怎么用最小成本、最短时间,验证一个 AI 假设到底成立不成立。

如果觉得有用,欢迎分享给更多人 🎉

- END -

了解企业专属投标智能体 免费投标诊断

本文由标手Top(深圳市凡达恩科技有限公司 FDE 旗下品牌)整理,政策与案例以最新官方发布为准。