LLM 评估(Evals)
定义
LLM 评估(Evals)是衡量 AI 系统是否真正可用的方法论:答案是否正确、是否有据可依、是否安全、是否有用?由于 LLM 输出是非确定性的自由文本,传统单元测试不够用。评估体系结合精心构建的测试集、自动化指标、LLM-as-Judge 打分和人工审核,把“看起来还行”变成可以跨模型、提示词和管道变更持续追踪的数字。
为什么对 AI 求职重要
所有认真做 AI 产品的团队都把评估当作发布流程的基石:没有回归测试集就无法安全地升级模型或修改提示词。越来越多 JD 明确写出“熟悉评估框架”。对资深工程师而言,评估经验证明你把 LLM 真正跑在了生产环境而不只是 Demo——这是当前 AI 招聘中最能拉开差距的能力之一。
核心概念
- 黄金测试集——带预期输出或评分标准的精选输入集合。
- LLM-as-Judge——用强模型 + 评分细则规模化打分,并用人工标注校准。
- RAG 指标——检索召回/精确率、忠实度(是否有据)、答案相关性。
- 智能体指标——任务成功率、每任务步数/成本、工具调用错误率。
- 回归测试——每次提示词/模型/管道变更都在 CI 中跑评估套件。
- 可观测性与链路追踪——记录每次请求的输入输出、延迟与成本(如 Langfuse、Braintrust)。
- A/B 与在线评估——生产环境中的用户反馈信号与影子部署。
学习路径
- 从你做过的任意 LLM 功能入手,写 30 个带通过标准的测试用例(表格或 JSON)。
- 自动化:写脚本批量跑用例并统计通过率,接入 CI。
- 加入 LLM-as-Judge(明确评分细则),并抽样对比自己的人工标注来校准。
- 上手一个评估/可观测工具(promptfoo、Langfuse 或 Braintrust),给真实应用加链路追踪。
- 实战演练:改一条提示词或换一个模型,用评估报告决定是否发布。