前言:为什么 AI 产品经理必须掌握这套体系
一个典型的反面案例
客户听说 DeepSeek-R1 在榜单上得分最高,要求替换原模型。替换后发现:
- R1 是长思考模型,反应速度慢;
- 长思考模型在未重写提示词的情况下极易产生幻觉;
- 最终效果不佳,被迫回退,人力物力双重浪费。核心教训:没有评测体系 → 选型没有依据 → 出了问题没人背锅 → 产品经理沦为"传话筒"。
AI 产品经理的三大困境(不懂指标与评测会陷入)
| 困境 | 表现 | 根因 |
|---|---|---|
| 技术话语权缺失 | 算法说什么就是什么,无法质疑选型方案 | 没有可量化的评判依据 |
| 被动响应式迭代 | 用户说"太生硬"→改;又说"太啰嗦"→改;陷入死循环 | 没有指标定位问题本质 |
| 问题归因模糊 | 投诉率从 1% 涨到 8%,不知是产品、Agent 还是宣传的锅 | 没有分层指标体系 |
指标与评测对产品经理的核心价值
- 让抽象的"好"变得可量化:"我做的产品特别成功" ≠ "我把 DAU 从 1000 做到 1 万"
- 统一团队语言:不说"我觉得还行",只说"留存率 25%"
- 驱动科学决策:指标指向的是下一步行动,而不是情绪
- 团队协作核心能力:评测体系怎么构建,是衡量 AI 产品经理专业度的关键;头部公司甚至设专职评测产品经理岗
第一篇:数据指标体系
这一篇解决的是 "什么是好" 的问题——在开始评测之前,先把"好"拆成可计算的标尺。
一、数据与指标的本质区别
| 对比项 | 数据(Data) | 指标(Metric) |
|---|---|---|
| 本质 | 原始的、未经处理的记录或事实 | 经过计算、聚合或定义的度量 |
| 用途 | 存储事实 | 衡量业务/运营效果 |
| 示例 | QQ 空间访问记录、付款流水、签到次数 | 留存率、转化率、客单价 |
| 类比 | 小孩每门考试的分数 | 学校大屏上公示的排名 |
| 形式 | 一张麦当劳小票 | 麦当劳后台的汇总看板 |
关键洞察:指标 ∈ 数据——指标是数据的一种,但必须经过度量加工。
二、从数据到决策的五步流转
① 原始采集 → ② 清洗标准化 → ③ 计算聚合 → ④ 确定业务指标 → ⑤ 做决策并行动
奶茶店类比(贯穿全篇):
- ① 店员在便签上记录订单(潦草、格式乱、易遗漏)
- ② 贴一张标准化表格让店员按列填写(解决格式统一)
- ③ 一天结束算总账(聚合计算)
- ④ 日订单量、客单价、爆款占比、利润四个核心指标
- ⑤ 珍珠奶茶占 53% → 多备货;果茶仅 32 杯 → 搞优惠;2-4 点密集 → 增兼职
三、指标的有效性判断
虚荣指标(Vanity Metric):看起来漂亮但对决策没价值的指标。
- 快递场景举例:「特殊密码数」「有彩色带彩的签收数」→ 虚荣
- 真正有用:平均送达时间、签收率、损坏率
判断标准:这个指标能驱动下一步行动吗?不能 → 虚荣。
四、指标体系的五层常见指标
AI 产品经理必须能把业务拆到这五层,每一层都有典型指标。
4.1 流量层(用户从哪里来)
| 指标 | 定义 | 坑点 |
|---|---|---|
| PV(Page View) | 页面被加载的次数,刷新算一次 | 可以通过刷新刷数据,不精准 |
| UV(Unique Visitor) | 一段时间内的独立访客数,按账号 ID / IP / 本地缓存去重 | 游客模式要靠 IP 兜底 |
| IP 数 | 独立 IP 地址数,同一路由器下的多台设备算一个 | 宿舍同一路由器下 = 1 个 IP |
| 跳出率 | 用户进入页面后很快离开的比例 | 跳出率高 = 产品差 or 推广人群错配 |
| 新老访客比 | 新用户占总访客的比例 | 7UV 以上算老用户(参考口径) |
4.2 用户层(用户是谁、用多少)
| 指标 | 英文 | 定义 |
|---|---|---|
| DAU | Daily Active Users | 当日登录或使用产品的去重用户数 |
| WAU | Weekly Active Users | 7 日内访问产品的去重用户数 |
| MAU | Monthly Active Users | 30 日内访问产品的去重用户数 |
| 留存率 | Retention | 新增用户经过 N 天后仍使用的比例 |
| 用户粘性 | Stickiness | DAU ÷ MAU |
深度分析:活跃的"浅/中/深"三层
| 产品 | 浅度(打开) | 中度(核心功能) | 深度(变现行为) |
|---|---|---|---|
| 微信 | 启动 APP | 发消息 | 转账、朋友圈点赞、公众号阅读 |
| 高德 | 启动 APP | 查看路线 | 打车 |
| 游戏 | 启动游戏 | 匹配/开一把 | 排位赛、充值买皮肤 |
| 电商 | 启动 APP | 搜索、比价 | 下单、评论 |
用户粘性的行业基准:
| 产品类型 | 健康粘性(DAU/MAU) |
|---|---|
| 强社交(微信、抖音) | > 50% |
| 电商/平台(淘宝、美团) | 20% - 50% |
| 工具(12306、银行 APP) | < 20% 是正常的 |
留存率的类型与应用:
- 次日留存:验证"新用户是否 get 到产品核心价值"。低 → 要加引导页、小红点、onboarding。
- 7 日留存:验证用户是否养成使用习惯(签到、支付宝收能量的底层逻辑)。
- 30 日留存:验证"用户是否离不开你"——所有社交类产品都盯这个(苹果不支持微信,用户选谁?)。
留存率计算陷阱:
- 分子:第一天新增用户中,第二天还来的人数
- 分母:第一天新增的用户数(不含老用户、不含第二天的新用户)
- 举例:第一天发鸡蛋吸引 1000 老头注册,第二天只剩 100 老头回来 → 次日留存 = 10%
4.3 行为层(用户怎么用)
| 指标 | 计算 / 定义 |
|---|---|
| 访问深度 | PV ÷ UV |
| 使用时长 | 单次/日均 |
| 核心行为次数 | 如生图次数、对话轮次 |
| 功能渗透率 | 使用某功能的用户 ÷ 总活跃用户 |
| 行为路径(用户旅程 UJM) | 第一步→第二步→...→第 N 步 |
4.4 转化层(用户掏不掏钱)
| 指标 | 定义 |
|---|---|
| 漏斗转化率 | 每一步到下一步的转化比例 |
| 付费率 | 付费用户数 ÷ 总用户数 |
| ARPU | 人均收入(Average Revenue Per User) |
| 复购率 | 再次购买的用户比例 |
| GMV | Gross Merchandise Volume,商品交易总额(不管亏赚都算) |
4.5 体验层(用户爽不爽)
| 指标 | 说明 |
|---|---|
| 响应时间 | P90 / P99 延迟,保证大多数用户流畅 |
| 首屏时间 | 首页跳转时长(很多 APP 用假首屏动画制造"秒开"错觉) |
| 下载错误率 | 请求失败的比例 |
| CSAT | 用户满意度打分(1-5 分) |
| NPS | 净推荐值(Net Promoter Score)——"你愿意推荐给朋友的意愿"(≠ 满意度) |
| AI 专属:意图识别准确率 | AI 能否理解用户真正想做什么 |
| AI 专属:回答相关性 | 答非所问的占比 |
| AI 专属:转人工率 | AI 兜不住要转给人工的比例 |
| AI 专属:多轮对话完成率 | 对话进行到底不中断的比例 |
核心要点:NPS 和满意度是两件事。满意度看"做得好不好",NPS 看"愿不愿意推荐给朋友"——推荐需要更高的信任。
五、指标分类的三种视角
5.1 按业务逻辑分类
不可控因素:监管、政策、汇率、市场(不用管)
可控因素:
├── 北极星指标:全公司/全项目的唯一最核心指标(最终目标)
├── 结果指标:业务最终结果(如 GMV、付费转化率)
├── 过程指标:业务过程中的关键节点(如转化率、完成率)
└── 运营指标:日常管理的操作性指标
关于北极星指标的常见辨析:
- 实际工作中,"你们公司的北极星指标是什么"是最容易被追问、也最该想清楚的问题
- 北极星 vs 结果指标区别:北极星偏长期/方向性衡量,结果指标偏阶段性衡量
- 北极星指标≈业务目标;不能自己拍脑袋定,必须找业务方对齐
5.2 按结构成分分类
| 类型 | 定义 | 示例 |
|---|---|---|
| 原子指标 | 维度 + 度量 + 汇总方式,不可再拆 | DAU = 账号 ID + 个数 + 求和 |
| 派生指标 | 原子指标 + 修饰词 + 新组合方式 | 7 日留存率 = 日活 + 7 日周期 + 比率 |
5.3 按先见后见性分类
| 类型 | 特点 | 示例 |
|---|---|---|
| 先见性指标 | 当下就能观测并决策 | 抬头率(50 人有 40 人抬头,80%) |
| 后见性指标 | 必须事后才有结果 | 用户最终转化率(周期结束才能算出来) |
实战经验:后见性指标无法直接操盘。办法是找到先见性与后见性之间的因果关系——内容吸引度 → 使用时长 → 任务完成度 → 复访率 → 最终转化率。先优化先见性指标来逼近后见性结果。
指标间的关系模式:
- 包含关系:流失率 ∈ 非活跃率
- 互补关系:留存率 + 流失率 ≈ 1
- 因果关系:投诉率 → 退货率;满意度 → 复购率
六、指标拆解的六大方法
这是体系构建的方法论武器库,六法对应不同场景。
6.1 要素法
列举一个目标/事物的组成要素。例:雷锋精神 = 拾金不昧 + 乐于助人 + 无私奉献 + ...
6.2 二分法
从"要/不要"两端分析。例:减肥 = 要运动/早睡/规律 + 不要碳水/零食/熬夜。对应核心金句:"管住嘴,迈开腿"。
关键提醒:做任何优化策略都可以套二分法——要让用户满意的事 vs 不要让用户痛苦的事。
6.3 公式法(最常用)
用数学公式表达关键因素之间的关系。
GMV = 用户数 × 成交率 × 平均客单价
= UV × 浏览转化率 × 加购转化率 × 支付转化率 × 平均客单价
总收入 = 新客收入 + 老客收入
= 新客UV × 新客ARPU + 老客UV × 老客ARPU
3 秒完播率 = 钩子强度 × 标题匹配度 × 开场节奏
李诞"有效粉丝"公式案例:
有效粉丝 = 总粉丝 - 未付费用户
李诞在直播间说"没付费的都是垃圾"——本质是公式法思维在商业判断上的应用。
6.4 漏斗法(转化分析必备)
按业务流程一层一层往下漏,看每层转化率。
曝光 → 点击 → 下载 → 注册 → 登录 → 激活 → 购买 → 复购
每一层之间的转化率都是可优化的杠杆点。
6.5 矩阵法
罗列所有组合进行对比。例:新老用户 × 多渠道;APP/小程序/H5 × 各业务模块。
H5 科普:H5 = HTML5,指在微信/飞书点击链接打开的网页,区别于"小程序"(依赖微信/支付宝官方平台的应用)。
6.6 树状图法(层级下钻)
北极星指标 → 一级指标 → 二级指标 → ...
实操以 GMV 提升 为例:
北极星:本月 GMV 提升 X%
├── 付费用户数(一级)
│ ├── 新用户数(二级)
│ │ ├── 注册 UV(三级)→ 投放广告、地推送鸡蛋、线上优惠券
│ │ ├── 登录率 → 注册即自动登录、短信提醒
│ │ └── 曝光 UV → 个性推荐、首页 Banner、限时秒杀
│ └── 老用户数 → 复购优惠券、会员体系、过期提醒
└── 客单价(一级)→ 组合套餐、满减策略、高端货曝光
七、指标分析的四大框架
7.1 AARRR 模型(海盗模型 / 增长黑客 / 用户增长)
① Acquisition 获客 → ② Activation 激活 → ③ Retention 留存 → ④ Revenue 变现 → ⑤ Referral 推荐
| 阶段 | 典型策略 |
|---|---|
| 获客 | 线上打广告、线下地推(扫街/扫楼/电梯广告)、送鸡蛋送行李箱、扫码送酸奶 |
| 激活 | 注册即登录、注册即送优惠券、首日引导页、小红点闪烁 |
| 留存 | 每日签到、蚂蚁庄园收能量、连续登录奖励、优惠券到期提醒 |
| 变现 | 缩短路径(拼多多无购物车)、冲动消费触发、限时倒计时、大额优惠券到期 |
| 推荐 | 拼团砍一刀、分享得奖励、"好友都在用"的社交背书 |
核心要点:变现的底层是"冲动消费 + 信任感"。路径越短,转化率越高。9.9 元垃圾袋不会纠结,9 千元大件才会反复对比。
7.2 UJM(用户旅程图 / User Journey Map)
梳理用户使用产品的每一步操作。以 AI 叫车场景为例:
打开首页 → 点击 AI 叫车 → 勾选乘车选项 → 点击呼叫 → 【分支】
├── 叫车成功
├── 长时间未确认 → 需要超时机制
└── 过程中修改 → 需要修改入口
每个节点都是优化点:入口找不到 → 加小红点引导;流程太长 → 合并步骤;完成率低 → 简化表单。
7.3 OSM 模型(日常管理)
O (Objective) 目标 → S (Strategy) 策略 → M (Measurement) 度量
实操例:
- O:提升用户量
- S:线下送鸡蛋 + 线上送优惠券 + 拉多少人抽奖 + 拼团优惠
- M:新增注册数、次日留存率、拉新 ARPU
7.4 杜邦分析(财务分析)
从净利率、资产周转率、权益乘数拆解 ROE,主要用于财务方向,其他岗位了解即可。
八、指标体系的本质
核心要点:指标体系不是一堆指标的堆砌,而是一套有组织的评价标准。
8.1 指标体系的三个作用
- 量化目标:把"做得好"变成"DAU 从 1000 到 1 万"
- 统一语言:不说"还行",只说"留存率 25%"
- 驱动决策:指标指向下一步行动
8.2 指标体系构建的三要素
北极星指标(定方向)→ 一级指标(拆业务关键节点)→ 二级指标(拆过程指标)
8.3 构建方法论
不要求每个人都能独立构建完整体系(通常是总监级工作),但必须掌握其中的零碎知识点——拆解方法、分析框架、层级术语。实际落地中能叫得上名字、解释得清原理,就是专业度的体现。
8.4 构建的要素标准(判断一个指标是否合格)
- 直接与商业/业务相关
- 能反映客户认可度
- 能影响用户行为
- 简单、直接、直观
- 容易获得且可衡量
九、公司本质与指标选择
| 公司类型 | 本质 | 核心指标方向 |
|---|---|---|
| To B / SaaS | 降本增效 | 节省人力成本、提升效率、服务时长、处理量 |
| To C | 盈利 | 用户增长、用户体验、GMV、付费转化 |
行业观察:
- 中国独有"运营"岗位是因为运营需求量大。国外没有独立运营岗。
- 美国擅长科研(砸钱搞 GDP、融资文化),中国擅长运营落地(无现金支付就是明证)。
- AI 时代运营需求增加——不仅要运营用户,还要运营产品(因为 AI 永远是概率事件,需要持续评测拉高准确率)。
第二篇:AI 产品评测体系
这一篇解决的是 "怎么验证好" 的问题——在有了指标之后,用科学方法测、归因、优化。
一、传统产品 vs AI 产品:评测的根本差异
| 维度 | 传统产品(如美图秀秀) | AI 产品(如即梦修图) |
|---|---|---|
| 用户路径 | 可控、固定、可预测 | 不可控、多轮对话、开放式 |
| 评测重点 | 功能是否正常触发(点击→出图) | 综合效果(采纳率、对话轮次、修改次数、保存率、响应时间) |
| 模板依赖 | 强 | 弱(每次生成都不同) |
| 沟通成本 | 低 | 高(需反复调整) |
| 标准答案 | 有 | 通常没有 |
二、传统 PM → AI PM 的三大转变
| 环节 | 传统 PM | AI PM(新增部分) |
|---|---|---|
| 需求分析 | 用户调研 + 竞品分析 | + AI 能力边界评估 |
| 产品设计 | 功能流程 + 交互设计 | + Prompt 工程 + Agent 流程设计 |
| 效果验证 | AB 测试 + 用户反馈 | + 评测集 + 指标体系 |
| 迭代决策 | 数据分析 + 定性反馈 | + Bad Case 归因 |
三、AI 产品的四层架构与产品经理职责
┌─────────────────────────────────────────┐
│ 用户层 │ 体验好不好(用户满意度、留存率、转化率、采纳率)
├─────────────────────────────────────────┤
│ 技术层 │ Agent / RAG / Prompt 的效果(意图准确率、知识召回率、任务完成率)
├─────────────────────────────────────────┤
│ 模型层 │ 模型本身的 benchmark 得分(SuperCLUE、MMLU、C-Eval)
├─────────────────────────────────────────┤
│ 基础层 │ 成本 / 算力 / 合规 / 数据资产
└─────────────────────────────────────────┘
各层产品经理的关注点:
| 层 | 产品经理要做什么 | 典型指标 |
|---|---|---|
| 用户层 | 界面交互形式、AI 输出展示策略、构建用户反馈闭环(点赞点踩)、设计透明度与可控性(人在环路 Human-in-the-loop) | 满意度、留存率、转化率、NPS |
| 技术层 | 知识库结构设计、检索生成策略、Agent 工作流拆解、评测体系构建、Bad Case 归因 | 意图识别准确率、关键知识召回率、任务完成率 |
| 模型层 | 模型选型(仅 0→1 阶段重要)、模型路由设计(简单任务用小模型,复杂任务用大模型) | benchmark 得分、幻觉率、指令遵循度 |
| 基础层 | 只管数据资产质量 + 数据飞轮闭环;成本/算力/合规交给算法团队 | 数据准确率、标注一致性 |
关键提醒:模型选型只在 0→1 阶段重要。产品稳定运行后,模型会被不断替换更优的版本,产品经理更多精力应放在 Prompt + Agent 流程优化 上。
主流评测平台:
- Langsmith、Langfuse:主流 Agent 评测追踪平台
- PromptPilot(字节):提示词评测与批量测试平台
- 通用 Benchmark:SuperCLUE、MMLU、C-Eval、AlignBench
四、评测五步法(核心框架)
① 定指标 → ② 选方法 → ③ 造评测集 → ④ 执行评测 → ⑤ 归因分析
这套五步法是贯通指标体系与评测体系的桥梁——第一步"定指标"就是第一篇讲的全部内容。
第一步:定指标(What is Good?)
4.1 构建思路(自顶向下)
业务指标(北极星)→ 拆解核心场景 → 明确定性指标 + 定量指标 → 制定打分方法
4.2 业务指标示例
| 产品类型 | 核心业务指标 |
|---|---|
| 生图产品 | 采纳率(客户不采纳就不用了) |
| 智能写作 | 一次修改率、报告结构合理性 |
| AI 客服 | 任务完成率、转人工率 |
| Agent 根因分析 | 问题准确定位率、行动建议可落地率 |
4.3 定性 vs 定量指标的区别(重中之重)
| 对比 | 定量指标 | 定性指标 |
|---|---|---|
| 特征 | 有标准答案、可计算 | 主观判断、难以标准化 |
| 评测方式 | 自动化脚本 | 大模型评测 or 人工评测 |
| 示例 | 准确率、召回率、响应时间 P90/P99、工具调用正确率、参数提取准确率 | 回答的情感丰富度、口语化程度、审美、有没有"人味"、回答相关性、逻辑性 |
| 谁把关 | 算法团队自测 | 产品经理重点把控 |
核心要点:定性指标是拉开产品差距的 Benchmark。如果大家都有标准答案(定量),所有模型表现都差不多;真正拉开差距的是"品味"——把抽象审美转化为可评测标准的能力。
4.4 定性指标如何设计?(以"有人味"为例)
不能说"有人味"就完事,必须拆成可评判维度:
- 情感丰富度:情感词汇数量 × 匹配度
- 口语化程度:是否贴近日常对话
- 个性化细节:是否加入场景化描述
然后定义评分标准(比如 1-5 分制),每个分数都给出正反案例。
4.5 定量指标的关键参考标准
| 指标 | 说明 |
|---|---|
| 响应时间 P90 | 90% 请求的延迟上限,保证大多数用户体验流畅 |
| 响应时间 P99 | 99% 请求的延迟上限,用于极端情况保障 |
| 并发能力 | 按预估峰值的 2 倍准备资源 |
| 召回率 | 知识库检索的完整性(关键知识是否被召回) |
| RPM / TPM | Requests Per Minute / Tokens Per Minute,系统并发处理能力 |
第二步:选方法(Who evaluates & How?)
三大评测方法对比:
| 方法 | 适用指标 | 成本 | 效率 | 典型场景 |
|---|---|---|---|---|
| 自动化脚本 | 定量指标 | 低 | 高 | CI/CD 回归测试、成功率、响应时间、工具调用正确率 |
| 大模型评测(LLM-as-Judge) | 定性指标 | 中 | 中 | 回答质量、相关性、逻辑性 |
| 人工评测 | 复杂主观任务 | 高 | 低 | 多轮对话连贯性、创意生成、业务专业判断 |
5.1 自动化脚本
定义好入参/出参后,开发自测。例如查天气工具:
- 入参:时间、地点
- 出参:目标时间的温度、天气描述
- 脚本批量跑 100 条查询,检查准确率
5.2 大模型评测(LLM-as-Judge)核心机制
用 高质量模型(如 Claude 4.6 / GPT-4)作为"教师模型",通过提示词让它给另一个模型的回答打分。本质是模型蒸馏的变体。
评分提示词必含的四要素:
1. 角色设定:你是一个资深评测专家
2. 评分原则:评分范围(0-4 或 1-5)、评分权重、每档分数的定义
3. 评分步骤:第一步阅读评测集,第二步对照规则,第三步输出结果
4. 输出格式:JSON(强烈推荐,可直接转表格;MD 格式不结构化)
JSON 输出示例结构:
{
"综合评分": 3,
"评分原因": "...",
"维度1": {"分数": 4, "原因": "..."},
"维度2": {"分数": 2, "原因": "..."}
}
打分方法:
- 绝对打分:1-5 分制,有完整评分标准
- GSB(Good/Same/Bad):两个模型对比,A 优于 B / 相同 / B 优于 A
- HPS:更细粒度的对比(5 档:明显好/稍好/相同/稍差/明显差)
选型建议:字节的 PromptPilot——支持提示词生成、调试、批量评测、智能评分。流程:写 Prompt → 上传评测集 → 跑两个模型 → 智能评分比较 GSB → 找到最优 Prompt。
5.3 人工评测的完整 SOP
① 任务发起(产品经理定义指标/规则/评测集)
→ ② 项目理解(标注师学习背景)
→ ③ 标准培训
→ ④ 试标(~10 条)+ 准确率核验
→ ⑤ 正式标注
→ ⑥ 质检(抽查标注质量)
→ ⑦ 复检(防止质检出错)
→ ⑧ 验收
角色分工:
- AI 训练师 / 标注师:执行标注
- AI 产品经理:定义评测指标 + 评测集 + 评分规则 + 决定由谁标
- 业务专家:没有标注师时,由最终用户/业务方直接标注
第三步:造评测集(What questions to ask?)
6.1 评测集的四大来源与配比
| 来源 | 配比 | 说明 |
|---|---|---|
| 真实用户日志 | 占主要部分 | 最具代表性;优先选多轮追问的 case,最能暴露短板 |
| 历史 Bad Case | ~20% | 用户点踩、投诉的 case;验证新版本是否修复了老问题 |
| 边界 Case(人工构造) | ~20% | 极端/非常规输入,测试鲁棒性。例:图文生成产品被要求写文案,看它能否合理拒答 |
| AI 生成样本 | 0→1 阶段占比高,后期逐步降低 | 无用户时用 LLM 批量生成模拟 query,人工筛选可用 |
6.2 核心原则:评测集聚焦 Bad Case
核心要点:1+1=2 这种已经掌握的题,不用再考。好的评测集是让 Agent 从"小学"升到"大学"的不断升级的试卷——里面全是他不会的题。
版本迭代时评测集的演进:
- 如果当前版本在现有评测集上达到 80% → 从剩下 20% 找未掌握的 case 补进去
- 如果回退(新版本分数下降)→ 评测集不动,回退的是产品设计
- 同一次对比必须用同一套评测集,否则分数不可比
6.3 评测集的构造(用大模型批量构造)
对 AI 生成部分,写一个"造题 Prompt":
你是一个评测结构专家。
构造评测集的要求:[具体业务场景描述]
输出格式:JSON
注意要点:[覆盖类型、难度分布、异常处理等]
第四步:执行评测
根据选定方法跑评测集,生成评测报告。报告必含:
- 核心业务指标当前值 vs 目标值
- 各场景下的得分分布
- Bad Case 归因分布
- 上线决策建议(能否上线、有何风险、迭代节奏)
第五步:Bad Case 归因分析(四层排查法)
当发现 Bad Case 时,按优先级从小到大逐层排查:
① 模型能力问题
→ 同一 Prompt 在不同模型(如 GPT-3.5 vs GPT-4)表现差异显著
→ 做 A/B 测试控制变量
② Prompt 设计问题
→ 模糊、约束不足、角色定义不清
→ 改进:基于优秀回答反向修改("提示词蒸馏")
③ 流程 / Agent 设计问题
→ Agent 协作不合理、缺校验节点、缺记忆机制
→ 改进:加工作流节点、加记忆模块
④ 数据 / 召回问题
→ RAG 返回信息不准确或不完整
→ 改进:切片策略、重排策略、知识库更新
排查策略:从小节点往大节点排除——先看模型,再看 Prompt,再看 RAG,最后看 Agent 架构。发现哪层有问题就改哪层,再用同一套评测集回测。
五、Agent 能力评测专项
Agent 是当前 AI 产品的核心形态,评测维度需要专门拆解。
5.1 Agent 的通用组成(提示词里必含的四件套)
Planning(规划)| Memory(记忆)| Tool Use(工具调用)| Execution(执行)
5.2 Agent 评测的"过程 + 结果"双维度
| 维度 | 检查点 |
|---|---|
| 过程(Process) | ① 成功率 ② 准确率 ③ 上下文相关性 ④ 工具调用正确性 |
| 结果(Outcome) | ① 最终输出质量(视频质量、文案质量) ② 有无 BUG ③ 任务完成度 |
5.3 各子能力的评测方式
| 子能力 | 评测点 | 方法 |
|---|---|---|
| Planning | CoT(思维链)是否合理、能否把复杂问题拆解成子任务 | 人工 / LLM 评分 |
| Memory | 上下文是否准确传递(用户偏好、历史对话) | LLM 自动验证上下文引用 |
| Tool Use | 工具选择是否正确、参数提取是否准确 | 自动化脚本 |
| Execution | 最终输出质量、任务完成度 | 综合评估 |
5.4 多 Agent 协作链路的评测
举例:AI 视频生成的流水线
艺术总监 Agent → 编剧 Agent → 角色设计 Agent → 场景设计 Agent → 视频生成
每一步都要评:
- 节点内部:成功率、输出质量
- 节点间传递:数据传递成功率、内容准确性(没有丢字段、没有幻觉)
实战经验:复杂 case 一般产品经理亲自评估,因为涉及多节点、长流程、需要综合判断。
5.5 复杂 Agent 的评测设计思路(以多步根因分析 Agent 为例)
评测设计思路:
- 一个 case 需要测很多步骤,因为过程复杂、流程长
- 每个步骤定义成功标准(不只是看最终结果)
- 核心 case 只有 3-4 个(每次迭代重点看这几个)
- 这种 case = "杀手 case"——做好了用户就离不开
流程拆解:
① 提出问题 → 评"是否能准确定位原因+数据匹配批次+不偏题"
② 多轮追问 → 评"是否按上一轮信息推进"
③ 提交工单 → 评"工具调用成功率"
六、RAG 系统评测与调优
| 参数 | 作用 | 调优思路 |
|---|---|---|
| Top-K | 检索返回的最相关片段数 | K 太小召回不全;K 太大干扰信息多 |
| Top-P / 相似度阈值 | 过滤低相似度结果 | 阈值太高会漏召回;太低会引入噪音 |
| 切片策略 | 长文档如何切成片段 | 过小失去上下文;过大检索不精准 |
| 重排(Re-rank)策略 | 对初次检索结果重新排序 | 用专门的重排模型提升相关性 |
RAG 归因常见问题:
- 切片不合理 → 片段不完整
- 重排策略不当 → 最相关的被排在后面
- 知识库质量差 → 根源性问题
第三篇:贯通指标与评测的知识闭环
闭环关系图
┌────────────────────────────────┐
│ 指标体系(定义好坏) │
│ ───────────────────────────── │
│ · 什么是指标 │
│ · 五层指标(流量→用户→行为→ │
│ 转化→体验) │
│ · 拆解六法(要素/二分/公式/ │
│ 漏斗/矩阵/树) │
│ · 分析框架(AARRR/UJM/OSM) │
└──────────────┬─────────────────┘
│ 输出:完整的指标体系
▼
┌────────────────────────────────┐
│ 评测体系(验证好坏) │
│ ───────────────────────────── │
│ ① 定指标 ←────── 基于指标体系 │
│ ② 选方法(脚本/LLM/人工) │
│ ③ 造评测集(4 大来源) │
│ ④ 执行评测 │
│ ⑤ Bad Case 归因(4 层排查) │
└──────────────┬─────────────────┘
│ 输出:优化方向
▼
┌────────────────────────────────┐
│ 产品迭代 → 指标回升 → 再评测 │
│ 持续飞轮 │
└────────────────────────────────┘
两套体系的共同底层
- 都服务于"产品到底行不行"这个根本问题
- 都强调"量化而非感觉"——拒绝"我觉得还行"
- 都要求产品经理建立"品味"——把抽象标准变成可传递的规则
- 都指向一个目标:建立专业话语权——让算法、业务、老板都认可你的判断
第四篇:实战建议与行业参考
一、产品经理实战表达升级
❌ 非专业表达:「我之前做的 AI 产品特别成功。」
✅ 专业表达:「我主导了 XX 产品的指标体系建设,将核心业务指标从 Y 提升到 Z,通过构建评测体系定位到 Prompt 和 RAG 两层的瓶颈,最终在 3 个月内将采纳率从 35% 提升到 62%。」
二、高加分的"产品观"表达(金句公式)
万能模板:
[产品名] + 做了一件[领域]史上没人做过的事 + 具体是什么 + 它解决了什么问题
示例:
- OpenAI「第一个把 AI 能力产品化的公司——把 AI 变成了可注册可使用的网页,人们第一次能亲身体验 AI 是什么」
- DeepSeek「弥补了国内没有推理能力模型的空白」
- Kimi「弥补了国内没有 Agent 能力模型的空白」
- 抖音「把人找信息变成了信息找人」
三、推荐学习的产品案例
| 产品 | 学习点 |
|---|---|
| Claude | 任务进度可视化强,增强用户安全感(Human-in-the-loop 典范) |
| 即梦(字节) | 模型能力强,医疗领域大量专家标注投入 |
| Perplexity | AI 搜索浏览器,信息源质量高,深度研究利器 |
| 电子笔记类产品 | 交互体验优,一键收藏、博主订阅 |
四、构建评测体系的关键心法
核心要点:评测常从"草台班子"起步,关键是先做起来,在持续迭代中逼近真实,而非追求一次性完美。
- 初期可用虚构 case 起步
- 随产品迭代持续优化评测集
- 用 GSB 或 HPS 进行相对评分,降低主观偏差
- 产品经理的"品味"是核心差异化竞争力
第五篇:术语表
指标类
| 术语 | 英文 | 释义 |
|---|---|---|
| PV | Page View | 页面浏览次数 |
| UV | Unique Visitor | 独立访客数 |
| DAU / WAU / MAU | Daily/Weekly/Monthly Active Users | 日/周/月活跃用户 |
| 留存率 | Retention Rate | 新增用户经 N 天后仍使用的比例 |
| 用户粘性 | Stickiness | DAU / MAU |
| NPS | Net Promoter Score | 净推荐值 |
| CSAT | Customer Satisfaction | 用户满意度 |
| ARPU | Average Revenue Per User | 人均收入 |
| GMV | Gross Merchandise Volume | 商品交易总额 |
| 北极星指标 | North Star Metric | 产品最核心的唯一指标 |
| 虚荣指标 | Vanity Metric | 无法驱动决策的指标 |
| 先见性 / 后见性 | Leading / Lagging | 当下可观测 / 事后才能观测 |
| AARRR | - | 获客/激活/留存/变现/推荐 |
| UJM | User Journey Map | 用户旅程图 |
| OSM | Objective / Strategy / Measurement | 目标-策略-度量 |
AI 与评测类
| 术语 | 英文 | 释义 |
|---|---|---|
| LLM-as-Judge | - | 用大模型作为评分教师 |
| Benchmark | - | 基准测试集(如 MMLU、SuperCLUE) |
| Bad Case | - | 表现不佳的评测案例 |
| Edge Case | - | 边界案例 |
| Golden Case | - | 黄金标准案例 |
| CoT | Chain of Thought | 思维链 |
| MCP | Model Context Protocol | 模型上下文协议 |
| Prompt Distillation | - | 提示词蒸馏(基于优秀回答反向改写) |
| Top-K / Top-P | - | RAG 检索的数量阈值 / 相似度阈值 |
| P90 / P99 | - | 90%/99% 分位延迟 |
| RPM / TPM | Requests/Tokens Per Minute | 每分钟请求/Token 数 |
| Human-in-the-Loop | HITL | 人在环路 |
| GSB / HPS | - | Good-Same-Bad / High-Pairwise-Score 评分法 |
第六篇:延伸实践建议
实践方向
- [ ] 为一款 AI 产品绘制用户旅程图(UJM),每个节点标注可优化点
- [ ] 按评测体系模板,为一个项目写一份智能写作产品评测体系文档
- [ ] 完成一次评测集构建(真实日志 + Bad Case + 边界 Case + AI 生成,按 60/20/20 配比)
- [ ] 使用 PromptPilot 平台跑一次完整的提示词评测流程(含批量测试 + 智能评分 + Bad Case 反向优化)
- [ ] 设计一次人工标注任务,配套培训材料与质检流程
- [ ] 围绕一个项目,串联 BRD → MRD → PRD → 评测体系 的全流程文档
第七篇:个人思考与复习要点
知识串联线索
- 问题意识:从「盲目换模型翻车」这个真实案例切入 → 必须有评测体系
- 量化工具:先学会拆指标、造体系(指标体系)
- 验证工具:再学会设计评测、归因优化(评测体系)
- 闭环:指标 → 评测 → 归因 → 迭代 → 新指标
最关键的 5 个概念(必须滚瓜烂熟)
- 北极星指标 vs 结果指标 vs 过程指标
- 留存率计算口径(分子分母的陷阱)
- 五步评测法(定指标→选方法→造评测集→执行→归因)
- Bad Case 四层归因(模型→Prompt→流程→数据)
- Agent 评测的"过程+结果"双维度
最值得深入探索的方向
- 提示词工程的评测化:未来 AI PM 的核心竞争力是"可量化、可评测、可迭代的 Prompt 工程体系"
- 数据飞轮闭环设计:如何让用户反馈自动化地反哺产品优化
- "用 AI 造评测、用评测训 AI":下一代智能体进化的可能路径
关于学习方法的元认知
知识体系不是树叶的堆砌(零散知识点),而是一棵树——先抓主干(指标+评测两大骨架),再抓分支(拆解方法、分析框架),最后生根(动手做案例)。只有这样,才能把零散知识变成工作中的真正武器。