AI Product Management 指标体系 评测体系

AI 产品指标与
评测体系.

从「怎么定义 AI 产品的好坏」到「怎么系统地验证和优化」—— 一套按知识主线重构的系统化方法论。

Structure
7 篇 · 知识体系优先
Design System
Linear
Knowledge Architecture

指标与评测的闭环结构

指标体系解决「衡量问题」——把抽象的"好"拆成可计算的标尺。 评测体系解决「验证问题」——用科学方法测、归因、优化。 两者在"定指标"这一步天然咬合。

PART · 01

指标体系

定义"什么是好"
  • 数据 vs 指标本质
  • 五层指标(流量/用户/行为/转化/体验)
  • 三种分类(业务/结构/时效)
  • 六法拆解(要素/二分/公式/漏斗/矩阵/树)
  • 四大分析框架(AARRR/UJM/OSM/杜邦)
Input
PART · 02

评测体系

验证"好不好"
  • ① 定指标(继承指标体系)
  • ② 选方法(脚本/LLM/人工)
  • ③ 造评测集(四大来源)
  • ④ 执行评测
  • ⑤ Bad Case 四层归因
产品迭代飞轮 · 指标 → 评测 → 归因 → 新指标,持续闭环

前言:为什么 AI 产品经理必须掌握这套体系

一个典型的反面案例

客户听说 DeepSeek-R1 在榜单上得分最高,要求替换原模型。替换后发现:
- R1 是长思考模型,反应速度慢;
- 长思考模型在未重写提示词的情况下极易产生幻觉;
- 最终效果不佳,被迫回退,人力物力双重浪费。

核心教训:没有评测体系 → 选型没有依据 → 出了问题没人背锅 → 产品经理沦为"传话筒"。

AI 产品经理的三大困境(不懂指标与评测会陷入)

困境 表现 根因
技术话语权缺失 算法说什么就是什么,无法质疑选型方案 没有可量化的评判依据
被动响应式迭代 用户说"太生硬"→改;又说"太啰嗦"→改;陷入死循环 没有指标定位问题本质
问题归因模糊 投诉率从 1% 涨到 8%,不知是产品、Agent 还是宣传的锅 没有分层指标体系

指标与评测对产品经理的核心价值

  • 让抽象的"好"变得可量化:"我做的产品特别成功" ≠ "我把 DAU 从 1000 做到 1 万"
  • 统一团队语言:不说"我觉得还行",只说"留存率 25%"
  • 驱动科学决策:指标指向的是下一步行动,而不是情绪
  • 团队协作核心能力:评测体系怎么构建,是衡量 AI 产品经理专业度的关键;头部公司甚至设专职评测产品经理岗

第一篇:数据指标体系

这一篇解决的是 "什么是好" 的问题——在开始评测之前,先把"好"拆成可计算的标尺。

一、数据与指标的本质区别

对比项 数据(Data) 指标(Metric)
本质 原始的、未经处理的记录或事实 经过计算、聚合或定义的度量
用途 存储事实 衡量业务/运营效果
示例 QQ 空间访问记录、付款流水、签到次数 留存率、转化率、客单价
类比 小孩每门考试的分数 学校大屏上公示的排名
形式 一张麦当劳小票 麦当劳后台的汇总看板

关键洞察:指标 ∈ 数据——指标是数据的一种,但必须经过度量加工。

二、从数据到决策的五步流转

① 原始采集 → ② 清洗标准化 → ③ 计算聚合 → ④ 确定业务指标 → ⑤ 做决策并行动

奶茶店类比(贯穿全篇):
- ① 店员在便签上记录订单(潦草、格式乱、易遗漏)
- ② 贴一张标准化表格让店员按列填写(解决格式统一)
- ③ 一天结束算总账(聚合计算)
- ④ 日订单量、客单价、爆款占比、利润四个核心指标
- ⑤ 珍珠奶茶占 53% → 多备货;果茶仅 32 杯 → 搞优惠;2-4 点密集 → 增兼职

三、指标的有效性判断

虚荣指标(Vanity Metric):看起来漂亮但对决策没价值的指标。
- 快递场景举例:「特殊密码数」「有彩色带彩的签收数」→ 虚荣
- 真正有用:平均送达时间、签收率、损坏率

判断标准:这个指标能驱动下一步行动吗?不能 → 虚荣。

四、指标体系的五层常见指标

AI 产品经理必须能把业务拆到这五层,每一层都有典型指标。

4.1 流量层(用户从哪里来)

指标 定义 坑点
PV(Page View) 页面被加载的次数,刷新算一次 可以通过刷新刷数据,不精准
UV(Unique Visitor) 一段时间内的独立访客数,按账号 ID / IP / 本地缓存去重 游客模式要靠 IP 兜底
IP 数 独立 IP 地址数,同一路由器下的多台设备算一个 宿舍同一路由器下 = 1 个 IP
跳出率 用户进入页面后很快离开的比例 跳出率高 = 产品差 or 推广人群错配
新老访客比 新用户占总访客的比例 7UV 以上算老用户(参考口径)

4.2 用户层(用户是谁、用多少)

指标 英文 定义
DAU Daily Active Users 当日登录或使用产品的去重用户数
WAU Weekly Active Users 7 日内访问产品的去重用户数
MAU Monthly Active Users 30 日内访问产品的去重用户数
留存率 Retention 新增用户经过 N 天后仍使用的比例
用户粘性 Stickiness DAU ÷ MAU

深度分析:活跃的"浅/中/深"三层

产品 浅度(打开) 中度(核心功能) 深度(变现行为)
微信 启动 APP 发消息 转账、朋友圈点赞、公众号阅读
高德 启动 APP 查看路线 打车
游戏 启动游戏 匹配/开一把 排位赛、充值买皮肤
电商 启动 APP 搜索、比价 下单、评论

用户粘性的行业基准:

产品类型 健康粘性(DAU/MAU)
强社交(微信、抖音) > 50%
电商/平台(淘宝、美团) 20% - 50%
工具(12306、银行 APP) < 20% 是正常的

留存率的类型与应用:
- 次日留存:验证"新用户是否 get 到产品核心价值"。低 → 要加引导页、小红点、onboarding。
- 7 日留存:验证用户是否养成使用习惯(签到、支付宝收能量的底层逻辑)。
- 30 日留存:验证"用户是否离不开你"——所有社交类产品都盯这个(苹果不支持微信,用户选谁?)。

留存率计算陷阱:
- 分子:第一天新增用户中,第二天还来的人数
- 分母:第一天新增的用户数(不含老用户、不含第二天的新用户)
- 举例:第一天发鸡蛋吸引 1000 老头注册,第二天只剩 100 老头回来 → 次日留存 = 10%

4.3 行为层(用户怎么用)

指标 计算 / 定义
访问深度 PV ÷ UV
使用时长 单次/日均
核心行为次数 如生图次数、对话轮次
功能渗透率 使用某功能的用户 ÷ 总活跃用户
行为路径(用户旅程 UJM) 第一步→第二步→...→第 N 步

4.4 转化层(用户掏不掏钱)

指标 定义
漏斗转化率 每一步到下一步的转化比例
付费率 付费用户数 ÷ 总用户数
ARPU 人均收入(Average Revenue Per User)
复购率 再次购买的用户比例
GMV Gross Merchandise Volume,商品交易总额(不管亏赚都算)

4.5 体验层(用户爽不爽)

指标 说明
响应时间 P90 / P99 延迟,保证大多数用户流畅
首屏时间 首页跳转时长(很多 APP 用假首屏动画制造"秒开"错觉)
下载错误率 请求失败的比例
CSAT 用户满意度打分(1-5 分)
NPS 净推荐值(Net Promoter Score)——"你愿意推荐给朋友的意愿"(≠ 满意度)
AI 专属:意图识别准确率 AI 能否理解用户真正想做什么
AI 专属:回答相关性 答非所问的占比
AI 专属:转人工率 AI 兜不住要转给人工的比例
AI 专属:多轮对话完成率 对话进行到底不中断的比例

核心要点:NPS 和满意度是两件事。满意度看"做得好不好",NPS 看"愿不愿意推荐给朋友"——推荐需要更高的信任。

五、指标分类的三种视角

5.1 按业务逻辑分类

不可控因素:监管、政策、汇率、市场(不用管)
可控因素:
├── 北极星指标:全公司/全项目的唯一最核心指标(最终目标)
├── 结果指标:业务最终结果(如 GMV、付费转化率)
├── 过程指标:业务过程中的关键节点(如转化率、完成率)
└── 运营指标:日常管理的操作性指标

关于北极星指标的常见辨析:
- 实际工作中,"你们公司的北极星指标是什么"是最容易被追问、也最该想清楚的问题
- 北极星 vs 结果指标区别:北极星偏长期/方向性衡量,结果指标偏阶段性衡量
- 北极星指标≈业务目标;不能自己拍脑袋定,必须找业务方对齐

5.2 按结构成分分类

类型 定义 示例
原子指标 维度 + 度量 + 汇总方式,不可再拆 DAU = 账号 ID + 个数 + 求和
派生指标 原子指标 + 修饰词 + 新组合方式 7 日留存率 = 日活 + 7 日周期 + 比率

5.3 按先见后见性分类

类型 特点 示例
先见性指标 当下就能观测并决策 抬头率(50 人有 40 人抬头,80%)
后见性指标 必须事后才有结果 用户最终转化率(周期结束才能算出来)

实战经验:后见性指标无法直接操盘。办法是找到先见性与后见性之间的因果关系——内容吸引度 → 使用时长 → 任务完成度 → 复访率 → 最终转化率。先优化先见性指标来逼近后见性结果。

指标间的关系模式:
- 包含关系:流失率 ∈ 非活跃率
- 互补关系:留存率 + 流失率 ≈ 1
- 因果关系:投诉率 → 退货率;满意度 → 复购率

六、指标拆解的六大方法

这是体系构建的方法论武器库,六法对应不同场景。

6.1 要素法

列举一个目标/事物的组成要素。例:雷锋精神 = 拾金不昧 + 乐于助人 + 无私奉献 + ...

6.2 二分法

从"要/不要"两端分析。例:减肥 = 要运动/早睡/规律 + 不要碳水/零食/熬夜。对应核心金句:"管住嘴,迈开腿"。

关键提醒:做任何优化策略都可以套二分法——要让用户满意的事 vs 不要让用户痛苦的事。

6.3 公式法(最常用)

用数学公式表达关键因素之间的关系。

GMV = 用户数 × 成交率 × 平均客单价
    = UV × 浏览转化率 × 加购转化率 × 支付转化率 × 平均客单价

总收入 = 新客收入 + 老客收入
      = 新客UV × 新客ARPU + 老客UV × 老客ARPU

3 秒完播率 = 钩子强度 × 标题匹配度 × 开场节奏

李诞"有效粉丝"公式案例:

有效粉丝 = 总粉丝 - 未付费用户

李诞在直播间说"没付费的都是垃圾"——本质是公式法思维在商业判断上的应用。

6.4 漏斗法(转化分析必备)

按业务流程一层一层往下漏,看每层转化率。

曝光 → 点击 → 下载 → 注册 → 登录 → 激活 → 购买 → 复购

每一层之间的转化率都是可优化的杠杆点。

6.5 矩阵法

罗列所有组合进行对比。例:新老用户 × 多渠道;APP/小程序/H5 × 各业务模块。

H5 科普:H5 = HTML5,指在微信/飞书点击链接打开的网页,区别于"小程序"(依赖微信/支付宝官方平台的应用)。

6.6 树状图法(层级下钻)

北极星指标 → 一级指标 → 二级指标 → ...

实操以 GMV 提升 为例:

北极星:本月 GMV 提升 X%
├── 付费用户数(一级)
│   ├── 新用户数(二级)
│   │   ├── 注册 UV(三级)→ 投放广告、地推送鸡蛋、线上优惠券
│   │   ├── 登录率 → 注册即自动登录、短信提醒
│   │   └── 曝光 UV → 个性推荐、首页 Banner、限时秒杀
│   └── 老用户数 → 复购优惠券、会员体系、过期提醒
└── 客单价(一级)→ 组合套餐、满减策略、高端货曝光

七、指标分析的四大框架

7.1 AARRR 模型(海盗模型 / 增长黑客 / 用户增长)

① Acquisition 获客 → ② Activation 激活 → ③ Retention 留存 → ④ Revenue 变现 → ⑤ Referral 推荐
阶段 典型策略
获客 线上打广告、线下地推(扫街/扫楼/电梯广告)、送鸡蛋送行李箱、扫码送酸奶
激活 注册即登录、注册即送优惠券、首日引导页、小红点闪烁
留存 每日签到、蚂蚁庄园收能量、连续登录奖励、优惠券到期提醒
变现 缩短路径(拼多多无购物车)、冲动消费触发、限时倒计时、大额优惠券到期
推荐 拼团砍一刀、分享得奖励、"好友都在用"的社交背书

核心要点:变现的底层是"冲动消费 + 信任感"。路径越短,转化率越高。9.9 元垃圾袋不会纠结,9 千元大件才会反复对比。

7.2 UJM(用户旅程图 / User Journey Map)

梳理用户使用产品的每一步操作。以 AI 叫车场景为例:

打开首页 → 点击 AI 叫车 → 勾选乘车选项 → 点击呼叫 → 【分支】
    ├── 叫车成功
    ├── 长时间未确认 → 需要超时机制
    └── 过程中修改 → 需要修改入口

每个节点都是优化点:入口找不到 → 加小红点引导;流程太长 → 合并步骤;完成率低 → 简化表单。

7.3 OSM 模型(日常管理)

O (Objective) 目标 → S (Strategy) 策略 → M (Measurement) 度量

实操例:
- O:提升用户量
- S:线下送鸡蛋 + 线上送优惠券 + 拉多少人抽奖 + 拼团优惠
- M:新增注册数、次日留存率、拉新 ARPU

7.4 杜邦分析(财务分析)

从净利率、资产周转率、权益乘数拆解 ROE,主要用于财务方向,其他岗位了解即可。

八、指标体系的本质

核心要点:指标体系不是一堆指标的堆砌,而是一套有组织的评价标准。

8.1 指标体系的三个作用

  1. 量化目标:把"做得好"变成"DAU 从 1000 到 1 万"
  2. 统一语言:不说"还行",只说"留存率 25%"
  3. 驱动决策:指标指向下一步行动

8.2 指标体系构建的三要素

北极星指标(定方向)→ 一级指标(拆业务关键节点)→ 二级指标(拆过程指标)

8.3 构建方法论

不要求每个人都能独立构建完整体系(通常是总监级工作),但必须掌握其中的零碎知识点——拆解方法、分析框架、层级术语。实际落地中能叫得上名字、解释得清原理,就是专业度的体现。

8.4 构建的要素标准(判断一个指标是否合格)

  • 直接与商业/业务相关
  • 能反映客户认可度
  • 能影响用户行为
  • 简单、直接、直观
  • 容易获得且可衡量

九、公司本质与指标选择

公司类型 本质 核心指标方向
To B / SaaS 降本增效 节省人力成本、提升效率、服务时长、处理量
To C 盈利 用户增长、用户体验、GMV、付费转化

行业观察:
- 中国独有"运营"岗位是因为运营需求量大。国外没有独立运营岗。
- 美国擅长科研(砸钱搞 GDP、融资文化),中国擅长运营落地(无现金支付就是明证)。
- AI 时代运营需求增加——不仅要运营用户,还要运营产品(因为 AI 永远是概率事件,需要持续评测拉高准确率)。


第二篇:AI 产品评测体系

这一篇解决的是 "怎么验证好" 的问题——在有了指标之后,用科学方法测、归因、优化。

一、传统产品 vs AI 产品:评测的根本差异

维度 传统产品(如美图秀秀) AI 产品(如即梦修图)
用户路径 可控、固定、可预测 不可控、多轮对话、开放式
评测重点 功能是否正常触发(点击→出图) 综合效果(采纳率、对话轮次、修改次数、保存率、响应时间)
模板依赖 强 弱(每次生成都不同)
沟通成本 低 高(需反复调整)
标准答案 有 通常没有

二、传统 PM → AI PM 的三大转变

环节 传统 PM AI PM(新增部分)
需求分析 用户调研 + 竞品分析 + AI 能力边界评估
产品设计 功能流程 + 交互设计 + Prompt 工程 + Agent 流程设计
效果验证 AB 测试 + 用户反馈 + 评测集 + 指标体系
迭代决策 数据分析 + 定性反馈 + Bad Case 归因

三、AI 产品的四层架构与产品经理职责

┌─────────────────────────────────────────┐
│ 用户层 │ 体验好不好(用户满意度、留存率、转化率、采纳率)
├─────────────────────────────────────────┤
│ 技术层 │ Agent / RAG / Prompt 的效果(意图准确率、知识召回率、任务完成率)
├─────────────────────────────────────────┤
│ 模型层 │ 模型本身的 benchmark 得分(SuperCLUE、MMLU、C-Eval)
├─────────────────────────────────────────┤
│ 基础层 │ 成本 / 算力 / 合规 / 数据资产
└─────────────────────────────────────────┘

各层产品经理的关注点:

层 产品经理要做什么 典型指标
用户层 界面交互形式、AI 输出展示策略、构建用户反馈闭环(点赞点踩)、设计透明度与可控性(人在环路 Human-in-the-loop) 满意度、留存率、转化率、NPS
技术层 知识库结构设计、检索生成策略、Agent 工作流拆解、评测体系构建、Bad Case 归因 意图识别准确率、关键知识召回率、任务完成率
模型层 模型选型(仅 0→1 阶段重要)、模型路由设计(简单任务用小模型,复杂任务用大模型) benchmark 得分、幻觉率、指令遵循度
基础层 只管数据资产质量 + 数据飞轮闭环;成本/算力/合规交给算法团队 数据准确率、标注一致性

关键提醒:模型选型只在 0→1 阶段重要。产品稳定运行后,模型会被不断替换更优的版本,产品经理更多精力应放在 Prompt + Agent 流程优化 上。

主流评测平台:
- Langsmith、Langfuse:主流 Agent 评测追踪平台
- PromptPilot(字节):提示词评测与批量测试平台
- 通用 Benchmark:SuperCLUE、MMLU、C-Eval、AlignBench

四、评测五步法(核心框架)

① 定指标 → ② 选方法 → ③ 造评测集 → ④ 执行评测 → ⑤ 归因分析

这套五步法是贯通指标体系与评测体系的桥梁——第一步"定指标"就是第一篇讲的全部内容。

第一步:定指标(What is Good?)

4.1 构建思路(自顶向下)

业务指标(北极星)→ 拆解核心场景 → 明确定性指标 + 定量指标 → 制定打分方法

4.2 业务指标示例

产品类型 核心业务指标
生图产品 采纳率(客户不采纳就不用了)
智能写作 一次修改率、报告结构合理性
AI 客服 任务完成率、转人工率
Agent 根因分析 问题准确定位率、行动建议可落地率

4.3 定性 vs 定量指标的区别(重中之重)

对比 定量指标 定性指标
特征 有标准答案、可计算 主观判断、难以标准化
评测方式 自动化脚本 大模型评测 or 人工评测
示例 准确率、召回率、响应时间 P90/P99、工具调用正确率、参数提取准确率 回答的情感丰富度、口语化程度、审美、有没有"人味"、回答相关性、逻辑性
谁把关 算法团队自测 产品经理重点把控

核心要点:定性指标是拉开产品差距的 Benchmark。如果大家都有标准答案(定量),所有模型表现都差不多;真正拉开差距的是"品味"——把抽象审美转化为可评测标准的能力。

4.4 定性指标如何设计?(以"有人味"为例)

不能说"有人味"就完事,必须拆成可评判维度:
- 情感丰富度:情感词汇数量 × 匹配度
- 口语化程度:是否贴近日常对话
- 个性化细节:是否加入场景化描述

然后定义评分标准(比如 1-5 分制),每个分数都给出正反案例。

4.5 定量指标的关键参考标准

指标 说明
响应时间 P90 90% 请求的延迟上限,保证大多数用户体验流畅
响应时间 P99 99% 请求的延迟上限,用于极端情况保障
并发能力 按预估峰值的 2 倍准备资源
召回率 知识库检索的完整性(关键知识是否被召回)
RPM / TPM Requests Per Minute / Tokens Per Minute,系统并发处理能力

第二步:选方法(Who evaluates & How?)

三大评测方法对比:

方法 适用指标 成本 效率 典型场景
自动化脚本 定量指标 低 高 CI/CD 回归测试、成功率、响应时间、工具调用正确率
大模型评测(LLM-as-Judge) 定性指标 中 中 回答质量、相关性、逻辑性
人工评测 复杂主观任务 高 低 多轮对话连贯性、创意生成、业务专业判断

5.1 自动化脚本

定义好入参/出参后,开发自测。例如查天气工具:
- 入参:时间、地点
- 出参:目标时间的温度、天气描述
- 脚本批量跑 100 条查询,检查准确率

5.2 大模型评测(LLM-as-Judge)核心机制

用 高质量模型(如 Claude 4.6 / GPT-4)作为"教师模型",通过提示词让它给另一个模型的回答打分。本质是模型蒸馏的变体。

评分提示词必含的四要素:

1. 角色设定:你是一个资深评测专家
2. 评分原则:评分范围(0-4 或 1-5)、评分权重、每档分数的定义
3. 评分步骤:第一步阅读评测集,第二步对照规则,第三步输出结果
4. 输出格式:JSON(强烈推荐,可直接转表格;MD 格式不结构化)

JSON 输出示例结构:

{
  "综合评分": 3,
  "评分原因": "...",
  "维度1": {"分数": 4, "原因": "..."},
  "维度2": {"分数": 2, "原因": "..."}
}

打分方法:
- 绝对打分:1-5 分制,有完整评分标准
- GSB(Good/Same/Bad):两个模型对比,A 优于 B / 相同 / B 优于 A
- HPS:更细粒度的对比(5 档:明显好/稍好/相同/稍差/明显差)

选型建议:字节的 PromptPilot——支持提示词生成、调试、批量评测、智能评分。流程:写 Prompt → 上传评测集 → 跑两个模型 → 智能评分比较 GSB → 找到最优 Prompt。

5.3 人工评测的完整 SOP

① 任务发起(产品经理定义指标/规则/评测集)
  → ② 项目理解(标注师学习背景)
  → ③ 标准培训
  → ④ 试标(~10 条)+ 准确率核验
  → ⑤ 正式标注
  → ⑥ 质检(抽查标注质量)
  → ⑦ 复检(防止质检出错)
  → ⑧ 验收

角色分工:
- AI 训练师 / 标注师:执行标注
- AI 产品经理:定义评测指标 + 评测集 + 评分规则 + 决定由谁标
- 业务专家:没有标注师时,由最终用户/业务方直接标注

第三步:造评测集(What questions to ask?)

6.1 评测集的四大来源与配比

来源 配比 说明
真实用户日志 占主要部分 最具代表性;优先选多轮追问的 case,最能暴露短板
历史 Bad Case ~20% 用户点踩、投诉的 case;验证新版本是否修复了老问题
边界 Case(人工构造) ~20% 极端/非常规输入,测试鲁棒性。例:图文生成产品被要求写文案,看它能否合理拒答
AI 生成样本 0→1 阶段占比高,后期逐步降低 无用户时用 LLM 批量生成模拟 query,人工筛选可用

6.2 核心原则:评测集聚焦 Bad Case

核心要点:1+1=2 这种已经掌握的题,不用再考。好的评测集是让 Agent 从"小学"升到"大学"的不断升级的试卷——里面全是他不会的题。

版本迭代时评测集的演进:
- 如果当前版本在现有评测集上达到 80% → 从剩下 20% 找未掌握的 case 补进去
- 如果回退(新版本分数下降)→ 评测集不动,回退的是产品设计
- 同一次对比必须用同一套评测集,否则分数不可比

6.3 评测集的构造(用大模型批量构造)

对 AI 生成部分,写一个"造题 Prompt":

你是一个评测结构专家。
构造评测集的要求:[具体业务场景描述]
输出格式:JSON
注意要点:[覆盖类型、难度分布、异常处理等]

第四步:执行评测

根据选定方法跑评测集,生成评测报告。报告必含:
- 核心业务指标当前值 vs 目标值
- 各场景下的得分分布
- Bad Case 归因分布
- 上线决策建议(能否上线、有何风险、迭代节奏)

第五步:Bad Case 归因分析(四层排查法)

当发现 Bad Case 时,按优先级从小到大逐层排查:

① 模型能力问题
   → 同一 Prompt 在不同模型(如 GPT-3.5 vs GPT-4)表现差异显著
   → 做 A/B 测试控制变量

② Prompt 设计问题
   → 模糊、约束不足、角色定义不清
   → 改进:基于优秀回答反向修改("提示词蒸馏")

③ 流程 / Agent 设计问题
   → Agent 协作不合理、缺校验节点、缺记忆机制
   → 改进:加工作流节点、加记忆模块

④ 数据 / 召回问题
   → RAG 返回信息不准确或不完整
   → 改进:切片策略、重排策略、知识库更新

排查策略:从小节点往大节点排除——先看模型,再看 Prompt,再看 RAG,最后看 Agent 架构。发现哪层有问题就改哪层,再用同一套评测集回测。

五、Agent 能力评测专项

Agent 是当前 AI 产品的核心形态,评测维度需要专门拆解。

5.1 Agent 的通用组成(提示词里必含的四件套)

Planning(规划)| Memory(记忆)| Tool Use(工具调用)| Execution(执行)

5.2 Agent 评测的"过程 + 结果"双维度

维度 检查点
过程(Process) ① 成功率 ② 准确率 ③ 上下文相关性 ④ 工具调用正确性
结果(Outcome) ① 最终输出质量(视频质量、文案质量) ② 有无 BUG ③ 任务完成度

5.3 各子能力的评测方式

子能力 评测点 方法
Planning CoT(思维链)是否合理、能否把复杂问题拆解成子任务 人工 / LLM 评分
Memory 上下文是否准确传递(用户偏好、历史对话) LLM 自动验证上下文引用
Tool Use 工具选择是否正确、参数提取是否准确 自动化脚本
Execution 最终输出质量、任务完成度 综合评估

5.4 多 Agent 协作链路的评测

举例:AI 视频生成的流水线

艺术总监 Agent → 编剧 Agent → 角色设计 Agent → 场景设计 Agent → 视频生成

每一步都要评:
- 节点内部:成功率、输出质量
- 节点间传递:数据传递成功率、内容准确性(没有丢字段、没有幻觉)

实战经验:复杂 case 一般产品经理亲自评估,因为涉及多节点、长流程、需要综合判断。

5.5 复杂 Agent 的评测设计思路(以多步根因分析 Agent 为例)

评测设计思路:
- 一个 case 需要测很多步骤,因为过程复杂、流程长
- 每个步骤定义成功标准(不只是看最终结果)
- 核心 case 只有 3-4 个(每次迭代重点看这几个)
- 这种 case = "杀手 case"——做好了用户就离不开

流程拆解:

① 提出问题 → 评"是否能准确定位原因+数据匹配批次+不偏题"
② 多轮追问 → 评"是否按上一轮信息推进"
③ 提交工单 → 评"工具调用成功率"

六、RAG 系统评测与调优

参数 作用 调优思路
Top-K 检索返回的最相关片段数 K 太小召回不全;K 太大干扰信息多
Top-P / 相似度阈值 过滤低相似度结果 阈值太高会漏召回;太低会引入噪音
切片策略 长文档如何切成片段 过小失去上下文;过大检索不精准
重排(Re-rank)策略 对初次检索结果重新排序 用专门的重排模型提升相关性

RAG 归因常见问题:
- 切片不合理 → 片段不完整
- 重排策略不当 → 最相关的被排在后面
- 知识库质量差 → 根源性问题


第三篇:贯通指标与评测的知识闭环

闭环关系图

           ┌────────────────────────────────┐
           │  指标体系(定义好坏)           │
           │  ─────────────────────────────  │
           │  · 什么是指标                    │
           │  · 五层指标(流量→用户→行为→    │
           │    转化→体验)                  │
           │  · 拆解六法(要素/二分/公式/    │
           │    漏斗/矩阵/树)                │
           │  · 分析框架(AARRR/UJM/OSM)    │
           └──────────────┬─────────────────┘
                          │ 输出:完整的指标体系
                          ▼
           ┌────────────────────────────────┐
           │  评测体系(验证好坏)           │
           │  ─────────────────────────────  │
           │  ① 定指标 ←────── 基于指标体系   │
           │  ② 选方法(脚本/LLM/人工)      │
           │  ③ 造评测集(4 大来源)          │
           │  ④ 执行评测                     │
           │  ⑤ Bad Case 归因(4 层排查)     │
           └──────────────┬─────────────────┘
                          │ 输出:优化方向
                          ▼
           ┌────────────────────────────────┐
           │   产品迭代 → 指标回升 → 再评测   │
           │   持续飞轮                        │
           └────────────────────────────────┘

两套体系的共同底层

  1. 都服务于"产品到底行不行"这个根本问题
  2. 都强调"量化而非感觉"——拒绝"我觉得还行"
  3. 都要求产品经理建立"品味"——把抽象标准变成可传递的规则
  4. 都指向一个目标:建立专业话语权——让算法、业务、老板都认可你的判断

第四篇:实战建议与行业参考

一、产品经理实战表达升级

❌ 非专业表达:「我之前做的 AI 产品特别成功。」

✅ 专业表达:「我主导了 XX 产品的指标体系建设,将核心业务指标从 Y 提升到 Z,通过构建评测体系定位到 Prompt 和 RAG 两层的瓶颈,最终在 3 个月内将采纳率从 35% 提升到 62%。」

二、高加分的"产品观"表达(金句公式)

万能模板:
[产品名] + 做了一件[领域]史上没人做过的事 + 具体是什么 + 它解决了什么问题

示例:
- OpenAI「第一个把 AI 能力产品化的公司——把 AI 变成了可注册可使用的网页,人们第一次能亲身体验 AI 是什么」
- DeepSeek「弥补了国内没有推理能力模型的空白」
- Kimi「弥补了国内没有 Agent 能力模型的空白」
- 抖音「把人找信息变成了信息找人」

三、推荐学习的产品案例

产品 学习点
Claude 任务进度可视化强,增强用户安全感(Human-in-the-loop 典范)
即梦(字节) 模型能力强,医疗领域大量专家标注投入
Perplexity AI 搜索浏览器,信息源质量高,深度研究利器
电子笔记类产品 交互体验优,一键收藏、博主订阅

四、构建评测体系的关键心法

核心要点:评测常从"草台班子"起步,关键是先做起来,在持续迭代中逼近真实,而非追求一次性完美。

  • 初期可用虚构 case 起步
  • 随产品迭代持续优化评测集
  • 用 GSB 或 HPS 进行相对评分,降低主观偏差
  • 产品经理的"品味"是核心差异化竞争力

第五篇:术语表

指标类

术语 英文 释义
PV Page View 页面浏览次数
UV Unique Visitor 独立访客数
DAU / WAU / MAU Daily/Weekly/Monthly Active Users 日/周/月活跃用户
留存率 Retention Rate 新增用户经 N 天后仍使用的比例
用户粘性 Stickiness DAU / MAU
NPS Net Promoter Score 净推荐值
CSAT Customer Satisfaction 用户满意度
ARPU Average Revenue Per User 人均收入
GMV Gross Merchandise Volume 商品交易总额
北极星指标 North Star Metric 产品最核心的唯一指标
虚荣指标 Vanity Metric 无法驱动决策的指标
先见性 / 后见性 Leading / Lagging 当下可观测 / 事后才能观测
AARRR - 获客/激活/留存/变现/推荐
UJM User Journey Map 用户旅程图
OSM Objective / Strategy / Measurement 目标-策略-度量

AI 与评测类

术语 英文 释义
LLM-as-Judge - 用大模型作为评分教师
Benchmark - 基准测试集(如 MMLU、SuperCLUE)
Bad Case - 表现不佳的评测案例
Edge Case - 边界案例
Golden Case - 黄金标准案例
CoT Chain of Thought 思维链
MCP Model Context Protocol 模型上下文协议
Prompt Distillation - 提示词蒸馏(基于优秀回答反向改写)
Top-K / Top-P - RAG 检索的数量阈值 / 相似度阈值
P90 / P99 - 90%/99% 分位延迟
RPM / TPM Requests/Tokens Per Minute 每分钟请求/Token 数
Human-in-the-Loop HITL 人在环路
GSB / HPS - Good-Same-Bad / High-Pairwise-Score 评分法

第六篇:延伸实践建议

实践方向

  • [ ] 为一款 AI 产品绘制用户旅程图(UJM),每个节点标注可优化点
  • [ ] 按评测体系模板,为一个项目写一份智能写作产品评测体系文档
  • [ ] 完成一次评测集构建(真实日志 + Bad Case + 边界 Case + AI 生成,按 60/20/20 配比)
  • [ ] 使用 PromptPilot 平台跑一次完整的提示词评测流程(含批量测试 + 智能评分 + Bad Case 反向优化)
  • [ ] 设计一次人工标注任务,配套培训材料与质检流程
  • [ ] 围绕一个项目,串联 BRD → MRD → PRD → 评测体系 的全流程文档

第七篇:个人思考与复习要点

知识串联线索

  1. 问题意识:从「盲目换模型翻车」这个真实案例切入 → 必须有评测体系
  2. 量化工具:先学会拆指标、造体系(指标体系)
  3. 验证工具:再学会设计评测、归因优化(评测体系)
  4. 闭环:指标 → 评测 → 归因 → 迭代 → 新指标

最关键的 5 个概念(必须滚瓜烂熟)

  1. 北极星指标 vs 结果指标 vs 过程指标
  2. 留存率计算口径(分子分母的陷阱)
  3. 五步评测法(定指标→选方法→造评测集→执行→归因)
  4. Bad Case 四层归因(模型→Prompt→流程→数据)
  5. Agent 评测的"过程+结果"双维度

最值得深入探索的方向

  • 提示词工程的评测化:未来 AI PM 的核心竞争力是"可量化、可评测、可迭代的 Prompt 工程体系"
  • 数据飞轮闭环设计:如何让用户反馈自动化地反哺产品优化
  • "用 AI 造评测、用评测训 AI":下一代智能体进化的可能路径

关于学习方法的元认知

知识体系不是树叶的堆砌(零散知识点),而是一棵树——先抓主干(指标+评测两大骨架),再抓分支(拆解方法、分析框架),最后生根(动手做案例)。只有这样,才能把零散知识变成工作中的真正武器。