Cheatsheet详细笔记
Analyst Notes

PLG × 数据分析|完整学习笔记

完整保留指定详细笔记原文,覆盖 PLG 业务语境、分析方法、Bias、PQL 与 Experimentation。

PLG × 数据分析|完整学习笔记

目的:把本轮会话中关于 PLG、PLG Data Analyst、需求澄清 的学习内容完整沉淀下来,尽量做到“知识点与会话内容逐项对应”,方便以后从头复习,也方便直接带进项目。 结构:Overall → 主题树展开 → Summary 本笔记不按“课堂章节”死记,而按真正做项目时会遇到的问题组织。

Overall|这轮学习到底建立了什么

这轮学习实际上建立了两套互相咬合的系统:

A. PLG 业务诊断模型
Acquire → Activate / Retain → Monetize → Expand
                     ↘ Growth Loops ↻
B. PLG Data Analyst 分析模型
Business Question
→ Metric Definition
→ Data Grain
→ Event Model
→ Funnel / Cohort / Segment
→ Bias Check
→ Validation
→ Hypothesis
→ Experiment
→ Decision

两者的关系是:

  1. PLG 的第一原则:产品本身承担增长。
  2. 指标不是事实;指标是对用户价值的一种测量假设。
  3. PLG 数据分析不是找最低的数字,而是建立一条能从获客一路解释到价值、留存、付费和扩展的证据链。

PLG Cheatsheet = 我怎么理解 / 诊断这个业务。 PLG Data Analyst = 我怎么用数据证明这个诊断到底对不对。 再往前一步: 数据分析师不是“把数算出来的人”,而是把业务问题变成可计算、可验证、可决策问题的人。 本轮最重要的总原则可以压成三句:

Part I|PLG 业务模型

1. PLG 的核心到底是什么

1.1 产品承担增长

会话中我们先讨论了“Growth Loop 是不是 PLG 第一核心”。 最终校准为:

PLG 的第一原则:产品本身承担增长。 也就是产品不只是“被卖出去的东西”,而要尽可能自己完成:

用户理解价值
→ 获得价值
→ 留存
→ 付费
→ 扩张
→ 理想情况下继续制造下一轮增长

1.2 Growth Loop 很重要,但不是 PLG 的唯一必要条件

更准确地说:

Growth Loop 是让“产品承担增长”这件事形成复利的机制。 因此:

Product-led Conversion
↓
Product-led Expansion
↓
Self-reinforcing Product Growth Loop

最后一层最强,但不能反过来说前两层“不是 PLG”。

2. PLG 的业务主干

最终形成的陌生产品诊断框架是:

Acquire
→ Activate / Retain
→ Monetize
→ Expand
Growth Loops 横跨全程

注意:

Growth Loop 不适合被当成“最后第五步再看看有没有”。 更好的方式是: 从第一步开始就问:这一环产生的 output,能不能重新成为下一轮增长的 input?

Part II|Activation / Retention

3. 真激活不是功能完成,而是价值兑现

3.1 真激活的定义链路

最稳定的定义顺序是:

产品定位
→ 核心价值承诺
→ 用户真正获得价值的时刻(Value Event)
→ 用哪个可观测产品行为代表它(Activation Metric)
→ 用 Retention 验证

会话中的核心判断是:

Retention 更适合做“验证”,不适合做“定义来源”。 也就是说,不建议从: “哪个行为和留存最相关?” 直接倒推出 Activation。 而应该先从产品自身定义: “我的产品是做什么的?” “我怎样表达了我能做这件事?” “对应产品里哪个操作,代表用户用我的产品完成了这件事?”

3.2 Value Event ≠ Activation Metric

需要严格区分: Value Event:用户真正获得价值的那个时刻。;Activation Metric:我们用一个可观测行为去代表这个 Value Event。 例如 AI 写作:

核心价值:帮用户更快产出可用内容
Value Event:用户拿到一份自己觉得能直接用的稿子
Activation Metric:生成 + 编辑 / 复制 / 导出

而不是简单的:

“生成过一次”。 因为: “生成”只是用了功能;“拿走结果”才更接近获得价值。

4. Retention 是 Activation 的合法性验证

4.1 真激活必须对后续 Retention 有明显预测力

如果一个所谓 Activation 定义: Activated cohort D30 retention = 12% Non-activated cohort D30 retention = 11% 那它就非常可疑。 更稳的判断是:

P(Retention | Activated)
>>
P(Retention | Not Activated)

这也是本轮非常重要的一句话:

Activation 的合法性,要由 Retention 来验尸。

4.2 真激活 ≠ 激活后一定留存

需要避免另一个极端: Activated → 100% Retained 不是。 即使用户真正拿到了一次价值,仍然可能因为: 产品使用频率低;持续价值不足;onboarding 后体验变差;有替代品;团队 adoption 没继续;用户需求本身消失。 而流失。 所以真正看的不是“一定留存”,而是: 真激活后,Retained probability 是否显著提高。

5. 多 Activation Path

5.1 多个 Activation Path 是合理的

一个产品可以对应多个场景: 个人记笔记;团队项目管理;团队知识库。 这些场景可以有不同真激活路径。

5.2 多 Activation Path ≠ 多套 PLG motion

判断是不是“真正不同的 PLG motion”,要继续看下游:

Activation 是否不同
→ Retention Driver 是否不同
→ Expansion / Monetization Driver 是否不同
→ Growth Loop 是否不同

越往下越重要。 一句话:

多 Activation 是多条入河支流;下游机制也不同,才是多条河。

Part III|PQL / Monetization

6. PQL 是什么

6.1 Activation 和 PQL 的区别

Activation 回答: 这个用户有没有真正拿到价值? PQL 回答: 已经拿到价值的人里,谁开始出现“值得商业转化 / 扩张”的信号? 因此: Activation = 这个产品对你有用 PQL = 你对这个产品已经出现商业价值

6.2 PQL 不是“高活跃用户”

PQL 更接近:

Value Realized
+
Usage / Adoption Depth
+
Commercial Intent

典型强信号包括: 完成核心价值行为;重复使用 / 使用深度增加;团队协作或 seats 增长;接近免费额度上限;连续撞到和真实需求相关的 paywall;开始使用高级 / 企业能力。

7. Paywall hit 不能单独定义 PQL

一个用户: 第一次登录就点高级功能 → 撞 paywall;连续使用 10 天,完成多个任务后撞额度墙。 虽然都“撞 paywall”,商业含义完全不同。 因此:

Paywall hit 本身是 Commercial Intent signal。 但: 它和 Value Realized 叠加后,才会成为强 PQL。 这也意味着: 碰到付费墙 ≠ 一定真激活。 只有付费墙在“价值已经兑现之后”的合理位置,才接近强商业信号。

8. PQL 是诊断枢纽,但不是万能根因

我们讨论过一种情况: Activation 好;Retention 好;PQL 很多;Paid 很低;Sales 介入后甚至把用户弄跑了。 此时重点可能包括: Free packaging 价值过剩;PQL definition 太宽;Sales-assist motion 有问题。 其中 PQL 很适合作为优先排查点,因为重新定义 PQL 会迫使你回答: 高价值用户到底做了什么;免费用户拿走了什么;什么行为真正代表商业意图;Paywall 是否在正确位置;Sales 应该何时介入。 但要注意: PQL definition 决定“谁值得被干预”。 Sales motion 决定“怎么干预”。 PQL 调准了,不代表 sales motion 自动正确。

Part IV|Free / Value Metric / Pricing Metric

9. 免费版必须有增长目的

一个好的 Free / Trial 不是: “尽量让用户爽”。 而是: 让用户充分感知价值,同时随着需求增强自然产生升级压力。 免费版可能承担: 帮用户完成首次真激活;降低试用门槛;制造 referral / sharing / collaboration;形成 usage habit;帮企业内部 bottom-up 扩散。 如果说不清免费版为什么存在,那它很可能只是在: “白送”。

10. Value Metric

10.1 Value Metric 不是“有没有价值”

核心问题是: 用户获得的价值沿哪个维度增长? 寻找顺序:

产品定位
→ ICP
→ 核心价值
→ 真激活
→ 找价值增长轴
→ 提出 Value Metric 假设
→ 用 Retention / PQL / Expansion 验证

可能的价值增长轴: 完成更多任务;更复杂 / 更高价值任务;节省更多人工时间;更多团队成员使用;更多 workflow 被覆盖;更多资产 / 数据被托管。

11. Value Metric ≠ Pricing Metric

会话中的一个关键区分是:

  1. Value alignment
  2. Measurable
  3. Predictable

真正价值,和最终拿来收费的计量单位,可以不是同一个东西。 例如: Value Outcome:节省人工小时 Pricing Metric:任务数 / workflow / credits 原因: 节省人工小时可能: 难测;难解释;易争议;用户难预测。 所以任务数可能作为更好的 proxy。

11.1 好 Pricing Metric 的三个条件

12. Cost 的位置

这轮非常重要的结论:

Value 是主轴,Cost 是约束条件。 因此定价设计顺序更接近:

Value alignment
→ Simplicity / predictability
→ Cost guardrail

而不是: 我们的 GPU / token 成本是多少 → 反推用户该付多少钱 特别是 Agent 产品,usage-based 经常自然,是因为:

任务执行量 ↑
→ 用户产出 ↑
→ 我们成本也 ↑

三者可能同向。 但“按边际成本收费”不应该成为 Value Metric 的定义。

13. 多类型 Agent 的计费复杂度

如果不同任务价值差异很大:

“改一个标题”和“做一份 6 小时行业研究” 都按 1 task 收费,就很不合理。 可以采用: Usage × Value / Complexity Class 例如: Quick = 1 credit;Standard = 5 credits;Advanced = 10 credits;Deep Research = 20 credits。 分档时: MECE 是结构原则,但还不够。 还需要: 同一档用户价值相近;同一档经济性相近;用户容易理解。 主轴仍然优先按: 用户价值 成本作为红线。

Part V|Expansion

14. Expansion ≠ 裂变

Expansion 问的是: 同一个客户,为什么会花越来越多钱? 而 Growth Loop / 裂变更偏: 现有用户怎么带来更多新用户或更多使用。 所以: Expansion ≠ Referral / Acquisition。

15. Expansion Axis

常见 Expansion Axis: Seats;Usage;Workflow / Module;Org / Cross-team;Capacity;Compound Value。 诊断顺序:

产品价值定位
→ 价值是否天然会随着采用加深而增长
→ 沿什么维度增长
→ Pricing Metric 是否承接这个增长
→ Unit Economics 是否成立

16. Compound Value

这轮我们特别强调了:

使用越久
→ 数据 / 知识 / 历史上下文越多
→ 产品越有价值
→ 越难替代
→ 越容易 Retain + Expand

这已经进入:

Retention + Expansion + Moat 的交叉区域。 好的 Expansion 不只是: 多卖几个 seat 而是: 随着组织采用加深,产品的 value surface 本身扩大甚至发生质变。

Part VI|Growth Loop

17. Growth Loop 不是“渠道”

“分享 / 社区 / 社媒 / 博文”本身不是 Growth Loop。 它们只是可能的载体。 真正 loop 必须闭环:

用户使用产品
→ 产生可传播 / 可协作 / 可索引资产
→ 外部或内部用户进入
→ 新用户继续使用
→ 再次制造增长输入

一句最重要的话:

Growth Loop 不是“我在哪里推广”,而是“产品使用本身如何制造下一轮增长的输入”。

18. Horizontal vs Vertical Growth

18.1 Horizontal Growth

带来: 新用户;新 workspace;new logo。 典型: 分享;邀请;UGC;模板;公开内容;协作。

18.2 Vertical Growth

在已有客户内部增长: seat;usage;workflow;team / org;revenue expansion。 这两类不要混。 因此一个产品即使: 100% 靠 SEO 获客;Activation / Conversion / Expansion 都是 Product-led。 也仍然可以是 PLG。 只是结构性缺陷是: new-logo acquisition 仍高度依赖外部流量供给。

Part VII|PLG Data Analyst 总框架

19. 数据分析师真正做什么

分析师不是: “会算转化率”。 而是把业务语言翻译成:

可计算
可验证
可归因
可决策

完整工作链:

Business Question
→ Metric Definition
→ Data Grain
→ Event Model
→ Funnel / Cohort / Segment
→ Bias Check
→ Validation
→ Hypothesis
→ Experiment
→ Decision

Part VIII|Metric Definition

20. 看到任何百分比先拆口径

例如:

D30 Retention = 32% 在接受它之前,至少要知道: Entity / Grain 是什么?;Denominator 是谁?;Numerator 是什么行为?;Window 是严格 D30 还是 rolling?;Eligibility 是什么?;Day 0 从哪开始?;不同 cohort / segment 是否混合?。 对于 Activation,则至少拆: 分子;分母;时间窗;哪些人真正有机会完成分子;渠道 / 画像是否混合;这个指标归谁负责。 一句话: 先把这个指标的 SQL 口径说清楚。

Part IX|Data Grain

21. B2B PLG 不能只看 user_id

常见层级: User;Workspace;Account;Organization;Subscription;Revenue。 不同 Grain 回答不同问题:

User → Adoption
Workspace / Account → 产品渗透
Logo → 客户关系
Revenue → 商业价值 / Expansion

完全可能同时出现:

User Retention ↓
Logo Retention 稳定
NRR ↑

三者不冲突。

Part X|Event Model

22. 事件模型需要什么

仅有: user_id + event_name + timestamp 通常不够。 更有用的是:

user_id
workspace_id
account_id
session_id
event_name
event_properties
channel
plan
experiment_variant
sales_assisted
timestamp
task_type
usage_amount

一个好的 Event Model 需要支持回答: 谁;做了什么;什么时候;在什么上下文;获得了什么价值;商业状态是什么。

Part XI|Funnel Analysis

23. Funnel 回答什么

用户沿着一个有顺序的路径,在哪一步大量流失? 典型:

Visit
→ Signup
→ Onboarding
→ Value Event / Activation
→ Retained
→ PQL
→ Paid

至少同时看: Conversion Rate;Absolute Loss;Time Between Steps。

23.1 优先级原则

不是:

  1. Cohort Anchor
  2. Return Event
  3. Return Window

哪个 conversion rate 最低就修哪个。 而是: 先用 PLG 顺序纪律决定修哪一层,再用绝对损失决定该层内部先修哪一段。

Part XII|Cohort / Retention

24. Funnel 和 Cohort 的区别

一句话: Funnel 看横向路径。 Cohort 看纵向时间。 Funnel 回答: 用户有没有到达那里? Cohort 回答: 到达以后,后来发生了什么?

25. Retention 真正测什么

不是: 用户回来登录了没有。 而是: 核心价值有没有重复发生。 所以: Activation = 第一次价值成立 Retention = 重复价值成立

26. Retention 的三个定义维度

任何 retention 指标必须有:

26.1 Day 0

验证产品价值时,经常更适合:

Activation-based Day 0 而不是 Signup-based Day 0。 因为 Signup → Activation 之间混入了 TTV。

27. Retention 类型

N-Day Retention

第 N 天回来。

Windowed Retention

如 D30 ± 3 天。

Rolling Retention

Day N 或之后任何时间回来。 指标要匹配: Natural Frequency 例如: Daily → D1 / D7 / D30;Weekly → W1 / W4 / W8;Monthly → M1 / M3 / M6。

28. Retention Curve

主要看三个区域:

Early Drop

初期快速掉。 可能对应: Activation quality;Expectation mismatch;Onboarding;First Value。

Long Decline

一直下滑。 可能说明: Recurring Value 不够强。

Plateau

出现长期稳定平台。 非常重要的问题: 哪些人进入 plateau,以及为什么?

29. Aggregate Retention 很危险

Overall retention 下降,不一定是产品变差。 可能只是: User Mix 变了。 因此脑中应该有:

Overall Metric Change
=
Within-segment Behavioral Change
+
Segment Composition Change

Part XIII|Segmentation

30. Segmentation 的目标

不是:

切 27 个维度。 而是: 找到不同的业务机制。 优先级:

Business mechanism

Acquisition mechanism

Product path

Commercial motion

Environment

30.1 好 Segmentation 的判断标准

切完以后,业务结论变了。 例如: Overall Activation 很差 → 切 Channel → SEO 很好、Paid 很差 根因从: “产品激活差” 变成: “Paid Acquisition Quality 差”。

Part XIV|Bias

31. Mix Shift

总体变化来自:

Within-segment Change
+
Composition Change

先问:

Same people got worse? 还是: User mix changed?

32. Simpson’s Paradox

可能出现: 每个 segment 都变好,但 overall 反而变差。 原因通常是: 低表现 segment 占比大幅增加。 所以: Aggregate metric 是现象,不一定是机制。

33. Selection Bias

核心问题: 为什么这些人会出现在这个组里? 例如: 用了高级功能的人 retention 高。 可能不是: 高级功能导致 retention。 而是: 高意愿用户本来就更容易用到高级功能。

34. Confounding

第三个变量同时影响 X 和 Y。 例如:

Company Size
↙          ↘
Invite     Paid

第一步处理方法:

Stratification。 在同一 company size 层内再比较。

35. Survivorship Bias

例如: 长期用户平均用了 12 个 feature。 不能直接说: 用 12 个 feature 导致长期留存。 因为: 只有长期留下的人,才有机会用到 12 个 feature。 更干净的方法: 固定一个 early observation window,例如 Activation 后前 7 天行为,预测 D30。

36. Look-ahead Bias / Leakage

预测未来商业结果时:

Observation Window
→ Scoring Point
→ Outcome Window

必须严格分离。 例如:

Day 0–7 behavior
→ Day 7 PQL score
→ Predict Day 8–30 Paid

不能把 Day 12 / Day 20 的行为偷偷放进去。

37. Attribution Bias

B2B PLG 至少区分:

Source

谁带来用户?

Product / Activation Influence

谁让用户拿到价值?

Close

谁完成商业交易? 典型:

Source = SEO
Activation = Product-led
Close = Sales

因此:

PLG 和 Sales 不是互斥归因。

Part XV|PQL / Predictive Analysis

38. PQL 是 prediction problem

真正问题: 在需要采取商业动作的那个时点,哪些已经发生的产品行为,可以预测未来付费 / 扩张? 结构:

Historical Product Behavior
→ PQL Signal / Score
→ Future Commercial Outcome
→ Intervention

39. Base Rate

先算: P(Paid) 例如: 全体 Activated users 未来 30 天 Paid = 5%。 这 5% 是后面比较所有 signal 的基线。

40. Lift

Lift(signal)
=
P(Paid | Signal)
/
P(Paid)

例如: Invite ≥3 的 Paid = 20% Base = 5% 那么: Lift = 4x

41. Coverage

Lift 高还不够。 需要问:

这个 signal 覆盖多少真正的商业机会? 高 Lift、低 Coverage 的 signal,可能不适合做主 PQL 规则。

42. Precision / Recall

Precision

TP / (TP + FP) 你判为 PQL 的人里面,多少真的付费?

Recall

TP / (TP + FN) 所有真正会付费的人里面,你抓到了多少?

43. PQL Threshold 取决于 Intervention Cost

低成本

如自动 Upgrade CTA。 可以接受较低 precision。

高成本

如 Sales contact。 需要更高 precision。 因此: PQL threshold 是业务 trade-off,不是统计学唯一最优。

44. PQL Signals 五类

Value Realization

Engagement

Collaboration / Expansion

Commercial Intent

Firmographic

PQL
=
Product Intent
× Commercial Potential

45. Rule-based Scoring

第一版完全可以:

True Activated          +20
≥3 Value Events         +10
≥5 Active Days          +10
Invite ≥3               +20
Usage ≥80% quota        +20
Relevant Paywall Hit    +20
Enterprise Workflow     +10

重点不在数学漂亮,而是:

每个 score 都有数据 evidence。 不需要一上来就 ML。

Part XVI|Monetization Analysis

46. Monetization 真正回答什么

不是: 付费率是多少? 而是: 用户在获得多少价值、处于什么状态、遇到什么商业边界以后,开始愿意付费? 完整商业化漏斗:

Activated
→ Retained / Repeated Value
→ PQL
→ Paywall / Upgrade Trigger
→ Checkout
→ Paid

47. Denominator Discipline

同时保留:

Signup → Paid
Activated → Paid
PQL → Paid

三者回答不同问题: Signup → Paid:混合了获客、激活、商业化。;Activated → Paid:更接近 Value Capture。;PQL → Paid:更接近商业化效率。

48. Free Tier Analysis

免费用户要换回某种增长价值: Activation;Habit;Referral;Team invite;PQL;Paid Conversion。 如果一类 Free 用户:

Cost 高
+ 不付费
+ 不分享
+ 不扩散

那这类 usage 很可能只是纯成本。

49. Usage Distribution

不要只看平均。 至少看: Median;P75;P90;P95;P99。 尤其 AI / Agent 产品要警惕 heavy tail。

50. Usage × Commercial Outcome

把用户按 usage bucket 分层,再看: Paid rate;Retention;ARPA;Expansion;Cost。 这可以帮助: PQL threshold;Free limit;Plan boundary;Usage pricing。

Part XVII|Paywall / Pricing Cohort

51. Paywall Analysis

完整分析路径:

Who hit paywall?
→ Activated?
→ Usage before paywall
→ Repeated paywall hits
→ Checkout
→ Paid
→ Post-paid retention

重点比较:

Paywall before Activation
vs
Paywall after Activation

如果付费墙出现在 Value Realized 前,可能直接伤害真激活。

52. Pricing Cohort

价格调整后不能只看:

ARPU 涨没涨。 应该比较 Old vs New Pricing Cohort: Activation;Paid Conversion;ARPA;Retention;Expansion;Gross Margin。 避免: 单笔收入涨了,但整体 LTV 变差。

Part XVIII|Revenue / Expansion Analysis

53. Revenue Decomposition

New Revenue
+ Expansion Revenue
- Contraction
- Churn
= Net Revenue Change

总收入涨 20%,如果不拆,就不知道到底为什么涨。

54. NRR

NRR
=
(Starting Revenue
- Churn
- Contraction
+ Expansion)
/
Starting Revenue

但:

NRR 是结果,不是 insight。 下一步要继续拆: 谁 Expansion?;沿哪个 Axis?;多久发生?;是否集中在少数 whale?。

55. Expansion Distribution

至少同时看: % Accounts Expanded;Median Expansion;P90 Expansion;Top 10 Account Contribution。 因为: 300 个客户自然扩张到 NRR 120% 和: 5 个大客户撑出 NRR 120% 不是一个业务。

56. Expansion Cohort / Velocity

按首次付费月份: M0 → M3 → M6 → M12 看: 一个典型客户经济价值如何随生命周期变化。 同时分析: Paid → First Expansion;Seat expansion timing;Workflow expansion timing;Org expansion timing。

Part XIX|Growth Loop Analysis

57. Growth Loop 也可以 Funnel 化

例如 Invite Loop:

Activated Users
→ Invite Rate
→ Invites / Inviter
→ Acceptance
→ Signup
→ Activation
→ Retention
→ Invite Again

近似:

New Activated Users
=
Activated Users
× Invite Rate
× Invites/User
× Acceptance
× Activation

数据分析目的:

找 Loop 真正 bottleneck。

Part XX|Experimentation

58. Observational ≠ Causal

前面分析看到: Invite ≥3 → Retention 更高 只能说: Invite 是 predictor。 想知道: “主动推动 invite,会不会提高 retention?” 需要实验。 因此:

Predictor
→ Causal Hypothesis
→ Randomized Experiment
→ Decision

59. Hypothesis 必须可证伪

差的:

优化 onboarding 提升体验。 好的: 将 onboarding 从 5 步缩到 3 步,会让首次注册且未激活用户的 7 天 Activation 从 28% 提升到至少 32%,同时 D7 retention 不下降超过 1pp。 好的假设明确: Who;Treatment;Outcome;Baseline;Target;Guardrail。

60. Primary Metric / Guardrail

Primary Metric

一次实验一个主输赢判断。

Guardrail

防止你: “赢得很难看”。 例如把 Free limit 从 100 降到 20: Paid conversion ↑ 但: Activation ↓ Retention ↓ 这时不能宣布赢。

61. Randomization Unit

根据干预机制选择: User;Workspace;Account;Organization。 团队协作、pricing、workspace limit 等,往往更适合 Account / Workspace level randomization,避免 spillover。

62. MDE

Minimum Detectable Effect: 至少多大的变化,业务上值得关心? 它连接:

Business Significance
↔
Sample Size

63. Statistical Significance ≠ Business Significance

不要只看:

  1. 真没效果
  2. 效果小于业务关心的 MDE
  3. 样本不足,实验没有 power 因此:

没有证据证明有效 ≠ 有证据证明无效。

65. Gray Zone

实验前提前定义: Success;Failure;Gray Zone。 避免结果出来后临时改标准。

66. SRM / Data Quality

如果计划 50/50 分流,却得到 70/30: 先查实验系统。 不要直接分析效果。 优先检查: Exposure event;分流;重复分组;Bot / Test account;Tracking 丢失;Conversion schema。

67. ITT

Intention-to-Treat: 按最初随机 assignment 分析。 不要只分析“真正用过新版的人”,否则可能重新引入 Selection Bias。

68. 实验最终输出

不要只写: A 赢 / B 赢。 至少输出: What happened;Effect size;Uncertainty;Guardrails;Key segments;Decision;What we learned。 决策:

p < 0.05 更应该一起看: Effect Size;Confidence Interval;Business Impact。 一个 +0.15pp 的变化可能统计显著,但商业毫无意义。

64. Power / Null Result

“No significant difference” 可能意味着:

Ship
Kill
Iterate
Continue

Part XXI|Dashboard / Analysis / Experiment

69. 三个不是一回事

Dashboard = Monitoring
发生了什么?
Analysis = Diagnosis
为什么发生?
Experiment = Causal Validation
改 X 会不会真的改变 Y?

成熟工作流:

Monitor
→ Diagnose
→ Hypothesis
→ Experiment
→ Decision

Part XXII|数据分析师需求澄清 Best Practice

70. 需求澄清不是 Clarify Data Request

最核心的一句话:

需求澄清不是问清“你想要什么数据”,而是问清“你要做什么决策”。 例如: “帮我看下渠道分析。” 不够。 要继续问: 最终是为了加预算、减预算、停渠道,还是优化 landing page? 因为不同决策对应完全不同分析。

71. 把需求改写成 Decision Question

一个很实用的句式: We are trying to determine whether / why / which... 例如: 我们要判断 8 月 D30 retention 下降,主要来自用户结构变化,还是同类用户自身留存恶化,以决定应该优先修 acquisition 还是 product retention。 这句话一旦写清,分析就清楚了一半。

72. 确认分析对象 / Grain

问: 我们到底在分析谁? 可能是: User;Account;Workspace;Company / Logo;Subscription;Order;Session;Revenue。 例如“客户留存率”一定要澄清: User retention;Logo retention;Revenue retention。

73. 锁死核心指标口径

例如“Activation Rate”: 必须确认: Numerator;Denominator;Window;Anchor;Exclusion;Eligibility。 最好形成: Metric Contract 例如: Activation Rate = 注册后 7 天内完成 ≥1 次成功任务并导出结果的 eligible ICP users / eligible ICP signups。

74. 问“为什么现在问这个问题”

这是非常重要但经常被漏掉的一步。 可能 trigger 是: Dashboard 指标下降;刚上线功能;CEO 感觉用户反馈变差;Sales 说用户质量不行;下季度预算决策。 Trigger 会影响分析方向。

75. 让业务方讲出当前 Hypothesis

更好的问法: 你目前最怀疑哪几个原因?有没有最近发生的产品、渠道、价格或流程变化? 这样可以快速拿到: Acquisition mix;Product changes;Sales route;Pricing changes;其他 confounder。 比盲切几十个维度有效得多。

76. 明确 Comparison

任何分析最好有比较基线: 上个月;去年同期;Control;Non-activated;ICP vs Non-ICP;Paid vs Free;Retained vs Churned;Before vs After。 例如: PQL conversion = 12% 本身没意义。 如果 base = 3%,那是 4× lift。

77. 明确 Segmentation 边界

不要业务方说: “按国家、渠道、用户类型、行业、设备都拆一下” 就全接。 要区分:

Must-have segments

真正可能改变业务机制的。

Exploratory segments

有空再看。 优先: ICP;Channel;Use case;Plan;Company size;Self-serve / Sales-assisted。

78. 时间范围有三层

Calendar Range

Jul–Aug

Cohort Window

7 月 signup cohort

Outcome Maturity

例如 D30 retention,只能纳入已经成熟到 D30 的 cohort。 所以要问: 哪些 cohort 已经有资格被分析?

79. 先确认数据是否存在

需求澄清后要做 lightweight feasibility check: Event 有吗?;历史从什么时候开始?;ID 能 join 吗?;Channel attribution 有吗?;Workspace / account mapping 有吗?;Pricing history 有吗?;Sales-assisted flag 有吗?。 如果数据没有,需要调整: 分析问题 或: 证据强度。

80. 明确需要哪种分析

快速映射: | 业务问题 | 方法 | |---|---| | 用户掉在哪里? | Funnel | | 哪批用户后来表现不同? | Cohort | | 为什么 overall 变了? | Segmentation / Decomposition | | 什么行为预测付费? | Lift / Predictive | | 一个改动有没有造成变化? | Experiment | | 收入为什么涨跌? | Revenue Decomposition | | 多久发生某行为? | Time-to-Event | 同时要问: 这是 Monitoring、Diagnosis,还是 Causal Validation?

81. 提前约定“什么结果会改变决策”

这是需求澄清很高级的一步: 如果结果是 X,你会做什么? 如果结果是 Y,你会做什么? 如果无论分析结果是什么,业务方都不会改变决策,那这个分析本身价值可疑。

82. 定义最终 Deliverable

不要默认: “给个报告”。 可能真正需要的是: 一个数字;一个表;一张 funnel;一个推荐结论;Weekly dashboard;实验 readout;SQL dataset。 同时确认: 一次性分析,还是长期 monitoring?

83. Accuracy vs Speed

Directional

快速,80% evidence。

Decision-grade

完整清洗、口径、敏感性分析。

Productionized

长期指标 / dashboard。 不是每个问题都需要做成博士论文。

84. 最后必须“回写确认”

聊完以后,分析师用几行重述: 我理解这次要解决的是: 判断 8 月 retention 下滑主要来自 acquisition mix 还是产品自身。 分析对象:Activated ICP users 主指标:Activation-based D30 retention 重点 segments:Channel / ICP / Sales-assisted 最终决策:判断优先调整渠道还是产品 retention。 然后确认: 对,这就是你要回答的问题吗? 这一步可以极大避免做完 3 天后对方说: “我其实不是想看这个。”

Part XXIII|需求澄清模板

A. Business Context

B. Decision

C. Analysis Question

D. Population / Grain

E. Metrics

F. Comparison

G. Segmentation

H. Data Feasibility

I. Time

J. Deliverable

Part XXIV|高频分析师脑回路

别人说:

注册率 12% 问: 然后这些人 Activated 了吗? 别人说: Activation 58% 问: 定义是什么?能预测 Retention 吗? 别人说: Retention 掉了 问: Same people got worse,还是 user mix changed? 别人说: 这个行为和付费高度相关 问: Selection / Confounding / Leakage 有吗? 别人说: 这个渠道 conversion 高 问: 转到 Signup,还是 Retained Paid? 别人说: PQL 很多 问: Base Rate / Lift / Coverage / Precision / Recall 呢? 别人说: NRR 120% 问: 谁贡献的?哪个 Expansion Axis?集中度呢? 别人说: 实验赢了 问: Effect Size、CI、Guardrail、核心 Segment 呢?

Summary|最终复习版

1. PLG 业务

Acquire
→ Activate / Retain
→ Monetize
→ Expand
Growth Loops 横跨全程

Activate

产品定位 → Value Event → Activation Metric → Retention 验证

PQL

Value Realized + Commercial Intent

Monetization

Value Creation ≠ Value Capture

Value / Pricing

Value 是主轴,Pricing Metric 是 proxy,Cost 是 guardrail

Expansion

Seat / Usage / Workflow / Org / Compound Value

Growth Loop

产品使用本身制造下一轮增长输入

2. PLG Data Analyst

Business Question
→ Grain
→ Value Event
→ Metric Definition
→ Event Model
→ Funnel / Cohort / Segment
→ Bias Check
→ Validation
→ Experiment
→ Decision

Funnel

掉在哪里?

Cohort

后来怎么样?

Segmentation

为什么总体变化?

PQL / Predictive

什么行为预测商业结果?

Time-to-Event

多久发生?

Revenue Decomposition

收入为什么变化?

Experiment

X 是否真的导致 Y?

3. Bias

必须熟悉: Mix Shift;Selection Bias;Confounding;Survivorship Bias;Look-ahead / Leakage;Simpson’s Paradox;Attribution Bias。

4. PQL

必须看: Base Rate;Lift;Coverage;Precision;Recall;Observation Window;Outcome Window。 PQL 不是找“最活跃用户”,而是:

在一个可行动的时间点,用已经发生的产品行为预测未来商业价值。

5. Experiment

Business Problem
→ Causal Hypothesis
→ Eligible Population
→ Randomization Unit
→ Treatment
→ Primary Metric
→ Guardrail
→ Baseline + MDE
→ Sample / Observation
→ Success / Failure / Gray Zone
→ Data Quality / SRM
→ Effect + CI
→ Ship / Kill / Iterate / Continue

最重要的实验纪律:

实验结果出来之前,就定义好怎么根据结果做决策。

6. 需求澄清

最重要的一句话: 数据分析师做需求澄清,不是问清“对方想要什么数据”,而是问清“对方要做什么决策,以及什么证据足够改变这个决策”。 一个好需求最终应该被改写成:

业务问题
+ 决策
+ 分析对象
+ 指标口径
+ Comparison
+ Segmentation
+ 时间成熟度
+ 数据可行性
+ Deliverable

最后一张脑图

PLG
├─ Acquire
│  ├─ ICP
│  ├─ Value 前移
│  ├─ Channel Quality
│  └─ Growth Input
│
├─ Activate / Retain
│  ├─ Value Event
│  ├─ Activation Metric
│  ├─ TTV
│  ├─ Retention
│  └─ Cohort / Plateau
│
├─ Monetize
│  ├─ PQL
│  ├─ Free Tier
│  ├─ Paywall
│  ├─ Value Metric
│  ├─ Pricing Metric
│  └─ Sales-assist
│
├─ Expand
│  ├─ Seat
│  ├─ Usage
│  ├─ Workflow
│  ├─ Org
│  ├─ Compound Value
│  └─ NRR / Expansion Distribution
│
└─ Growth Loops
   ├─ Horizontal Growth
   └─ Vertical Growth
PLG Data Analyst
├─ Clarify Decision
├─ Define Grain
├─ Define Value Event
├─ Lock Metric Contract
├─ Build Event Model
├─ Funnel
├─ Cohort
├─ Segmentation
├─ Bias Check
├─ PQL / Predictive
├─ Monetization / Expansion
├─ Experiment
└─ Decision
需求澄清
├─ Business Context
├─ Decision
├─ Analysis Question
├─ Population / Grain
├─ Metrics
├─ Comparison
├─ Segmentation
├─ Data Feasibility
├─ Time
└─ Deliverable

最终一句

PLG 数据分析的本质,不是“看数字”,而是沿产品价值链建立证据;数据分析师需求澄清的本质,不是“接数据需求”,而是把业务方的模糊诉求压成一个可验证、可比较、可归因、可改变决策的问题。

Source integrity:本页对应硬约束源全文已完整嵌入页面;网页只增加导航、锚点与视觉层级。