PLG × 数据分析|完整学习笔记
目的:把本轮会话中关于 PLG、PLG Data Analyst、需求澄清 的学习内容完整沉淀下来,尽量做到“知识点与会话内容逐项对应”,方便以后从头复习,也方便直接带进项目。 结构:Overall → 主题树展开 → Summary 本笔记不按“课堂章节”死记,而按真正做项目时会遇到的问题组织。
Overall|这轮学习到底建立了什么
这轮学习实际上建立了两套互相咬合的系统:
A. PLG 业务诊断模型
Acquire → Activate / Retain → Monetize → Expand
↘ Growth Loops ↻
B. PLG Data Analyst 分析模型
Business Question
→ Metric Definition
→ Data Grain
→ Event Model
→ Funnel / Cohort / Segment
→ Bias Check
→ Validation
→ Hypothesis
→ Experiment
→ Decision
两者的关系是:
- PLG 的第一原则:产品本身承担增长。
- 指标不是事实;指标是对用户价值的一种测量假设。
- PLG 数据分析不是找最低的数字,而是建立一条能从获客一路解释到价值、留存、付费和扩展的证据链。
PLG Cheatsheet = 我怎么理解 / 诊断这个业务。 PLG Data Analyst = 我怎么用数据证明这个诊断到底对不对。 再往前一步: 数据分析师不是“把数算出来的人”,而是把业务问题变成可计算、可验证、可决策问题的人。 本轮最重要的总原则可以压成三句:
Part I|PLG 业务模型
1. PLG 的核心到底是什么
1.1 产品承担增长
会话中我们先讨论了“Growth Loop 是不是 PLG 第一核心”。 最终校准为:
PLG 的第一原则:产品本身承担增长。 也就是产品不只是“被卖出去的东西”,而要尽可能自己完成:
用户理解价值
→ 获得价值
→ 留存
→ 付费
→ 扩张
→ 理想情况下继续制造下一轮增长
1.2 Growth Loop 很重要,但不是 PLG 的唯一必要条件
更准确地说:
- 一个产品可以是很强的 Product-led Conversion;
- 也可以有 Product-led Expansion;
- 但如果没有 Product-led New-logo Growth Loop,它的 acquisition 仍可能高度依赖 SEO、广告、市场或销售。 于是形成三层理解:
Growth Loop 是让“产品承担增长”这件事形成复利的机制。 因此:
Product-led Conversion
↓
Product-led Expansion
↓
Self-reinforcing Product Growth Loop
最后一层最强,但不能反过来说前两层“不是 PLG”。
2. PLG 的业务主干
最终形成的陌生产品诊断框架是:
Acquire
→ Activate / Retain
→ Monetize
→ Expand
Growth Loops 横跨全程
注意:
Growth Loop 不适合被当成“最后第五步再看看有没有”。 更好的方式是: 从第一步开始就问:这一环产生的 output,能不能重新成为下一轮增长的 input?
Part II|Activation / Retention
3. 真激活不是功能完成,而是价值兑现
3.1 真激活的定义链路
最稳定的定义顺序是:
产品定位
→ 核心价值承诺
→ 用户真正获得价值的时刻(Value Event)
→ 用哪个可观测产品行为代表它(Activation Metric)
→ 用 Retention 验证
会话中的核心判断是:
Retention 更适合做“验证”,不适合做“定义来源”。 也就是说,不建议从: “哪个行为和留存最相关?” 直接倒推出 Activation。 而应该先从产品自身定义: “我的产品是做什么的?” “我怎样表达了我能做这件事?” “对应产品里哪个操作,代表用户用我的产品完成了这件事?”
3.2 Value Event ≠ Activation Metric
需要严格区分: Value Event:用户真正获得价值的那个时刻。;Activation Metric:我们用一个可观测行为去代表这个 Value Event。 例如 AI 写作:
核心价值:帮用户更快产出可用内容
Value Event:用户拿到一份自己觉得能直接用的稿子
Activation Metric:生成 + 编辑 / 复制 / 导出
而不是简单的:
“生成过一次”。 因为: “生成”只是用了功能;“拿走结果”才更接近获得价值。
4. Retention 是 Activation 的合法性验证
4.1 真激活必须对后续 Retention 有明显预测力
如果一个所谓 Activation 定义:
Activated cohort D30 retention = 12% Non-activated cohort D30 retention = 11%那它就非常可疑。 更稳的判断是:
P(Retention | Activated)
>>
P(Retention | Not Activated)
这也是本轮非常重要的一句话:
Activation 的合法性,要由 Retention 来验尸。
4.2 真激活 ≠ 激活后一定留存
需要避免另一个极端: Activated → 100% Retained 不是。 即使用户真正拿到了一次价值,仍然可能因为: 产品使用频率低;持续价值不足;onboarding 后体验变差;有替代品;团队 adoption 没继续;用户需求本身消失。 而流失。 所以真正看的不是“一定留存”,而是: 真激活后,Retained probability 是否显著提高。
5. 多 Activation Path
5.1 多个 Activation Path 是合理的
一个产品可以对应多个场景: 个人记笔记;团队项目管理;团队知识库。 这些场景可以有不同真激活路径。
5.2 多 Activation Path ≠ 多套 PLG motion
判断是不是“真正不同的 PLG motion”,要继续看下游:
Activation 是否不同
→ Retention Driver 是否不同
→ Expansion / Monetization Driver 是否不同
→ Growth Loop 是否不同
越往下越重要。 一句话:
多 Activation 是多条入河支流;下游机制也不同,才是多条河。
Part III|PQL / Monetization
6. PQL 是什么
6.1 Activation 和 PQL 的区别
Activation 回答: 这个用户有没有真正拿到价值? PQL 回答: 已经拿到价值的人里,谁开始出现“值得商业转化 / 扩张”的信号? 因此:
Activation = 这个产品对你有用 PQL = 你对这个产品已经出现商业价值6.2 PQL 不是“高活跃用户”
PQL 更接近:
Value Realized
+
Usage / Adoption Depth
+
Commercial Intent
典型强信号包括: 完成核心价值行为;重复使用 / 使用深度增加;团队协作或 seats 增长;接近免费额度上限;连续撞到和真实需求相关的 paywall;开始使用高级 / 企业能力。
7. Paywall hit 不能单独定义 PQL
一个用户: 第一次登录就点高级功能 → 撞 paywall;连续使用 10 天,完成多个任务后撞额度墙。 虽然都“撞 paywall”,商业含义完全不同。 因此:
Paywall hit 本身是 Commercial Intent signal。 但: 它和 Value Realized 叠加后,才会成为强 PQL。 这也意味着: 碰到付费墙 ≠ 一定真激活。 只有付费墙在“价值已经兑现之后”的合理位置,才接近强商业信号。
8. PQL 是诊断枢纽,但不是万能根因
我们讨论过一种情况: Activation 好;Retention 好;PQL 很多;Paid 很低;Sales 介入后甚至把用户弄跑了。 此时重点可能包括: Free packaging 价值过剩;PQL definition 太宽;Sales-assist motion 有问题。 其中 PQL 很适合作为优先排查点,因为重新定义 PQL 会迫使你回答: 高价值用户到底做了什么;免费用户拿走了什么;什么行为真正代表商业意图;Paywall 是否在正确位置;Sales 应该何时介入。 但要注意: PQL definition 决定“谁值得被干预”。 Sales motion 决定“怎么干预”。 PQL 调准了,不代表 sales motion 自动正确。
Part IV|Free / Value Metric / Pricing Metric
9. 免费版必须有增长目的
一个好的 Free / Trial 不是: “尽量让用户爽”。 而是: 让用户充分感知价值,同时随着需求增强自然产生升级压力。 免费版可能承担: 帮用户完成首次真激活;降低试用门槛;制造 referral / sharing / collaboration;形成 usage habit;帮企业内部 bottom-up 扩散。 如果说不清免费版为什么存在,那它很可能只是在: “白送”。
10. Value Metric
10.1 Value Metric 不是“有没有价值”
核心问题是: 用户获得的价值沿哪个维度增长? 寻找顺序:
产品定位
→ ICP
→ 核心价值
→ 真激活
→ 找价值增长轴
→ 提出 Value Metric 假设
→ 用 Retention / PQL / Expansion 验证
可能的价值增长轴: 完成更多任务;更复杂 / 更高价值任务;节省更多人工时间;更多团队成员使用;更多 workflow 被覆盖;更多资产 / 数据被托管。
11. Value Metric ≠ Pricing Metric
会话中的一个关键区分是:
- Value alignment
- Measurable
- Predictable
真正价值,和最终拿来收费的计量单位,可以不是同一个东西。 例如:
Value Outcome:节省人工小时 Pricing Metric:任务数 / workflow / credits原因: 节省人工小时可能: 难测;难解释;易争议;用户难预测。 所以任务数可能作为更好的 proxy。11.1 好 Pricing Metric 的三个条件
12. Cost 的位置
这轮非常重要的结论:
Value 是主轴,Cost 是约束条件。 因此定价设计顺序更接近:
Value alignment
→ Simplicity / predictability
→ Cost guardrail
而不是:
我们的 GPU / token 成本是多少 → 反推用户该付多少钱
特别是 Agent 产品,usage-based 经常自然,是因为:
任务执行量 ↑
→ 用户产出 ↑
→ 我们成本也 ↑
三者可能同向。 但“按边际成本收费”不应该成为 Value Metric 的定义。
13. 多类型 Agent 的计费复杂度
如果不同任务价值差异很大:
“改一个标题”和“做一份 6 小时行业研究” 都按 1 task 收费,就很不合理。 可以采用:
Usage × Value / Complexity Class例如: Quick = 1 credit;Standard = 5 credits;Advanced = 10 credits;Deep Research = 20 credits。 分档时: MECE 是结构原则,但还不够。 还需要: 同一档用户价值相近;同一档经济性相近;用户容易理解。 主轴仍然优先按: 用户价值 成本作为红线。Part V|Expansion
14. Expansion ≠ 裂变
Expansion 问的是: 同一个客户,为什么会花越来越多钱? 而 Growth Loop / 裂变更偏: 现有用户怎么带来更多新用户或更多使用。 所以: Expansion ≠ Referral / Acquisition。
15. Expansion Axis
常见 Expansion Axis: Seats;Usage;Workflow / Module;Org / Cross-team;Capacity;Compound Value。 诊断顺序:
产品价值定位
→ 价值是否天然会随着采用加深而增长
→ 沿什么维度增长
→ Pricing Metric 是否承接这个增长
→ Unit Economics 是否成立
16. Compound Value
这轮我们特别强调了:
使用越久
→ 数据 / 知识 / 历史上下文越多
→ 产品越有价值
→ 越难替代
→ 越容易 Retain + Expand
这已经进入:
Retention + Expansion + Moat 的交叉区域。 好的 Expansion 不只是: 多卖几个 seat 而是: 随着组织采用加深,产品的 value surface 本身扩大甚至发生质变。
Part VI|Growth Loop
17. Growth Loop 不是“渠道”
“分享 / 社区 / 社媒 / 博文”本身不是 Growth Loop。 它们只是可能的载体。 真正 loop 必须闭环:
用户使用产品
→ 产生可传播 / 可协作 / 可索引资产
→ 外部或内部用户进入
→ 新用户继续使用
→ 再次制造增长输入
一句最重要的话:
Growth Loop 不是“我在哪里推广”,而是“产品使用本身如何制造下一轮增长的输入”。
18. Horizontal vs Vertical Growth
18.1 Horizontal Growth
带来: 新用户;新 workspace;new logo。 典型: 分享;邀请;UGC;模板;公开内容;协作。
18.2 Vertical Growth
在已有客户内部增长: seat;usage;workflow;team / org;revenue expansion。 这两类不要混。 因此一个产品即使: 100% 靠 SEO 获客;Activation / Conversion / Expansion 都是 Product-led。 也仍然可以是 PLG。 只是结构性缺陷是: new-logo acquisition 仍高度依赖外部流量供给。
Part VII|PLG Data Analyst 总框架
19. 数据分析师真正做什么
分析师不是: “会算转化率”。 而是把业务语言翻译成:
可计算
可验证
可归因
可决策
完整工作链:
Business Question
→ Metric Definition
→ Data Grain
→ Event Model
→ Funnel / Cohort / Segment
→ Bias Check
→ Validation
→ Hypothesis
→ Experiment
→ Decision
Part VIII|Metric Definition
20. 看到任何百分比先拆口径
例如:
D30 Retention = 32% 在接受它之前,至少要知道: Entity / Grain 是什么?;Denominator 是谁?;Numerator 是什么行为?;Window 是严格 D30 还是 rolling?;Eligibility 是什么?;Day 0 从哪开始?;不同 cohort / segment 是否混合?。 对于 Activation,则至少拆: 分子;分母;时间窗;哪些人真正有机会完成分子;渠道 / 画像是否混合;这个指标归谁负责。 一句话: 先把这个指标的 SQL 口径说清楚。
Part IX|Data Grain
21. B2B PLG 不能只看 user_id
常见层级: User;Workspace;Account;Organization;Subscription;Revenue。 不同 Grain 回答不同问题:
User → Adoption
Workspace / Account → 产品渗透
Logo → 客户关系
Revenue → 商业价值 / Expansion
完全可能同时出现:
User Retention ↓
Logo Retention 稳定
NRR ↑
三者不冲突。
Part X|Event Model
22. 事件模型需要什么
仅有:
user_id + event_name + timestamp
通常不够。
更有用的是:
user_id
workspace_id
account_id
session_id
event_name
event_properties
channel
plan
experiment_variant
sales_assisted
timestamp
task_type
usage_amount
一个好的 Event Model 需要支持回答: 谁;做了什么;什么时候;在什么上下文;获得了什么价值;商业状态是什么。
Part XI|Funnel Analysis
23. Funnel 回答什么
用户沿着一个有顺序的路径,在哪一步大量流失? 典型:
Visit
→ Signup
→ Onboarding
→ Value Event / Activation
→ Retained
→ PQL
→ Paid
至少同时看: Conversion Rate;Absolute Loss;Time Between Steps。
23.1 优先级原则
不是:
- Cohort Anchor
- Return Event
- Return Window
哪个 conversion rate 最低就修哪个。 而是: 先用 PLG 顺序纪律决定修哪一层,再用绝对损失决定该层内部先修哪一段。
Part XII|Cohort / Retention
24. Funnel 和 Cohort 的区别
一句话: Funnel 看横向路径。 Cohort 看纵向时间。 Funnel 回答: 用户有没有到达那里? Cohort 回答: 到达以后,后来发生了什么?
25. Retention 真正测什么
不是: 用户回来登录了没有。 而是: 核心价值有没有重复发生。 所以:
Activation = 第一次价值成立 Retention = 重复价值成立26. Retention 的三个定义维度
任何 retention 指标必须有:
26.1 Day 0
验证产品价值时,经常更适合:
Activation-based Day 0 而不是 Signup-based Day 0。 因为 Signup → Activation 之间混入了 TTV。
27. Retention 类型
N-Day Retention
第 N 天回来。
Windowed Retention
如 D30 ± 3 天。
Rolling Retention
Day N 或之后任何时间回来。 指标要匹配: Natural Frequency 例如: Daily → D1 / D7 / D30;Weekly → W1 / W4 / W8;Monthly → M1 / M3 / M6。
28. Retention Curve
主要看三个区域:
Early Drop
初期快速掉。 可能对应: Activation quality;Expectation mismatch;Onboarding;First Value。
Long Decline
一直下滑。 可能说明: Recurring Value 不够强。
Plateau
出现长期稳定平台。 非常重要的问题: 哪些人进入 plateau,以及为什么?
29. Aggregate Retention 很危险
Overall retention 下降,不一定是产品变差。 可能只是: User Mix 变了。 因此脑中应该有:
Overall Metric Change
=
Within-segment Behavioral Change
+
Segment Composition Change
Part XIII|Segmentation
30. Segmentation 的目标
不是:
- ICP
- Use case
- Persona
- Account size
切 27 个维度。 而是: 找到不同的业务机制。 优先级:
Business mechanism
Acquisition mechanism
- Channel
- Campaign
- Landing page
Product path
- Activation path
- Workflow
- Feature adoption
Commercial motion
- Self-serve
- Sales-assisted
- Plan
Environment
- Country
- Device
- OS 除非环境确实改变机制,否则不要优先切。
30.1 好 Segmentation 的判断标准
切完以后,业务结论变了。 例如: Overall Activation 很差 → 切 Channel → SEO 很好、Paid 很差 根因从: “产品激活差” 变成: “Paid Acquisition Quality 差”。
Part XIV|Bias
31. Mix Shift
总体变化来自:
Within-segment Change
+
Composition Change
先问:
Same people got worse? 还是: User mix changed?
32. Simpson’s Paradox
可能出现: 每个 segment 都变好,但 overall 反而变差。 原因通常是: 低表现 segment 占比大幅增加。 所以: Aggregate metric 是现象,不一定是机制。
33. Selection Bias
核心问题: 为什么这些人会出现在这个组里? 例如: 用了高级功能的人 retention 高。 可能不是: 高级功能导致 retention。 而是: 高意愿用户本来就更容易用到高级功能。
34. Confounding
第三个变量同时影响 X 和 Y。 例如:
Company Size
↙ ↘
Invite Paid
第一步处理方法:
Stratification。 在同一 company size 层内再比较。
35. Survivorship Bias
例如: 长期用户平均用了 12 个 feature。 不能直接说: 用 12 个 feature 导致长期留存。 因为: 只有长期留下的人,才有机会用到 12 个 feature。 更干净的方法: 固定一个 early observation window,例如 Activation 后前 7 天行为,预测 D30。
36. Look-ahead Bias / Leakage
预测未来商业结果时:
Observation Window
→ Scoring Point
→ Outcome Window
必须严格分离。 例如:
Day 0–7 behavior
→ Day 7 PQL score
→ Predict Day 8–30 Paid
不能把 Day 12 / Day 20 的行为偷偷放进去。
37. Attribution Bias
B2B PLG 至少区分:
Source
谁带来用户?
Product / Activation Influence
谁让用户拿到价值?
Close
谁完成商业交易? 典型:
Source = SEO
Activation = Product-led
Close = Sales
因此:
PLG 和 Sales 不是互斥归因。
Part XV|PQL / Predictive Analysis
38. PQL 是 prediction problem
真正问题: 在需要采取商业动作的那个时点,哪些已经发生的产品行为,可以预测未来付费 / 扩张? 结构:
Historical Product Behavior
→ PQL Signal / Score
→ Future Commercial Outcome
→ Intervention
39. Base Rate
先算:
P(Paid)
例如:
全体 Activated users 未来 30 天 Paid = 5%。
这 5% 是后面比较所有 signal 的基线。
40. Lift
Lift(signal)
=
P(Paid | Signal)
/
P(Paid)
例如:
Invite ≥3 的 Paid = 20%
Base = 5%
那么:
Lift = 4x
41. Coverage
Lift 高还不够。 需要问:
- 核心任务完成
- 结果导出
- Workflow success
这个 signal 覆盖多少真正的商业机会? 高 Lift、低 Coverage 的 signal,可能不适合做主 PQL 规则。
42. Precision / Recall
Precision
TP / (TP + FP)你判为 PQL 的人里面,多少真的付费?Recall
TP / (TP + FN)所有真正会付费的人里面,你抓到了多少?43. PQL Threshold 取决于 Intervention Cost
低成本
如自动 Upgrade CTA。 可以接受较低 precision。
高成本
如 Sales contact。 需要更高 precision。 因此: PQL threshold 是业务 trade-off,不是统计学唯一最优。
44. PQL Signals 五类
Value Realization
Engagement
- Active days
- Task count
- Usage frequency
Collaboration / Expansion
- Invite
- Team size
- Workspace growth
Commercial Intent
- Paywall hit
- Quota threshold
- Premium workflow attempted
Firmographic
- Company size
- Industry
- Role 成熟 B2B:
PQL
=
Product Intent
× Commercial Potential
45. Rule-based Scoring
第一版完全可以:
True Activated +20
≥3 Value Events +10
≥5 Active Days +10
Invite ≥3 +20
Usage ≥80% quota +20
Relevant Paywall Hit +20
Enterprise Workflow +10
重点不在数学漂亮,而是:
每个 score 都有数据 evidence。 不需要一上来就 ML。
Part XVI|Monetization Analysis
46. Monetization 真正回答什么
不是: 付费率是多少? 而是: 用户在获得多少价值、处于什么状态、遇到什么商业边界以后,开始愿意付费? 完整商业化漏斗:
Activated
→ Retained / Repeated Value
→ PQL
→ Paywall / Upgrade Trigger
→ Checkout
→ Paid
47. Denominator Discipline
同时保留:
Signup → Paid
Activated → Paid
PQL → Paid
三者回答不同问题: Signup → Paid:混合了获客、激活、商业化。;Activated → Paid:更接近 Value Capture。;PQL → Paid:更接近商业化效率。
48. Free Tier Analysis
免费用户要换回某种增长价值: Activation;Habit;Referral;Team invite;PQL;Paid Conversion。 如果一类 Free 用户:
Cost 高
+ 不付费
+ 不分享
+ 不扩散
那这类 usage 很可能只是纯成本。
49. Usage Distribution
不要只看平均。 至少看: Median;P75;P90;P95;P99。 尤其 AI / Agent 产品要警惕 heavy tail。
50. Usage × Commercial Outcome
把用户按 usage bucket 分层,再看: Paid rate;Retention;ARPA;Expansion;Cost。 这可以帮助: PQL threshold;Free limit;Plan boundary;Usage pricing。
Part XVII|Paywall / Pricing Cohort
51. Paywall Analysis
完整分析路径:
Who hit paywall?
→ Activated?
→ Usage before paywall
→ Repeated paywall hits
→ Checkout
→ Paid
→ Post-paid retention
重点比较:
Paywall before Activation
vs
Paywall after Activation
如果付费墙出现在 Value Realized 前,可能直接伤害真激活。
52. Pricing Cohort
价格调整后不能只看:
ARPU 涨没涨。 应该比较 Old vs New Pricing Cohort: Activation;Paid Conversion;ARPA;Retention;Expansion;Gross Margin。 避免: 单笔收入涨了,但整体 LTV 变差。
Part XVIII|Revenue / Expansion Analysis
53. Revenue Decomposition
New Revenue
+ Expansion Revenue
- Contraction
- Churn
= Net Revenue Change
总收入涨 20%,如果不拆,就不知道到底为什么涨。
54. NRR
NRR
=
(Starting Revenue
- Churn
- Contraction
+ Expansion)
/
Starting Revenue
但:
NRR 是结果,不是 insight。 下一步要继续拆: 谁 Expansion?;沿哪个 Axis?;多久发生?;是否集中在少数 whale?。
55. Expansion Distribution
至少同时看: % Accounts Expanded;Median Expansion;P90 Expansion;Top 10 Account Contribution。 因为: 300 个客户自然扩张到 NRR 120% 和: 5 个大客户撑出 NRR 120% 不是一个业务。
56. Expansion Cohort / Velocity
按首次付费月份:
M0 → M3 → M6 → M12看: 一个典型客户经济价值如何随生命周期变化。 同时分析: Paid → First Expansion;Seat expansion timing;Workflow expansion timing;Org expansion timing。Part XIX|Growth Loop Analysis
57. Growth Loop 也可以 Funnel 化
例如 Invite Loop:
Activated Users
→ Invite Rate
→ Invites / Inviter
→ Acceptance
→ Signup
→ Activation
→ Retention
→ Invite Again
近似:
New Activated Users
=
Activated Users
× Invite Rate
× Invites/User
× Acceptance
× Activation
数据分析目的:
找 Loop 真正 bottleneck。
Part XX|Experimentation
58. Observational ≠ Causal
前面分析看到:
Invite ≥3 → Retention 更高只能说: Invite 是 predictor。 想知道: “主动推动 invite,会不会提高 retention?” 需要实验。 因此:
Predictor
→ Causal Hypothesis
→ Randomized Experiment
→ Decision
59. Hypothesis 必须可证伪
差的:
优化 onboarding 提升体验。 好的: 将 onboarding 从 5 步缩到 3 步,会让首次注册且未激活用户的 7 天 Activation 从 28% 提升到至少 32%,同时 D7 retention 不下降超过 1pp。 好的假设明确: Who;Treatment;Outcome;Baseline;Target;Guardrail。
60. Primary Metric / Guardrail
Primary Metric
一次实验一个主输赢判断。
Guardrail
防止你: “赢得很难看”。 例如把 Free limit 从 100 降到 20: Paid conversion ↑ 但: Activation ↓ Retention ↓ 这时不能宣布赢。
61. Randomization Unit
根据干预机制选择: User;Workspace;Account;Organization。 团队协作、pricing、workspace limit 等,往往更适合 Account / Workspace level randomization,避免 spillover。
62. MDE
Minimum Detectable Effect: 至少多大的变化,业务上值得关心? 它连接:
Business Significance
↔
Sample Size
63. Statistical Significance ≠ Business Significance
不要只看:
- 真没效果
- 效果小于业务关心的 MDE
- 样本不足,实验没有 power 因此:
没有证据证明有效 ≠ 有证据证明无效。
65. Gray Zone
实验前提前定义: Success;Failure;Gray Zone。 避免结果出来后临时改标准。
66. SRM / Data Quality
如果计划 50/50 分流,却得到 70/30: 先查实验系统。 不要直接分析效果。 优先检查: Exposure event;分流;重复分组;Bot / Test account;Tracking 丢失;Conversion schema。
67. ITT
Intention-to-Treat: 按最初随机 assignment 分析。 不要只分析“真正用过新版的人”,否则可能重新引入 Selection Bias。
68. 实验最终输出
不要只写: A 赢 / B 赢。 至少输出: What happened;Effect size;Uncertainty;Guardrails;Key segments;Decision;What we learned。 决策:
p < 0.05 更应该一起看: Effect Size;Confidence Interval;Business Impact。 一个 +0.15pp 的变化可能统计显著,但商业毫无意义。
64. Power / Null Result
“No significant difference” 可能意味着:
Ship
Kill
Iterate
Continue
Part XXI|Dashboard / Analysis / Experiment
69. 三个不是一回事
Dashboard = Monitoring
发生了什么?
Analysis = Diagnosis
为什么发生?
Experiment = Causal Validation
改 X 会不会真的改变 Y?
成熟工作流:
Monitor
→ Diagnose
→ Hypothesis
→ Experiment
→ Decision
Part XXII|数据分析师需求澄清 Best Practice
70. 需求澄清不是 Clarify Data Request
最核心的一句话:
- 什么现象触发需求?
- 为什么现在分析?
- 当前最担心什么?
需求澄清不是问清“你想要什么数据”,而是问清“你要做什么决策”。 例如: “帮我看下渠道分析。” 不够。 要继续问: 最终是为了加预算、减预算、停渠道,还是优化 landing page? 因为不同决策对应完全不同分析。
71. 把需求改写成 Decision Question
一个很实用的句式: We are trying to determine whether / why / which... 例如: 我们要判断 8 月 D30 retention 下降,主要来自用户结构变化,还是同类用户自身留存恶化,以决定应该优先修 acquisition 还是 product retention。 这句话一旦写清,分析就清楚了一半。
72. 确认分析对象 / Grain
问: 我们到底在分析谁? 可能是: User;Account;Workspace;Company / Logo;Subscription;Order;Session;Revenue。 例如“客户留存率”一定要澄清: User retention;Logo retention;Revenue retention。
73. 锁死核心指标口径
例如“Activation Rate”: 必须确认: Numerator;Denominator;Window;Anchor;Exclusion;Eligibility。 最好形成: Metric Contract 例如: Activation Rate = 注册后 7 天内完成 ≥1 次成功任务并导出结果的 eligible ICP users / eligible ICP signups。
74. 问“为什么现在问这个问题”
这是非常重要但经常被漏掉的一步。 可能 trigger 是: Dashboard 指标下降;刚上线功能;CEO 感觉用户反馈变差;Sales 说用户质量不行;下季度预算决策。 Trigger 会影响分析方向。
75. 让业务方讲出当前 Hypothesis
更好的问法: 你目前最怀疑哪几个原因?有没有最近发生的产品、渠道、价格或流程变化? 这样可以快速拿到: Acquisition mix;Product changes;Sales route;Pricing changes;其他 confounder。 比盲切几十个维度有效得多。
76. 明确 Comparison
任何分析最好有比较基线: 上个月;去年同期;Control;Non-activated;ICP vs Non-ICP;Paid vs Free;Retained vs Churned;Before vs After。 例如: PQL conversion = 12% 本身没意义。 如果 base = 3%,那是 4× lift。
77. 明确 Segmentation 边界
不要业务方说: “按国家、渠道、用户类型、行业、设备都拆一下” 就全接。 要区分:
Must-have segments
真正可能改变业务机制的。
Exploratory segments
有空再看。 优先: ICP;Channel;Use case;Plan;Company size;Self-serve / Sales-assisted。
78. 时间范围有三层
Calendar Range
Jul–Aug
Cohort Window
7 月 signup cohort
Outcome Maturity
例如 D30 retention,只能纳入已经成熟到 D30 的 cohort。 所以要问: 哪些 cohort 已经有资格被分析?
79. 先确认数据是否存在
需求澄清后要做 lightweight feasibility check: Event 有吗?;历史从什么时候开始?;ID 能 join 吗?;Channel attribution 有吗?;Workspace / account mapping 有吗?;Pricing history 有吗?;Sales-assisted flag 有吗?。 如果数据没有,需要调整: 分析问题 或: 证据强度。
80. 明确需要哪种分析
快速映射: | 业务问题 | 方法 | |---|---| | 用户掉在哪里? | Funnel | | 哪批用户后来表现不同? | Cohort | | 为什么 overall 变了? | Segmentation / Decomposition | | 什么行为预测付费? | Lift / Predictive | | 一个改动有没有造成变化? | Experiment | | 收入为什么涨跌? | Revenue Decomposition | | 多久发生某行为? | Time-to-Event | 同时要问: 这是 Monitoring、Diagnosis,还是 Causal Validation?
81. 提前约定“什么结果会改变决策”
这是需求澄清很高级的一步: 如果结果是 X,你会做什么? 如果结果是 Y,你会做什么? 如果无论分析结果是什么,业务方都不会改变决策,那这个分析本身价值可疑。
82. 定义最终 Deliverable
不要默认: “给个报告”。 可能真正需要的是: 一个数字;一个表;一张 funnel;一个推荐结论;Weekly dashboard;实验 readout;SQL dataset。 同时确认: 一次性分析,还是长期 monitoring?
83. Accuracy vs Speed
Directional
快速,80% evidence。
Decision-grade
完整清洗、口径、敏感性分析。
Productionized
长期指标 / dashboard。 不是每个问题都需要做成博士论文。
84. 最后必须“回写确认”
聊完以后,分析师用几行重述: 我理解这次要解决的是: 判断 8 月 retention 下滑主要来自 acquisition mix 还是产品自身。 分析对象:Activated ICP users 主指标:Activation-based D30 retention 重点 segments:Channel / ICP / Sales-assisted 最终决策:判断优先调整渠道还是产品 retention。 然后确认: 对,这就是你要回答的问题吗? 这一步可以极大避免做完 3 天后对方说: “我其实不是想看这个。”
Part XXIII|需求澄清模板
A. Business Context
B. Decision
- 分析支持什么决策?
- 不同结果分别导致什么动作?
C. Analysis Question
- 最终要回答的具体问题是什么?
- 当前有哪些 hypothesis?
D. Population / Grain
- User / Workspace / Account / Revenue?
- 包含 / 排除谁?
E. Metrics
- Primary Metric?
- Numerator / Denominator / Window / Anchor?
- Guardrail / Secondary?
F. Comparison
- 和谁比?
- Baseline / Control / Cohort / Segment?
G. Segmentation
- Must-have segments?
- Exploratory segments?
H. Data Feasibility
- 数据存在吗?
- 历史多久?
- Tracking 靠谱吗?
- 已知缺口?
I. Time
- Calendar Range
- Cohort Maturity
- Deadline
J. Deliverable
- One-off / Dashboard / Dataset / Experiment Readout?
- 深度?
- Decision Owner?
Part XXIV|高频分析师脑回路
别人说:
注册率 12% 问: 然后这些人 Activated 了吗? 别人说: Activation 58% 问: 定义是什么?能预测 Retention 吗? 别人说: Retention 掉了 问: Same people got worse,还是 user mix changed? 别人说: 这个行为和付费高度相关 问: Selection / Confounding / Leakage 有吗? 别人说: 这个渠道 conversion 高 问: 转到 Signup,还是 Retained Paid? 别人说: PQL 很多 问: Base Rate / Lift / Coverage / Precision / Recall 呢? 别人说: NRR 120% 问: 谁贡献的?哪个 Expansion Axis?集中度呢? 别人说: 实验赢了 问: Effect Size、CI、Guardrail、核心 Segment 呢?
Summary|最终复习版
1. PLG 业务
Acquire
→ Activate / Retain
→ Monetize
→ Expand
Growth Loops 横跨全程
Activate
产品定位 → Value Event → Activation Metric → Retention 验证
PQL
Value Realized + Commercial Intent
Monetization
Value Creation ≠ Value Capture
Value / Pricing
Value 是主轴,Pricing Metric 是 proxy,Cost 是 guardrail
Expansion
Seat / Usage / Workflow / Org / Compound Value
Growth Loop
产品使用本身制造下一轮增长输入
2. PLG Data Analyst
Business Question
→ Grain
→ Value Event
→ Metric Definition
→ Event Model
→ Funnel / Cohort / Segment
→ Bias Check
→ Validation
→ Experiment
→ Decision
Funnel
掉在哪里?
Cohort
后来怎么样?
Segmentation
为什么总体变化?
PQL / Predictive
什么行为预测商业结果?
Time-to-Event
多久发生?
Revenue Decomposition
收入为什么变化?
Experiment
X 是否真的导致 Y?
3. Bias
必须熟悉: Mix Shift;Selection Bias;Confounding;Survivorship Bias;Look-ahead / Leakage;Simpson’s Paradox;Attribution Bias。
4. PQL
必须看: Base Rate;Lift;Coverage;Precision;Recall;Observation Window;Outcome Window。 PQL 不是找“最活跃用户”,而是:
在一个可行动的时间点,用已经发生的产品行为预测未来商业价值。
5. Experiment
Business Problem
→ Causal Hypothesis
→ Eligible Population
→ Randomization Unit
→ Treatment
→ Primary Metric
→ Guardrail
→ Baseline + MDE
→ Sample / Observation
→ Success / Failure / Gray Zone
→ Data Quality / SRM
→ Effect + CI
→ Ship / Kill / Iterate / Continue
最重要的实验纪律:
实验结果出来之前,就定义好怎么根据结果做决策。
6. 需求澄清
最重要的一句话: 数据分析师做需求澄清,不是问清“对方想要什么数据”,而是问清“对方要做什么决策,以及什么证据足够改变这个决策”。 一个好需求最终应该被改写成:
业务问题
+ 决策
+ 分析对象
+ 指标口径
+ Comparison
+ Segmentation
+ 时间成熟度
+ 数据可行性
+ Deliverable
最后一张脑图
PLG
├─ Acquire
│ ├─ ICP
│ ├─ Value 前移
│ ├─ Channel Quality
│ └─ Growth Input
│
├─ Activate / Retain
│ ├─ Value Event
│ ├─ Activation Metric
│ ├─ TTV
│ ├─ Retention
│ └─ Cohort / Plateau
│
├─ Monetize
│ ├─ PQL
│ ├─ Free Tier
│ ├─ Paywall
│ ├─ Value Metric
│ ├─ Pricing Metric
│ └─ Sales-assist
│
├─ Expand
│ ├─ Seat
│ ├─ Usage
│ ├─ Workflow
│ ├─ Org
│ ├─ Compound Value
│ └─ NRR / Expansion Distribution
│
└─ Growth Loops
├─ Horizontal Growth
└─ Vertical Growth
PLG Data Analyst
├─ Clarify Decision
├─ Define Grain
├─ Define Value Event
├─ Lock Metric Contract
├─ Build Event Model
├─ Funnel
├─ Cohort
├─ Segmentation
├─ Bias Check
├─ PQL / Predictive
├─ Monetization / Expansion
├─ Experiment
└─ Decision
需求澄清
├─ Business Context
├─ Decision
├─ Analysis Question
├─ Population / Grain
├─ Metrics
├─ Comparison
├─ Segmentation
├─ Data Feasibility
├─ Time
└─ Deliverable
最终一句
PLG 数据分析的本质,不是“看数字”,而是沿产品价值链建立证据;数据分析师需求澄清的本质,不是“接数据需求”,而是把业务方的模糊诉求压成一个可验证、可比较、可归因、可改变决策的问题。