10. 数据测量、GSC、诊断与实验 · 讲者经验 · 教学步骤 6

一次只扩大一个变量

同时扩页、换模板、加链接会让结果无法归因。

原知识点:新站先少量页面验证抓取与出词,再逐档扩大,GSC反馈不过关就停在当前档调整模板。

执行步骤

  1. 写出唯一主要变量、因果假设、主要二元/连续指标及保持不变条件。
  2. 数据量足时预设基线率p、最小有意义变化δ、显著性α与把握度1−β,并用样本量公式或可信计算器得出n;保存方法。
  3. 低流量或结果不可统计推断时,改用风险型规则:覆盖所有高风险失败场景、设置现金/错误暴露上限和完整反馈周期,并明确只判断可运行性。
  4. 计算观察期=所需样本÷日均合格事件+数据延迟,且覆盖相关业务周期。
  5. 保存基线/对照、批次URL、版本和护栏;到复查点按预写分支执行,不中途改成功标准。

可复制工作表

# 实验定义
假设:改变__会使__
唯一变量:__
保持不变:__
主要指标/单位:__
基线或对照:__

# 统计型样本(适用时)
基线率p:__
最小有意义绝对变化δ:__
显著性α:__;zα/2:__
把握度1−β:__;zβ:__
二组近似样本量/组 n = 2×(zα/2+zβ)^2×p×(1−p)/δ^2 = __
采用的正式计算器/方法与输出:__

# 风险型替代(低流量时二选一填写)
高风险失败场景(每项复制一行):__
最大现金/工时/错误暴露:__/__/__
必须覆盖的完整反馈周期:__
允许结论仅为:可运行/不可运行/继续研究

# 观察期
日均合格事件q:__
数据延迟d:__
观察期T=ceil(总样本/q)+d,并覆盖__业务周期 = __

# 三情景与判断
|情景|主要指标|护栏|判断|动作|
|---|---|---|---|---|
|悲观|__|__|失败|暂停/回滚__|
|基准|__|__|不确定/通过__|继续__|
|乐观|__|__|通过|仅扩大同一变量__|

完整示例

示例(数字、版本和命令仅演示预注册实验):
假设:把上传完成后的CTA从“继续”改为“生成可下载文字”,会提高合格开始用户的任务完成率。唯一变量为CTA文案;页面结构、流量入口、价格、模型版本、文件上限和事件v2保持不变。主要指标=后端task_complete去重用户/后端task_start去重用户;基线p=0.30。

统计型设计:最小有意义绝对变化δ=0.15;双侧α=0.05,zα/2=1.96;把握度80%,zβ=0.84。二组近似样本量n=2×(1.96+0.84)^2×0.30×0.70/0.15^2=146.35,向上取147/组。正式复核使用statsmodels proportions_ztest,计算记录CALC-83与预注册EXP-83在发布前锁定,不中途改变标准。

日均两组合计合格事件q=20,数据延迟d=3天;原始T=ceil(294/20)+3=18天。为覆盖完整周周期,从2026-08-03周一开始,正式观察延长到21天,最早分析日2026-08-24。

列较多时可左右滚动;首列会固定,便于逐行比较。

情景主要指标护栏判断动作
悲观变体≤27%或低于对照且95%区间支持负向5xx>1%、任务错误>2%或隐私事件失败立即deploy rollback cta-v17
基准28%–44.9%或差异95%区间跨05xx≤1%、错误≤2%不确定只收满预注册样本或记录不确定,不改δ
乐观变体≥45%且差异95%区间下界>05xx≤1%、错误≤2%、延迟p95不增>10%通过保留cta-v18,并在另一cohort复测同一变量

实际锁定样本为对照44/147=29.9%,变体68/147=46.3%,绝对差16.3个百分点,95%区间约+5.4至+27.3个百分点;5xx分别0.7%/0.8%,任务错误1.4%/1.2%,p95延迟变化+4%,护栏均通过。结果落入乐观情景,保留cta-v18但不据一次实验扩展其他变量;制品为release-cta-v17/v18,回滚演练耗时6分钟。

若预估流量无法取得294个事件,改用风险型可运行性小测:最多20个目标用户、100元现金、8工时、错误暴露上限2次,必须覆盖14天退款/故障周期;只允许输出“可运行/不可运行/继续研究”,不得声称因果提升。支付、隐私或错误暴露先触线即停止。

完成清单

  • 数据量足时保存p、δ、α、把握度、公式/计算器与样本结果;低流量时保存风险型替代规则。
  • 观察期由样本、日均事件、反馈延迟和业务周期推导。
  • 实验只有一个主要变量,并预先记录三情景、护栏、暂停与回滚。
  • 风险型小测不输出因果提升结论,统计型也不在中途改标准。

适用条件

每轮只扩大页面量这一主要变量。

来源:程序化SEO生成海量页面