一个月 23 次付费墙测试,来自内部的真实复盘

TL;DR:
- Glam AI 的每一场测试,最终决策都仅依据单用户净收入(net revenue per user)或 LTV。 转化率只是诊断工具。有个变体把购买转化拉高了四分之一,照样被砍掉——因为单用户收入还不如对照组。
- 一次胜利只属于它赢下来的那个位置和那群用户。在主付费墙上将年订阅转化率从 0.43% 提升至 0.55% 的诱饵套餐,应用在内页付费墙时却毫无作用。
- backlog 按“离钱的距离”排序:付费墙和定价第一,购买前链路第二,激活和留存最后。
以前抄一版付费墙,要搭上一整个工程迭代周期;现在一个下午就够了——你能做到,跟你抢生意的所有人同样能做到。所以“上线快”已经不再是拉开差距的东西。真正拉开差距的,是你能说清上个月上线的二十件事里,究竟哪一件真的赚到了钱。
这件事比听上去难得多。买量成本一个季度比一个季度高,LTV/CAC 每到夏天都会趋于平稳,而且即使某种策略能够提升转化率,也可能导致收入下降。
Artem Altynov 是 Glam AI 的增长产品负责人。Glam AI是一款 AI 修图应用,iOS 与 Android 双端合计 $50M ARR,月活 4M。他的团队 7 月跑完 23 次测试,9 次胜出。他在我们关于 Glam AI 实验体系的直播中 拆解了其中四场:两胜两败——而其中一场被砍掉的测试,购买转化足足涨了四分之一。
为什么 Glam AI 砍掉了一个拉高购买转化的测试?
因为单用户收入掉了。团队测的是主付费墙的头图内容——静态图对比视频,两侧的套餐结构和 $59.99 年订阅完全一致。
变体 B 把“浏览→付费”从 1% 拉到 1.25%,每组样本约 8,300 人。样本量足够大,结果也足够干净。团队还是把它扔了。

B 的视频头图起到了更好的吸引作用。但它同时把用户推向了 $8.99 的周订阅而不是年订阅,于是年订阅量下滑,退款率上升。全量流量下,单用户净收入低于 A;只切美国流量再算一遍,依然低于 A。最终他们保留了对照组。
Glam AI 把指标分成两类。转化率、单用户净收入和 LTV 是决定指标、;流失、退款、评分和客服工单是护栏指标。一个变体哪怕转化率赢了,只要有护栏指标下滑,就不能上线——涨幅再好看也不行。这套原则,我聊过的每个增长团队都认同。可现实是:转化率第三天就出结果,单用户收入却要再等两周、再等一个退款窗口才有意义,而变体早在有人复核之前就已经全量上线了。这个时间差,正是付费墙测试最容易踩坑的地方。
每块屏幕看起来都能测,到底该先测哪个?
Glam AI 给需求池排序的标准是“离钱的距离”:一个改动多直接地触达收入,以及在效果落到账上之前,还有多少环节必须先跑通。

Glam AI 按“改动与收入之间隔了几步”给每一个测试想法排序。
第一层是变现:付费墙、Offer、定价、套餐结构。周一改个价,周五就能读出结果——因为改动和收入之间什么都不隔。
第二层是购买前链路:引导流程、付费墙入口,以及通往购买的整条动线。效果是真实存在的,只是要多穿过几个环节才落地,所以你需要更大的样本和更多的耐心。
第三层是激活和留存:核心体验、用户参与度以及更深层的产品机制。其中部分工作是产品路线图上价值最高的项目,但全都不适合做快速实验,因为留存带来的收益可能需要一个季度才能体现在营收数据上,而到那时,你已经在此基础上上线了四十项其他功能。
这个排序更多是排期决策,而不是价值判断。每月 23 次的测试量级要求实验必须在数天内产出结论,因此,高频走量的必然是第一层(变现层)。第三层依然要做,只是节奏不同,通常也换一拨人来做——这也正是为什么引导流程测试一旦没人认领就容易停摆。
加一个根本没人买的贵套餐,能带动其他套餐的销量吗?
在用户看到的第一个付费墙上,能。Glam AI 的对照组给两个选项:$59.99 的年订阅和 $8.99 的周订阅。变体 B 在最上面加了第三个——$119.99 的 Yearly Business,折算下来每周 $2.31,而常规年订阅每周只要 $1.15。

没人指望 Business 真能卖出去,关键在于它对下面那个选项做了什么。年订阅转化从 0.43% 涨到 0.55%,每组样本约 24,500 人。周订阅保持不变,也就是说年订阅是净增,并没有吃掉周订阅;单用户净收入从 $0.261 提升到 $0.292。这一个实验胜出了。
值得停下来看看这个样本量。效果只有 12 个基点,而基准值本身还不到 0.5%,读出这个结论用掉了将近 50,000 名用户。很多团队拿 2,000 个用户跑同样的测试,看到一堆噪声,然后得出结论:诱饵定价没用。这套机制并不新鲜,在付费墙设计上早有充分论证。
但你在自己的量级上能不能测得出来,是另一个问题——而这正是判断测试是否值得跑的关键。
仅仅调换套餐顺序,本身就能带来变化吗?
它把引导流程付费墙的转化从 3.14% 提升到了 3.77%,每组样本约 7,800 人。两个变体的套餐、价格和文案完全一致。

对照组把 Yearly Business 放在最上面,“最受欢迎”角标挂在中间位置的 $59.99 年订阅上。B 则把年订阅连同角标一起挪到顶部,Business 放到它下面。屏幕上其他任何元素都没动。
这是整套测试里成本最低的一个,而且低出一大截:没有定价模型要建,没有设计要做;就算输了,你也只是在全应用流量最大的那个位置上损失一周。大多数团队上来就重做整个付费墙,却从来没测过上面那几项的先后顺序。
接下来,同一个团队把一个刚在某块屏幕上赢下来的机制换了个位置,结果颗粒无收。
为什么一个赢过的机制,换个位置就失效了?
因为赢的是位置,不是机制。
Glam AI 把刚刚拉高年订阅转化的诱饵结构搬到了内页付费墙,也就是用户进入应用之后才会碰到的那些。效果:零。这套三档套餐布局,对第一次看到价格的人有用,对已经看过一遍价格的人就毫无作用。这恰恰说明了诱饵到底在做什么:它给你一个参照点。如果你手上已经有参照点了,它就没什么可给你的了。
第二个案例是社会认同视频。它在自己那场测试里赢了,于是团队把它放进了第 4 节提到的新版套餐选择页。结果是 2.54% 对 2.43%——这就是噪声。同一个素材,同一批用户,只是外面包着的屏幕换了,效果就没了。
这两件事都不是在反对复用有效的东西,而是在反对省掉复测这一步——后者是个便宜得多的问题。一个被验证过的机制,进入新的位置、新的用户分群或新的渠道,就是一场全新的实验,必须配自己的对照组。Glam AI 7 月的数据给出的基准胜率大约是十场赢四场。个性化方案也遭遇同样困境:对于原本就能实现转化的付费墙,它只会放大其效果;而对无法实现转化的付费墙,则毫无作用。
针对高价机型用户进行提价,是否可行?
Glam AI 试过,结果是转化掉了,收入没涨。这个假设每个增长团队都动过:手里拿着 $800 以上 iPhone 的人,应该扛得住更高的价格,那就给这群人涨价、把利润留下来。他们把年订阅上调 30%,从 $59.99 提到 $79.99,周订阅从 $8.99 提到 $11.99,每组样本约 8,100 人。

转化从 2.55% 跌到 2.09%。ARPU 持平——每个付费用户多贡献的收入,刚好抵掉了流失掉的那批付费用户,仅此而已。
更奇怪的还在后面。他们把年订阅价格改回去、只保留贵的周订阅,结果周订阅疲软,年订阅纹丝不动。于是他们上了一个首购优惠:年订阅 $59 对标常价 $79——这种玩法通常是稳赚的。2,500 个用户里,一单年订阅都没有。团队去排查埋点 bug,什么也没查到。
同一轮还有两个结果指向同一个方向。Business 从 $119.99 降到 $99,什么都没发生——降了 $21,没人察觉。而 Business 上的五折券,直接把该位置的单用户收入砍到了原来的五分之一。
降价可以毫无存在感,折扣也可以贵得吓人,区别只在于用户怎么解读它。任何大到足以被注意到的折扣,同时也在告诉用户:原价是编出来的。到那一步,两个数字对他来说都不再真实。
设备价格说明的是一个人付得起多少,而不是他愿意付多少。若要基于付费意愿进行用户分群,请优先利用用户在应用内已留下的行为数据:引导流程里他们给出的答案,或者他们进入应用之后的真实行为。
把一条在 Web 上跑得通的漏斗搬进应用,会发生什么?
Glam AI 最好的一条 Web 漏斗,在应用内连输四次。当初想试的逻辑没有问题:问卷前置的流程在 Web 上转化很好,而应用端流量更大,那就把这套有效的东西搬过来收钱。

购买转化没动。引导流程完成率却大幅下滑,而且掉得最狠的正是第一屏——这就是破绽所在。一个三十秒前刚点了应用广告的用户,落地就撞上一份问卷,他还什么都没答应呢。而在 Web 上,同一个用户已经读过落地页、主动点了进来,本来就预期会被问问题。同一条漏斗,撞上它的人却处在完全不同的心理状态。
于是他们在问卷前加了一个欢迎页。完成率回来了,购买转化反倒掉了。两个月,四轮迭代,挑战者一次都没赢过对照组。
这就是第 5 节那个问题的放大版:机制被验证过,理论上受众群体看起来并无差别,而周边环境所起到的作用远超所有人的认知。绝大多数失效的网页跳转应用转化漏斗, 恰恰都是在这一衔接处出现问题:一套为某类流量热度设计的业务流程,遇上了另一类流量。
值得庆幸的是,两个月的失败只花掉了 Glam AI 一个人两个月的精力,没有损失任何收入——因为他们一版都没上线。这跟在生产环境里才发现问题,完全是两种结局。
14 场都要输,一个月还怎么跑 23 场测试?
你得不再把失败当成“测试失败”,而是开始给它标价。23 场赢 9 场,这就是 Glam AI 的 7 月;在 Artem 看来,十场输六场是正常基准线,而不是哪里出了问题的信号。所以真正有用的问题是:怎么让每一次失败都足够便宜,让 39% 的命中率依然能滚起复利。
每场测试上线前,都要先回答五个问题:
- 这件事为什么应该有效?
- 哪一个指标做最终决策?
- 护栏指标是什么:流失、退款、评分、客服工单?
- 效果要能被看见,最小样本量和覆盖度是多少?
- 如果输了怎么办,下一轮迭代是什么?
大多数团队会跳过最后一个,而正是它把那条 Web 漏斗的故事变成了四轮迭代,而不是一个半途而废的实验。一场没有预设下一步的测试,等数据出来之后,你会为它吵上一整周。
如果每个变体都要发一次版,一个月 23 场根本跑不起来。Adapty 的 Flow & Paywall Builder 拆掉的正是这个约束:引导流程和付费墙作为一整条流程搭建,直接从后台发布;测试可以跑通整段用户旅程,而不只是单独一块屏幕;再配上一份逐屏的漏斗数据,让你看清用户到底在哪一步走掉。那场 Web 漏斗测试之所以能定位到第一屏,前提就是漏斗按屏逐一上报。
该从哪里入手?
Glam AI 的 7 月,看上去输得很惨:14 场测试无疾而终,一条 Web 漏斗两个月里输了四次,一场价格实验在 2,500 个用户里一单未成。它之所以依然成立,是因为这些东西一个都没进生产环境,也因为每一场测试最终都收敛到同一个指标上。
如果你的测试节奏被发版周期卡住了,那这就是最该先修的地方。 Flow & Paywall Builder 让你把引导流程和付费墙作为一整条流程来搭建,不发版就能改,并且逐屏读取漏斗数据。 预约 demo 演示,我们可以帮你一起复盘。
观看 Artem 的完整直播,里面有每一场测试的付费墙截图和背后的数据。



