一个月 23 次付费墙测试,来自内部的真实复盘

Victoria Kharlan
Victoria Kharlan
2分钟阅读
一个月 23 次付费墙测试,来自内部的真实复盘

TL;DR:

  • Glam AI 的每一场测试,最终决策都仅依据单用户净收入(net revenue per user)或 LTV。 转化率只是诊断工具。有个变体把购买转化拉高了四分之一,照样被砍掉——因为单用户收入还不如对照组。
  • 一次胜利只属于它赢下来的那个位置和那群用户。在主付费墙上将年订阅转化率从 0.43% 提升至 0.55% 的诱饵套餐,应用在内页付费墙时却毫无作用。
  • backlog 按“离钱的距离”排序:付费墙和定价第一,购买前链路第二,激活和留存最后。

以前抄一版付费墙,要搭上一整个工程迭代周期;现在一个下午就够了——你能做到,跟你抢生意的所有人同样能做到。所以“上线快”已经不再是拉开差距的东西。真正拉开差距的,是你能说清上个月上线的二十件事里,究竟哪一件真的赚到了钱。

这件事比听上去难得多。买量成本一个季度比一个季度高,LTV/CAC 每到夏天都会趋于平稳,而且即使某种策略能够提升转化率,也可能导致收入下降。

Artem Altynov 是 Glam AI 的增长产品负责人。Glam AI是一款 AI 修图应用,iOS 与 Android 双端合计 $50M ARR,月活 4M。他的团队 7 月跑完 23 次测试,9 次胜出。他在我们关于 Glam AI 实验体系的直播中 拆解了其中四场:两胜两败——而其中一场被砍掉的测试,购买转化足足涨了四分之一。

为什么 Glam AI 砍掉了一个拉高购买转化的测试?

因为单用户收入掉了。团队测的是主付费墙的头图内容——静态图对比视频,两侧的套餐结构和 $59.99 年订阅完全一致。

变体 B 把“浏览→付费”从 1% 拉到 1.25%,每组样本约 8,300 人。样本量足够大,结果也足够干净。团队还是把它扔了。

Two Glam AI paywall variants with identical pricing, where the higher-converting version lost on net revenue per user.变体 B 把“浏览→付费”从 1% 提升到 1.25%,Glam AI 最终仍然上线了变体 A

B 的视频头图起到了更好的吸引作用。但它同时把用户推向了 $8.99 的周订阅而不是年订阅,于是年订阅量下滑,退款率上升。全量流量下,单用户净收入低于 A;只切美国流量再算一遍,依然低于 A。最终他们保留了对照组。

Glam AI 把指标分成两类。转化率、单用户净收入和 LTV 是决定指标、;流失、退款、评分和客服工单是护栏指标。一个变体哪怕转化率赢了,只要有护栏指标下滑,就不能上线——涨幅再好看也不行。这套原则,我聊过的每个增长团队都认同。可现实是:转化率第三天就出结果,单用户收入却要再等两周、再等一个退款窗口才有意义,而变体早在有人复核之前就已经全量上线了。这个时间差,正是付费墙测试最容易踩坑的地方。

每块屏幕看起来都能测,到底该先测哪个?

Glam AI 给需求池排序的标准是“离钱的距离”:一个改动多直接地触达收入,以及在效果落到账上之前,还有多少环节必须先跑通。

Three-tier test prioritization with monetization first, pre-purchase funnel second, activation and retention last.Glam AI 按“改动与收入之间隔了几步”给每个测试想法排序

Glam AI 按“改动与收入之间隔了几步”给每一个测试想法排序。

第一层是变现:付费墙、Offer、定价、套餐结构。周一改个价,周五就能读出结果——因为改动和收入之间什么都不隔。

第二层是购买前链路:引导流程、付费墙入口,以及通往购买的整条动线。效果是真实存在的,只是要多穿过几个环节才落地,所以你需要更大的样本和更多的耐心。

第三层是激活和留存:核心体验、用户参与度以及更深层的产品机制。其中部分工作是产品路线图上价值最高的项目,但全都不适合做快速实验,因为留存带来的收益可能需要一个季度才能体现在营收数据上,而到那时,你已经在此基础上上线了四十项其他功能。

这个排序更多是排期决策,而不是价值判断。每月 23 次的测试量级要求实验必须在数天内产出结论,因此,高频走量的必然是第一层(变现层)。第三层依然要做,只是节奏不同,通常也换一拨人来做——这也正是为什么引导流程测试一旦没人认领就容易停摆。

加一个根本没人买的贵套餐,能带动其他套餐的销量吗?

在用户看到的第一个付费墙上,能。Glam AI 的对照组给两个选项:$59.99 的年订阅和 $8.99 的周订阅。变体 B 在最上面加了第三个——$119.99 的 Yearly Business,折算下来每周 $2.31,而常规年订阅每周只要 $1.15。

A two-plan paywall against a three-plan version where an expensive option sits above the plan Glam AI wants users to buy.在 $59.99 年订阅上方加入 $119.99 的 Yearly Business 后,年订阅转化从 0.43% 升至 0.55%

没人指望 Business 真能卖出去,关键在于它对下面那个选项做了什么。年订阅转化从 0.43% 涨到 0.55%,每组样本约 24,500 人。周订阅保持不变,也就是说年订阅是净增,并没有吃掉周订阅;单用户净收入从 $0.261 提升到 $0.292。这一个实验胜出了。

值得停下来看看这个样本量。效果只有 12 个基点,而基准值本身还不到 0.5%,读出这个结论用掉了将近 50,000 名用户。很多团队拿 2,000 个用户跑同样的测试,看到一堆噪声,然后得出结论:诱饵定价没用。这套机制并不新鲜,在付费墙设计上早有充分论证

但你在自己的量级上能不能测得出来,是另一个问题——而这正是判断测试是否值得跑的关键。

仅仅调换套餐顺序,本身就能带来变化吗?

它把引导流程付费墙的转化从 3.14% 提升到了 3.77%,每组样本约 7,800 人。两个变体的套餐、价格和文案完全一致。

The same three plans at the same prices in two different orders, with the year first in the winning variant.把 $59.99 年订阅移到列表顶部,引导流程付费墙转化从 3.14% 升至 3.77%

对照组把 Yearly Business 放在最上面,“最受欢迎”角标挂在中间位置的 $59.99 年订阅上。B 则把年订阅连同角标一起挪到顶部,Business 放到它下面。屏幕上其他任何元素都没动。

这是整套测试里成本最低的一个,而且低出一大截:没有定价模型要建,没有设计要做;就算输了,你也只是在全应用流量最大的那个位置上损失一周。大多数团队上来就重做整个付费墙,却从来没测过上面那几项的先后顺序。

接下来,同一个团队把一个刚在某块屏幕上赢下来的机制换了个位置,结果颗粒无收。

为什么一个赢过的机制,换个位置就失效了?

因为赢的是位置,不是机制。

Glam AI 把刚刚拉高年订阅转化的诱饵结构搬到了内页付费墙,也就是用户进入应用之后才会碰到的那些。效果:零。这套三档套餐布局,对第一次看到价格的人有用,对已经看过一遍价格的人就毫无作用。这恰恰说明了诱饵到底在做什么:它给你一个参照点。如果你手上已经有参照点了,它就没什么可给你的了。

第二个案例是社会认同视频。它在自己那场测试里赢了,于是团队把它放进了第 4 节提到的新版套餐选择页。结果是 2.54% 对 2.43%——这就是噪声。同一个素材,同一批用户,只是外面包着的屏幕换了,效果就没了。

这两件事都不是在反对复用有效的东西,而是在反对省掉复测这一步——后者是个便宜得多的问题。一个被验证过的机制,进入新的位置、新的用户分群或新的渠道,就是一场全新的实验,必须配自己的对照组。Glam AI 7 月的数据给出的基准胜率大约是十场赢四场。个性化方案也遭遇同样困境:对于原本就能实现转化的付费墙,它只会放大其效果;而对无法实现转化的付费墙,则毫无作用。

针对高价机型用户进行提价,是否可行?

Glam AI 试过,结果是转化掉了,收入没涨。这个假设每个增长团队都动过:手里拿着 $800 以上 iPhone 的人,应该扛得住更高的价格,那就给这群人涨价、把利润留下来。他们把年订阅上调 30%,从 $59.99 提到 $79.99,周订阅从 $8.99 提到 $11.99,每组样本约 8,100 人。

Standard Glam AI pricing against a variant charging $79.99 for the year and $11.99 for the week.针对 $800 以上 iPhone 用户涨价 30%,转化从 2.55% 跌到 2.09%,而 ARPU 原地不动

转化从 2.55% 跌到 2.09%。ARPU 持平——每个付费用户多贡献的收入,刚好抵掉了流失掉的那批付费用户,仅此而已。

更奇怪的还在后面。他们把年订阅价格改回去、只保留贵的周订阅,结果周订阅疲软,年订阅纹丝不动。于是他们上了一个首购优惠:年订阅 $59 对标常价 $79——这种玩法通常是稳赚的。2,500 个用户里,一单年订阅都没有。团队去排查埋点 bug,什么也没查到。

同一轮还有两个结果指向同一个方向。Business 从 $119.99 降到 $99,什么都没发生——降了 $21,没人察觉。而 Business 上的五折券,直接把该位置的单用户收入砍到了原来的五分之一。

降价可以毫无存在感,折扣也可以贵得吓人,区别只在于用户怎么解读它。任何大到足以被注意到的折扣,同时也在告诉用户:原价是编出来的。到那一步,两个数字对他来说都不再真实。

设备价格说明的是一个人付得起多少,而不是他愿意付多少。若要基于付费意愿进行用户分群,请优先利用用户在应用内已留下的行为数据:引导流程里他们给出的答案,或者他们进入应用之后的真实行为。

把一条在 Web 上跑得通的漏斗搬进应用,会发生什么?

Glam AI 最好的一条 Web 漏斗,在应用内连输四次。当初想试的逻辑没有问题:问卷前置的流程在 Web 上转化很好,而应用端流量更大,那就把这套有效的东西搬过来收钱。

The quiz-first screen that converts on web lost onboarding completion when it opened the app.在 Web 上转化良好的问卷前置页面,搬进应用后拉低了引导流程完成率

购买转化没动。引导流程完成率却大幅下滑,而且掉得最狠的正是第一屏——这就是破绽所在。一个三十秒前刚点了应用广告的用户,落地就撞上一份问卷,他还什么都没答应呢。而在 Web 上,同一个用户已经读过落地页、主动点了进来,本来就预期会被问问题。同一条漏斗,撞上它的人却处在完全不同的心理状态。

于是他们在问卷前加了一个欢迎页。完成率回来了,购买转化反倒掉了。两个月,四轮迭代,挑战者一次都没赢过对照组。

这就是第 5 节那个问题的放大版:机制被验证过,理论上受众群体看起来并无差别,而周边环境所起到的作用远超所有人的认知。绝大多数失效的网页跳转应用转化漏斗, 恰恰都是在这一衔接处出现问题:一套为某类流量热度设计的业务流程,遇上了另一类流量。

值得庆幸的是,两个月的失败只花掉了 Glam AI 一个人两个月的精力,没有损失任何收入——因为他们一版都没上线。这跟在生产环境里才发现问题,完全是两种结局。

14 场都要输,一个月还怎么跑 23 场测试?

你得不再把失败当成“测试失败”,而是开始给它标价。23 场赢 9 场,这就是 Glam AI 的 7 月;在 Artem 看来,十场输六场是正常基准线,而不是哪里出了问题的信号。所以真正有用的问题是:怎么让每一次失败都足够便宜,让 39% 的命中率依然能滚起复利。

每场测试上线前,都要先回答五个问题:

  • 这件事为什么应该有效?
  • 哪一个指标做最终决策?
  • 护栏指标是什么:流失、退款、评分、客服工单?
  • 效果要能被看见,最小样本量和覆盖度是多少?
  • 如果输了怎么办,下一轮迭代是什么?

大多数团队会跳过最后一个,而正是它把那条 Web 漏斗的故事变成了四轮迭代,而不是一个半途而废的实验。一场没有预设下一步的测试,等数据出来之后,你会为它吵上一整周。

如果每个变体都要发一次版,一个月 23 场根本跑不起来。Adapty 的 Flow & Paywall Builder 拆掉的正是这个约束:引导流程和付费墙作为一整条流程搭建,直接从后台发布;测试可以跑通整段用户旅程,而不只是单独一块屏幕;再配上一份逐屏的漏斗数据,让你看清用户到底在哪一步走掉。那场 Web 漏斗测试之所以能定位到第一屏,前提就是漏斗按屏逐一上报。

该从哪里入手?

Glam AI 的 7 月,看上去输得很惨:14 场测试无疾而终,一条 Web 漏斗两个月里输了四次,一场价格实验在 2,500 个用户里一单未成。它之所以依然成立,是因为这些东西一个都没进生产环境,也因为每一场测试最终都收敛到同一个指标上。

如果你的测试节奏被发版周期卡住了,那这就是最该先修的地方。 Flow & Paywall Builder 让你把引导流程和付费墙作为一整条流程来搭建,不发版就能改,并且逐屏读取漏斗数据。 预约 demo 演示,我们可以帮你一起复盘。

观看 Artem 的完整直播,里面有每一场测试的付费墙截图和背后的数据。

FAQ

相关文章

了解 Adapty 如何提升您的应用收入