---
title: "一个月 23 次付费墙测试，来自内部的真实复盘"
description: "Glam AI 一个月跑了 23 场付费墙测试，最终只上线 9 场。拉高年订阅转化的那个诱饵套餐，以及换一块屏幕就失效的那个赢家。"
url: "https://adapty.io/zh/blog/glam-ai-paywall-tests/"
language: "zh"
slug: "glam-ai-paywall-tests"
category: "grow-your-app"
date: "2026-09-03T08:47:04.424Z"
date_modified: "2026-09-07T09:29:05.853Z"
author: "Victoria Kharlan"
---

# 一个月 23 次付费墙测试，来自内部的真实复盘

## TL;DR

- *Glam AI 的每一场测试，最终决策都仅依据单用户净收入（net revenue per user）或 LTV。 转化率只是诊断工具。有个变体把购买转化拉高了四分之一，照样被砍掉——因为单用户收入还不如对照组。*
- *一次胜利只属于它赢下来的那个位置和那群用户。在主付费墙上将年订阅转化率从 0.43% 提升至 0.55% 的诱饵套餐，应用在内页付费墙时却毫无作用。*
- *backlog 按“离钱的距离”排序：付费墙和定价第一，购买前链路第二，激活和留存最后。*

以前抄一版付费墙，要搭上一整个工程迭代周期；现在一个下午就够了——你能做到，跟你抢生意的所有人同样能做到。所以“上线快”已经不再是拉开差距的东西。真正拉开差距的，是你能说清上个月上线的二十件事里，究竟哪一件真的赚到了钱。

这件事比听上去难得多。买量成本一个季度比一个季度高，LTV/CAC 每到夏天都会趋于平稳，而且即使某种策略能够提升转化率，也可能导致收入下降。

Artem Altynov 是 Glam AI 的增长产品负责人。Glam AI是一款 AI 修图应用，iOS 与 Android 双端合计 $50M ARR，月活 4M。他的团队 7 月跑完 23 次测试，9 次胜出。他在[**我们关于 Glam AI 实验体系的直播中**](https://www.youtube.com/watch?v=0Xo1jDWuO0E) **拆解了其中四场：两胜两败——而其中一场被砍掉的测试，购买转化足足涨了四分之一。**

## 为什么 Glam AI 砍掉了一个拉高购买转化的测试？

因为单用户收入掉了。团队测的是主付费墙的头图内容——静态图对比视频，两侧的套餐结构和 $59.99 年订阅完全一致。

变体 B 把“浏览→付费”从 1% 拉到 1.25%，每组样本约 8,300 人。样本量足够大，结果也足够干净。团队还是把它扔了。

![Two Glam AI paywall variants with identical pricing, where the higher-converting version lost on net revenue per user.](https://adapty.io/uploads/glam-ai-paywall-test-one.png)
*变体 B 把“浏览→付费”从 1% 提升到 1.25%，Glam AI 最终仍然上线了变体 A*

B 的视频头图起到了更好的吸引作用。但它同时把用户推向了 $8.99 的周订阅而不是年订阅，于是年订阅量下滑，退款率上升。全量流量下，单用户净收入低于 A；只切美国流量再算一遍，依然低于 A。最终他们保留了对照组。

Glam AI 把指标分成两类。转化率、单用户净收入和 LTV 是决定指标、；流失、退款、评分和客服工单是护栏指标。一个变体哪怕转化率赢了，只要有护栏指标下滑，就不能上线——涨幅再好看也不行。这套原则，我聊过的每个增长团队都认同。可现实是：转化率第三天就出结果，单用户收入却要再等两周、再等一个退款窗口才有意义，而变体早在有人复核之前就已经全量上线了。这个时间差，[正是付费墙测试最容易踩坑的地方。](https://adapty.io/blog/paywall-ab-testing-mistakes/)

## 每块屏幕看起来都能测，到底该先测哪个？

Glam AI 给需求池排序的标准是“离钱的距离”：一个改动多直接地触达收入，以及在效果落到账上之前，还有多少环节必须先跑通。

![Three-tier test prioritization with monetization first, pre-purchase funnel second, activation and retention last.](https://adapty.io/uploads/distance-to-money.png)
*Glam AI 按“改动与收入之间隔了几步”给每个测试想法排序*

Glam AI 按“改动与收入之间隔了几步”给每一个测试想法排序。

第一层是变现：付费墙、Offer、定价、套餐结构。周一改个价，周五就能读出结果——因为改动和收入之间什么都不隔。

第二层是购买前链路：引导流程、付费墙入口，以及通往购买的整条动线。效果是真实存在的，只是要多穿过几个环节才落地，所以你需要更大的样本和更多的耐心。

第三层是激活和留存：核心体验、用户参与度以及更深层的产品机制。其中部分工作是产品路线图上价值最高的项目，但全都不适合做快速实验，因为留存带来的收益可能需要一个季度才能体现在营收数据上，而到那时，你已经在此基础上上线了四十项其他功能。

这个排序更多是排期决策，而不是价值判断。每月 23 次的测试量级要求实验必须在数天内产出结论，因此，高频走量的必然是第一层（变现层）。第三层依然要做，只是节奏不同，通常也换一拨人来做——这也正是为什么[引导流程测试一旦没人认领就容易停摆。](https://adapty.io/blog/mobile-app-onboarding-testing/)

## 加一个根本没人买的贵套餐，能带动其他套餐的销量吗？

在用户看到的第一个付费墙上，能。Glam AI 的对照组给两个选项：$59.99 的年订阅和 $8.99 的周订阅。变体 B 在最上面加了第三个——$119.99 的 Yearly Business，折算下来每周 $2.31，而常规年订阅每周只要 $1.15。

![A two-plan paywall against a three-plan version where an expensive option sits above the plan Glam AI wants users to buy.](https://adapty.io/uploads/glam-ai-paywall-test-two.png)
*在 $59.99 年订阅上方加入 $119.99 的 Yearly Business 后，年订阅转化从 0.43% 升至 0.55%*

没人指望 Business 真能卖出去，关键在于它对下面那个选项做了什么。年订阅转化从 0.43% 涨到 0.55%，每组样本约 24,500 人。周订阅保持不变，也就是说年订阅是净增，并没有吃掉周订阅；单用户净收入从 $0.261 提升到 $0.292。这一个实验胜出了。

值得停下来看看这个样本量。效果只有 12 个基点，而基准值本身还不到 0.5%，读出这个结论用掉了将近 50,000 名用户。很多团队拿 2,000 个用户跑同样的测试，看到一堆噪声，然后得出结论：诱饵定价没用。这套机制并不新鲜，在[付费墙设计上早有充分论证](https://adapty.io/blog/how-to-design-a-paywall-for-a-mobile-app/)。

但你在自己的量级上能不能测得出来，是另一个问题——而这正是判断测试是否值得跑的关键。

## 仅仅调换套餐顺序，本身就能带来变化吗？

它把引导流程付费墙的转化从 3.14% 提升到了 3.77%，每组样本约 7,800 人。两个变体的套餐、价格和文案完全一致。

![The same three plans at the same prices in two different orders, with the year first in the winning variant.](https://adapty.io/uploads/glam-ai-paywall-test-three.png)
*把 $59.99 年订阅移到列表顶部，引导流程付费墙转化从 3.14% 升至 3.77%*

对照组把 Yearly Business 放在最上面，“最受欢迎”角标挂在中间位置的 $59.99 年订阅上。B 则把年订阅连同角标一起挪到顶部，Business 放到它下面。屏幕上其他任何元素都没动。

这是整套测试里成本最低的一个，而且低出一大截：没有定价模型要建，没有设计要做；就算输了，你也只是在全应用流量最大的那个位置上损失一周。大多数团队上来就重做整个付费墙，却从来没测过上面那几项的先后顺序。

接下来，同一个团队把一个刚在某块屏幕上赢下来的机制换了个位置，结果颗粒无收。

## 为什么一个赢过的机制，换个位置就失效了？

因为赢的是位置，不是机制。

Glam AI 把刚刚拉高年订阅转化的诱饵结构搬到了内页付费墙，也就是用户进入应用之后才会碰到的那些。效果：零。这套三档套餐布局，对第一次看到价格的人有用，对已经看过一遍价格的人就毫无作用。这恰恰说明了诱饵到底在做什么：它给你一个参照点。如果你手上已经有参照点了，它就没什么可给你的了。

第二个案例是社会认同视频。它在自己那场测试里赢了，于是团队把它放进了第 4 节提到的新版套餐选择页。结果是 2.54% 对 2.43%——这就是噪声。同一个素材，同一批用户，只是外面包着的屏幕换了，效果就没了。

这两件事都不是在反对复用有效的东西，而是在反对省掉复测这一步——后者是个便宜得多的问题。一个被验证过的机制，进入新的位置、新的用户分群或新的渠道，就是一场全新的实验，必须配自己的对照组。Glam AI 7 月的数据给出的基准胜率大约是十场赢四场。[个性化方案也遭遇同样困境](https://adapty.io/blog/how-to-personalize-onboarding-and-paywalls-in-your-mobile-app/)：对于原本就能实现转化的付费墙，它只会放大其效果；而对无法实现转化的付费墙，则毫无作用。

## 针对高价机型用户进行提价，是否可行？

Glam AI 试过，结果是转化掉了，收入没涨。这个假设每个增长团队都动过：手里拿着 $800 以上 iPhone 的人，应该扛得住更高的价格，那就给这群人涨价、把利润留下来。他们把年订阅上调 30%，从 $59.99 提到 $79.99，周订阅从 $8.99 提到 $11.99，每组样本约 8,100 人。

![Standard Glam AI pricing against a variant charging $79.99 for the year and $11.99 for the week.](https://adapty.io/uploads/glam-ai-paywall-test-four.png)
*针对 $800 以上 iPhone 用户涨价 30%，转化从 2.55% 跌到 2.09%，而 ARPU 原地不动*

转化从 2.55% 跌到 2.09%。ARPU 持平——每个付费用户多贡献的收入，刚好抵掉了流失掉的那批付费用户，仅此而已。

更奇怪的还在后面。他们把年订阅价格改回去、只保留贵的周订阅，结果周订阅疲软，年订阅纹丝不动。于是他们上了一个首购优惠：年订阅 $59 对标常价 $79——这种玩法通常是稳赚的。2,500 个用户里，一单年订阅都没有。团队去排查埋点 bug，什么也没查到。

同一轮还有两个结果指向同一个方向。Business 从 $119.99 降到 $99，什么都没发生——降了 $21，没人察觉。而 Business 上的五折券，直接把该位置的单用户收入砍到了原来的五分之一。

降价可以毫无存在感，折扣也可以贵得吓人，区别只在于用户怎么解读它。任何大到足以被注意到的折扣，同时也在告诉用户：原价是编出来的。到那一步，两个数字对他来说都不再真实。

设备价格说明的是一个人付得起多少，而不是他愿意付多少。若要基于付费意愿进行用户分群，请优先利用用户在应用内已留下的行为数据：引导流程里他们给出的答案，或者他们进入应用之后的真实行为。

## 把一条在 Web 上跑得通的漏斗搬进应用，会发生什么？

Glam AI 最好的一条 Web 漏斗，在应用内连输四次。当初想试的逻辑没有问题：问卷前置的流程在 Web 上转化很好，而应用端流量更大，那就把这套有效的东西搬过来收钱。

![The quiz-first screen that converts on web lost onboarding completion when it opened the app.](https://adapty.io/uploads/web-paywalls-glam-ai.png)
*在 Web 上转化良好的问卷前置页面，搬进应用后拉低了引导流程完成率*

购买转化没动。引导流程完成率却大幅下滑，而且掉得最狠的正是第一屏——这就是破绽所在。一个三十秒前刚点了应用广告的用户，落地就撞上一份问卷，他还什么都没答应呢。而在 Web 上，同一个用户已经读过落地页、主动点了进来，本来就预期会被问问题。同一条漏斗，撞上它的人却处在完全不同的心理状态。

于是他们在问卷前加了一个欢迎页。完成率回来了，购买转化反倒掉了。两个月，四轮迭代，挑战者一次都没赢过对照组。

这就是第 5 节那个问题的放大版：机制被验证过，理论上受众群体看起来并无差别，而周边环境所起到的作用远超所有人的认知。[绝大多数失效的网页跳转应用转化漏斗](https://adapty.io/blog/why-your-web-to-app-funnel-is-broken-and-how-to-fix-it/), 恰恰都是在这一衔接处出现问题：一套为某类流量热度设计的业务流程，遇上了另一类流量。

值得庆幸的是，两个月的失败只花掉了 Glam AI 一个人两个月的精力，没有损失任何收入——因为他们一版都没上线。这跟在生产环境里才发现问题，完全是两种结局。

## 14 场都要输，一个月还怎么跑 23 场测试？

你得不再把失败当成“测试失败”，而是开始给它标价。23 场赢 9 场，这就是 Glam AI 的 7 月；在 Artem 看来，十场输六场是正常基准线，而不是哪里出了问题的信号。所以真正有用的问题是：怎么让每一次失败都足够便宜，让 39% 的命中率依然能滚起复利。

每场测试上线前，都要先回答五个问题：

- 这件事为什么应该有效？
- 哪一个指标做最终决策？
- 护栏指标是什么：流失、退款、评分、客服工单？
- 效果要能被看见，最小样本量和覆盖度是多少？
- 如果输了怎么办，下一轮迭代是什么？

大多数团队会跳过最后一个，而正是它把那条 Web 漏斗的故事变成了四轮迭代，而不是一个半途而废的实验。一场没有预设下一步的测试，等数据出来之后，你会为它吵上一整周。

如果每个变体都要发一次版，一个月 23 场根本跑不起来。Adapty 的 Flow & Paywall Builder 拆掉的正是这个约束：引导流程和付费墙作为一整条流程搭建，直接从后台发布；测试可以跑通整段用户旅程，而不只是单独一块屏幕；再配上一份逐屏的漏斗数据，让你看清用户到底在哪一步走掉。那场 Web 漏斗测试之所以能定位到第一屏，前提就是漏斗按屏逐一上报。

[Video: https://youtu.be/8Cby6lVGI0o](https://youtu.be/8Cby6lVGI0o)

## 该从哪里入手？

Glam AI 的 7 月，看上去输得很惨：14 场测试无疾而终，一条 Web 漏斗两个月里输了四次，一场价格实验在 2,500 个用户里一单未成。它之所以依然成立，是因为这些东西一个都没进生产环境，也因为每一场测试最终都收敛到同一个指标上。

如果你的测试节奏被发版周期卡住了，那这就是最该先修的地方。 [Flow & Paywall Builder](https://adapty.io/flow-paywall-builder/) 让你把引导流程和付费墙作为一整条流程来搭建，不发版就能改，并且逐屏读取漏斗数据。 [预约 demo 演示](https://app.notion.com/p/adapty/URL)，我们可以帮你一起复盘。

[**观看 Artem 的完整直播**](https://www.youtube.com/watch?v=0Xo1jDWuO0E)，里面有每一场测试的付费墙截图和背后的数据。

## FAQ

### 一场付费墙 A/B 测试，每组需要多少用户？

这取决于你的基准转化率，以及你预期的最小效果差异。Glam AI 要读出 0.43% 到 0.55% 的变化，每组用了大约 24,500 名用户；而一场把 3.14% 推到 3.77% 的测试，每组 7,800 人就够了。基准值越低、预期效果越小，所需样本量涨得越快，所以务必在上线前先算清楚。

### 付费墙测试该看转化率还是看收入？

用单用户净收入或 LTV 做决策，用转化率去解释收入为什么会动。Glam AI 砍掉过一个把购买转化拉高 25% 的变体，因为它把用户推向了周订阅，还带来了更多退款。转化率总是先出数据——这正是团队往往过早依赖它做决策的诱因。

### 一个赢下来的付费墙，能直接铺到其他位置吗？

把它当成一场全新的测试，配上自己的对照组。Glam AI 的诱饵套餐在第一个付费墙上拉高了年订阅转化，到内页付费墙上就没有任何可测量的效果。跨渠道、跨国家、跨用户分群搬运胜出组时，同理。

### 付费墙测试 40% 的胜率算正常吗？

正常。Glam AI 7 月跑完 23 场测试、赢下 9 场，并把十场输六场当作日常基准。一个团队如果报出高得多的胜率，通常意味着两件事：要么测试跑得更少、更保守，要么在护栏指标还没跟上时就急着宣布结果。

### 对使用高价设备的用户涨价，管用吗？

对 Glam AI 不管用。针对 $800 以上 iPhone 用户涨价 30%，转化从 2.55% 跌到 2.09%，ARPU 持平。设备价格反映了某人的支付能力，但这并不能很好地代表他们实际愿意支付的金额。
