北极星指标不是“全公司只看一个数字”,而是用一个最接近用户已获得价值的结果,约束系统不要把下载、点击、会话量当增长。真正可执行的是“北极星结果 + 3–5 个输入指标 + 护栏 + 因果证据”。对 Momcozy APP,比 DAU(日活跃用户数)更值得先验证的,可能是“合格用户在合理周期内安全、稳定地完成关键任务”;但这个口径不能靠讨论拍定,必须先证明它与后续价值有关。
团队为什么需要 North Star Metric(北极星指标)?因为每个部门都能找到让自己显得成功的数字:市场看下载,产品看功能点击,客服看结案量,商业看收入。如果这些数字没有共同指向“用户究竟获得了什么价值”,系统越会优化,局部数字越可能漂亮,整体体验却没有变好。
大白话定义:北极星指标是一个最能代表用户已经从产品获得核心价值、又能较早预示长期业务结果的指标。生活类比是健身:体重不是唯一目标,步数也不是最终价值。若真正目标是“恢复稳定活动能力”,每周完成经评估的训练可能是结果指标;训练频率、动作完成率和恢复时间是可影响的输入;受伤与疼痛则是护栏。
所以北极星不能独自工作。Input Metric(输入指标)是团队可以直接改善、并相信会推动北极星的 3–5 个因素;例如合格用户覆盖、首次价值耗时、任务成功率、下一次真实需求中的复用。它们是因果假设,不是数学真理。某输入上升而北极星不动,就说明“这条增长机制”可能错了,或作用只对某些 cohort(同类用户群)成立。
Momcozy 的待验证例子:若把 APP DAU 当北极星,系统会天然鼓励更多打开和触达;但设备任务完成后不必每天打开,阶段自然结束也不等于流失。更接近价值的候选表达是:“在合理周期内,完成至少一次经验证的关键设备、指导或协作任务的合格用户数。”这里每个词都要被定义:谁算合格、什么叫完成、不同任务的合理周期是什么、怎样确认安全与稳定。
Amplitude:北极星应该离团队“隔一层”,由输入推动
若一个数字可以被直接做大,它往往更像活动量;真正的北极星应由多个可行动输入共同推动,让团队追问“为什么价值结果变化”。
Amplitude 在 2026 年 7 月更新的指南中,把好北极星归纳为三点:代表用户价值、处于产品与增长可影响范围、领先于收入;并建议搭配 3–5 个互补输入。文章披露 Amplitude 自己至少改过三次北极星,目前的一手例子是“一周内至少有一个问题被平台回答的活跃用户”,刻意区别于登录数。它还提醒,常被引用的 Airbnb、Spotify 等北极星多是行业流传的说明性例子,并非各公司在该文中的官方确认。
Snowplow:把北极星接入实时动作,闭环可能更快,也可能更快跑偏
从事后看板走向实时反馈回路是 AI-native 的必要条件,但若价值定义和因果证据错误,实时个性化只会加速错误干预。
Snowplow 公开的方法把链路写成 Collect → Understand → Orchestrate → Measure(采集 → 理解 → 编排 → 衡量):统一采集事件,计算实时状态,在产品内触发引导或推荐,再把结果回写。它也指出常见断点包括洞察延迟、分析和触达使用不同数据口径、实验反馈周期过长。文章给出留存、功能采用、内容参与和收入等不同北极星类型,并主张依据业务模式选择,而不是统一采用 DAU。
先认识这次新增的机制
Elena Verna 是 Lovable 的增长负责人。此前我们已拆过激活进入核心产品、产品改善式召回、使用留存和口碑循环;今天只新增一层:怎样区分 output(结果)与 input(输入),又不让指标树把团队锁进局部优化。 这对刚开始搭增长系统很重要,因为 Agent 最擅长优化可量化的旋钮,也最容易忽略“整个解法需要重做”。
核心机制:收入是结果,使用价值是更靠前的输入
访谈 12:22–15:02,Elena 把留存拆成付费留存和使用留存,称 Lovable 当时更优先扩大真实使用,再调变现;她明确说收入是团队推动更多人使用产品后的 output,而不是直接追逐的旋钮。这里不是“收入不重要”,而是说:收入出现得晚,且会被价格、套餐和市场热度影响;持续获得核心价值更早暴露产品是否健康。
过去常见做法是收入慢了就加付费墙、促销或召回。输入视角会先问:目标人群有没有到达首次价值?生成结果是否够好?下一次需求是否仍会回来?只有这些机制成立,收入才更可能是可持续结果。
最容易误解:输入指标也会把人困在旧解法里
Elena 随后给出一个看似矛盾、其实很关键的数字:在以往岗位,她可能只花 5%–10% 做增长创新;在 Lovable,她称约 95% 在创新、5% 在优化。原因是高速变化的新类别里,微调已有漏斗不一定值得,增长团队会直接做 Shopify 集成、语音模式或新的 Agent 工作流。
因此,北极星树不能退化为“把每个输入提高 2%”。它还要允许一种判断:当前输入不再解释北极星,问题不是按钮摩擦,而是用户需要新的能力或更可靠的核心体验。AI 可以发现偏离,却不能仅凭 Lovable 的 95/5 比例替我们决定 Momcozy 的资源组合。
我们能借什么、不能照抄什么
能借的是两层纪律:先把收入、DAU 等结果拆成更靠近用户价值的输入;再定期检查这些输入是否仍代表正确解法。不能照抄 Lovable 的“尽量多使用”或高频发布。母婴设备 APP 的使用由真实任务和阶段驱动,稳定完成后少打开可能是成功;硬件可靠性、隐私和安全也使大范围快速试错代价更高。
以“北极星证据 Agent”为例:
系统读取什么:经授权、口径统一的关键任务资格、真实曝光、首次稳定成功、问题解决、合理周期复用、客服与脱敏 VOC、人工接管、实验分组、成本和长期结果;同时读取埋点版本、缺失率和数据权限。母婴、儿童、健康与设备数据必须最小化,不为提高预测分数默认拼接身份和阶段。
形成什么判断:先判断候选北极星是否代表价值、是否可测、是否领先于长期结果;再检查 3–5 个输入与北极星的关系是稳定、只在某 cohort 成立、已经衰减,还是纯相关。系统必须区分“输入与结果同行”和“实验已经证明输入有增量作用”。
能做什么:维护指标树与定义版本;发现“点击上升、任务价值不动”时提出反证;结合 VOC 生成修能力、补测量、低风险实验或不动作候选;在影子模式比较不同决策。未经明确授权,不向真实用户发送 Push、EDM、站内信,不修改生产策略。
如何看结果并更新策略:实验若提高输入且北极星与护栏同步改善,就提高该机制置信度;若输入上涨但稳定任务、信任或长期价值不动,就降低它在指标树中的权重;若新价值场景出现,由人批准后再改北极星定义,不能让 Agent 为了“更容易赢”自行换指标。
何时交给人:目标冲突、北极星定义变更、高风险健康或儿童语境、设备安全、隐私投诉、小样本、因果证据不足、阶段自然结束,以及所有真实触达与上线都交给人。自动生成指标看板只是 AI-assisted Operations(AI 辅助运营);持续感知指标失配、提出验证、在受限范围学习并更新策略,才接近 AI-native Growth System(AI 原生增长系统)。
场景一:设备绑定与首次稳定使用。 待验证北极星候选不是“绑定按钮完成”,而是“合格设备用户在限定时间内完成首次稳定连接”。输入可包括开始绑定覆盖、权限步骤通过、可诊断错误比例、首次成功耗时;护栏包括重复失败、客服、崩溃和负面 VOC。不能为了提高完成率引导无效重试,也不能把已知可靠性修复留给普通增长实验。最先需要的证据是:绑定完成是否真的能与稳定连接及后续可用串起来。
场景二:AI 助手与 BBM/VOC。 待验证价值结果可以是“合格低风险任务被安全解决或正确转人工”,不是会话数、轮数或自动结案率。输入可以是正确知识检索、工具调用成功、首次回答可执行、适时人工接管;护栏是危险回答漏检、重复求助、隐私和信任。不能把所有咨询混成一个指标,更不能用减少转人工证明增长。最先要用人工校准小样本定义“已解决 / 未解决 / 正确接管 / 无法判断”。
场景三:阶段变化。 待验证假设是,同一北极星的合理周期会随任务变化:设备核心使用、一次性故障帮助、内容或照护协作不能统一按日活衡量。可以借“价值结果 + 输入”的结构,不能照抄高频 SaaS 的使用强度。用户阶段自然结束时,成功退出应被保留为一种好结果;涉及阶段识别必须基于授权与可解释信号,证据不足时不动作。
- North Star Metric|北极星指标:最能代表用户获得核心价值、又较早预示长期结果的一个指标。Momcozy 例子不是 APP 打开数,而是待验证的关键任务稳定完成。
- Input Metric|输入指标:团队可直接改善、并假设会推动北极星的因素。Momcozy 例子是首次价值耗时或正确错误诊断率,不是终局价值本身。
- Leading Indicator|领先指标:比收入、续费等最终结果更早出现的信号。Momcozy 例子是首次稳定使用,但必须验证它是否真的预示后续价值。
- Vanity Metric|虚荣指标:容易上涨、容易展示,却不能说明用户得到了价值的数字。Momcozy 例子是只看 AI 会话量,不看任务是否解决。
- Metric Tree|指标树:把一个价值结果拆成少数可行动输入与护栏。Momcozy 例子是“稳定任务完成”向下连接资格、耗时、成功率与信任边界。
- 先补完一句话:“Momcozy APP 帮助哪类用户,在什么情境下,完成什么关键价值?”
- 把它改写成一个可计数的候选北极星,明确分母、成功事件和合理周期;
- 写 3 个可行动输入、2 个不能被伤害的护栏;
- 写一个最可能让该指标虚高的反例,以及一条能验证它与后续价值关系的数据或实验。
产出物是一页“价值陈述—候选北极星—输入—护栏—反例”卡。完成后能更新的判断是:我们正在定义用户真正获得的价值,还是只挑了一个最容易被系统做大的数字?最后只回答一个具体问题:如果只能从“设备首次稳定使用”与“AI 助手安全解决一次真实任务”中选一个先做指标树,哪一个当前更接近 Momcozy APP 最急迫、也最可验证的价值问题?