Skip to content

AMC MTA 能力评价

最终评价

当前项目适合定义为:

工程完整、契约严格、可复现的 AMC MTA 归因与双模型诊断 Demo。

它已经超过“算法草稿”:输入、路径、成本、模型、比较、治理输出和测试形成了闭环。 但它仍不是生产级归因系统,更不是因果增量或自动预算系统。最大的短板已不在“代码 能不能跑”,而在真实 AMC 数据证据、稳定性、方法校准和生产运行边界。

分层成熟度

维度等级证据
工程可靠性较高流程可复现、校验严格,107项测试覆盖来源追溯、隐私、守恒、可靠性与回滚
归因方法中等双模型互补且语义清楚,但仍需手算基准和真实数据校准
数据证据只有确定性模拟样例,没有真实 AMC 查询与跨窗口证据
业务决策很低当前只输出模型诊断与可靠性,不提供决策值或自动化字段
Demo 完成度较高适合演示、教学、接口讨论和真实数据接入准备
生产就绪度缺少生产数据、稳定性、CI、监控与因果验证

等级依据当前代码、测试、输入和输出证据,不是统计评级,也不适用于未来数据版本。

已具备的 MTA 能力

1. AMC 路径输入能力

  • 使用严格五段键区分广告产品、形式、位置、创意和曝光/点击。
  • 明确区分购买用户、购买次数和收入。
  • 支持 14 天连续间隔、起点截断和同 journey 多购买切段。
  • 只接受单一账户、市场、币种与窗口,并要求 Ads 逐日完整覆盖。
  • 不从汇总曝光/点击数据伪造用户路径。

2. 双模型归因能力

  • Markov 使用顺序、重复触点和 removal effect。
  • Path-level Shapley 提供不依赖顺序的路径参与参照。
  • 三个 outcome 分别归因并守恒。
  • 曝光和点击保持为独立五段主结果。
  • 两模型不平均,避免把不同假设伪装成共识。

3. 成本与效率能力

  • Amazon Ads 成本按完整五段键关联。
  • CPC 只归点击,CPM 只归曝光,成本不复制。
  • 输出 ROAS、ROI、订单 CPA 和每购买用户成本。
  • 平台报告购买/销售与 AMC 归因 outcome 保持口径隔离。

4. 模型诊断与可靠性能力

  • 逐触点、逐 outcome 比较 Markov/Shapley share、绝对百分点差和相对差。
  • 在摘要中计算 TVD、Spearman 和 Top 5 重合率。
  • 曝光与点击始终作为独立五段触点比较。
  • 从原始 AMC 路径重算唯一路径、购买用户和购买次数三项支持证据。
  • 仅以计算有效、数据支撑充分、模型一致生成二元可靠性结果。
  • 当前精简结果不提供预算执行字段;稳定性研究需在独立未来产物中完成。

这一点尤其重要:当前推荐表只是 Markov 正式展示口径、Shapley 参照和可靠性结果, 不能被解释为预算建议或自动化许可。

当前样例结果

以下结果是2026-07-29从统一用户事件主表原子重建十项产物得到的确定性快照。 主表包含11,147条事件、2,400个合成用户和3,547个journey;归因输入包含153条 唯一聚合路径、17个五段触点、920个购买用户、1,023次购买和87,802.83收入。 两个模型都完全守恒。输入变化后必须重新生成本节,不能沿用这些数字。

整体差异

Outcome五段 TVDSpearman rhoTop 5判断
购买用户1.945%0.88903/5份额接近,头部存在次序差异
购买次数1.975%0.91113/5份额接近,整体排名较一致
收入2.059%0.93144/5份额接近,整体排名较一致

这意味着需要重新分配约2%的贡献份额,两个模型才会一致。准确描述应是“整体份额 接近,但部分头部排序仍受模型假设影响”,不能把当前模拟结果表述为真实业务稳定性。

最大触点差距

当前全部outcome中share差距最大的记录是收入触点:

text
AMAZON_DSP:DISPLAY:UNSPECIFIED:IMAGE:IMPRESSION

它的收入份额为Markov 6.129%、Shapley 6.660%,相差0.532个百分点,相对差约 8.32%。精简结果保留 gap_pprelative_gapmodels_consistent,但不再 输出差距等级或关键分歧标签。

当前可靠性结果

全部 51 条触点/outcome 记录为:

text
calculation_valid = 51 true
data_support_sufficient = 51 true
models_consistent = 51 true
reliability_status = 51 RELIABLE / 0 UNRELIABLE

三个 outcome 摘要分别对本 outcome 全部触点的三项可靠性布尔值做 AND; TVD、Spearman 和 Top-K 重合率只作摘要证据,不改变该结果。

三份双模型输出已收敛为 14/13/15 列,仅表达差距、支持证据、可靠性与据此选择的 单点/模型区间推荐值,可用于模型诊断、人工讨论和真实数据接入验收,不可直接用于 自动预算。

两个模型在快消品场景的定位

当前治理选择 Markov 作为主展示口径,其待验证依据是:快消品通常曝光频繁、路径 较短、重复购买多,顺序、重复接触以及购买用户的 Null 信息可能具有业务价值。 Shapley 被用作参照,以判断结果是否过度依赖顺序与 removal 假设。该选择尚未被 真实 AMC 数据或增量实验验证。

但当前实现仍有两个方法限制:

  1. 订单和收入 Markov 只在正 outcome 路径上建模,更接近加权路径贡献分配,而不是 完整的订单/收入发生概率 removal effect。
  2. 当前 Shapley 是路径 unanimity game 的精确均分,不是对所有观察联盟建立的通用 响应 Shapley。

因此“Markov 正式、Shapley 参照”是治理选择,不表示 Markov 已被证明是真值。

主要风险

高优先级

  1. 真实数据缺失:尚无 AMC 查询 SQL、隐私阈值、查询版本和真实聚合结果。
  2. 稳定性未验证:没有滚动窗口、3/7/14 天敏感性或合适的重采样。
  3. 范围隔离:事件构建只按 journey_id 分组,跨账户复用 ID 可能串联路径。
  4. 模型基准不足:Markov 移除、负效应截零和均分退化缺少可手算金标准案例。

中优先级

  1. 无时区时间自动按 UTC 解释,可能隐藏上游时区错误。
  2. AMC 路径没有 currency,无法直接验证收入和成本币种。
  3. 大整数经 float 解析可能在 2**53 以上损失精度,金额未使用 Decimal
  4. 多进程并发发布缺少锁;并发读取者仍可能短暂看到混合文件版本。
  5. 尚无 package、依赖锁定和 CI,脚本依赖本地路径注入。

完整工程问题见延期事项

推荐实施顺序

第一阶段:证明真实 AMC 可用

  1. 固化 AMC 查询模板、隐私阈值、字段映射、查询版本和 data_as_of
  2. 使用真实但匿名聚合的多周期数据替换模拟路径。
  3. 将 marketplace、advertiser 和 currency 纳入完整范围键。
  4. 建立输入快照 manifest 和可复算运行记录。

第二阶段:建立稳定性

  1. 运行 3/7/14 天路径窗口敏感性。
  2. 建立至少 8 个滚动窗口,并覆盖促销、非促销和季节变化。
  3. 从底层 journey/周期重建或采用适合聚合计数的参数重采样。
  4. 输出区间宽度、Top 5 入选率、gap 方向一致率和差距档位稳定率。

第三阶段:方法与工程加固

  1. 为 Markov removal effect 增加手算基准和替代移除语义对照。
  2. 明确是否保留当前 Path-level Shapley,或增加其他响应模型作为第三参照。
  3. 使用 Decimal、严格 schema、package 和 CI。
  4. 使用版本目录与原子 manifest 提供强一致发布。

第四阶段:业务验证

  1. 先把输出用于人工复盘,不自动调预算。
  2. 选取头部且支持充分的触点开展增量实验或准实验。
  3. 使用真实稳定性和实验结果重新校准 v1 差距/支持度阈值。
  4. 只有达到 FULL_SUPPORT + STABLE 后,才考虑开放自动化。

是否值得继续

暂定建议是继续沿用当前代码基础接入真实 AMC 数据,而不是立即推倒重写。这个建议 成立的条件是:真实聚合路径能满足现有契约、数据规模在批处理可承受范围内、手算 基准没有否定当前模型语义。若任一条件不成立,应重新比较重构与替代方案。目标仅为 MTA 归因时,保持单模块架构仍比提前扩展到预测和预算平台更合适。

Attribution evidence and non-optimized campaign budget initialization.