AMC MTA 能力评价
最终评价
当前项目适合定义为:
工程完整、契约严格、可复现的 AMC MTA 归因与双模型诊断 Demo。
它已经超过“算法草稿”:输入、路径、成本、模型、比较、治理输出和测试形成了闭环。 但它仍不是生产级归因系统,更不是因果增量或自动预算系统。最大的短板已不在“代码 能不能跑”,而在真实 AMC 数据证据、稳定性、方法校准和生产运行边界。
分层成熟度
| 维度 | 等级 | 证据 |
|---|---|---|
| 工程可靠性 | 较高 | 流程可复现、校验严格,107项测试覆盖来源追溯、隐私、守恒、可靠性与回滚 |
| 归因方法 | 中等 | 双模型互补且语义清楚,但仍需手算基准和真实数据校准 |
| 数据证据 | 低 | 只有确定性模拟样例,没有真实 AMC 查询与跨窗口证据 |
| 业务决策 | 很低 | 当前只输出模型诊断与可靠性,不提供决策值或自动化字段 |
| Demo 完成度 | 较高 | 适合演示、教学、接口讨论和真实数据接入准备 |
| 生产就绪度 | 低 | 缺少生产数据、稳定性、CI、监控与因果验证 |
等级依据当前代码、测试、输入和输出证据,不是统计评级,也不适用于未来数据版本。
已具备的 MTA 能力
1. AMC 路径输入能力
- 使用严格五段键区分广告产品、形式、位置、创意和曝光/点击。
- 明确区分购买用户、购买次数和收入。
- 支持 14 天连续间隔、起点截断和同 journey 多购买切段。
- 只接受单一账户、市场、币种与窗口,并要求 Ads 逐日完整覆盖。
- 不从汇总曝光/点击数据伪造用户路径。
2. 双模型归因能力
- Markov 使用顺序、重复触点和 removal effect。
- Path-level Shapley 提供不依赖顺序的路径参与参照。
- 三个 outcome 分别归因并守恒。
- 曝光和点击保持为独立五段主结果。
- 两模型不平均,避免把不同假设伪装成共识。
3. 成本与效率能力
- Amazon Ads 成本按完整五段键关联。
- CPC 只归点击,CPM 只归曝光,成本不复制。
- 输出 ROAS、ROI、订单 CPA 和每购买用户成本。
- 平台报告购买/销售与 AMC 归因 outcome 保持口径隔离。
4. 模型诊断与可靠性能力
- 逐触点、逐 outcome 比较 Markov/Shapley share、绝对百分点差和相对差。
- 在摘要中计算 TVD、Spearman 和 Top 5 重合率。
- 曝光与点击始终作为独立五段触点比较。
- 从原始 AMC 路径重算唯一路径、购买用户和购买次数三项支持证据。
- 仅以计算有效、数据支撑充分、模型一致生成二元可靠性结果。
- 当前精简结果不提供预算执行字段;稳定性研究需在独立未来产物中完成。
这一点尤其重要:当前推荐表只是 Markov 正式展示口径、Shapley 参照和可靠性结果, 不能被解释为预算建议或自动化许可。
当前样例结果
以下结果是2026-07-29从统一用户事件主表原子重建十项产物得到的确定性快照。 主表包含11,147条事件、2,400个合成用户和3,547个journey;归因输入包含153条 唯一聚合路径、17个五段触点、920个购买用户、1,023次购买和87,802.83收入。 两个模型都完全守恒。输入变化后必须重新生成本节,不能沿用这些数字。
整体差异
| Outcome | 五段 TVD | Spearman rho | Top 5 | 判断 |
|---|---|---|---|---|
| 购买用户 | 1.945% | 0.8890 | 3/5 | 份额接近,头部存在次序差异 |
| 购买次数 | 1.975% | 0.9111 | 3/5 | 份额接近,整体排名较一致 |
| 收入 | 2.059% | 0.9314 | 4/5 | 份额接近,整体排名较一致 |
这意味着需要重新分配约2%的贡献份额,两个模型才会一致。准确描述应是“整体份额 接近,但部分头部排序仍受模型假设影响”,不能把当前模拟结果表述为真实业务稳定性。
最大触点差距
当前全部outcome中share差距最大的记录是收入触点:
AMAZON_DSP:DISPLAY:UNSPECIFIED:IMAGE:IMPRESSION它的收入份额为Markov 6.129%、Shapley 6.660%,相差0.532个百分点,相对差约 8.32%。精简结果保留 gap_pp、relative_gap 和 models_consistent,但不再 输出差距等级或关键分歧标签。
当前可靠性结果
全部 51 条触点/outcome 记录为:
calculation_valid = 51 true
data_support_sufficient = 51 true
models_consistent = 51 true
reliability_status = 51 RELIABLE / 0 UNRELIABLE三个 outcome 摘要分别对本 outcome 全部触点的三项可靠性布尔值做 AND; TVD、Spearman 和 Top-K 重合率只作摘要证据,不改变该结果。
三份双模型输出已收敛为 14/13/15 列,仅表达差距、支持证据、可靠性与据此选择的 单点/模型区间推荐值,可用于模型诊断、人工讨论和真实数据接入验收,不可直接用于 自动预算。
两个模型在快消品场景的定位
当前治理选择 Markov 作为主展示口径,其待验证依据是:快消品通常曝光频繁、路径 较短、重复购买多,顺序、重复接触以及购买用户的 Null 信息可能具有业务价值。 Shapley 被用作参照,以判断结果是否过度依赖顺序与 removal 假设。该选择尚未被 真实 AMC 数据或增量实验验证。
但当前实现仍有两个方法限制:
- 订单和收入 Markov 只在正 outcome 路径上建模,更接近加权路径贡献分配,而不是 完整的订单/收入发生概率 removal effect。
- 当前 Shapley 是路径 unanimity game 的精确均分,不是对所有观察联盟建立的通用 响应 Shapley。
因此“Markov 正式、Shapley 参照”是治理选择,不表示 Markov 已被证明是真值。
主要风险
高优先级
- 真实数据缺失:尚无 AMC 查询 SQL、隐私阈值、查询版本和真实聚合结果。
- 稳定性未验证:没有滚动窗口、3/7/14 天敏感性或合适的重采样。
- 范围隔离:事件构建只按
journey_id分组,跨账户复用 ID 可能串联路径。 - 模型基准不足:Markov 移除、负效应截零和均分退化缺少可手算金标准案例。
中优先级
- 无时区时间自动按 UTC 解释,可能隐藏上游时区错误。
- AMC 路径没有 currency,无法直接验证收入和成本币种。
- 大整数经
float解析可能在2**53以上损失精度,金额未使用Decimal。 - 多进程并发发布缺少锁;并发读取者仍可能短暂看到混合文件版本。
- 尚无 package、依赖锁定和 CI,脚本依赖本地路径注入。
完整工程问题见延期事项。
推荐实施顺序
第一阶段:证明真实 AMC 可用
- 固化 AMC 查询模板、隐私阈值、字段映射、查询版本和
data_as_of。 - 使用真实但匿名聚合的多周期数据替换模拟路径。
- 将 marketplace、advertiser 和 currency 纳入完整范围键。
- 建立输入快照 manifest 和可复算运行记录。
第二阶段:建立稳定性
- 运行 3/7/14 天路径窗口敏感性。
- 建立至少 8 个滚动窗口,并覆盖促销、非促销和季节变化。
- 从底层 journey/周期重建或采用适合聚合计数的参数重采样。
- 输出区间宽度、Top 5 入选率、gap 方向一致率和差距档位稳定率。
第三阶段:方法与工程加固
- 为 Markov removal effect 增加手算基准和替代移除语义对照。
- 明确是否保留当前 Path-level Shapley,或增加其他响应模型作为第三参照。
- 使用
Decimal、严格 schema、package 和 CI。 - 使用版本目录与原子 manifest 提供强一致发布。
第四阶段:业务验证
- 先把输出用于人工复盘,不自动调预算。
- 选取头部且支持充分的触点开展增量实验或准实验。
- 使用真实稳定性和实验结果重新校准 v1 差距/支持度阈值。
- 只有达到
FULL_SUPPORT + STABLE后,才考虑开放自动化。
是否值得继续
暂定建议是继续沿用当前代码基础接入真实 AMC 数据,而不是立即推倒重写。这个建议 成立的条件是:真实聚合路径能满足现有契约、数据规模在批处理可承受范围内、手算 基准没有否定当前模型语义。若任一条件不成立,应重新比较重构与替代方案。目标仅为 MTA 归因时,保持单模块架构仍比提前扩展到预测和预算平台更合适。