提示词的广告模式:AI 的垂直整合
英文标题:The Ads Model for Prompts Vertically Integrates AI
Meta 推出 Muse Spark 1.3 模型,通过两级定价将用户数据使用权与推理费用挂钩,以高达 92% 的折扣换取训练数据,垂直整合 AI 数据供应链。
为什么值得关注
这一模式将用户数据与 AI 服务直接挂钩,类似互联网广告的交换逻辑。对企业用户而言,选择隐私保护需支付高额溢价;对普通用户,可能意味着免费或低价 AI 服务背后隐藏着数据使用权。它可能加速 AI 发展,但也引发数据隐私和公平性的讨论。
核心要点
- Meta 推出 Muse Spark 1.3,采用两级定价:标准层级保护隐私,贡献者层级提供 92% 折扣但允许数据训练。
- 价差每百万 token 1.24 美元,揭示了用户提示词数据的市场价值。
- 该模式类似广告,用补贴换取数据,垂直整合 AI 数据供应链。
- Meta 能以远低于专业数据实验室的成本获取训练数据。
- 这可能为开源模型解决商业模式问题,同时加剧数据隐私担忧。
简而言之:Meta 的 Muse Spark 1.3 将推理(inference,即模型生成答案的过程)定价分为两个层级:私有数据每百万 token(token,文本处理的基本单位)收费 $1.25/$4.25,而同意用于训练的数据收费 $0.10/$0.20,价差高达 92%。Michael Mauboussin 曾教导我们,市场价格包含了关于潜在预期的信息。这个价差为用户的提示词和智能体(agent,能自主执行任务的 AI 程序)提示词数据确立了每百万 token $1.24 的流动性清算价格,使 Meta 能够垂直整合 AI 数据供应链,并以远低于专业数据实验室的成本获取训练后数据。
Meta 昨天发布了两项内容:一个前沿模型和一套基础模型的新定价体系。1 Muse Spark 将美国的开源模型推向了前沿。与此同时,这套定价体系重塑了行业的商业模式。
三十年来,企业软件一直遵循严格的许可费模式,并承诺完全隐私和零数据保留。2 消费科技则遵循相反的原则:用免费软件换取行为数据。消费者用查询换取便利,但企业则极力保护其知识产权。
如今,这种模式正以新的方式进入 AI 领域。
Meta 的新定价通过两级定价结构(有隐私和无隐私)将这种交换明确化:3
-
标准层级(muse-spark-1.3):输入 token 每百万 $1.25,输出 token 每百万 $4.25。你的提示词和生成内容绝不会用于训练 Meta 的基础模型。
-
贡献者层级(muse-spark-1.3-contributor):输入 token 每百万 $0.10,输出 token 每百万 $0.20。作为交换,Meta 获得在未来的模型训练中使用你数据的权利,而你则享受输入 92% 和输出 95% 的折扣。
目前没有其他基础模型提供商在其 API 上提供这种明确的交换方式。这就是广告模式进入 AI 领域的体现。
正如 Michael Mauboussin 在《预期投资》中所写,价格中蕴含着信息。4 当 Meta 对同一个 AI 收取两种截然不同的价格时,价格差异就告诉我们数据的价值。
按照智能体 30:1 的输入输出比计算,5 标准层级的混合成本为每百万 token $1.35,而贡献者层级仅为 $0.103。两者相差每百万 token $1.24,相当于 92.3% 的有效补贴。
对于每天处理 10 亿 token 的企业来说,选择零数据保留(ZDR,即服务商不存储用户数据)意味着每年 $454,000 的隐私附加费。这个差异就是 Meta 对流入客户数据的估值:每百万 token $1.24。
这也解构了每月 $20 的消费者订阅模式。实验室之所以能在固定费率的消费者套餐上承受计算亏损,是因为默认条款授予了训练权,这是一种隐性的数据补贴,而 Meta 现在将其按 token 正式化。6
为什么要放弃 92% 的推理收入?这并非出于利他主义。
公共网络已被彻底爬取;前沿进展现在来自训练后阶段、基于 AI 反馈的强化学习(RLHF,一种让 AI 根据人类反馈改进的方法)以及用户使用模式。据估计,训练数据和人工标注的市场年收入可达 $100 亿。7
Meta 的定价模式绕过了这一中间环节。正如搜索和社交平台通过直接从用户获取行为数据来垂直整合数字广告供应链一样,Meta 正在垂直整合 AI 数据供应链。Meta 不是付费给标注供应商来模拟人类行为,而是将其推理网络变成一个自我供能的数据飞轮。
以每百万 token $1.24 的补贴计算,8 Meta 以远低于专业数据实验室的成本获取有机推理轨迹,同时在推理价格上低于封闭基础模型。
计算不再仅仅作为基础设施出售。它已成为一种货币,直接用于交换构建下一代前沿模型所需的训练 token。
最终,这为美国开源模型解决了商业模式问题。就像广告一样,这种交换很简单:以数据换取补贴访问。
-
企业主服务协议和合规框架(SOC 2、ISO 27001、HIPAA)要求零数据保留,并禁止供应商使用客户数据进行模型训练。↩︎
-
按个人每月 1000 万 token 的使用量计算,$1.24/m 的价差相当于每月 $12 的补贴。对于每月消耗 2000 万至 5000 万 token 的重度用户,数据补贴可达每月 $25 至 $62,与消费者订阅折扣相当。↩︎
-
按每百万 token $1.24 计算,Meta 对每条 3,000 token 的交互轨迹的有效补贴为 $0.0037。相比之下,专业人工标注供应商对领域专家每小时收费 $25 至 $100 以上,每条经过验证的推理轨迹成本为 $5 至 $50。↩︎
术语表
- token
- 文本处理的基本单位,可以是单词、子词或字符,AI 模型通过处理 token 来理解和生成语言。
- 推理(inference)
- AI 模型根据输入生成输出的过程,例如回答问题或生成文本。
- 智能体(agent)
- 能自主执行任务的 AI 程序,例如自动完成多步骤操作。
- 零数据保留(ZDR)
- 服务商不存储用户数据,确保隐私安全。
- RLHF
- 基于人类反馈的强化学习,一种让 AI 根据人类评价改进回答的方法。
- 垂直整合
- 企业控制供应链的多个环节,例如 Meta 既提供模型又获取训练数据。
生产区
使用这篇文章
复制包含 frontmatter、中文正文和英文来源的 Markdown。
我的研究区
记录自己的判断,不会写回原文或公开页面。
一句话说清这篇材料能支撑什么角度。
每行一个,最多 20 个。
支持 Markdown。要核对的数据、可复用的方法、反方观点或补充来源。