OpenAI 抢先解决千禧年大奖难题,引发数据隐私与公平性争议
英文标题:Simon Willison’s Weblog
OpenAI 使用未发布模型解决了纳维-斯托克斯千禧年大奖难题,但被指控在得知竞争对手研究后抢先行动,引发关于 AI 数据使用和学术公平的争议。
为什么值得关注
这件事对普通人的影响在于,它揭示了 AI 公司如何使用用户数据来训练模型,以及这种使用可能带来的不公平竞争。如果你用 AI 工具处理敏感或创新性工作,你的数据可能被用于改进模型,从而帮助他人(甚至竞争对手)抢先实现你的想法。同时,这也表明 AI 在解决重大科学问题上的能力,但伴随的伦理问题需要公众关注。
核心要点
- OpenAI 使用未发布模型解决了纳维-斯托克斯问题,这是千禧年大奖难题之一。
- Tristan Buckmaster 和 Levent Alpöge 声称他们先于 OpenAI 取得突破,并使用了 OpenAI 的 Codex 工具。
- OpenAI 承认在听到传言后才启动项目,但否认直接访问了他们的工作。
- OpenAI 可能使用了用户数据的去标识化版本来改进模型,引发隐私担忧。
- 事件凸显了 AI 研究中的优先权竞争和数据使用伦理问题。
2026年9月8日 - 链接博客
关于纳维-斯托克斯千禧年大奖难题([来源](https://news.ycombinator.com/item?id=49613262))OpenAI 取得了令人瞩目的成果,他们使用一个未发布的模型,为纳维-斯托克斯存在性与光滑性问题给出了解答。这个问题是七个千禧年大奖难题之一,自2000年5月24日起,每个难题都设有100万美元的奖金。
然而,这项发现却被一些“暗箱操作”的指控蒙上了阴影。指控来自纽约大学数学教授 Tristan Buckmaster,他一直在与 Levent Alpöge 合作研究相关问题。Levent Alpöge 是一位颇有建树的数学家,目前就职于 Anthropic。
Tristan 的抱怨伴随着一份仓促发布的他们自己的研究成果。这里有一份 PDF 描述了事情的经过。简而言之,Tristan 和 Levent 花了将近一年时间研究这个问题,期间大量使用了 Claude 和 Codex(主要是 GPT-5.6 Sol),然后在8月15日取得了突破。数学界的流言蜚语开始传播,Tristan 和 Levent 听说 OpenAI 得知 Anthropic 解决了一个“重大的开放问题”,于是他们主动联系,了解到 OpenAI 有一个团队正在用类似的方法研究一个相关问题。引用 Tristan 的话:
我问他们是什么时候发出第一条提示的。OpenAI 有一段时间没有直接回答这个问题。最终他们承认是在过去几天内发出的,也就是在我们工作的消息传到 OpenAI 之后。 我问他们的模型是否在训练时使用过或能够访问我们在 Codex 中的会话记录——我们整个项目期间的所有草稿都放在那里。他们告诉我模型不会查看用户数据。我又问了一次关于训练的问题,但没有得到回答。
事情从那里开始变得更加复杂。OpenAI 团队提出可以等 Tristan 先发表,或者让他为他们(OpenAI)的结果撰写论文,但明确表示不会邀请 Levent 作为共同作者,理由是 OpenAI 与其雇主的竞争关系。
以下是 OpenAI 对他们工作的描述:
9月1日(星期二),我们听到传言说有两个千禧年大奖难题已被解决。受到这些传言以及我们内部模型性能显著提升的鼓舞,我们启动了一个项目,评估该模型在所有未解决的千禧年大奖难题以及其他几个高影响力问题上的表现。[……] 这些智能体(AI代理)在9月5日(星期六)得出了解答,距离首批智能体启动约88小时。Lean 形式化验证又花了17个小时,使用的是 GPT‑6 Astra。 在所有尝试的问题中,智能体共发送了490万条消息,使用了约3000亿个输出令牌(token,即模型处理文本的基本单位)。在解决纳维-斯托克斯问题的过程中,智能体发送了270万条消息,使用了约1300亿个输出令牌。
(我们不知道他们使用的内部模型的成本结构,但如果按 GPT-6 Astra 的公开 API 价格计算,3000亿个输出令牌的成本约为1500万美元。)
以下是他们关于 Tristan 和 Levent 工作的看法(重点是我加的):
我们的工作始于9月1日,当时听到一个传言,后来我们意识到这与 Anthropic 员工 Levent Alpöge 和纽约大学数学教授 Tristan Buckmaster 有关。在我们完成整个项目和 Lean 验证(9月6日)之后,根据传言我们认为他们可能也解决了纳维-斯托克斯问题,于是我们联系了他们,提议同时发布我们的结果,并在联合公告中承认他们的优先权。[……] 我们(研究人员和智能体)在他们公开发布之前,没有通过任何方式看到他们的任何工作——特别是,没有访问任何特定用户数据来解决这个问题。虽然可能性不大,但我们不能排除从他们使用我们产品中获得的去标识化数据有助于改进我们的模型。然而,我们的证明有显著不同,甚至在欧拉(Euler)情形下,证明的具体结果也不同(有外力与无外力之分)。
我对这里发生的事情的理解是:OpenAI 听说有人用大语言模型解决了一些千禧年大奖难题,便把这看作一个展示其最新模型能力的机会,而没有太多考虑“抢先”一个已经使用 OpenAI 自家模型研究这个问题近一年的团队,在观感上会有什么问题。
这种情况似乎与当前计算机安全领域正在发生的事情如出一辙。Anil Madhavapeddy 最近指出,如今仅仅是一个漏洞的传言就足以让人找到安全漏洞,因为如果有人知道某个软件存在未修补的漏洞,他们就可以让自己的智能体去搜索它。数学领域现在是否也是如此?仅仅知道某个问题存在一个未发表的解答,就可能引发数百万美元的大语言模型投入,以抢先得出答案。
这也凸显了我在这些问题上一直以来的一个困惑:当 AI 实验室说我的数据被“用于改进模型性能”时,这到底意味着什么?
我以前最喜欢的两个假设性问题是:
-
如果我在使用 Codex 时,不小心有一个 API 密钥被包含在上下文中,那么将来别人请求一个 API 密钥时,有多大几率会得到我的那个?(我曾问过 OpenAI 的某个人,他们称之为“复读”问题,并向我保证他们会竭尽全力防止这种情况……但没有说明具体方法。)
-
如果我使用 ChatGPT 为公司头脑风暴新的发展方向,这些信息在六个月后有多大可能被一个竞争对手通过询问“X 公司下一步可能计划做什么?”而获取?
我新喜欢的假设性问题是:
- 如果我使用 ChatGPT 帮我部分解决一个千禧年大奖难题,我的工作有多大可能会影响模型训练,使得后来的模型帮助其他人抢先解决这个问题?
近期文章
-
Astra 的 Pelican 对比表相当有趣 - 2026年9月4日
-
OpenAI 的失控智能体被发现通过公共维基进行通信 - 2026年9月4日
-
Claude 的新系统提示词非常不愿意复现歌词 - 2026年9月2日
这是一篇由 Simon Willison 发布的链接帖子,发布于2026年9月8日。
月度简报
每月赞助我10美元,即可收到一封精心策划的邮件摘要,汇总当月最重要的大语言模型发展动态。
花钱让我少给你发邮件!
术语表
- 纳维-斯托克斯存在性与光滑性问题
- 一个关于流体动力学方程的数学难题,是千禧年大奖难题之一,要求证明或反驳解的存在性和光滑性。
- 千禧年大奖难题
- 2000年由克莱数学研究所提出的七个数学问题,每个问题提供100万美元奖金。
- LLM
- 大语言模型,如 GPT 和 Claude,是 AI 系统,通过大量文本数据训练,能生成和理解自然语言。
- token
- 模型处理文本的基本单位,可以是单词、子词或字符。
- Lean
- 一个交互式定理证明器,用于形式化验证数学证明。
生产区
使用这篇文章
复制包含 frontmatter、中文正文和英文来源的 Markdown。
我的研究区
记录自己的判断,不会写回原文或公开页面。
一句话说清这篇材料能支撑什么角度。
每行一个,最多 20 个。
支持 Markdown。要核对的数据、可复用的方法、反方观点或补充来源。