核心句型 · 10
1. It seems unprecedented, but actually I think there are historical precedents for …
“It seems unprecedented. but actually I think there are historical precedents for what we're going through.”
先承认表面印象,再用 but actually 翻转,引入历史类比。适合议论开头,仿写:It seems X, but actually there are precedents for Y.
2. It's not a crisis in A, but a crisis in B.
“It's not a crisis in our mathematical arguments but it's a crisis in our mathematical values and practices”
否定—肯定的对比结构,用于精确界定问题的性质。仿写时 A、B 需是同一范畴内的两个不同层面。
3. Regardless of whether X is true or false or partly true, I think it is overdue that we …
“Regardless of whether this hypothesis is true or false or partly true or whatever I think it is actually overdue that we do need to talk about why we do mathematics”
先撇开争议前提,再提出无论如何都成立的主张。overdue 表示「早该做」,语气比 necessary 更强。
4. As long as A, you can do X and you'd also be doing Y as well.
“As long as you're far away from all these goals, as long as they're kind of roughly correlated with each other, you can move towards one goal and you'd also be moving towards other goals as well.”
以条件句解释某种机制为何过去有效。as long as 可重复叠加多个条件;后句用 would 表示一般推论。
5. This works until you start …, and at some point you become so good at A that any further progress actually moves you away from B.
“This works until you start optimizing a lot and you become very good at say goal one. and at some point you become so good at goal one that any further progress towards goal one actually moves you away from goal two”
描述「过度优化的临界点」的经典结构:works until + so…that。适合讲任何指标失效的场景。
6. It is not enough to A, and it is not enough to B. C needs to …
“It is not enough to generate proofs and it's not enough to verify the proofs. The proofs need to be explained well enough that they can be communicated”
递进式否定,逐层抬高标准,最后给出真正的要求。not enough to 可连续排比,形成层次感。
7. X is only a sufficient condition. It's not necessary.
“Making it correct and easy to read helps, but that's only a sufficient condition. It's not necessary.”
借用数理逻辑术语表达「有帮助但不保证」。注意此处陶的口误,逻辑上他想说的是「必要而非充分」;仿写时确认方向。
8. All the problems in the world can be classified into problems of X and problems of Y.
“Roughly speaking all the problems in the world can be classified into problems of scarcity and problems of abundance.”
用二分法建立分析框架,之后用具体类比(食物)填充。roughly speaking 缓和绝对化语气。
9. It will be incumbent on X to …
“It will be incumbent on authors to make their papers at the highest expositional standard”
正式语体表达「责任落在某方」。比 X should 更书面、更强调义务转移,适合政策建议。
10. Just like we teach people A before B, … same in C.
“Just like we teach people arithmetic before they do calculators or we teach people to walk and run before they we give them the keys to a car. same in math.”
用两个并列日常类比再以 same in 收束,是口语中强调原则普适性的高效方式。
生词精讲 · 118 · 按出现顺序
accolades
/ˈækəleɪdz/
n.
0:00
荣誉、赞誉(常用复数)
foyer
/ˈfɔɪər/
n.
0:00
门厅、休息厅
existential crises
phr.
0:53
生存危机;关乎存亡的危机
accustomed to
phr.
0:53
习惯于
unprecedented
/ʌnˈpresɪdentɪd/
adj.
1:42
前所未有的
precedents
/ˈpresɪdənts/
n.
1:42
先例
prologue
/ˈproʊlɔːɡ/
n.
1:42
开场白、序言
semiformally
/ˌsemiˈfɔːrməli/
adv.
1:42
半形式化地
inconsistent
/ˌɪnkənˈsɪstənt/
adj.
2:21
(逻辑)不相容的、矛盾的
axioms
/ˈæksiəmz/
n.
2:21
公理
traumatic
/trəˈmætɪk/
adj.
2:21
创伤性的、令人痛苦的
turbulent
/ˈtɜːrbjələnt/
adj.
2:21
动荡的、混乱的
orthodox
/ˈɔːrθədɑːks/
adj.
3:22
正统的、公认的
consensus
/kənˈsensəs/
n.
3:22
共识
proof assistant
n.
3:22
证明助手(形式化验证软件)
strenuously
/ˈstrenjuəsli/
adv.
3:22
费力地、严格地
resilient
/rɪˈzɪliənt/
adj.
4:19
有韧性的、能迅速恢复的
incorporate
/ɪnˈkɔːrpəreɪt/
v.
4:19
纳入、吸收
advent
/ˈædvent/
n.
5:19
(重要事物的)到来、出现
lay down some rules
phr.
5:19
制定规则
conjecture
/kənˈdʒektʃər/
n.
6:08
猜想(数学中未证明的命题)
tackle
/ˈtækl/
v.
6:08
着手处理(难题)
placeholders
/ˈpleɪsˌhoʊldərz/
n.
6:50
占位符
non-trivial
/ˌnɑːnˈtrɪviəl/
adj.
6:50
非平凡的、不可忽视的
devolved
/dɪˈvɑːlvd/
v.
7:47
退化、蜕变(devolve into)
distracting from
phr.
7:47
分散对……的注意力
novelty
/ˈnɑːvəlti/
n.
8:32
新奇玩意儿
business as usual
phr.
8:32
一切照常
ostensibly
/ɑːˈstensəbli/
adv.
8:32
表面上、名义上
common rooms
n.
9:26
(学院、系里的)公共休息室
counter claims
n.
10:34
反驳主张
selectively disclosed
phr.
10:34
选择性披露的
incentives
/ɪnˈsentɪvz/
n.
11:05
激励、动机
in as favorable a light as possible
phr.
11:05
以尽可能有利的方式呈现
conflate
/kənˈfleɪt/
v.
11:05
混为一谈
grassroots
/ˈɡræsruːts/
adj.
11:41
草根的、自下而上的
harnesses
/ˈhɑːrnɪsɪz/
n.
11:41
(AI)运行框架、封装系统
autonomous
/ɔːˈtɑːnəməs/
adj.
11:41
自主的、无人干预的
publication quality
n.
12:45
可发表的质量
complement
/ˈkɑːmplɪmənt/
n.
13:37
补集;补充
working hypothesis
n.
13:37
工作假设
conditional analysis
n.
13:37
条件分析
condition on
phr.
14:37
以……为条件
explicit
/ɪkˈsplɪsɪt/
adj.
14:37
明确的、显性的
implicit
/ɪmˈplɪsɪt/
adj.
15:35
隐含的、隐性的
the humanities
n.
15:35
人文学科
have the luxury of
phr.
15:35
有……的余裕/奢侈
overdue
/ˌoʊvərˈduː/
adj.
16:38
早该做的、逾期的
compiled
/kəmˈpaɪld/
v.
16:38
汇编、整理
cumulative
/ˈkjuːmjəleɪtɪv/
adj.
17:34
累积的
downplay
/ˌdaʊnˈpleɪ/
v.
17:34
轻描淡写、低估
aligned
/əˈlaɪnd/
adj.
18:26
一致的、对齐的
proxy
/ˈprɑːksi/
n.
18:26
代理、替代指标
ceases to be
phr.
19:20
不再是
at the expense of
phr.
20:03
以……为代价
untethered
/ʌnˈteðərd/
adj.
20:03
不受束缚的、脱离的
rubric
/ˈruːbrɪk/
n.
20:44
评分标准、评价准则
in so far as
phr.
21:32
就……而言
deconstruct
/ˌdiːkənˈstrʌkt/
v.
21:32
拆解、解构
flow network
n.
23:19
流网络(图论概念)
sync
/sɪŋk/
n.
23:19
此处为 sink,汇点
complimentary
/ˌkɑːmplɪˈmentri/
adj.
24:18
此处意为 complementary,互补的
vouch
/vaʊtʃ/
v.
25:18
担保(vouch for)
backwalk
n.
25:18
此处意为 backlog,积压
unwelcome
/ʌnˈwelkəm/
adj.
26:14
不受欢迎的
artifacts
/ˈɑːrtɪfækts/
n.
26:14
人工制品;此处指孤立的产出物
exposition
/ˌekspəˈzɪʃn/
n.
27:05
阐述、(数学)写作表达
lema
/ˈlemə/
n.
27:05
即 lemma,引理
scoring function
n.
28:03
评分函数
slick
/slɪk/
adj.
29:02
过于流畅的、油滑的(含贬义)
sanded down
phr.
29:02
打磨掉、磨平
natural friction
n.
29:02
自然摩擦(陶自创术语)
sail through
phr.
29:02
轻松通过
blast through
phr.
29:58
一冲而过、快速带过
paradoxically
/ˌpærəˈdɑːksɪkli/
adv.
29:58
自相矛盾地、反常地
annotation
/ˌænəˈteɪʃn/
n.
31:02
批注
fought my way through
phr.
31:02
艰难地啃完
digesting
/daɪˈdʒestɪŋ/
v.
32:02
消化(知识)
production quer
n.
32:02
即 production quota,生产指标
sufficient condition
n.
32:39
充分条件
scarce
/skers/
adj.
33:41
稀缺的
flooded with
phr.
33:41
被……淹没
bottlenecks
/ˈbɑːtlneks/
n.
33:41
瓶颈
induce
/ɪnˈduːs/
v.
33:41
诱导、促使
opaque
/oʊˈpeɪk/
adj.
34:46
不透明的
look under the hood
phr.
34:46
查看内部运作机制
corporate secrets
n.
34:46
商业机密
reputable
/ˈrepjətəbl/
adj.
35:35
有声望的
appetizing
/ˈæpɪtaɪzɪŋ/
adj.
35:35
诱人的、开胃的
referee
/ˌrefəˈriː/
n./v.
36:42
审稿人;审稿
prestigious
/preˈstɪdʒəs/
adj.
36:42
有威望的
gamed
/ɡeɪmd/
v.
37:43
被钻空子、被操纵
take … out of the equation
phr.
37:43
把……排除在考虑之外
coherent
/koʊˈhɪrənt/
adj.
38:41
连贯的、条理清晰的
canonicalization
/kəˌnɑːnɪkələˈzeɪʃn/
n.
38:41
正典化、标准化
definitive
/dɪˈfɪnətɪv/
adj.
39:30
权威的、决定性的
dig through
phr.
40:30
翻找、深挖
unlocked
/ʌnˈlɑːkt/
v.
40:30
解锁、释放
internalize
/ɪnˈtɜːrnəlaɪz/
v.
41:28
内化
indigestion
/ˌɪndɪˈdʒestʃən/
n.
42:19
消化不良
impedance mismatching
n.
42:19
阻抗失配(电路术语)
extrapolate
/ɪkˈstræpəleɪt/
v.
42:57
外推、推断
pileup
/ˈpaɪlʌp/
n.
42:57
堆积、积压
abundance
/əˈbʌndəns/
n.
42:57
丰裕、过剩
famine
/ˈfæmɪn/
n.
43:43
饥荒
malnutrition
/ˌmælnuːˈtrɪʃn/
n.
43:43
营养不良
edible
/ˈedəbl/
adj.
43:43
可食用的
signaries
/ˈsɪɡnətɔːriz/
n.
45:03
即 signatories,签署者
iterations
/ˌɪtəˈreɪʃnz/
n.
45:03
迭代、修订版本
normalize
/ˈnɔːrməlaɪz/
v.
46:02
使成为常态
in that vein
phr.
46:02
本着这种精神、循此思路
incumbent on
phr.
46:02
是……的责任
formalization
/ˌfɔːrməlaɪˈzeɪʃn/
n.
47:03
形式化
attribute
/əˈtrɪbjuːt/
v.
47:51
归功于、署名归属
on the table
phr.
48:26
摆上桌面(供讨论)
innate
/ɪˈneɪt/
adj.
49:24
内在的、天生的
take the initiative
phr.
49:24
主动采取行动
venues
/ˈvenjuːz/
n.
50:25
(发表的)场所、渠道
理解自测 · 11 题 · 是真懂了,还是以为自己懂
1. 陶哲轩用哪一段历史来类比当前 AI 对数学的冲击?这段历史的起因与结果分别是什么?
他用一百年前的「数学基础危机」作类比。起因是 20 世纪之前数学家以半形式化、朴素的方式使用集合、数、函数、极限等概念,罗素指出朴素集合论不相容(可构造既包含又不包含自身的集合),哥德尔又证明了不完备定理,迫使数学家重新思考「什么是证明」。过程动荡且痛苦,但结果是获得了一阶逻辑加 ZFC 这样的标准框架,被检验了一个世纪。陶在开场章节据此论证:当下的危机同样会带来更健康、更有韧性的学科。
2. FirstProof 挑战赛的评测方式和 2026 年 5 月一轮的结果是什么?
FirstProof 是数学家发起的草根独立评测,不受 AI 公司赞助。数学家捐出 10 道未发表的研究级问题,用于测试完全自主的 AI 系统,且不只看是否解出,还看写作是否达到可发表质量。5 月一轮有四套 harness 提交,陶参与了其中一个团队。单个系统最好成绩是 10 题中 5 题,四套合计有 7 题达到可发表水平,每题成本从 10 美元到 1000 美元不等。陶称这是目前「最科学的数据点」,但强调后续测试可能改变这些数字。
3. 陶把「解题」拆解成了哪五个阶段?其中哪些阶段被 AI 加速、哪些没有?
五个阶段是:证明生成、证明验证、证明解释(写作与理解)、共同体接受(发表与审稿)、正典化(进入教科书与课程)。前两个阶段已明显加速:生成靠 AI,验证主要靠 Lean 等证明助手语言的进步。第三阶段 AI 仍很弱,只擅长拼写格式而重点分配失衡;第四阶段依赖人类反应,AI「基本没有影响」;第五阶段需要教学、反馈和共识,AI「基本完全无用」。陶把后三阶段统称为「证明消化」。
4. 陶在演讲中如何披露自己对 AI 的使用?他为什么要这样做?
他说明本次演讲的文字由自己撰写,但有几处用了自动补全,图表则由 AI 生成,并调侃破折号是人类打的。这样做是为了践行莱顿宣言的第一条个人建议「始终披露 AI 工具使用」。他解释理由:当前最应避免的场景是人人暗中用 AI、无人披露、无人分享最佳实践与错误,这会阻碍整个共同体学会正确使用 AI。因此需要把负责任的披露变成常态,他以身作则。这一段位于结尾的共同体应对建议部分。
5. 陶为何认为「过去不必明说数学的多重目标」,而现在必须明说?请复述其论证链。
陶的论证分三步。第一,数学有多重目标(解题、建理论、理解世界、教育、审美等),但过去数学太难,离所有目标都很远,目标之间大致正相关,因此朝一个目标前进就等于朝所有目标前进,一个显性目标可以作为其他目标的代理。第二,古德哈特定律指出,当某个指标被过度优化,进一步的进展会以牺牲其他目标为代价。第三,人类不擅长优化所以问题不大,但 AI 和 AI 公司是极强的优化器,会使目标从正相关变成竞争关系。因此现在必须同时明确多个目标并给出清晰的评分标准。
6. 为什么陶说「过于流畅的证明」反而可能有害?他用什么亲身经历支持这一观点?
陶提出「自然摩擦」概念:人类写证明时在易处快速带过、在难处放慢并仔细组织,读者能借此感知难点所在;AI 生成的证明对易难之处一视同仁,读者失去这一信号,而过于光滑的证明会把困难「打磨掉」,读者回家自己重构时却做不出来。他的例子是研究生时期读 Jean Bourgain 1991 年关于挂谷猜想与限制猜想的论文,痛苦到批注「我讨厌 Jean Bourgain」,但在 Eli Stein 和 Tom Wolff 帮助下攻克后,理解了他的思维方式,几年后反而最偏爱读他的论文。他推断若该论文被 AI 层层润色,自己可能得不到那样的教育。
7. 陶为什么说 AI 在数学上的成功本身依赖于「正典化」?这一论点有什么反直觉之处?
陶指出,AI 之所以擅长数学,很大原因是几个世纪以来人类已把线性代数、群论等理论整理成成熟的正典定义和教科书,AI 吸收了这些材料。正典化是解题流程的终点,也是数学对工程、物理、生物等领域产生应用的必经形态——外行不会去啃顶刊论文,他们需要教科书。反直觉之处在于:AI 恰恰在这一最有价值的阶段「基本完全无用」,却又以这一阶段的产物为食。因此如果 AI 生成的证明堆积而无人正典化,长期会同时损害数学和 AI 自身。这一论点出现在「正典化」章节。
8. 「证明消化不良」这一概念是如何从流程分析中推导出来的?它有哪些具体表现?
陶先把解题拆成五个阶段,然后观察到 AI 在前两阶段(生成、验证)远强于后三阶段(解释、接受、正典化),各环节速率不匹配,他借用电路术语称之为「阻抗失配」,通俗说法就是「证明消化不良」。具体表现有四种:未验证的证明不断堆积;已验证但无人愿读的证明(如 Lean 形式化的埃尔德什问题解答);可读但无人愿意发表的证明;以及按趋势外推即将出现的、已发表却无人知道如何写进教科书的 AI 证明。他进一步把这归类为「过剩问题」,与过去几个世纪的「稀缺问题」对照。
9. 陶为什么坚持「不能把人类审稿人从环节中剔除」?如果有人反驳「AI 审稿更快更便宜」,他会如何回应?
陶的立场是期刊可以用 AI 作初筛、可以把规范定得更精确,但纯 AI 审稿的期刊不会成功。他会从三方面回应「更快更便宜」的反驳:第一,AI 审稿工具「相当容易被钻空子」,一旦成为目标就会遭遇古德哈特定律;第二,审稿的本质不只是判断对错,而是把个人成就转化为集体理解,并借此培养下一代数学家,这是人与人之间的过程;第三,「被 100 个 AI 审稿人接受」并不等于共同体接受,不意味着任何人真的想读它。速度和成本解决的是前两阶段的问题,而接受阶段的瓶颈本来就是人类注意力。
10. 陶提出的作者署名标准是什么?这一标准若应用于大型协作项目或纯形式化证明,还成立吗?
陶的标准是:如果一个「作者」不能像在讲台上那样报告结果并回答关于该结果的提问,就不该署名,或至少论文在有一个能真正谈论该结果的人之前不应发表。这一标准的核心是「有人能为结果负责并解释它」,而非「每个作者都懂全部」。放到大型协作项目上,只要至少有一人能整体解释,标准仍成立,且与陶对第三阶段「证明必须被理解」的要求一致。但对纯形式化证明(如 Lean 验证的埃尔德什问题解答),当前恰恰出现了「提交者说自己不够格评价、检查者也不能担保」的情形,按陶的标准这些结果尚不能算「可发表」,这正是他想用该标准来约束的场景。
11. 陶用「食物从稀缺到过剩」类比数学从「证明稀缺」到「证明过剩」。这个类比的解释力边界在哪里?
类比的强处在于:它把问题从「AI 好不好」转换为「我们如何建立品味」——人类应对食物过剩靠的是分辨好坏饮食、提升烹饪、拒绝技术上可食用但不想吃的东西,对应到数学就是建立评价证明价值的标准、只投入稀缺的审稿注意力给值得消化的结果。它也解释了为何「讲故事、展示过程」变得重要,因为要让论文更「开胃」。类比的边界在于:食物的好坏有相对客观的营养学标准,而陶自己承认「证明写得好不好」目前没有好的评分标准;此外食物消费是个体选择,而正典化需要整个领域的共识,个体品味无法直接汇总成集体正典。因此类比适合说明「态度转变」,但对「如何形成共识」这一最慢阶段解释力有限。