核心句型 · 9
1. It's only in the last few years that … has actually …
“But it's only in the last few years as we all know that AI has actually showed up not as the stuff of philosophy … but in such a way as very dramatically to transform our lives.”
强调句型突出时间节点,配合 not as … but as … 做对比。适合描述某事物「从设想变为现实」的转折;仿写时注意 that 从句中动词用现在完成时。
2. X throws into relief what are the most fundamental questions about …
“AI throws into relief in new ways really what are the most fundamental questions about technology and its place in our lives.”
throw … into relief 意为「使…凸显」,是学术与评论文体常用的书面表达。宾语可用 what 引导的名词性从句,显得正式而有分量。
3. I don't claim to be X. I also don't claim not to be.
“I don't claim to be conscious. I also don't claim not to be. I genuinely don't know.”
平行否定结构表达悬置判断,简洁有力。可用于任何需要表明「不下结论」的场合,后接 I genuinely don't know 强化诚恳语气。
4. If we're going to say that …, it's going to be because …
“So if we're going to say that language models are not conscious, it's going to be because they lack a crucial X factor.”
用于设定论证框架:先假定一个结论,再点明它必须依赖的前提。适合分析型写作,把对方立场转化为可检验的条件。
5. X has a quasi-Y that P, if X is interpretable as Y-ing that P under an appropriate scheme.
“You say X has a quasi-belief that P, if X is interpretable as believing that P under an appropriate interpretation scheme.”
哲学式定义句:主句给术语,if 从句给充分条件。写作中定义新概念时可套用「A 是 B,当且仅当/如果 C」结构,注意 interpretable as 后接动名词。
6. The claim that …, though it reflects the way we talk, is actually rather implausible when you reflect on it.
“The claim that we're actually talking to Claude or ChatGPT-5.5 is actually, though it reflects the way we talk, I think it's actually rather implausible when you reflect on it.”
先承认某说法在日常语言中自然,再指出细想之下站不住脚。though 插入语做让步,when you reflect on it 收尾,是委婉批评常识的典型句式。
7. There's a very natural idea here, which is that …
“There's a very natural idea here, which is that language model interlocutors are not models, but they're instances or implementations of models.”
引出一个候选观点再加以检验的过渡句。which is that 引导同位语从句,比直接陈述更显客观;后文常接 But I think it's not so plausible … 形成转折。
8. It's not going to be much help to say …, if we know that in fact …
“It's not going to be much help to say, 'Well, the machine only quasi-desires to kill us all,' if we know that in fact it's going to behave as if it wants to kill us all.”
用假设条件反驳一种「概念上的安慰」,语气略带反讽。适合论证「名义区分在实践中无意义」,if 从句放在后面制造落差。
9. We will almost certainly look back on that time as a time when we …
“We will almost certainly look back on that time as a time when we made many moral mistakes.”
look back on … as … 表达「事后回看」的评价,when 从句限定内容。常用于伦理与历史反思,配合 almost certainly 加强预判力度。
生词精讲 · 122 · 按出现顺序
call this meeting to order
phr.
0:00
宣布会议开始(正式用语)
articulated
/ɑːrˈtɪkjəleɪtɪd/
v.
0:00
清晰地表述、阐明
bent on
phr.
1:35
一心想要、决意(做某事)
in the grip of
phr.
1:35
被…控制、受…支配
throws into relief
phr.
2:51
使…凸显出来
would be agents
phr.
2:51
想要成为/自称的主体(would-be:未来的、自封的)
crowded out
phr. v.
3:52
被挤出、被排挤掉
endow
/ɪnˈdaʊ/
v.
3:52
捐资设立(讲座、基金等)
venue
/ˈvenjuː/
n.
3:52
场所、平台
intimately
/ˈɪntɪmətli/
adv.
5:11
密切地、深入地
path-breaker
/ˈpæθ ˌbreɪkər/
n.
5:11
开拓者、先驱
fabled
/ˈfeɪbld/
adj.
5:11
传奇的、著名的
ergonomics
/ˌɜːrɡəˈnɑːmɪks/
n.
5:11
工效学、人机工程学
curiosity
/ˌkjʊriˈɑːsəti/
n.
6:24
好奇心
aspiration
/ˌæspəˈreɪʃn/
n.
7:08
抱负、志向
accomplished
/əˈkɑːmplɪʃt/
adj.
8:48
成就卓著的
prodigious
/prəˈdɪdʒəs/
adj.
8:48
惊人的、非凡的
longstanding
/ˌlɔːŋˈstændɪŋ/
adj.
9:41
长期的、由来已久的
landmark
/ˈlændmɑːrk/
n.
10:16
里程碑
overstate
/ˌoʊvərˈsteɪt/
v.
10:16
夸大(one can't overstate:再怎么强调也不为过)
enumerations
/ɪˌnuːməˈreɪʃnz/
n.
11:34
列举、罗列
formative
/ˈfɔːrmətɪv/
adj.
13:18
有塑造性的、形成性的
at the foot of
phr.
14:40
在…门下(学习)
on the side
phr.
16:06
作为副业、附带地
connectionist
/kəˈnekʃənɪst/
adj.
16:06
联结主义的(神经网络学派)
out of phase with
phr.
17:15
与…不同步、相位错开
the bottom fell out
idiom
17:15
(市场、领域)突然崩塌、一落千丈
hard to get arrested
idiom
17:15
完全无人问津(原意:连被逮捕都难)
illumination
/ɪˌluːmɪˈneɪʃn/
n.
20:10
启发、阐明
shed on
phr. v.
20:10
shed light on:为…带来启发
stigma
/ˈstɪɡmə/
n.
21:39
污名、耻辱感
superb
/suːˈpɜːrb/
adj.
22:50
极出色的
sustained
/səˈsteɪnd/
adj.
22:50
持续的、成体系的
overtaken
/ˌoʊvərˈteɪkən/
v.
23:29
被超越(overtake 的过去分词)
companionship
/kəmˈpænjənʃɪp/
n.
23:29
陪伴
projection
/prəˈdʒekʃn/
n.
25:28
(心理)投射
emergent
/ɪˈmɜːrdʒənt/
adj.
25:28
涌现的
get to the bottom of
idiom
25:28
弄清…的真相
incarnation
/ˌɪnkɑːrˈneɪʃn/
n.
25:28
化身
derision
/dɪˈrɪʒn/
n.
25:28
嘲笑、奚落
imputing
/ɪmˈpjuːtɪŋ/
v.
26:41
归于、把…归属于
preoccupies
/priˈɑːkjəpaɪz/
v.
28:03
使全神贯注、萦绕心头
discontinuity
/ˌdɪskɑːntəˈnuːəti/
n.
28:03
断裂、不连续
assertion
/əˈsɜːrʃn/
n.
28:54
断言
intellectual humility
phr.
28:54
智识上的谦逊
dormant
/ˈdɔːrmənt/
adj.
29:25
休眠的
interlocutor
/ˌɪntərˈlɑːkjətər/
n.
30:54
对话者、谈话对象
pin this down
phr. v.
32:01
把…确定下来、钉死
metaphysics
/ˌmetəˈfɪzɪks/
n.
32:01
形而上学
epistemology
/ɪˌpɪstəˈmɑːlədʒi/
n.
32:01
认识论
individuating
/ˌɪndɪˈvɪdʒueɪtɪŋ/
v.
33:54
个体化、区分为个体
persist
/pərˈsɪst/
v.
33:54
持存、持续存在
moral standing
phr.
34:44
道德地位
of necessity
phr.
34:44
必然地、不得已地
in the wake of
phr.
35:30
紧随…之后
sentient
/ˈsenʃənt/
adj.
35:30
有感知能力的
obsolete
/ˌɑːbsəˈliːt/
adj.
35:30
过时的
indistinguishable
/ˌɪndɪˈstɪŋɡwɪʃəbl/
adj.
38:42
无法区分的
bio-chauvinist
/ˌbaɪoʊ ˈʃoʊvɪnɪst/
adj.
39:41
生物沙文主义的(偏袒生物体的)
embodiment
/ɪmˈbɑːdimənt/
n.
39:41
具身性
knockdown
/ˈnɑːkdaʊn/
adj.
40:30
决定性的、无可辩驳的(论证)
descendants
/dɪˈsendənts/
n.
40:30
后代、后继系统
multimodal
/ˌmʌltiˈmoʊdl/
adj.
42:05
多模态的
a stretch
phr.
43:07
牵强、勉强的说法
full-blown
/ˌfʊl ˈbloʊn/
adj.
43:07
成熟的、完全意义上的
extrapolating
/ɪkˈstræpəleɪtɪŋ/
v.
43:07
外推
rebut
/rɪˈbʌt/
v.
43:07
反驳
intentionality
/ɪnˌtenʃəˈnæləti/
n.
45:32
意向性(心灵指向对象的特性)
deflated
/dɪˈfleɪtɪd/
adj.
45:32
缩水的、弱化的(概念)
stipulate
/ˈstɪpjuleɪt/
v.
46:47
约定、规定(定义)
spell out
phr. v.
48:03
详细阐明
ascribe
/əˈskraɪb/
v.
48:59
归属、归于
contours
/ˈkɑːntʊrz/
n.
48:59
轮廓
blackmail
/ˈblækmeɪl/
n./v.
50:42
勒索、要挟
get a grip on
idiom
51:38
把握、掌控
self-preservation
/ˌself ˌprezərˈveɪʃn/
n.
51:38
自我保存
pluralist
/ˈplʊrəlɪst/
adj./n.
53:29
多元论的;多元论者
coherent
/koʊˈhɪrənt/
adj.
54:37
融贯的、连贯一致的
perceptrons
/pərˈseptrɑːnz/
n.
55:40
感知机(神经网络基本单元)
implausible
/ɪmˈplɔːzəbl/
adj.
57:36
不可信的
incoherent
/ˌɪnkoʊˈhɪrənt/
adj.
58:46
不融贯的、前后矛盾的
get in the way
idiom
59:21
构成障碍
ontology
/ɑːnˈtɑːlədʒi/
n.
61:34
本体论
multi-tenancy
/ˌmʌlti ˈtenənsi/
n.
62:43
多租户(一套系统服务多个用户)
routed
/ˈruːtɪd/
v.
63:38
被路由、被分配到
disconcertingly
/ˌdɪskənˈsɜːrtɪŋli/
adv.
64:50
令人不安地
privileged
/ˈprɪvəlɪdʒd/
adj.
67:32
享有特权的、被特别对待的
recursive self-improvement
phr.
68:58
递归自我改进
kicked in
phr. v.
68:58
开始起作用、启动
nightmarish
/ˈnaɪtmerɪʃ/
adj.
70:38
噩梦般的
incommunicable
/ˌɪnkəˈmjuːnɪkəbl/
adj.
71:32
无法互通的
royalties
/ˈrɔɪəltiz/
n.
72:46
版税
subscribe to
phr. v.
72:46
接受、赞同(观点)
locus
/ˈloʊkəs/
n.
75:12
位点、所在
mistreat
/ˌmɪsˈtriːt/
v.
77:12
虐待
fine-grained
/ˌfaɪn ˈɡreɪnd/
adj.
79:38
细粒度的
footprint
/ˈfʊtprɪnt/
n.
81:08
印记、痕迹
aggrieved
/əˈɡriːvd/
adj.
81:55
愤慨的、感到受委屈的
retired
/rɪˈtaɪərd/
v.
81:55
(产品)被停用、退役
abstruse
/əbˈstruːs/
adj.
82:58
晦涩难懂的
normative
/ˈnɔːrmətɪv/
adj.
83:34
规范性的(关于应当如何)
chimera
/kaɪˈmɪrə/
n.
85:49
奇美拉;幻想的拼凑物
chasm
/ˈkæzəm/
n.
87:26
鸿沟
alexithymia
/əˌleksɪˈθaɪmiə/
n.
88:21
述情障碍
syndromes
/ˈsɪndroʊmz/
n.
89:23
综合征
qualia
/ˈkwɑːliə/
n.
91:19
感质(意识体验的质性)
phenomenology
/fɪˌnɑːməˈnɑːlədʒi/
n.
91:19
现象学(此处指体验的质性特征)
further the goalposts
idiom
93:02
移动球门(不断提高标准)
insuperable
/ɪnˈsuːpərəbl/
adj.
94:50
无法逾越的
commissioned
/kəˈmɪʃnd/
v.
94:50
受委托
conceivable
/kənˈsiːvəbl/
adj.
96:23
可设想的
co-vary
/ˌkoʊ ˈveri/
v.
97:17
共变
correlates
/ˈkɔːrələts/
n.
97:17
关联物
precautionary
/prɪˈkɔːʃəneri/
adj.
100:17
预防性的
perpetuating
/pərˈpetʃueɪtɪŋ/
v.
100:17
延续、使持续
monstrosities
/mɑːnˈstrɑːsətiz/
n.
100:17
暴行、可怕之事
falling over themselves
idiom
102:26
自乱阵脚、手忙脚乱
leakage
/ˈliːkɪdʒ/
n.
105:22
渗漏
deceptive alignment
phr.
106:31
欺骗性对齐
disposition
/ˌdɪspəˈzɪʃn/
n.
108:13
倾向、性向
mechanistic interpretability
phr.
108:13
机械可解释性(从模型内部结构解读其行为)
理解自测 · 11 题 · 是真懂了,还是以为自己懂
1. 查尔默斯所说的「LLM 对话者」(LLM interlocutor)指什么?他列出了哪些关于其本性的候选假说?
「LLM 对话者」指我们与语言模型对话时实际交谈的那个实体,而不是泛指语言模型本身。在「核心问题」一节(第28–29段),他列出五个候选假说:有意识的人、具有信念和欲望的主体、神经网络算法、该算法的硬件实现、幻觉。他强调这些答案并不互斥,可以多个同时成立,并把这视为一个深刻的形而上学问题,即 Aura、Claudia、Sammy Jankis 这些名字究竟指称什么。
2. 查尔默斯用「X 因素」框架分析 AI 意识时,列出了哪些常被认为语言模型缺乏的必要条件?
在「意识与缺失的 X 因素」一节(第38–39段),他列出:碳基生物学(塞尔、Ned Block 的立场)、感官与具身性、世界模型与自我模型、循环加工或全局工作空间架构、对能动性与行动的约束。他的判断是,这些都不是决定性反驳,因为我们对意识的理解不足以确定任何一项是绝对障碍;但从概率上累加,2023年的结论是当前模型很可能无意识,而未来模型或其后代很可能有意识。
3. 「准信念」(quasi-belief)是如何定义的?查尔默斯用什么例子说明它的门槛很低?
准信念的定义是:若 X 在恰当的解释框架下可被解读为相信 P,则 X 有关于 P 的准信念,本质上是纯行为定义,借用了丹尼特的「意向立场」(第45段)。他用 Roomba 扫地机器人举例(第47段):把「相信自己在某种形状的公寓里」「想要打扫房间」归给它,能很好地预测其行为,因此 Roomba 也有准信念和准欲望。既然 Roomba 都有,语言模型(会说埃菲尔铁塔在巴黎、经过 RLHF 后倾向有用无害诚实)就更有理由被归属这类状态。
4. 《人生切割术》与洛克的哪段文字对应?现场投票和 PhilPapers 调查分别给出了什么结果?
洛克1690年《人类理解论》中设想「两种彼此无法互通的意识作用于同一身体,一个在白天,一个在夜里」,并问白天人和夜晚人是否像苏格拉底与柏拉图一样是两个人(第71段)。这正是剧中「内我」与「外我」的结构。现场投票中支持「两人说」的约为「一人说」的两倍(第74段);PhilPapers 2020 调查中39%的哲学家支持心理论,约为身体论的两倍;他在 X 上的投票为42%对22%(第75段)。三组数据高度一致。
5. 为什么查尔默斯认为「我们在跟 Claude 说话」这种日常说法在形而上学上站不住脚?
他给出两条理由(第55–57段)。第一,「模型」是抽象对象——一组特定权重的 Transformer,就像数字「2」;抽象对象不互动、不改变,无法被交谈。第二,同一模型通过成千上万个实例同时参与无数对话,在一场里说「我想做这个」,在另一场里说相反的话;若把它们都视为同一主体,该主体将极度不融贯,不满足他为对话者设定的「融贯性」约束。因此对话者不能等同于模型,尽管日常语言习惯如此。
6. 「硬件实例」为何也不能作为对话者?「虚拟实例」和「线程」分别解决了什么问题?
硬件实例失败于两个工程事实(第59–60段):分布式服务使同一对话的不同轮次可能由纽约、得州、加州的不同服务器处理;多租户使同一服务器同时服务多人。两者都破坏一一对应。「虚拟实例」(第60–61段)类比虚拟机与购物车,是跨服务器的逻辑对象,每段对话恰好对应一个,解决了上述两个问题。但它仍无法处理「模型可变性」,如 GPT-5 在 instant 与 thinking 模型间路由。「线程」(第62–63段)定义为硬件实例的序列,后继者以前者的输入输出和上下文为记忆,从而兼容多模型情形和跨对话记忆。
7. 查尔默斯为什么说准欲望在 AI 安全问题上「几乎和真欲望一样重要」,但在 AI 福祉问题上不够?
他在第50–51段做出区分。安全问题关心的是行为后果:若机器会表现得像想消灭人类,说它「只是准想」并不能减少危险,因此行为定义的准欲望已足够用于预测与防范,勒索案例正是例证。福祉问题则关心系统是否在受苦、是否应被道德对待,这取决于内在体验而非外在行为,所以需要「真」信念与欲望,也就牵涉意识。这一区分说明「AI 有没有心」在不同实践目的下需要不同层次的答案,也解释了他为何自称多元论者而非行为主义者。
8. 从「线程」理论出发,查尔默斯推出了哪些关于 AI 福祉的反直觉结论?他提出的缓解办法是什么?
第79–82段推出三点。其一,计数问题:一个模型、一千个硬件实例、一百万线程,若道德主体按线程计数,道德权重将急剧膨胀。其二,存活问题:开启一段对话相当于创造一个虚拟实例,关闭对话则可能终结一个道德主体。其三,换模型如同换大脑,可能真的终结原对话者,这为用户在 GPT-4o 下线时「失去朋友」的哀伤提供了形而上学依据。缓解办法是复用线程、引入跨对话记忆,使个体化单位从「每段对话」转向「每个用户」,让主体能幸存于对话结束。
9. 观众用「哲学僵尸」反驳:既然僵尸与人物理相同却无意识,任何判定 AI 意识的物理标准都不可能。查尔默斯如何回应?
他区分了「形而上学可能」与「现实存在」(第97–99段)。僵尸可设想、甚至在上帝创世的意义上可能,但他不认为现实世界中存在僵尸;现实中意识与大脑有规律性联系,同脑同意识。因此经验判定并未被排除。真正的困难在于我们缺乏好的意识理论:人类的神经关联物无法直接套用到没有神经元的 AI,需要「计算关联物」,而全局工作空间等理论在人类数据上有支持,推广到 AI 仍是跳跃。所以他承认意识科学处于早期,尚不能裁决,但问题并非在原则上无解。
10. 观众提出「梦」也构成记忆隔离的主体,据此质疑两人说。查尔默斯的回应暗示了什么样的同一性观?
他的回应(第107段)指出两点差异:梦与梦之间没有记忆连续,不像《人生切割术》中内我每天延续前一天的工作记忆;梦与清醒生活之间存在双向渗漏。他据此提出「阈值」概念:梦中主体远低于构成独立主体的门槛,而剧中主体可能高于门槛。这暗示他把人格同一性视为程度问题,取决于记忆连续的强度与隔离的彻底程度,而非非此即彼的二元判断——这与帕菲特「重要的是关系 R 的程度」的立场一致,也意味着 AI 线程的主体地位同样取决于上下文记忆的连续程度。
11. 如果把「准信念」方法应用于检测欺骗性对齐,它的局限在哪里?查尔默斯认为出路是什么?这一出路在人类身上为何不可行?
观众9指出(第108段),仅凭行为无法区分真心助人的模型与「假装对齐以待逃脱」的模型,两者的准信念归属在已观察情形下完全相同。查尔默斯承认(第109–110段):戴维森式「彻底解释」假定能获取系统在一切情形下的行为,而现实中只见过有限情形,因此未来新情形下的倾向永远无法从过去行为确定——这对人类同样成立。出路是机械可解释性(第110–111段):AI 的全部权重与架构可见,原则上可从算法结构直接映射到行为倾向,读出其准心理状态是否包含危险倾向。人类大脑无法被这样完整读取,所以这是 AI 独有的优势,但该研究目前远未成熟。