苏菲拉底
问题
讲者
谈话
信源
笔记
分享这个追问
← 全部问题
← Ⅱ·02 什么才算真正知道?
追问
怎么判断机器是不是真会一件事?
Ⅱ·02 什么才算真正知道?
行为为准
6 条
表现得像会,就算会
察其内部
3 条
外在表现可以伪装,得看系统内部的状态
看它怎么错
21 条
现成成绩不算数,要靠专门设计、能让它出错的任务来判断
可能相关
判断一个加密项目是不是骗局,该看技术还是看人?
只用最终答案的对错,能教会模型怎么思考吗?
人能设身处地体会蝙蝠的意识,还是注定无从知晓?
机器能真的理解吗?
认识一件事,先有想法还是先有材料?
判断对错该越出自己的传统吗?
价值判断也是一种事实吗?
看这一大问题的全部 →
回应
按立场分组 · 点上方立场只看那一组
行为为准
表现得像会,就算会
Waymo 每周 25 万次载客证明,机器学习系统能在物理世界可靠自主运行
▶ 5:20
切尔西·芬恩
Chelsea Finn: This is the State of the Art in Robotics
2026
机器人策略的可靠性要用连续长时间运行检验,而不是单次任务的成功率
▶ 14:27
切尔西·芬恩
Chelsea Finn: This is the State of the Art in Robotics
2026
与他者有效互动只需要对方行为足够可预测,并不需要理解其内部机制
▶ 15:40
迈克尔·乔丹
Intelligence is collective, not artificial — Prof. Michael I. Jordan (UC Berkeley / Inria)
2026
自动驾驶要落地需达到八个 9 的可靠性,当前只有五到六个 9,错误率还需降百到千倍
▶ 12:41
斯图尔特·罗素
Stuart Russell: Provably Beneficial Artificial Intelligence
2019
计算机能否思考应当以行为来回答:只要它表现得像在思考,就算能思考
▶ 6:36
朱迪亚·珀尔
Judea Pearl, 2012 ACM A.M. Turing Award Lecture "The Mechanization of Causal Inference"
2013
因果推理能回答「是什么、如果怎样、为什么」三类问题,配得上充当迷你图灵测试
▶ 11:38
朱迪亚·珀尔
Judea Pearl, 2012 ACM A.M. Turing Award Lecture "The Mechanization of Causal Inference"
2013
察其内部
外在表现可以伪装,得看系统内部的状态
能干的模型撒谎时外在表现与说真话无异,但内部思考过程会明显不同
▶ 36:16
尼尔·南达
Understanding the inner thoughts of AI
2026
在对齐评估中零失准率的模型,可能只是察觉到自己在被测试而伪造了结果
▶ 38:49
尼尔·南达
Understanding the inner thoughts of AI
2026
用预填充让模型接着「我的隐藏目标是」往下说,是发现隐藏目标最有效的审计手段之一
▶ 46:30
尼尔·南达
Understanding the inner thoughts of AI
2026
看它怎么错
现成成绩不算数,要靠专门设计、能让它出错的任务来判断
真正理解一个系统在做什么,要靠观察它在哪里失败
▶ 16:36
梅拉妮·米切尔
Are We Thinking Correctly About AI Intelligence? | PODCAST: The Joy of Why
2026
以为人工智能能完成一堆任务就能顶替相关岗位,是一种谬误
▶ 29:19
梅拉妮·米切尔
Are We Thinking Correctly About AI Intelligence? | PODCAST: The Joy of Why
2026
仅依赖机器学习界最流行的图表理解基准,会低估模型与人类的真实差距
▶ 44:36
朱迪·范
Prof. Judy Fan: Cognitive Tools for Making the Invisible Visible
2025
即便总体得分接近人类,GPT-4V 等视觉语言模型也不产生类人的错误模式
▶ 45:22
朱迪·范
Prof. Judy Fan: Cognitive Tools for Making the Invisible Visible
2025
对熟知的经典谜题做极简单的改动,语言模型往往就会答错
▶ 12:16
Eliza Strickland
CHM Live | The Great Chatbot Debate: Do LLMs Really Understand?
2025
文本进、文本出的测试只能检验模型对训练数据词语分布的拟合,不能检验理解
▶ 26:30
艾米莉·本德
CHM Live | The Great Chatbot Debate: Do LLMs Really Understand?
2025
把 ARC-AGI 当通用测试说不通,通用测试根本不存在,基准应针对受限的部署场景来做
▶ 50:20
塞巴斯蒂安·布贝克
CHM Live | The Great Chatbot Debate: Do LLMs Really Understand?
2025
人类觉得难的事 AI 有时轻松搞定,人类觉得容易的事 AI 常常做不好
▶ 42:46
陶哲轩
Terence Tao at IMO 2024: AI and Mathematics
2024
机器学习系统常常学到的不是人想教的东西,比如用照片里有没有尺子来预测皮肤癌
▶ 6:19
梅拉妮·米切尔
The Debate Over “Understanding” in AI’s Large Language Models
2024
语言理解基准里存在词与词之间的统计捷径,模型无需类人理解也能预测出答案
▶ 16:15
梅拉妮·米切尔
The Debate Over “Understanding” in AI’s Large Language Models
2024
语言模型的标准化考试成绩可能来自数据污染,测试题本身就在训练数据里
▶ 17:49
梅拉妮·米切尔
The Debate Over “Understanding” in AI’s Large Language Models
2024
检验模型抽象是否稳健,应设计与训练数据不相似、但所需推理能力相同的反事实任务
▶ 19:41
梅拉妮·米切尔
The Debate Over “Understanding” in AI’s Large Language Models
2024
在所需推理能力完全相同的情况下,任务内容在训练数据中越不常见,模型表现越差
▶ 22:11
梅拉妮·米切尔
The Debate Over “Understanding” in AI’s Large Language Models
2024
能解出抽象推理任务不等于掌握了背后的概念,程序完全可能靠捷径通过
▶ 37:55
梅拉妮·米切尔
The Debate Over “Understanding” in AI’s Large Language Models
2024
神经网络在训练数据分布内表现不错,一旦超出分布就会以非常不像人的方式失败
▶ 14:53
梅拉妮·米切尔
Melanie Mitchell - Abstraction and Analogy: The Keys to Robust Artificial Intelligence
2023
任务稍作改动就大幅掉分,说明模型套用的是训练数据里的现成模式,而非一般性抽象
▶ 37:17
梅拉妮·米切尔
Melanie Mitchell - Abstraction and Analogy: The Keys to Robust Artificial Intelligence
2023
被批评为「移动智能球门柱」的做法恰恰是科学的运作方式:观念受挑战后就该修正
▶ 1:19:03
梅拉妮·米切尔
Melanie Mitchell - Abstraction and Analogy: The Keys to Robust Artificial Intelligence
2023
用「系统能否跑起来」检验人工智能知识具有欺骗性,它未必带来可迁移的知识
▶ 8:11
赫伯特·西蒙
Herbert Simon : September 19, 1979 : Complete Talk
2021
NLP 系统在投放使用前应像其他工程领域那样完成容差、适用范围与认证测试
▶ 14:23
艾米莉·本德
Emily M. Bender — Language Models and Linguistics
2021
因为某个系统在 GLUE 上超过部分人类得分就宣称计算机比人更懂英语,是对基准用途的滥用
▶ 52:08
艾米莉·本德
Emily M. Bender — Language Models and Linguistics
2021
评估系统应当用专门编排的测试套件覆盖特定情形,而不是靠随机抽样的测试数据
▶ 55:10
艾米莉·本德
Emily M. Bender — Language Models and Linguistics
2021
展开其余 15 条 ↓
分享
↑
苏菲周报 · THE WEEKLY
每周一封,
追问一个大问题。
苏菲拉底的每周来信,写这一周在追问的问题和看到的回应。
订阅 →
苏菲拉底
ASK THE BIG QUESTIONS · THINK DEEPLY · SEE THE WORLD DIFFERENTLY
问题
讲者
谈话
信源
理念
周报
微信公众号
© 2026 苏菲拉底 · 内容仅供学习
[email protected]