编者按:2018年,哈佛大学计算机科学教授辛西娅·德沃克(Cynthia Dwork)应邀在微软研究院作人工智能杰出讲座,题为《算法公平的新兴理论》。德沃克是差分隐私的奠基者之一,此番讲的是她自2010年起在微软硅谷实验室开启的另一条研究线:怎样用数学语言定义并保证算法的公平。讲座之后,现场听众与她就度量的来源、随机性、因果推断、自动驾驶等问题展开了长时间的辩论。本文依据现场录音编译整理。
主持人:欢迎各位。今天下午我很高兴为大家介绍人工智能杰出讲座的讲者辛西娅·德沃克,在座很多人都认识她。辛西娅是我接触过的最有成就的技术女性之一。她有四个响亮的头衔:现在是哈佛大学计算机科学系的戈登·麦凯教授,同时是拉德克利夫高等研究院的校友教授,还是哈佛法学院的兼职教员。除此之外,她也是微软研究院的杰出科学家,大约十多年前,她就是首批杰出科学家之一。
主持人:辛西娅在康奈尔大学师从约翰·霍普克罗夫特(John Hopcroft)取得博士学位,随后在麻省理工学院跟随南希·林奇(Nancy Lynch)做了两年博士后,之后在IBM阿尔马登研究中心工作了相当长的时间,做了许多奠基性的工作。坦白说,直到今天早些时候我才了解到其中不少内容,比如她在排序聚合(rank aggregation)上的工作,那对网页搜索非常重要。她还在密码学基础和工作量证明(proof of work)上有建树,后者是比特币的底层基础之一。在微软研究院,她以另外两条工作线闻名。一条是差分隐私(differential privacy),把隐私放到了坚实的理论基础上,这在今天无比重要。今天下午她要讲的,是更年轻的一条线:算法公平。
主持人:这些工作和她毕生的成就赢得了许多奖项,多到我数不过来,还有开头提到的那些头衔。她当然是美国计算机协会会士,获得过迪杰斯特拉奖,十多年前就得了哥德尔奖。她是极少数同时当选美国国家科学院和国家工程院院士的人。她是一位极有深度的科学家,而且总是挑选真正有实际影响的问题,我认为这是一种非常罕见的本事。下面请辛西娅给我们讲讲她在算法公平方面的工作。
德沃克:非常感谢这番慷慨的介绍,也感谢邀请,我很高兴来到这里。开讲之前我想先问几个问题。在座有多少人从事机器学习和人工智能?好。有多少人专门做过公平问题?好的。理论计算机科学家呢?很好,这样我就知道该讲些什么了。这项研究实际上始于微软如今已经关闭的硅谷实验室,大约在2010年。我要说明,今天所有做得好的幻灯片都出自我的学生克里斯蒂娜·伊尔文托(Christina Ilvento)之手。
德沃克:我们的问题是这样的。我们关心算法公平,稍后会讲得更具体。我们面对一个人群,这个人群在许多维度上是多样的:族裔、宗教、地域、健康状况等等。不管我们要做什么,都想确保自己在某种意义上是公平的。典型的例子是这样:一家银行在向你展示网页之前,先拿到了关于你的详细信息。你浏览到某家银行的网站,在他们给你看任何东西之前,他们先去咨询追踪网络,把你的底细摸清楚。《华尔街日报》2010年做过一个系列报道,叫《他们知道什么》,主要谈的是隐私,但也提出了下面这个公平方面的担忧:把少数族裔引向条件较差的信用卡产品,这是违法的。金融业受到的监管比许多其他行业严格得多,所以这个问题不只是「公平问题」,它实实在在是个法律问题。
德沃克:先把几个显而易见的想法处理掉。一个建议自然是对分类器隐藏敏感信息,也就是不让它知道你是不是少数群体成员。这个办法会栽在几件事上。首先是划红线(redlining)。谁知道这个词?很好,等下我们会看到一张图。在网上,对应的说法叫网络划线(weblining)。简单说,就是拿邮政编码来充当种族的冗余编码。依据种族歧视是违法的,依据邮政编码歧视却不违法。我们现在普遍面临这种冗余编码的问题:敏感属性可以像全息图一样嵌在你的其他属性里。
德沃克:另一个是「物以类聚」现象。有人见过这张图吗?这是麻省理工学院一门课上的本科生研究项目,算不上完整的研究,但学生们发现的大致是这样:如果你是男性,而你在脸书上大约百分之五的朋友自称是同性恋者,那你很可能也是。你自己可能选择不公开这一点,但根据「物以类聚」的规律,从你朋友的属性就能推断出来。所以,隐藏敏感属性这条路有点悬。
德沃克:隐藏敏感信息还有另一个问题:在某种意义上,了解文化背景的算法比一无所知的算法更准确。一个懂得文化差异的算法能够很好地利用敏感信息来提高准确度。这里我先介绍一下这次讲座要用的两个人群。我们大多数人都喜欢吃东西。有些人喜欢用鼠尾草(sage)调味,其余的人喜欢用百里香(thyme)。所以我的两个群体就是吃百里香的人和吃鼠尾草的人,一般来说吃鼠尾草的是少数群体,但不是每个例子都需要这一点。我把它们记作S和T。假设在吃鼠尾草的人当中,「听见声音」是很常见的宗教体验,而在吃百里香的人当中,这是精神分裂症的一条诊断标准。这是一个真实的医学例子。那么,知道一个人吃鼠尾草还是百里香,就能做出更好、更准确的分类。
德沃克:大家都知道,机器学习是在历史数据上训练的。历史数据往往带有偏见,所以不能简单地说「在数据上训练就行」,那样我们会把偏见连同训练数据的乳汁一起喝下去。这就带来一个非常重要的问题:对于我们想做的事情,一般来说并不存在什么通用的真相来源。我们必须在牢记这一点的前提下,想办法尽可能地提取公平,不能只去翻训练数据。
德沃克:有谁知道这是什么画?这是西斯廷礼拜堂里米开朗基罗的《最后的审判》。耶稣在中间,他左手边的人被打入地狱,右手边的人升入天堂。这是一个二元分类的场景。也可以有三元分类的场景。这里是几张脑组织切片,左边是癌变组织,右边是健康组织,中间那些细胞并非癌细胞,但也不正常,它们受到了肿瘤的影响。对这类情况,我们可能需要三元的、更复杂的分类体系。
德沃克:还有另一种分类问题,我称之为依存分类问题。比方说你在招人,你的任务不只是把合格的人和不合格的人分开,甚至不只是在合格者中间分出等级。你的问题更复杂:也许有几百个合格乃至非常合格的人,但你只想面试其中十个,毕竟资源有限。你想公平地挑出一批人来面试。这是一个分类问题,但你不能只是逐个判断每个人够不够格面试,你必须以某种方式加上约束。
德沃克:再一类分类问题是打分。这是一套评估被捕未成年人的表格,用来判定应当拘留还是释放。这是一个计分系统。你能看到,本次所犯的各类罪行各有分值,先前的犯罪记录另有分值,还有从减轻情节得来的负分。这些分数再被换算成一个二元决定:释放还是拘留。取决于你采用哪种定义,打分上的公平可能导致、也可能不导致决定上的公平。到现在为止,我还什么都没定义。
德沃克:我们想要一套数学上严格的算法公平理论。历史上,把这类宏大目标转化为一个能通向可行成果的研究纲领,是有章可循的。这个基本范式的第一项是定义:你到底想做什么?对我们来说,就是「公平」指的是什么。定义公平的一种办法,是去想你想要防止什么。按照密码学的好传统,我们设想一个对手,这个对手试图制造不公平,而你要防御它。那么,对手可能有哪些行为或目标是你想防住的?据此,你就定义了公平。
德沃克:有了定义之后,你要构造算法,并且要求算法能够强制执行你定义的那个东西。也就是说,有了公平的定义,我们就要构造一个按该定义是公平的分类算法。最后,我们需要一个组合定理(composition theorem)。想想那些给人分类的系统。比方说你在判断某个人适合看这条广告还是那条广告,你不会只给他分类一次,而是一遍又一遍地分类,针对各种各样的广告,在一天中的各个时段。同样,做隐私保护的数据分析时,没有人只要一个隐私保护的统计量,人们要的是一大堆统计量。密码学里也一样,你不会只看到一条消息或一个数字签名,而是海量消息的签名和加密。所以你需要证明某种定理,说明这些东西在实践中如何组合,这就是组合定理。在这里,我们想要的是:如果一个系统由公平的部件搭成,那么整个系统在某种意义上也是公平的。
德沃克:这个通用范式在密码学和隐私领域尤其成功。能把它用到公平上吗?简短的回答是:我想大概可以,但依我的经验,这比另外两个领域难得多。定义公平非常非常困难,也非常非常有争议。我不相信技术社群能拿出一个单一的定义,让整个社会都说「对,就是它」。我不认为那会发生。构造算法是我们的看家本领,只要有了定义就行。这方面已经有很多工作,有些是最近的,令人兴奋,我会讲一点。组合则被证明非常棘手,我们也会看到一点。
德沃克:先谈定义公平。我说过,我们的思路是考虑对手想干什么。以数字签名方案为例,你想从中得到什么?大家会立刻给出同一个答案:任何人都不能伪造。然后你得深入细节,把「任何人都不能伪造」里的各种量词都弄准确,但归根到底,伪造就是你要防的东西。那我们这里要防的是什么?
德沃克:我们最初的一个场景是广告。广告主可能有偏见,我们想搭建一个平台来抵消广告主的偏见,做到公平。所以我们真的就是坐下来问:一个居心叵测的恶意广告主可能干出哪些事?划红线我们已经谈过了,它是真实存在的。在贷款上划红线绝对是真的,比如美国的住房贷款。有一本很棒的书推荐大家读,理查德·罗斯坦(Richard Rothstein)的《法律的颜色》,讲的是美国政府在这些偏见中扮演的角色。
德沃克:还有反向象征主义(reverse tokenism)。比方说你拒绝了我的贷款,我说「你拒绝我是因为我是卷发」,他们就指着谢尔盖说:「他显然比你强得多,他是直发,我们也拒绝了他。」问题在于,他们拿他一个人当所有卷发人的挡箭牌。这就是反向象征主义。再有一种,我称之为故意瞄准吃鼠尾草人群中错误的那一部分,这个例子我放到后面一两张幻灯片再讲。
德沃克:总之我们就是坐下来,写出一大堆想要防止的恶行。这是个合理的办法吗?我不知道有别的办法。而且这种办法有个好处:假设你造了一个系统,能防住我们列出的所有这些行为,很好。然后有人跑来说「你漏了一条」,你说「太好了」,重新设计系统,把新的一条也防住。与此同时,前面那些行为你一直是防着的,所以总比什么都不做要强。
德沃克:多数人按我刚才的引入方式去想公平,会立刻想到群体,事实上我的引入方式也在暗示这一点。那么什么是群体公平?群体公平性质基本上是对不同群体待遇的统计要求。统计均等(statistical parity),又叫人口均等(demographic parity),说的是:假设我们只做正负二元分类,那么被判为正的人群的人口构成应该与总体人口的构成相同。也就是说,吃鼠尾草的人和吃百里香的人被判为正的比例,与他们在总人口中的比例一致,被判为负的情况也一样。
德沃克:这很好。但它什么时候真正有意义?我们会看到,它主要是在被违反时才有意义。如果你看到统计均等被严重偏离,那是一面红旗。这不一定意味着事情不公平,但绝对是一个值得去追问「为什么会这样」的地方。所以它在被违反时有意义,可它允许我们所说的瞄准S的错误子集。我开了一家水疗馆,很豪华,我实在不想让那些吃鼠尾草的人来,可我又必须按他们在总人口中的比例向他们投放广告。那我怎么办?怎么偏心?我就向S里那些付不起钱的人投放广告。我故意瞄准来不了的那些人,从而确保我的水疗馆不会多出吃鼠尾草的新客户。而在吃百里香的人里,我向富人投广告,他们来得了。所以人口均等,哎呀,是不够的,你得看得仔细得多。
德沃克:还有交叉群体的问题,由此引出一个说法很生动的概念:公平的选区操纵(fairness gerrymandering)。我们有一群人,我把他们分成吃鼠尾草的和吃百里香的,可他们同时也分成喝茶的和喝咖啡的。我们真正想要的,也许是看四个交叉类别时,每一类都有按比例的代表。如果我们只把广告给吃鼠尾草又喝咖啡的人看,那是非常不公平的。你可以把真实的人口群体代入进去,看看哪些情况下你明确想要这种交叉的均等。统计均等本身并不能防止这种选区操纵。
德沃克:统计均等是群体公平的一种定义,还有别的定义。然后我们不得不面对一个事实:有些群体公平性质是互不相容的。多少人知道这个故事?不少人知道,但大多数人不知道。假设我有一个分类器,我们在给人分类并做预测:我们认为你会再犯罪,或者我们认为你不会。这里的关键是,有些信息注定缺失,比如未来还没有发生,一个人出狱后会不会再犯,可能取决于他出狱之后经历的许多事情。
德沃克:你可能合理地希望,各个人口群体的假阳性率(false positive rate)相等。另一个愿望可能是各群体的假阴性率(false negative rate)相等。你也可能希望阳性预测值(positive predictive value)相等,也就是在被预测会再犯的人当中,实际再犯的比例。我选这三个不是因为只有这三个,而是因为它们非常有名:已知任何不完美的分类器,都不可能同时保证各群体假阳性率相等、假阴性率相等、阳性预测值相等,除非各群体的基础率(base rate)相同,也就是各群体的再犯率相同。
德沃克:舒尔德乔娃(Chouldechova)在她的论文里指出,原因在于这几个量由这样一个等式联系在一起。我们可以为吃鼠尾草的人写下假阳性率、假阴性率和阳性预测值,它们满足这个等式,其中P是这一群体的基础率。再为吃百里香的人写下同样的等式。要求两个群体假阳性率相等,意味着这一项在两个等式里必须相同,于是这些蓝色的项必须相同,那个蓝色的项也必须相同,唯一可能的情况就是基础率P在两个群体里相同。
德沃克:当未来未知、分类因而不完美时,没有任何算法能同时满足这三条非常自然的要求,除非基础率相同。这跟算法怎么实现毫无关系。不管你相信自由意志还是随机性,无论算法是机器还是别的什么形式,结论都一样。所以,说「我们把人放进环节里来解决这个问题」是讲不通的。你放进去的人谁也解决不了这个问题。这就是数学。你们大概听得出来,我对群体公平的概念不满意,理由有好几条,我正在跟大家分享其中一些。
德沃克:这就引到一段非常有名的视频。多少人看过?不是所有人,好,连一半都不到。这是一个卷尾猴实验,猴子两两配对。猴子要完成的任务是把一块石头递给你,然后得到奖励。我们来看。
德沃克:(视频画外音)她把石头递给我们,这就是任务。我们给她一片黄瓜,她吃了。另一只也得递石头给我们,她照做了,她得到一颗葡萄。第一只看见了,现在她再递石头过来,得到的还是黄瓜。
德沃克:这就引出我更偏爱的概念:个体公平(individual fairness)。直观地说,个体公平是指:对于给定的分类任务,如果两个人就这项任务而言是相似的,那么他们应当得到相似的对待。要让这句话有意义,我们需要一个恰当的「相似」或「不相似」的概念,也就是某种距离概念。一个经典的例子是信用评分,信用分之差就直接给出了一个度量(metric),衡量两个人在信用可靠性上被认为有多么不同。
德沃克:当然,我必须再次强调,这是一个针对具体任务的概念。谢尔盖和我在贷款资格上可能确实相当,但在推荐护发产品上就完全不同。我们在一个目的上相似,在另一个目的上截然不同。所以谈这些度量时,一定要记住它们是针对任务的。
德沃克:再想想信用分。也许人们大体上是从极合格到极不合格均匀铺开的。当你根据某人是否越过一条阈值来决定放不放贷时,可能有两个人挨得非常近,你给了一个贷款,拒绝了另一个。如果分数确实是沿着这条线密密麻麻排着的,那这种事必然发生:你总得在某处画一条线,这是普遍的担忧。于是就会有非常相似的人受到非常不同的对待。理论家说这种情况下该怎么办?随机化。不是对你说「肯定给」、对他说「肯定不给」,而是根据信用状况给每个人分配一个获得贷款的概率,或者说获得A的概率。你要安排得让两个人如果非常相似,他们面对的结果概率分布也非常相似。请讲?
听众:最近有两名警察被解雇了,因为他们抛硬币决定要不要以超速逮捕一个人。他们大概是听过你的课。
德沃克:没有。我要说的是,在某些情形下这可能是对的做法。警察有巨大的自由裁量权,如果他们对相似的人一视同仁,也许没什么不好。
听众:也许不用随机化,可以把贷款额度做成连续的。不设一个固定数额,而是让贷款金额随着信用逐渐降到零。
德沃克:当然可以做那样的事情,我得把所有后果都想一遍。但确实有些情况你必须做出二元决定。
德沃克:我们就把这个当作公平的定义。我们有一个结果集合O,在这里就是「是」或「否」。这是结果上的概率分布。我们要找一个分类器,把我们全体(universe)中的个体映射到结果的概率分布上,并满足以下条件:对于某个衡量两个概率分布差异的恰当尺度,比如总变差距离,我们要求两个分布的差异被两个个体之间的距离所界定。这是一个利普希茨(Lipschitz)约束,用的是针对具体任务的度量下的距离。
德沃克:当然,这马上引出一个问题:度量从哪里来?你怎么把它弄到手?我没有很好的答案,但我也相信,如果我们真的有一个人们认为公平的分类系统,那我们可以从中提取出一个度量。
听众:那怎么确保度量本身是公平的?
德沃克:我刚才说的正是这一点,我们不知道去哪里拿这个度量。我们最初做这项工作时说,它至多是社会在当下的最佳猜测,而这显然是我们需要的东西。我现在越来越明白,这些事情将由政治过程来处理,除了把各方利益相关者和各种测量结合起来,没有别的路能走到某个地方。但是,对于度量从哪里来,我们没有直截了当的数学答案。请讲?
听众:这里是不是有一种张力?「谁来监督监督者」这个论点说,判断我是否冒犯了你的最佳人选是你而不是我。这并不意味着公平规则应当由社会来决定,可那样我们又回到群体公平去了。对个体公平来说,最难啃的骨头在于:度量的来源正是决定所施加的对象。就像那只猴子,是猴子自己判定「这不公平」的。你有没有什么想法,怎么把社会公平和个体公平整合起来,或者把它们妥当地分开?
德沃克:对此我还没有数学上的答案。我现在正在大量投入的,是思考从政治的角度看这个问题的正确方式,我说的不是政治正确,我说的是政治理论和伦理学。但这是一个未知领域,各位来做吧,这真的很有道理,是个重要问题。也许结束时再多问我一些。
听众:我们是做这件事的合适人选吗?
德沃克:不能只靠你们自己,除非你有非常广博的教育背景。立法和监管不可避免地会来。我们必须确保被立法、被监管的东西不是技术上愚蠢的,不是不可行的。我认为出现很糟糕的法律和监管的风险是真实存在的,所以技术人员在帮助避开这种局面上有重要的作用。另外,技术人员多听听这些关切和问题,他们手里有一些工具,能够推动并回应这些关切。所以我们算是合适的人选,但不能只靠我们自己。请讲?
听众:我们怎么知道这个度量是可计算的?比方说,如果大脑是一台通用图灵机,那么从通用图灵机到一个可计算度量的映射,未必存在。
德沃克:你的话我只听清了大约三分之二,你似乎在问「我们怎么知道它是可计算的」,也就是说,我们怎么知道信息是可得的,怎么把能给出度量的信息弄到手?
听众:如果假设大脑是一台通用图灵机,那么一台计算机也就是从通用图灵机映射到一个可计算的度量。
德沃克:我不太确定你想套用的是哪个判定问题,是大脑遇到自身时会不会停机之类的吗?我不清楚。抱歉,也许会后再问我。我要继续了。
德沃克:来谈谈算法。首先,正如我所说,这些是我们熟悉的挑战。在广告场景里,我们设想的情形是我们确实知道个体的全体,我们甚至让广告主有机会对每个个体和每个可能的结果表态:把这个人映射到这个结果有多糟糕?也就是把个体映射到结果o所招致的损失是多少。这只是我们额外加上的一个可选项,让供应商能够参与意见。
德沃克:然后我们把各种成分组装起来:那个科幻般的度量,加上供应商的损失函数。我们要在公平条件的约束下最小化供应商的损失。也就是说,损失函数被当作软约束,理论家的公平条件被当作硬约束。这只是一个线性规划。所以理论上可以求解。而且有一个有趣的观察,它让人联想到基础率不等时「什么做不到」的那些定理:如果你求解这个公平线性规划,所得到的分类器给出统计均等,当且仅当,直观地讲,两个分布是相同的,也就是吃鼠尾草人群上的均匀分布与吃百里香人群上的均匀分布之间的推土机距离(earth mover distance)为零。
德沃克:那项工作假设我们知道整个全体。最近,罗斯布卢姆(Rothblum)和约纳(Yona)展示了如何把这一点稍作放松,他们称之为「大概近似公平」(probably approximately fair),从而获得可泛化性。我们最初的结果是不能泛化的。那是2018年的结果。
德沃克:我提到过近几年有很多进展。比如哈特(Hardt)、普赖斯(Price)和斯雷布罗(Srebro)把假阴性率相等作为公平要求,可选地再加上假阳性率相等,展示了如何把不公平的预测器转化为公平的预测器。这不是个体公平,他们的公平概念是群体公平。我想在座各位会欣赏的一点是,他们全部是在后处理阶段完成的。你们知道,如果想让产品团队用你的工具,最好是不必去干扰他们的流水线,只在开头或末尾加点东西。他们就是这么做的。
德沃克:另一项工作中,约瑟夫(Joseph)、卡恩斯(Kearns)、摩根斯特恩(Morgenstern)和罗斯(Roth)看的是不同的问题。他们研究的是老虎机(bandit)场景。每个人口群体对应一条臂,在我们的例子里是两个群体,但可以更一般。他们担心的是,少数群体可能缺乏训练数据,也就是关于吃鼠尾草的人,你没有多少训练数据。他们的要求是这样的:以贷款为例,每一轮,每个人口群体来一个人,你必须选一个人放贷,或者至多选一个。也许你实际做的是选定一个概率分布,然后从这个分布中抽一个人。要求是:尽管存在不确定性,一个更差的申请人在这些概率上永远不能比更好的申请人更受青睐。他们研究的是如何在最小化遗憾(regret)的同时学到一个公平的策略。他们比较了两种遗憾:强制执行这种公平条件时的遗憾,与不管公平时的遗憾。这种条件在你了解少数群体的过程中是有代价的:一旦你充分了解了少数群体,就可以有把握地预测,但在了解之前不行。他们证明了这里存在一个差距,也就是学习公平策略更昂贵,遗憾更高。有问题?
听众:这里用的是哪种公平?
德沃克:他们在每一轮内部使用个体公平,针对这一轮到场的人。
听众:也就是说选中他们的概率不应当有差别。
德沃克:对,不应当。其实不对,抱歉,是更弱一点的东西:只要求更差的申请人不比更好的申请人更受青睐。是的,抱歉,我记错了,这篇论文用的是这个。那是2016年。2017年是很有意思的一年,两个独立的研究小组开始研究一些类似的问题。这里就进入我前面提到的交叉情形了。第一篇论文就是「选区操纵」这个名称的出处。
德沃克:设想你有几个敏感比特,比如K个:鼠尾草对百里香,咖啡对茶,再加几个。这给出2的K次方个子集。假设所有这些子集都还很大,相对于总人口不算微小,也就是大集合的大交集。他们研究交叉情形,想学一个分类器,来保证若干种公平概念,比如统计均等,或者在这些交叉集合之间让假阳性率或假阴性率相等。我刚才把集合描述为由K个比特定义的所有子集,但你也可以用别的方式描述这个集合族,比如所有能用小电路描述的集合。只要这些集合足够大,他们就想在各群体之间保证这些公平概念。他们还证明了他们所说的公平审计(fairness auditing)的一般问题是困难的:给你一个分类器和这些群体的描述(也许是隐式的),你怎么判断是否存在某个群体、某个交叉群体,受到了你的不公平对待?他们通过从不可知学习(agnostic learning)归约来证明其困难性。他们之所以既能给出算法又有这些否定性结果,是因为大家都知道,机器学习经常在理论上困难的问题上做出有意思的事情。
德沃克:赫伯特-约翰逊(Hébert-Johnson)、金(Kim)、莱因戈尔德(Reingold)和罗斯布卢姆研究了非常相似的问题。等等,我说错了,这一篇是罗斯布卢姆,前一篇是罗斯。他们研究校准(calibration)。假设我的预测器现在给出的是分数,我给每个人打一个零到一之间的数,可以把它理解为我对你再犯概率的预测。如果在被评为v的人当中,最终真正得到正标签的比例接近v,对所有的v都成立,那么系统就是校准的。换句话说,它要求对每个v,被评为v的人平均而言是正确的。他们得到了非常相似的结果,只不过用的是校准版本,把这种正确性当作公平。如果你熟悉克莱因伯格(Kleinberg)、穆莱纳森(Mullainathan)和拉加万(Raghavan)的结果,那里用的就是这种校准概念,或者相关的校准概念。他们论证这比其他群体公平概念更讲得通,除此之外得到的结果非常相似:对预先给定的电路集合C中每个电路所定义的集合,他们同时得到近似校准。迈克尔·金(Michael Kim)和詹姆斯·邹(James Zou)后来用这个方法改进了一些医学预测器,取得了不错的结果。
德沃克:我的讲座还有多长?好,那我再讲一会儿。下一批结果是试图弥合群体公平和个体公平之间鸿沟的算法工作。它假设我们有某种神谕(oracle),我们可以就某些边的集合去问「这些边上的距离是多少」,然后利用这一点做出强有力的事情,而不需要你去问所有的点对。
德沃克:在深度学习社区,有一种完全不同的路子:对抗学习,或者说学习公平表示(fair representations)以及它的对抗版本。这是一个群体公平的概念。哎呀,抱歉,这张幻灯片我跳过去。大致想法是这样:我们从集合X中的实例出发,学习一种新的表示,让它在某种意义上尽可能保留信息,同时压制某些关键属性,比如某人是吃鼠尾草的还是吃百里香的。他们用的是生成对抗网络,所以有一个对手,它试图在给定z的情况下分辨这个z来自吃鼠尾草的x还是吃百里香的x。这个直觉的关键在于:预测器是在表示Z上工作的。对手试图区分两个群体,并且训练了编码器使表示不可区分。如果预测器的能力不超过这个对手A,那么在某种意义上它的预测就不可能带有偏见。这非常非常有意思。它是一种群体公平概念,我很想看到个体公平被融进来,这是另一个很有趣的研究方向。
德沃克:最后五分钟我要讲组合,因为这非常有意思,而且是新的。我们的直觉是:如果一个系统由一堆各自满足个体公平的部件构成,那么把它们放在一起看,整个系统至少也相对公平。答案是:这很复杂。
德沃克:举一个非常简单的例子。假设你在看《纽约时报》网站,页面顶部只有一个横幅广告位。这就是我们的场景。你们知道,为了争夺你的注意力,那里会跑一场拍卖,广告主竞争这个位置。我们看两类广告主:一类推广技术岗位,另一类推广生鲜配送服务。两者在争夺你的注意力。理想情况下,如果我们判断谁适合看技术岗位广告的分类器是公平的,判断谁适合看生鲜广告的分类器也是公平的,那么整个系统多多少少也该是公平的。我们希望在这个复杂系统里仍然做到:对技术岗位资格相近的人,看到技术岗位广告的可能性也相近,生鲜广告也一样。
德沃克:现在假设生鲜广告主总是出价高过技术岗位广告主。这是拍卖,出价高者得。我们甚至可以把它想成出价高的先走。生鲜广告主先走,或者说它出价更高。于是技术公司实际上只能捡剩下的,也就是没被生鲜广告主抓走的那些人。无论是时间上一先一后,还是单纯靠出价决定,结论都一样。这是个大问题。它意味着:不管你对技术岗位广告多么合适,只要你非常适合生鲜配送,你就看不到技术岗位广告。
德沃克:那谁适合生鲜配送服务?新手父母。广告主对可以向新手父母推销的东西垂涎三尺,而这些广告主往往不是招技术岗位的。事实上你可以说,技术岗位广告主本来就应该对「为人父母」这个属性避之唯恐不及。可即便他们非常得体地不看为人父母的状态,那些与他们争夺你注意力的竞争者在看,而这就影响了技术岗位广告主那边发生的事情。这个问题在个体公平和群体公平下都有相应的版本,它不会自行消失。这些内容没时间细讲了。
德沃克:不过这里有一条出路,我提一下:我们可以在广告任务上固定一个概率分布,任何我们想要的分布都行,然后按这个分布抽一个任务,只为选中的任务运行分类器。证明这给出个体公平非常简单。但它把钱留在了桌上,因为有些人我们就是不会向他们展示广告了。这为对算法与经济学交叉感兴趣的人提出了许多非常有意思的经济学问题。因为时间关系,其余的我跳过。
德沃克:最后几点评论。首先是可解释性与因果性。关于公平的可解释性和因果性都有大量文献。这张幻灯片为什么是空的?首先,我非常努力地想在可解释性上取得进展,但失败了。我不理解人们在要求什么,以及它如何能够实现。扎卡里·利普顿(Zachary Lipton)有一篇很有意思的文章,《可解释性的神话》,他解释并归纳了人们可能想要的种种东西,以及各自的问题。文章写得非常深思熟虑,我对此还没想完,但我在这个问题上卡住了。
德沃克:至于因果性,我能看到它在好几个方面成问题。首先,如果你用的是珀尔(Pearl)的因果推理理论,你需要一个生成模型。你也许熟悉那句话:所有模型都是错的,但有些模型有用。如果你的公平定义把分类器和模型绑在一起,需要两者一起才能判定某件事是否公平,而你的模型是错的,那你很可能得出错误的结论。这是我在因果性上遇到的一些困难的一瞥。
德沃克:再简短谈一点。我们谈了度量,谈了度量从哪里来的问题,但问题还不止于此。假设有一家新闻机构,叫「好新闻」。这家机构有一个环境,环境里有随机性;有一个个体x,x身上也有随机性。你可以谈论(尽管无法真正拿到)这个个体x在「好新闻」获得成功的概率。一旦你为这两处随机性指定了硬币,这个概率就是良定义的。你拿不到它,但至少它在数学上说得通。你可能会要求:如果两个人相似,意思是他们成功的概率相近,而成功可以定义得很清楚,比如在公司待满至少三年并且期间至少晋升一次,那么这两个同等可能成功的人,被录用的概率也应当非常相近。这似乎讲得通,于是度量捕捉的就是成功的概率。
德沃克:可是,如果这家不是「好新闻」,而是「坏新闻」,它素来对吃鼠尾草的人极不友好,吃鼠尾草的人无论多有才华都不可能成功,或者要经历真正艰苦的攀爬,那会怎样?度量究竟应当捕捉人们是否同等可能成功,还是应当捕捉他们是否同等有才华?这里正确的做法是什么?并不清楚。
德沃克:最后几句话。真相难以捉摸,而且用计算机并不能弥补这一点。我们已经论证过,我真的相信度量是一切的核心,即便找到它们可能需要很长时间。但我们始终主张让度量沐浴阳光:度量不应当被保密,它必须公开,供人辩论、讨论和修正。计算机不一定比人差,它们可能更准确,尤其是在容易的案例上;它们可能更容易测试,你不停地拿例子去试它们,它们不会累。就是这些,谢谢大家。
主持人:有人提问。请讲,先是后面那位,然后是你。
听众:这一点我相信你思考过,也许上一张幻灯片就提到了。考虑个体的时候,假设吃百里香的人一直在教育孩子,而有一种可怕的鼠尾草感染,凡吃鼠尾草的人都会病得很重,再加上吃鼠尾草的人历史上遭受过严重的不公。他们各方面表现都差一些,因为他们忙于应付这种疾病。于是,仅仅由于这种历史巧合,吃鼠尾草的人几乎从来不会和吃百里香的人处于「情形相似」的位置上。按个体公平的度量,我们似乎只会说「没问题」,然后设计工作岗位时,全都给了吃百里香的人。我们没有考虑度量的群体维度,可我觉得社会在某个地方需要处理历史正义的问题。
德沃克:这当然是一个非常好的观点。在论文里,我们描述了我们称之为「公平的平权行动」(fair affirmative action)的方法来处理这一点:正是出于这个理由,我们打破某些利普希茨约束,但这是一种有原则的做法。我应当提一下,它跟加利福尼亚州和得克萨斯州在大学录取上的做法并非全然不同。如果你在班级排名前百分之十,在加州你就能进入某所加州大学,在得州则是某所州立大学,我想是这样。要点在于,不同社区的学校在考试等方面的表现可能天差地别,但基本思路是一样的。我们在此基础上加了一点东西,不像「取前百分之十」那么粗糙。
德沃克:耶鲁大学的约翰·罗默(John Roemer)有很有意思的工作,他非常关注分配正义理论,对教育想得很多。他认为必须对儿童投资、投资、再投资,以补偿处境的差异;随着教育过程推进,这种补偿应当越来越少,因为孩子们既已获得了良好的基础,理论上就更应当为自己如何运用所拥有的东西负责。我尤其记得他在大学录取的语境下说过这样的话:按母亲的受教育程度把学生分层,在每一层内部,看学生每周花在作业上的小时数的累积分布函数,然后把不同层里处于相同百分位的人视为可比的。他提出的一个我觉得极有说服力的观点是:如果你在一个没有人受过教育的家庭里长大,你可能根本想不到一周可以花十到十五个小时做作业,这个念头压根不会出现在你脑子里,或者你在打工,没法这么做。我认为社会科学家的这类洞见对我们的工作非常重要,我们做的事在某种意义上与之类似。这是一个很好的观点。
听众:刚才这整段讨论,其实都和「坏新闻」那个选择度量的问题有关,最后归结为要不要以某些中介变量为条件之类的问题。讲座其余的部分没有处理这类问题,也就是如何公平地选择度量。有没有工作用图模型或者因果推断的其他想法来做这件事?因为我们有一个直观的想法:要构造一个公平的度量,应该以某些变量为条件,但绝对不要以另外一些变量为条件。有没有人试图把这一点形式化?
德沃克:有这样的工作,很有意思,如果你感兴趣,我可以给你一批论文。这类工作的一个难处在于,同一个可观测的数据分布可以与非常不同的因果模型相容,这就带来麻烦。
听众:推断模型本身就非常难。
德沃克:对此我还不知道该说什么。看到有一篇反事实公平(counterfactual fairness)的论文时我非常兴奋,心想「对,就是它,就是它」。可后来我们找到了两个不同的模型,它们产生同样的分布,同一个分类器在一个模型下是公平的,在另一个下不是。那你怎么办?
听众:假设我要为学校选一支国际象棋队,三个人,代表学校去参加比赛。我大概会去测量这些人的水平,按测量结果挑出最好的三个。我们来看看这是否符合你的个体公平定义。我测量得越准,随机性就越少,选拔也就越不公平。
德沃克:是你引入了随机性。
听众:总会有随机性的。
德沃克:你是说算法引入了随机性。
听众:我是说,按人们通常的做法,他们不会刻意引入随机性,但随机性总会有,因为有人赢有人输,测量人的技能本身就有随机性。按你的定义,我们测量技能越准确,随机性越少,选拔过程就越不公平。
德沃克:如果你是说你可以测得非常非常准的话。
听众:等一下,那为什么一个完全随机的过程会比一个任人唯贤的过程更公平?
德沃克:好,这类问题在公平领域随时都会冒出来,你这个例子正中要害。个体公平的定义里确实埋着这样一个含义:如果你从头到尾都在抛硬币,那是公平的。如果你决定谁进象棋队的方式就是抛硬币,相似的人当然得到了相似的对待。我们没有保证的是,不相似的人得到不相似的对待。这正是我们要引入「在公平约束下最小化损失」的地方,我们要把某种损失的概念纳入决策过程。我们既要保持公平,也要最大化效用。
听众:我觉得说公平约束必须是随机的,这本身就不公平。
德沃克:我明白你的意思,你大概还能举出更好的例子,说明随机性在哪些地方是不公平的,或者对所有人一视同仁在哪些地方是不公平的。通常可以把问题重新表述,把这些关切推到目标函数里,而不是放在公平约束里。顺便说一句,我们当初以为「相似者相似对待」是我们的原创,可亚里士多德早就说过同样的话,而且他还说,不相似者应当得到不相似的对待。
德沃克:我们最初想的是广告,我当时想,看实体报纸的时候,每个人看到的广告都一样,没有定向投放,那似乎相当公平。至于让年轻人看到奢侈品广告,是否有助于形成志向?你应该说穷人、穷孩子不该看到好东西,或者好东西的图片吗?有人从心理学和社会学的角度研究这类问题,他们认为,广告与自我的形成紧密相连,人们看到的东西存在真实差异是有害的。所以我不知道。
听众:听你谈个体公平的度量时,我想到了药物治疗效应,也就是随机对照的分配。你面对一个人群,从另一个人群里找到一个匹配得很好的人,然后看不同处理分配下的治疗效应。我可以想象一个不同的问题:你希望分类器对这些匹配上的个体表现得像安慰剂,而不是像一种有治疗效应的药物。这归结起来不是对人群中每一对个体都施加度量的那种个体公平,而只是跨群体的。也就是说,在群体内部允许任人唯贤,但在群体之间要求安慰剂式的效果。这值得处理一下。
德沃克:这非常有意思,我不知道。我提到过,在因果性的文献里,有一些在珀尔模型下的工作。在鲁宾(Rubin)模型下,我不知道有什么工作,也许有,但我不知道,我想去看看。我认为这绝对值得想透,很好的问题。
听众:我在想一件事。这个标题是「走向公平建模的理论」。有没有人反过来做:接受事情注定不公平,转而去量化事情有多不公平?换句话说,不把它们当作公平约束,而是像人们研究程序类别那样,把它们分成等价类,说这是B、那是D。你在这个方向上有什么想法?
德沃克:沿这条线的理论结果我只知道一个,就是我讲到个体公平蕴含统计均等的时候:实际上有一个更紧的刻画,用群体之间的推土机距离来衡量不公平的程度。此外,我想最近有些工作确实在看稍微放松一点会怎样,比如「大概近似公平」的概念:好,我们引入一点松弛,能得到什么?这方面有一些。但我不知道有谁整个儿地说「好,我们就打算这样对待这些人」。我不知道。
听众:我在想,差分隐私里有一个权衡,比如你设定epsilon参数,就落在那条曲线上的某一点,用隐私换取准确度。
德沃克:对。你想想,个体公平的定义和差分隐私的定义在味道上非常相似,但它在组合下的行为不一样。另外还有一个结果,是用差分隐私里的某个特定算法来保证公平,你说的那种权衡在那里也许是相关的。还有人吗?请讲。
听众:我有一个关于实践的问题。这个问题很复杂,你对相关工作做了非常漂亮的综述,也谈到要达成共识,或者达不成,总之要有立法,还需要很长时间。与此同时,计算机不一定比人差,人们正在把模型投放到各个领域的现实世界里。你的处方是什么?现在需要做什么?我们是停下来,等真正理解这些问题之后再说,还是采用某种合理的办法,因为有总比没有好?从业者的行动指南是什么?
德沃克:我觉得自己完全没有资格回答这个问题,但还是试一试。即使我认为等待是合适的(我并不这么认为),在商业世界里那也根本行不通。脸书不会停下来。我想你根本不可能让产业停在原地,政治力量太强了。你能做的,当然是开始创建测试集,至少是创建者自认为知道正确结果应当是什么的测试集。比如保释裁定中的算法辅助,很多州都在用,具体数字我记不清,肯定至少有十二个,但为什么这个数字不在我脑子里,我也说不上。总之很多州在用。我们希望的是,我不知道看代码有多大用处,因为代码可能很难看懂,但你肯定希望某些合适的人和机构能够拿测试案例去试这个算法,看它怎么做。我会说,用你能拿出的最好的黄金数据集做真正密集的监测,让很多人一起做,我认为这就是我们眼下的处境。因为监测是你能做到的。
听众:那么,如果就按人们现在的做法,努力把准确度做到最高,然后把算法放到现实世界里,有没有哪些案例明显是出了问题的?
德沃克:你是问算法明显出了问题的案例?
听众:是的。
德沃克:很多。
听众:比如?
德沃克:「路面颠簸」,是叫这个名字吧?Street Bump?我记不清了。一个坑洼探测器,向市政部门报告路面坑洼。但这是一个iPhone应用,所以只有富人区的坑洼得到了报告。
听众:可那似乎只是一个准确度不如预期的问题。问题在于……
德沃克:它肯定造成了不公平的影响。
听众:不准确。那大概就是你想修正的东西,可做这个应用的人本来就想更准确,他们就是在朝这个方向努力。
德沃克:不,不,我不明白。如果这个应用没有覆盖到该覆盖的坑洼,没有渗透到城里的穷人区,它就没有给你你想要的信息。整个系统是不公平的。你是在问有没有某个分类算法出问题?
听众:这更像是少数群体的数据少,所以准确度低,大致是这样。
德沃克:我不确定它在覆盖到的地方是不准确的,它只是没有覆盖,是覆盖面的缺失。
听众:你可能没明白,因为……
德沃克:好,你要不要举个例子?
听众:好,比如COMPAS。如果你定义……
德沃克:等等,你要从COMPAS讲起。COMPAS的问题在于它是「测试公平」的。
听众:对,在那些标准下是,但在假阳性、假阴性上不是。
德沃克:是的,但它是测试公平的,而同时做到测试公平、假阳性率相等、假阴性率相等是不可能的。
听众:我想找的是那种明显不公平的案例,随便问一个路人,都会觉得明显不公平的那种。
听众:大学录取?
德沃克:什么?
听众:大学录取和财富,大概是个很好的例子。
德沃克:可是平权行动是有争议的,对吧?这正是问题的一部分。我开头说过,在隐私上的共识至少比在公平上多。平权行动公平吗?你们怎么看?这个屋子里对它公平与否会有一系列不同的意见。历史上有没有过严重偏颇的分类算法的例子?有。答案是有。
听众:谈到公平与分类,有些分类问题似乎没那么要紧。比如决定给人看哪条广告,确实会给一些人造成麻烦;但如果一辆车在决定撞死哪个人,它的分类……
德沃克:关于汽车,我是这么想的。这是你的问题吗?
听众:嗯,你打算说什么?
德沃克:谢谢。好,有一阵子我想:「天哪,在弄清所有情形下什么是对的之前,我们什么都做不了。」后来想到汽车,我想,假设你有一个算法,它学习普通人会怎么做。也许你用「道德机器」(Moral Machine)来做这件事,也许有别的办法从统计上弄清一个随机的人会怎么做。然后你的驾驶算法就该这样:遇到那种真正棘手的情形时,它做一个随机的人会做的事;其余时间,它就正常地自动驾驶。这会比人类好得多,因为在所有寻常情形下它更准确,在真正诡异的情形下它不比人差。合起来,它更好。
听众:你说「随机的人会怎么做」,这到底是什么意思?我想一种直觉是人人平等,所以没有办法……
德沃克:就是一个随机的人会怎么做。有某个概率分布,你从中抽一个人,然后按那个人的做法做。
听众:这是不是把问题往后推了,比如什么时候切换模式?真正的决定是不是转移到了那里?
德沃克:我原本想,知道何时切换模式不会太难:大多数时候该怎么做完全清楚,偶尔出现道德问题,这时你去查你那个「人们会怎么做」的数据库。
听众:如果你是从一个有偏的样本里抽样,而人是有偏见的,那这似乎只会强化社会偏见。即使随机挑一个人,那也是一个有偏的决定。
德沃克:好。
主持人:最后一个问题,请讲。
听众:我有一个关于数据的问题。这一类公平问题似乎在数据集里就带着偏见。比如再犯问题,某些人被逮捕的比率本来就更高,所以基础率一开始就是有偏的。再比如收入的例子:女性首席执行官很少见,所以如果你在做一个预测薪酬的模型,历史上高薪女性本来就少,你一开始就没有数据。在我看来,应该有人在数据空间里做点事,比如去「幻想」出公平的训练数据会是什么样。
德沃克:有一些努力正是你说的这种,我称之为「按摩」训练数据。我不知道怎么给它们打下坚实的理论基础,但确实有人想过这类事。如你所说,可以幻想出一些数据来改变训练集。我不了解多少关于怎么做这件事的工作,不过既然你提起,统计学家给样本加权时一直在做这种事。所以也许可行,但接下来你得决定怎么加权。
听众:最后一点,是不是有点像鲁宾式的反事实公平做法?
德沃克:什么?
听众:鲁宾式的反事实公平,不是珀尔的,是鲁宾的。你会给女性首席执行官加权,因为相对于所有首席执行官,她是非常稀有的样本。实际训练时,你把女性首席执行官的权重稍微调高一点,这样来纠正。
德沃克:对。正如我说的,我认为沿这个方向探索、看看它能带来什么,是个很好的主意。
听众:有一篇类似的论文写得不错。
德沃克:很好。
主持人:好的。非常感谢。
德沃克:谢谢大家。
Cynthia Dwork 在这场讲座中系统梳理了算法公平的理论框架:借鉴密码学"定义—算法—组合定理"范式,论证群体公平指标互相矛盾且易被规避,主张以任务相关度量为核心的"个体公平"(相似的人相似对待),并坦承度量来源、组合性和因果建模仍是未解难题。

微信公众号