首页 > 科技 > 清华大学刘洋:联邦学习开拓者,拓展纵向联邦学习与联邦迁移学习

清华大学刘洋:联邦学习开拓者,拓展纵向联邦学习与联邦迁移学习

2016 年,谷歌最早提出了联邦学习(Federated Learning),通过让用户数据不出本地,而在设备本地进行模型训练。

目的是保障大数据交换时的信息安全、保护终端数据和个人数据隐私以及合规的前提下,在多参与方或多计算结点之间开展高效率的机器学习。

由于其将训练数据的“横向划分”,在后来的分类中被称为横向联邦学习。

在那之后的三、四年时间里,一股联邦学习研究热潮被掀起,该领域每年的论文数量从个位数上升至上百篇,联邦学习迈入加速发展的阶段。

清华大学刘洋的研究方向是机器学习、联邦学习等。她是纵向联邦学习、联邦迁移学习等算法框架和“广义”联邦机器学习概念的主要提出者之一,在国际上率先提出了包括线性回归模型、树模型、神经网络模型等多种机器学习模型在加密分布式场景下的训练算法,两次获得国际人工智能领域 AAAI 工业创新应用奖。

▲图 | 《麻省理工科技评论》中国 2022 年隐私计算科技创新人物入选者刘洋

此外,刘洋还参与共同创建国际最早、最大的工业联邦学习开源平台(FATE)和生态体系(FedAI.org),并共同编写了世界上首个联邦学习的 IEEE 国际标准 P3652.1。

其学术成果被 Openmined PySyft、百度 PaddleFL、字节跳动 Fedlearner、FedML 和 微众银行 FATE 等多个国际主流隐私计算和联邦学习开源项目实现,并应用于智慧金融、智慧医疗、智慧营销等领域。

以问题为驱动,以产业化为目标

刘洋认为当时谷歌提出的横向联邦学习并没能解决企业之间数据孤岛问题。而在 AI 持续落地的行业背景下,尤其是小企业缺少数据的支持,产业需要解决如何让小企业享受到大企业的数据价值,即保障数据、隐私安全的前提下破除孤岛问题。

2018 年,刘洋踏上了离开美国的飞机,回到国内加入微众银行,并在之后的三年里曾担任微众银行资深研究员、AI 部门联邦学习研究团队负责人。在此之前,她曾在美国多家科技公司从事大数据方向工作。

“智能产业需要以数据为驱动,而国内在数据资源和场景方面是最多的,相应的机会也就更多。”在做出回国决定时,丰富的技术落地场景是重要因素之一。

刘洋表示,不论是在学界还是业界,她研究风格从来都是以问题为驱动、以产业化为目标。

在微众银行时期,刘洋带领团队推进关于联邦学习,AI 隐私和信任的研究和应用示范,在金融,医疗保健和计算机视觉等领域落地首个联邦学习应用系统。

期间,刘洋与微众银行首席人工智能官杨强首先提出了“广义”联邦学习概念与分类。

在学界的影响方面,相关论文在 ACM TIST 发表以来被下载超过 2 万次,引用近 2 千次,仅用 2 年时间成为 ACM TIST 史上最受欢迎前 2 位文章,也是联邦学习领域全球高引文章。

▲图 | 来源:刘洋

刘洋带领研究团队率先提出纵向联邦学习和联邦迁移学习等算法框架,以及多种机器学习模型在加密分布式场景下的训练算法。

如今这两种算法已经成为业界和学界主流的框架,获得隐私计算领域相关 30 余件授权专利,超过 130 件专利申请,并在 JMLR、AAAI、IJCAI、USENIX 等人工智能领域重要国际期刊和会议发表学术论文 40 余篇,Google Scholar 引用数超过 7000 次。

在刘洋的带领下,微众银行提出了一种主要针对于纵向联邦学习的联邦学习系统架构:首先在加密空间上对样本进行对齐,识别出参与联邦学习的各个相同的用户;在识别出这些用户后,通过协作者对用户数据进行加密模型训练。加密训练包含以下步骤:公钥的分发与收集、加密过程中中间结果的交互、加密汇总梯度与损失、更新双方模型。

在训练过程中,传递的并不是数据本身或数据的加密形式,而是运算过程中产生的中间结果的加密形式。整个训练过程保证了效果的前提下,没有向其它各方泄露任何的底层数据,从而保证了数据安全。

相比之下,谷歌用联邦学习服务自己的 To C 业务端的需求,而刘洋团队提出的纵向联邦学习则能满足 B 端需求,用以解决企业与企业之间的数据孤岛难题,利于打造一个更开放、类似企业联盟的生态。

在纵向联邦学习的训练过程中,多主体需要每次迭代时实时交换梯度更新信息进行联合计算和训练,导致通信效率成为决定纵向联邦学习框架可扩展性的主要瓶颈问题,制约了纵向联邦学习的广泛应用。

针对这一问题,刘洋和团队潜心钻研。近日,由刘洋担任一作的论文(由刘洋和明尼苏达大学张欣为合作,通讯作者为刘洋和微众银行首席 AI 官杨强教授)发表在“信息与通信工程”学科的国际顶级期刊上。

▲图 | 相关论文(来源:IEEE Transactions on Signal Processing)

研究团队提出了面向分布式特征的纵向联邦学习的高效通信协作学习框架,通过系统地采用本地 Block Coordinate Descent(BCD)算法和联邦协作,在保证理论收敛性的指导下进行足够数量的局部更新来解决纵向联邦学习场景中昂贵的通信开销问题。

纵向联邦学习方法允许具有关于同一用户不同属性集的多方联合构建模型,而无需公开其原始数据或模型参数,突破了传统纵向联邦学习通信瓶颈并提高了安全性,助力跨机构间数据价值流通。

“联邦学习进入2.0 阶段”

在产业落地方面,微众银行将刘洋团队研发的联邦学习技术用于小微企业信贷以及个人贷款的风险管理,据介绍,在金融领域的应用中,可以通过联邦学习技术打通企业征信和发票数据的交互渠道,结合第三方数据建立风控模型。

“通过使用联邦学习技术,我们可以对企业的征信进行更好的预测和评分。”刘洋表示。

微众银行曾在 2020 年通过联邦学习,完善了多家小微企业的征信评分。该项目最终获得了当年深圳市金融科技专项奖一等奖,这也是深圳为产业转化项目给到的最高奖项之一。

目前联邦学习技术持续完善,将在 AI、金融、医疗、智能制造等领域获得广泛应用的空间。

在自动驾驶领域,驾驶能力升级依赖持续的数据收集和系统迭代,传统自动驾驶系统训练往往是将所有车辆数据收到一个模型里进行训练,这种方式采集的成本很高。

5G 的逐渐普及将拓展联邦学习在其中的应用,将传统的集中式学习框架逐渐过渡到分布式的终端智能的互相学习的体系,这种体系可以使各个终端持续的进行分布式学习,而不用批量的收集数据,最终促进车端的智能化程度。

此外,联邦学习可以解决车与车之间的数据不共享、企业之间数据不能共享的问题;在车路协同的发展模式下,纵向联邦学习有助于打通路侧设备,交通数据等多方数据,同时避免延迟和隐私问题。

在 AI 医疗场景下,医疗机构之间的数据无法互通带来了数据孤岛现象严重,各家医院都难以积累足量的数据。联邦学习技术可以在数据不出数据中心的情况下,进行模型的学习,提供一个隐私安全计算的环境,使得各方在保护用户隐私和信息安全的前提下提升系统效率,扩展 AI 在医疗领域的应用。

由于市场成熟度仍较低,刘洋团队还在打通技术从论文到落地的各个环节。“过去一年,我们联合产业界的伙伴做了非常多前期的示范性工作。智慧医疗对隐私计算的需求非常大,因此也成为了工作的重心。”

刘洋说:“技术在医疗场景中落地能够真正服务于医生,连接来自不同医院的数据,打造更精准的模型辅助诊断,最终让更广泛的就医群体受益。”

刘洋表示,其科研的目标一直都是解决真正的产业问题,在解决实际产业问题过程中驱动科研进展。她认为,目前联邦学习技术已经发展到了 2.0 阶段,即搭建了基础的架构,未来的工作重心则是让技术更安全、更高效地应用到产业当中。

本文来自网络,不代表趣头条立场,转载请注明出处:https://www.ngnnn.com/article/4_94211.html
上一篇iPhone14 Pro系列市场“捷报”频传,供应链受益有几分?
下一篇向更多新模式、新业态领域探索 格力系布局餐饮智能配送

为您推荐

谷歌推出文本到图像模型Muse:生成图片质量更高、推理时间更短

谷歌推出文本到图像模型Muse:生成图片质量更高、推理时间更短

作者 | 冬梅自 2021 年初以来,随着大量深度学习支持的文本到图像模型(例如 DALL-E-2、Stable Diffusion 和 Midjourney 等)的诞生,人工智能研究的进展发生了革命性的变化。近日,谷歌Muse AI 系统正式亮相。据谷歌 Muse AI 团队称,Muse 是一种文本到图像的 Transformer 模型,该模型可以实现先进的图像生成性能。我们提
盖茨盛赞ChatGPT:人工智能历史意义不亚于“PC或互联网诞生”

盖茨盛赞ChatGPT:人工智能历史意义不亚于“PC或互联网诞生”

腾讯科技讯 2月3日消息,微软联合创始人比尔·盖茨表示,像ChatGPT这样的AI聊天机器人将变得与个人电脑或互联网同样重要。盖茨今日接受采访时表示:“AI将成为2023年最热门的话题。这是不可避免的。”他随后补充道:“ChatGPT将变得与个人电脑、互联网同样重要。”盖茨在20世纪80年代帮助开创了个人电脑时代。在微软和苹果等
谷歌街景独立 App 将于 2023 年停止运营

谷歌街景独立 App 将于 2023 年停止运营

IT之家 11 月 2 日消息,安卓和 iOS 版谷歌街景 App 将于明年初停止运营,并将在未来几周从应用商店中删除。一位 Google 发言人证实,该应用将从 2023 年 3 月起停用。这是安卓和 iPhone 上的专用街景应用程序,允许用户使用谷歌公司的服务来获得世界各地的 360 度视图。需要注意的是,该功能不会从标准的谷歌地图应用中删
专访墨奇科技CEO邰骋:人工智能需要新的AI数据基础设施

专访墨奇科技CEO邰骋:人工智能需要新的AI数据基础设施

“人工智能要发展到下一代,必然需要基础理论和基础设施的革新,特别是需要新的 AI 数据基础设施。”9月2日,新京报贝壳财经记者获悉,在近日举办的HICOOL2022全球创业者峰会上,AI(人工智能)基础技术和平台墨奇科技的项目团队获得“HICOOL 2022 全球创业大赛一等奖”。墨奇科技联合创始人、CEO 邰骋接受了新京报贝壳财
人工智能大会将举办智慧体育高峰论坛,发布AI+体育蓝皮书

人工智能大会将举办智慧体育高峰论坛,发布AI+体育蓝皮书

2022年世界人工智能大会智慧体育高峰论坛将于9月2日开幕。  主办方供图AI+体育,将成为世界人工智能大会的全新命题和新亮点。2022年世界人工智能大会智慧体育高峰论坛将于9月2日开幕。论坛上将发布由上海人工智能研究院牵头,联合上海交通大学、上海体育学院、首都体育学院、同济大学等单位编制的国内首本《“AI+体育”蓝
大脑还有多少秘密?世界人工智能大会首开脑机接口主题论坛

大脑还有多少秘密?世界人工智能大会首开脑机接口主题论坛

在2022世界人工智能大会上,天桥脑科学研究院(简称TCCI)转化中心联合中国科学院上海微系统与信息技术研究所、脑虎科技、中国神经科学学会、上海市神经科学学会共同举办“脑·机智能融合-让大脑连接未来”论坛,这也是脑机接口首次以主题论坛的形式登陆世界人工智能大会。英国皇家工程院院士、上海交大医疗机器人研究院院
我国人工智能学科主要奠基人涂序彦逝世,享年 88 岁

我国人工智能学科主要奠基人涂序彦逝世,享年 88 岁

IT之家 3 月 28 日消息,据北京科技大学消息,我国人工智能领域著名科学家、人工智能学科的主要奠基人、中国人工智能学会的主要创始人之一、第二和第三届中国人工智能学会理事长、北京科技大学计算机与通信工程学院教授涂序彦先生,因病医治无效,于 2023 年 1 月 1 日 0 时 10 分在北京逝世,享年 88 岁。IT之家附讣告原文
苹果谷歌牵头制定追踪行业规范草案 防止功能遭滥用

苹果谷歌牵头制定追踪行业规范草案 防止功能遭滥用

【CNMO新闻】在2021年的春季发布会上,苹果推出了蓝牙追踪设备AirTag,该产品配合苹果设备的“查找”应用,可以追踪和查找重要物品。然而,也有用户发现这类设备可能会遭到滥用,例如将其放在他人不知情的地方,可以对个人进行跟踪。AirTag为了杜绝此类现象,苹果与谷歌宣布联合提交一份行业规范草案,帮助应对蓝牙定位追踪
梁建章:人工智能如何影响经济和各行各业

梁建章:人工智能如何影响经济和各行各业

近日人工智能再次成为了热门话题。很多人好奇的是,人工智能未来到底会如何影响经济、人口和创新?今天,我跟大家分享个人的一些看法——谈谈人工智能对于经济以及各行各业的影响。自从深度神经网络出现以来,人工智能的发展速度超乎想象。ChatGPT的出现是个奇迹,超出了几乎所有计算机科学家的预料。一个简单的神经网络模
劈柴哥预告Bard将迎重磅升级,谷歌“最强大脑”能否超车ChatGPT?

劈柴哥预告Bard将迎重磅升级,谷歌“最强大脑”能否超车ChatGPT?

财联社4月2日讯(编辑 赵昊)上周,美国科技巨头谷歌公司推出了聊天机器人“巴德”(Bard)的测试版本。由于用户使用体验远不如ChatGPT,Bard反响平平。当地时间周五(3月31日),谷歌首席执行官"劈柴哥"桑达尔·皮查伊(Sundar Pichai)在播客节目中表示,这种状况可能很快就会改变,因为Bard将在未来几天从目前基于的LaM
科技巨头欧洲裁员不易,谷歌亚马逊设法“吸引”员工离职

科技巨头欧洲裁员不易,谷歌亚马逊设法“吸引”员工离职

勒紧裤腰带“过冬”的美国科技巨头现在碰到新的难题,想在欧洲搞大裁员谈何容易,特别是要在国内劳动法对员工保护力度位居欧盟成员国前列的法国和德国,更是难上加难。在美国,企业宣布大裁员后就能在几个月内解雇数百甚至数千名员工,许多公司已经这样做。而在欧洲,媒体发现,科技企业的大裁员已经停滞,因为在一些欧洲国
AI炒股新纪元?头部量化私募幻方宣布全力探索人工智能应用

AI炒股新纪元?头部量化私募幻方宣布全力探索人工智能应用

头部量化私募幻方宣布成立新的独立的研究组织,探索AGI(即通用人工智能,Artificial General Intelligence)的本质。4月14日,幻方发布公告显示,幻方将集中资源和力量,全力投身到服务于全人类共同利益的人工智能之中,成立新的独立的研究组织,探索AGI的本质,“我们将充分而持续地投入,不做中庸的事,用最长期的眼光去
谷歌Stadia发布新试玩系统:玩家解锁特定成就完成试玩

谷歌Stadia发布新试玩系统:玩家解锁特定成就完成试玩

【CNMO新闻】游戏试玩我们都曾有所接触,在过去游戏试玩版本通常是开发者在游戏上市之前发布的一个涵盖游戏部分内容的封包进行上传后,有意试玩的玩家进行下载测试,这样的方式已经延续了很久,其弊端就是玩家需要在游戏正式发布后在单独下载新的游戏包体,增加了重复下载的困扰。也有一些开发者选择游戏整包作为测试版本上
史上AI最高分!谷歌大模型创美国医师执照试题新纪录

史上AI最高分!谷歌大模型创美国医师执照试题新纪录

杨净 羿阁 发自 凹非寺量子位 | 公众号 QbitAI史上AI最高分,谷歌新模型刚刚通过美国医师执照试题验证!而且在科学常识、理解、检索和推理能力等任务中,直接与人类医生水平相匹敌。在一些临床问答表现中,最高超原SOTA模型17%以上。此进展一出,瞬间引爆学界热议,不少业内人士感叹:终于,它来了。广大网友在看完Med-PaL
谷歌计划打造全新搜索引擎应对必应等竞争 推AI功能升级现有引擎

谷歌计划打造全新搜索引擎应对必应等竞争 推AI功能升级现有引擎

【美媒:谷歌计划打造全新搜索引擎应对必应等竞争 将推出AI功能升级现有引擎】财联社4月17日电,据纽约时报消息,新必应等AI竞争者正成为25年来谷歌搜索业务的“最严重威胁”,作为回应,谷歌据悉正寻求打造一款由AI技术驱动的全新搜索引擎。查阅的内部文件显示,谷歌还在用AI功能升级现有引擎。据悉,谷歌正测试项目名为“
卷完模型卷芯片!为提升效率,微软准备推出专属人工智能芯片

卷完模型卷芯片!为提升效率,微软准备推出专属人工智能芯片

在早期成功押注ChatGPT的研发公司OpenAI之后,市场发现,微软在其武器库中还拥有另一个秘密武器:自研人工智能芯片,这一芯片将为生成式AI背后的大型语言模型提供强大动力。4月18日周二,据媒体援引两位知情人士的话说,微软早在2019年就开始开发内部代号为Athena的AI芯片。其中一位知情人士称,一些微软和OpenAI的员工已经
真正的应用级量子人工智能距离我们还有多远?

真正的应用级量子人工智能距离我们还有多远?

·“量子科技是强国竞争的战略制高点,但不能一哄而上,低水平重复内卷,或片面追求发论文、抢专利,各自为战,闭门造车,而缺少真正的技术投入和系统配合。”·“当下量子系统的规模非常重要,而这很大程度上取决于芯片。”当前,发展量子计算和人工智能已成为世界各国的重要战略,两者交汇而生的量子人工智能更是发展迅速
消息称谷歌正测试一款类似ChatGPT的聊天机器人

消息称谷歌正测试一款类似ChatGPT的聊天机器人

鞭牛士 2月2日消息,据外媒报道,据知情人士表示,谷歌正在测试新的人工智能驱动的聊天产品,可能会影响未来公共产品的发布。这些产品包括一个新的聊天机器人,以及一种将其整合到搜索引擎的潜在方式。
返回顶部