学者观察 | 联邦学习与区块链、大模型等新技术的融合与挑战-北京航空航天大学童咏昕

导语

当下,数据已成为经济社会发展中不可或缺的生产要素,正在发挥越来越大的价值。但是在数据使用过程中,由于隐私、合规或者无法完全信任合作方等原因,数据的拥有者并不希望彻底和他方共享数据。为解决原始数据自主可控与数据跨区域流动之间的矛盾,联邦学习这项技术应运而生。

在北京航空航天大学教授童咏昕看来,联邦学习和区块链技术在打破多方数据孤岛、实现数据共享的场景中都发挥了重要作用,实现了“原始数据不出域,数据可用不可见”的效果。以我国自主创新的区块链软硬件技术体系“长安链”为例,通过与联邦学习技术的深度融合,突破了数字经济中的数据“暗区”,实现了数据价值的释放,通过垂域大模型等场景应用,提升了数字经济的活力。

图片

学者寄语

面向国家数字经济发展重大战略需求,联邦学习与区块链等新技术的融合发展大有可为!希望长安链可以不断开拓创新,更进一步。

——北京航空航天大学  教授  童咏昕

理解联邦学习

联邦学习是一种隐私保护的分布式机器学习技术。通俗的理解好比小羊吃草,传统的机器学习方式是把数据汇集到一起再进行处理,就像各个牧场把草集中到一个地方喂小羊,小羊生长越来越健壮,也就是模型越来越强大。联邦学习就好比牵着小羊去各个牧场吃草,让羊越来越健壮,数据不动模型动,数据虽不出域但同样释放价值。

如今,联邦学习已经在智慧金融、智慧医疗、智慧城市等领域展现其应用价值。例如金融联合风控、疾病联合预测等,我们日常生活中经常使用的手机地图聚合网约车平台,也是联邦学习和时空数据挖掘的典型应用:各平台以联邦学习的方式在敏感数据不出域的条件下实现跨平台信息共享,合理地分配各平台订单及运力。

联邦学习与区块链,“正交”技术深度融合

联邦学习与区块链是“正交”的两个方向。区块链就像去中心化的账本,它解决的是多方协作的可信问题。联邦学习本质上是分布式机器学习的一类,使数据在不出本地的前提下联合学习。虽然从理论基础上来讲这两个技术是正交的,但是二者存在很多共性:都是分布式的计算,都能够实现数据共享。因此,二者的融合点在于可信联邦学习。

联邦学习与区块链的融合点在于可信联邦学习。联邦学习中最有代表性的算法为联邦平均算法(FedAvg),其中所有中间结果(梯度)均需上传传到中心服务器进行计算,所以从根本上它依然是一个中心化的分布式计算方法,算法的安全性依赖于中心服务器的可信度。而区块链之所以受到大家欢迎,是因为在很多业务场景中去中心化的技术框架更具可信度。区块链与中心化的联邦学习互补成为去中心化的联邦学习,这是非常有价值的。

至此大家可能不禁要问:为什么在现在有影响力的联邦学习开源社区里几乎没有基于区块链的联邦学习项目?我认为是因为缺少区块链领域的顶尖的研究机构对区块链和联邦学习深度融合的探索,这是一片蓝海。目前,未来区块链与隐私计算高精尖创新中心正在围绕长安链进行开拓,着力研发出有效的、开源的、联邦学习与区块链深度融合的系统,有希望填补这块空白。当然,这对系统构架来讲难度很高,比如,区块链的吞吐量和联邦学习的大梯度之间怎么耦合,才能既不浪费计算资源又能控制通信量,其中有非常多的工程和科学的问题需要解决。我们来自多个方向的科学家正在持续攻关。 

联邦学习与大模型,互补放大价值

联邦学习与大模型的结合是近期热门的研究问题。大模型是生成式学习中的前沿技术,很多人认为把数据汇在一起训练大模型已经非常耗费硬件资源和算力,采用联邦学习这种分布式方式联合多方数据进行训练,增大通信量是不是画蛇添足?其实不然。

现在的大模型训练主要使用的是公开的公有域数据,但高质量的数据往往存储在不对外公开的私域里,比如涉及隐私的政务数据,科研机构的数据,行业数据,这些数据质量更高,但无法在保持数据自治权的前提下轻易共享参与到基础通用大模型的训练中。联邦学习会对基础通用大语言模型训练产生助力,用私域的高质量数据解决公域数据质量不足的问题。

两种技术的另一个结合点是垂域大模型。基础大模型的体量非常庞大,例如meta开源的Llama 2有着百亿的参数量,我们国家的大型科技企业也拥有100亿参数级别的大模型。大模型对于算力的要求非常高,500张显卡已经是基础配置,每张显卡价格数万元,训练成本高昂,一般的科研机构或者高校很难持续投入。而在基础大模型之上注入特定领域数据使领域内的系统更智能,这样的垂域大模型正在构筑未来“办公自动化”的新形态。例如走失人口或犯罪分子的追踪任务,只需要在公安系统中输入相关的嫌疑人特征,系统就能够联合当地所有摄像头数据库,通过大模型进行人员锁定;又如一些基础的公文撰写任务,办公人员仅需简单描述一下需求之后可以自动生成,大幅提升了效率。在这个过程中,联邦学习技术使得行业高价值数据得以充分利用,同时又确保了数据不出域。因此联邦学习和大模型的技术融合在很多领域大有可为,相信未来一两年之内会不断涌现成熟的产品。

面向未来的联邦学习,须跨多道栏

机构数据共享仍需引导激励。联邦学习是一种作用于生产关系的技术,越面向多个参与主体的时候越能发挥更大的价值。在当前的法律和隐私保护框架下,如何能更好地推动跨机构间的合作是联邦学习面临的问题。

首先,联邦学习等技术领域亟待建立完备的法律基础。“数据可用不可见、原始数据不出域”是一个描述性术语,从计算机语言来讲“差分隐私保护”、“匿名化”、“脱敏”“安全多方计算”都是密码学或隐私计算相关的术语,而在监管与合规的过程中计算机技术术语与法律术语之间存在理解的壁垒,无法达到法律条款与技术之间的映射,这催生出了一个很火的方向“计算法学”,为联邦学习等隐私计算相关技术夯实法律基础,以应对多方机构间的权益纠纷,这是需要学者和法律工作者们共同推动的工作。

此外,政府单位或者行业协会需要引导、推动建设激励机制。解决数据自治和跨域协同之间矛盾的根本在于有一个好的激励机制,联邦的过程存在多方博弈,这种博弈存在着竞争与合作,双方在博弈的过程中是非理性的,每一方都想少输出、多获益。建设一个好的激励机制,以保证贡献数据多、价值大的主体能够获益多,将会促进数据要素价值流通的实现,营造良性的数字经济发展环境。

联邦学习理论研究仍需夯实基础。目前我国联邦学习技术处于领跑状态。这一技术最早是在国外提出,随后国内一批学者很快就参与到联邦学习的研究中,并在其技术发展中起到了引领作用,具有较强的国际影响力。比如,联邦学习在IEEE的第一个国际标准就是由我国牵头制定,第一本联邦学习英文教材也来自我国,谷歌学术上被引用量最高的论文也来自我国。

我国联邦学习的飞速发展在于国家对于数字经济的高度重视。“个人信息保护法”使个人数据隐私和安全保护有了法律基础,连续发布的“数据二十条”等政策为构建数据基础制度体系指明了方向,各地数据交易所的建设为联邦学习提供了天然的应用土壤,联邦学习成为了数据要素流通与交易有代表性的交易范式之一。此外,国家近年来大幅推动数字化转型,智慧政府、智慧城市、智慧交通等产业也在为新的信息技术应用提供了机会,联邦学习在应用方面相较其他国家有很大优势。

虽然在技术及应用上我国已取得了一些成绩,但仍存在问题:我国在该领域的研究优势主要集中于应用,在基础理论研究上与国外还有较大差距。

因此,我国联邦学习的发展仍需持之以恒加强基础理论研究。通过建立合作与交流平台,推动国内外高校、科研机构和创新中心间的知识共享与学术交流;为年轻人提供更多的学术机会和支持,为联邦学习培养人才后备军;鼓励学者进行基础研究、创新研究,设立奖项或资助计划以激励学者进行高水平的学术研究,培养出优秀的学术人才。要让更多的人加入到联邦学习的基础理论研究中来,还需要政府、高校、科研院共同营造领域内更加良好的学术氛围。

「数据新动能」学者观察

数据作为数字经济发展的核心引擎,如何激发动能、释放价值,驱动数字经济高质量发展?长安链开源社区发起的「数据新动能」学者观察栏目邀请专家学者分享数字经济、数字技术的研究、思考与展望,共同探索数字经济“密码”。

 拥抱区块链技术,探索数字经济“密码”

聚焦数字经济发展

追踪尖端学术前沿

探讨新潮科技理念

捕捉鲜活产业动态

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.hqwc.cn/news/174600.html

如若内容造成侵权/违法违规/事实不符,请联系编程知识网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

什么是代理模式,用 Python 如何实现 Proxy(代理 或 Surrogate)对象结构型模式?

什么是代理模式? 代理(Proxy)是一种结构型设计模式,其目的是通过引入一个代理对象来控制对另一个对象的访问。代理对象充当目标对象的接口,这样客户端就可以通过代理对象间接地访问目标对象,从而在访问过程…

C 语言实现 UDP

广播 发送广播信息&#xff0c;局域网中的客户端都可以接受该信息 #include <stdio.h> #include <stdlib.h> #include <unistd.h> #include <string.h> #include <arpa/inet.h>int main() {// 1.创建一个通信的socketint fd socket(PF_INET, …

[Go语言]SSTI从0到1

[Go语言]SSTI从0到1 1.Go-web基础及示例2.参数处理3.模版引擎3.1 text/template3.2 SSTI 4.[LineCTF2022]gotm1.题目源码2.WP 1.Go-web基础及示例 package main import ("fmt""net/http" ) func sayHello(w http.ResponseWriter, r *http.Request) { // 定…

浅谈JavaScript闭包,小白的JS学习之路!

前言 在JavaScript中&#xff0c;闭包是一种强大而灵活的特性&#xff0c;它不仅允许变量私有化&#xff0c;而且提供了一种在函数执行完毕后仍然保持对外部作用域变量引用的机制。本文将深入讨论JavaScript闭包的概念、优点、缺点以及如何避免潜在的内存泄漏问题。 调用栈与…

linux基础知识

一、Linux权限详解 Linux的文件权限有以下设定&#xff1a; Linux下文件的权限类型一般包括读&#xff0c;写&#xff0c;执行。对应字母为 r、w、x。 Linux下权限的属组有 拥有者 、群组 、其它组 三种。每个文件都可以针对这三个属组&#xff08;粒度&#xff09;&#x…

【Unity】 场景优化策略

Unity 场景优化策略 GPU instancing 使用GPU Instancing可以将多个网格相同、材质相同、材质属性可以不同的物体合并为一个批次&#xff0c;从而减少Draw Calls的次数。这可以提高性能和渲染效率。 GPU instancing可用于绘制在场景中多次出现的几何体&#xff0c;例如树木或…

深度强化学习论文中的阴影折线图——总结和分析

前言 作为目前人工智能算法的一个重要领域&#xff0c;强化学习算法的表现非常出色&#xff0c;然而&#xff0c;强化学习算法的结果是出了名的不稳定&#xff1a;超参数的搜索空间往往非常大&#xff0c;算法对不同超参数都较为敏感&#xff0c;且哪怕仅仅只有随机数种子的不…

NSSCTF web刷题记录5

文章目录 [HZNUCTF 2023 preliminary]ezlogin[MoeCTF 2021]地狱通讯[NSSRound#7 Team]0o0[ISITDTU 2019]EasyPHP[极客大挑战 2020]greatphp[安洵杯 2020]Validator[GKCTF 2020]ez三剑客-ezweb[安洵杯 2019]easy_serialize_php [HZNUCTF 2023 preliminary]ezlogin 考点&#xff…

ppt中的字体,如何批量替换?

想要将PPT中的文字全部更换&#xff0c;有什么方便的方法吗&#xff1f;今天分享两个方法&#xff0c;一键修改ppt文件字体。 方法一&#xff1a; 找到功能栏中的编辑选项卡&#xff0c;点击替换 – 替换字体&#xff0c;在里面选择我们想要替换的字体就可以了。 方法二&…

css3 初步了解

1、css3的含义及简介 简而言之&#xff0c;css3 就是 css的最新标准&#xff0c;使用css3都要遵循这个标准&#xff0c;CSS3 已完全向后兼容&#xff0c;所以你就不必改变现有的设计&#xff0c; 2、一些比较重要的css3 模块 选择器 1、标签选择器&#xff0c;也称为元素选择…

Linux 使用随记

Linux 使用随记 shell 命令行模式登录后所取得的程序被成为shell&#xff0c;这是因为这个程序负责最外层的跟用户&#xff08;我们&#xff09;通信工作&#xff0c;所以才被戏称为shell。 命令 1、命令格式 command [-options] parameter1 parameter2 … 1、一行命令中第…

信息安全工程师软考知识点

文章目录 知识点总结2023软考总结选择题问答题 知识点总结 军用不对外公开的信息系统安全等级至少应该>三级 数据中心的耐火等级不应低于二级 政府网站的信息安全等级原则上不应低于二级第一代交换机以集线器为代表&#xff0c;工作在OSI物理层 第二代交换机以太网交换机&a…