《金融科技概论》ch05《如何建立合规有效的数据要素市场?》学习笔记

1 本章解决的问题

本章讨论:数据为什么能够成为一种要素,数据具有什么技术与经济学特征,数据价值如何形成和计量,以及在数据所有权复杂、数据价值难以客观衡量、数据具有非竞争性和外部性的条件下,如何建立合规有效的数据要素配置机制和市场。

2020年4月9日发布的《关于构建更加完善的要素市场化配置体制机制的意见》,首次将数据与土地、劳动力、资本、技术等传统要素并列,提出推进政府数据开放共享、提升社会数据资源价值、加强数据资源整合和安全保护三方面工作(p.62)。本章进一步指出,市场化配置不等于简单的市场交易,因为许多数据并不适合直接买卖(p.70)。

核心难题包括:

  1. 数据的所有权、使用权和控制权难以清晰区分,尤其是个人数据。
  2. 数据对不同使用者、不同场景和不同时间的价值不同,缺乏统一的客观价格。
  3. 数据具有非竞争性,且常常具有非排他性,传统商品市场的交易和定价方式不完全适用。
  4. 数据使用涉及数据主体、数据生产者、平台、数据使用者和监管者等多个利益相关方,存在信息不对称和非完全契约。
  5. 数据共享可能创造公共价值,也可能侵犯隐私、造成数据滥用或形成平台垄断。

2 核心结论与逻辑主线

本章的逻辑主线是:

数据观察现实对象形成数据 → 数据经过组织和认知形成信息、知识与智慧 → 数据与场景、分析方法及其他数据结合产生价值 → 数据的非竞争性、外部性和产权复杂性使传统市场机制失灵 → 应按数据类型和应用场景选择公共供给、开放银行、数据信托、PIK模式改进、密码学交易、合资共享等配置机制 → 以技术和制度共同界定数据产权,并在隐私保护和数据共享之间取得平衡。

第一,数据不是天然具有固定价值的物品。数据价值取决于使用者、任务、时间、制度和政策环境。相同数据对不同人的价值可能差异很大,数据容量增加也不必然增加价值(p.67–68)。

第二,数据价值链不是原始数据到价格的直接转换,而是“原始数据—处理与整合—分析—可行动洞见—行动—价值”的过程(p.66)。因此,价值往往在数据加工、组合和应用中产生。

第三,数据要素市场不能简单复制石油、股票等私人产品市场。作者认为,把数据比喻成“石油”并不准确,因为许多数据更接近公共产品或准公共产品,所有权难以界定;“阳光”是更合适的比喻(p.66)。

第四,合规有效的数据市场需要技术和制度共同作用。可验证计算、同态加密、安全多方计算和区块链可以支持数据使用权交易、数据存证和授权;法律制度则通过被遗忘权、可携带权、有条件授权和最小化采集原则等方式细化产权(p.74–75)。

3 关键概念

3.1 DIKW模型

DIKW分别指数据(Data)、信息(Information)、知识(Knowledge)和智慧(Wisdom)。从数据中可以提取信息,从信息中总结知识,从知识中升华智慧,但这些过程依赖方法论、应用场景和相关学科背景,并非机械转换(p.63)。

3.2 数据的技术特征

主要包括样本分布、时间范围、变量类型、容量、质量、时效性、来源、数据类型、互操作性和可联接性,以及是否属于个人数据(p.64–65)。

数据质量不仅包括准确性,还包括代表性、规范性、颗粒度、精度、误差和完整性。不同数据集能否联接,还取决于样本识别、变量定义和数据单位是否一致。

3.3 数据的经济学特征

数据具有资产属性,同时兼有商品和服务的特征:可以存储、转移和积累,又有无形性。大部分数据可以重复使用,具有非竞争性;一些数据可以通过技术和制度设计实现排他性(p.65)。

许多数据属于公共产品或准公共产品。数据的所有权尤其是个人数据的所有权难以清晰界定,因为数据可能被未经授权地收集、复制、汇集和加工,且加工后还会产生新数据(p.66)。

3.4 数据价值的三个特征

3.5 绝对估值与相对估值

绝对估值试图评估数据本身的价值,目前没有公认方法,主要包括成本法、收入法、市场法和问卷测试法,但各有明显缺陷(p.69)。

相对估值是在共同任务下,评估不同数据集对任务完成的贡献。沙普利值符合直觉,但数据集数量增加时计算量呈指数上升(p.70)。相对估值还说明,偏离数据集合“主流”的异常值可能具有较高价值。

3.6 数据产权

数据产权主要包括所有权、使用权和控制权。控制权涉及谁能使用数据、如何使用数据、能否继续向外分享数据。数据所有权和控制权可以分离,尤其适用于所有权不清晰的个人数据(p.75)。

4 重要论据

  1. 数据不是简单的私人商品。
    大部分数据具有非竞争性,同一数据可以同时被不同人使用;许多数据还具有非排他性。因此,数据交易无法完全依照传统私人产品的产权和价格机制运行(p.65–66)。

  2. 数据价值并不等于数据规模。
    数据容量越大,价值不一定越高。更多数据可能揭示规律,也可能引入噪声;1小时的视频监控数据中,真正有价值的内容可能只有1–2秒(p.68)。

  3. 数据价值内生于制度和政策。
    不同国家对个人数据的保护程度不同,数据收集、使用和商业化的空间也不同。数据滥用还会损害用户信任、品牌形象和公司价值(p.67–68)。

  4. 绝对定价存在结构性困难。
    成本法无法充分反映不同使用者、不同时间和数据组合带来的价值差异;收入法难以建模社会经济影响和期权价值;市场法受限于数据交易不足、市场厚度不足和价格发现不健全;问卷测试法适用范围窄且成本高(p.69)。

  5. 配置机制首先要解决信息不对称与非完全契约。
    数据主体不清楚数据何时、为何及产生何种后果;数据生产者不清楚数据使用者的价值判断;使用者事前也难以完全了解数据价值。由于数据应用场景丰富、价值链条较长,契约很难事先覆盖所有情况(p.70)。

  6. 技术只能解决部分问题。
    密码学技术能够使数据以密文形式使用,支持数据确权和使用权交易,但加密后同一数据仍可同时向多方提供,数据仍具有非竞争性。因此,密码学市场不会自然形成“多个买方竞价,价高者得”的模式(p.74)。

5 具体案例

5.1 百行征信的合资共享模式

**背景:**金融科技机构拥有大量用户数据,但这些数据是核心商业秘密。机构之间存在竞争关系,彼此直接共享用户数据的激励不足(p.74–75)。

**机制/做法:**多家金融科技机构成立合资公司,按照数据贡献比例分配合资公司股权。各机构把用户数据共享给合资公司,由合资公司整合成数据产品,对外销售,例如用户信用分析和不良用户黑名单。

**论证结果:**该模式通过股权利益绑定,使各机构既不用直接向竞争对手交出用户数据,又能获得完整用户信息,并作为股东分享合资公司利润;数据整合还可能形成“1+1>2”的效果,从而缓解数据共享中的激励相容问题。原文将我国个人征信市场的百行征信公司列为代表(p.75)。

**边界:**该模式不能消除个人数据产权、隐私保护和数据使用授权问题,也不能证明所有数据整合都会产生规模报酬递增。原文只说明其在金融机构竞争与共享之间提供了一种配置安排,不应扩大解释为普遍适用的唯一模式。

5.2 政府数据开放

美国联邦政府于2009年推出Data.gov,将原本分散于不同机构网站的数据统一托管;2019年《开放政府数据法案》要求,除国家安全和其他特殊原因外,联邦政府应在线发布其拥有的数据,并采用标准化、机器可读形式(p.71)。

其机制是:政府作为公共数据的提供者,在不涉密前提下开放数据,以发挥数据公共价值。边界在于,国家安全等特殊原因可以构成不公开的限制;开放数据也需要标准化和机器可读形式,不能只停留在形式上的发布。

6 作者提出的方法

本章没有把全部内容命名为一个独立操作框架,而是按照数据的经济学特征和应用场景提出配置机制。

6.1 按公共产品属性配置

当数据属于公共产品时,私人部门可能投资不足、供给不足,通常由政府利用税收收入提供。政府应在不涉密前提下尽可能开放政府数据(p.71)。

**判断标准:**数据是否具有公共价值,私人供给是否不足,是否涉及国家安全或其他特殊限制。

**失败模式:**不加区分地开放涉密数据;只公开数据而没有标准化、机器可读形式;把政府数据开放误解为所有数据都应无条件公开。

6.2 对准公共产品采用差异化机制

  1. 具有排他性的数据,可以采用付费订购,例如收费媒体信息终端。
  2. 开放银行通过API向经授权的第三方开放用户数据,由银行限制开放数据范围和机构范围,部分实现用户数据可携带性(p.71)。
  3. 数据信托由受托机构保管多个委托人的数据,按委托人预先确定的目标使用和分享数据(p.72)。

**判断标准:**所有权是否相对清晰、是否具有排他性、是否需要授权中介和目标约束。

**失败模式:**授权范围不清;数据被用于超出原目标的业务;数据主体无法控制数据迁移和再次分享。

6.3 改进互联网平台的PIK模式

PIK模式中,用户以注意力和个人数据换取资讯和社交服务,平台通过广告、精准营销和信贷产品等方式变现(p.72)。

其主要弊端是平台与用户地位不平等、平台可能过度收集或跨业务使用数据、平台生态可能锁定用户并造成数据垄断、用户也难以获得合理报酬。

**改进方向:**需要纠正平台作为数据控制者相对于用户这一数据主体的主导地位,明确数据产权和授权边界,并保护用户隐私、迁移和合理利益。原文没有提出一个具体命名的PIK改革方案。

6.4 采用密码学与制度共同确权

**判断标准:**是否需要在不暴露明文的前提下完成计算,是否需要证明计算正确,是否需要记录授权和使用过程。

**失败模式:**误以为加密会使数据变成完全竞争性的私人产品;误以为技术可以替代隐私制度;忽视不同应用场景导致的数据价值差异。

6.5 使用相对估值辅助配置

在给定数据集和共同任务的情况下,可以用沙普利值评估各数据集对任务的贡献(p.70)。

**判断标准:**任务是否明确,数据集贡献能否比较,是否可以承受随数据集数量增长而增加的计算成本。

**失败模式:**把相对贡献误当成数据的绝对市场价格;忽视任务变化、分析方法变化和数据组合变化;忽略异常值可能具有较高贡献。

7 可能的隐含假设

8 与其他章节的联系

9 一句话总结

数据不是可以直接按石油或普通商品方式交易的同质化资产;只有结合数据类型、应用场景、产权界定、隐私保护、技术确权和利益激励,才能建立合规有效的数据要素配置机制与市场。

10 原文依据或页码

自测与参考答案(5题含答案)

  1. 为什么作者认为数据更像“阳光”而不是“石油”?
    **答案:**石油通常具有竞争性和排他性,产权较易界定;许多数据具有非竞争性、非排他性,所有权难以清晰界定,因此更接近公共产品或准公共产品(p.65–66)。

  2. 数据价值为什么不能只用数据容量衡量?
    **答案:**数据价值受使用者、任务、分析方法、时间和数据组合影响;数据越多可能增加信息,也可能增加噪声,容量越大不必然价值越高(p.67–68)。

  3. 数据绝对估值的四种方法及主要缺陷是什么?
    **答案:**成本法难以反映场景和组合价值;收入法难以建模社会影响和期权价值;市场法受交易不足和流动性不足限制;问卷测试法适用范围窄、成本较高(p.69)。

  4. 开放银行如何作为数据配置机制?
    **答案:**银行通过API向经授权的第三方开放用户数据,同时限制可开放的数据和机构范围,部分实现用户数据可携带性(p.71)。

  5. 为什么密码学数据市场不会自然形成传统的价高者得?
    **答案:**同一数据加密后仍可同时提供给多个使用者,数据仍具有非竞争性;且同一数据对不同人的价值差别很大,价格难以提供统一、有效的定价信息(p.74)。

易错点与原文疑点