《金融科技概论》ch05《如何建立合规有效的数据要素市场?》学习笔记
- 来源:
full.md/pages - PDF页码:p.62–76
- 生成模型:
gpt-5.6-luna - 日期:2026-10-08
- 作者:未明确列示
- 文章导入:p.62开头关于信息基础设施、数据要素市场政策背景与研究现状的文字,属于本文导入,不是第二篇的篇首导言。
1 本章解决的问题
本章讨论:数据为什么能够成为一种要素,数据具有什么技术与经济学特征,数据价值如何形成和计量,以及在数据所有权复杂、数据价值难以客观衡量、数据具有非竞争性和外部性的条件下,如何建立合规有效的数据要素配置机制和市场。
2020年4月9日发布的《关于构建更加完善的要素市场化配置体制机制的意见》,首次将数据与土地、劳动力、资本、技术等传统要素并列,提出推进政府数据开放共享、提升社会数据资源价值、加强数据资源整合和安全保护三方面工作(p.62)。本章进一步指出,市场化配置不等于简单的市场交易,因为许多数据并不适合直接买卖(p.70)。
核心难题包括:
- 数据的所有权、使用权和控制权难以清晰区分,尤其是个人数据。
- 数据对不同使用者、不同场景和不同时间的价值不同,缺乏统一的客观价格。
- 数据具有非竞争性,且常常具有非排他性,传统商品市场的交易和定价方式不完全适用。
- 数据使用涉及数据主体、数据生产者、平台、数据使用者和监管者等多个利益相关方,存在信息不对称和非完全契约。
- 数据共享可能创造公共价值,也可能侵犯隐私、造成数据滥用或形成平台垄断。
2 核心结论与逻辑主线
本章的逻辑主线是:
数据观察现实对象形成数据 → 数据经过组织和认知形成信息、知识与智慧 → 数据与场景、分析方法及其他数据结合产生价值 → 数据的非竞争性、外部性和产权复杂性使传统市场机制失灵 → 应按数据类型和应用场景选择公共供给、开放银行、数据信托、PIK模式改进、密码学交易、合资共享等配置机制 → 以技术和制度共同界定数据产权,并在隐私保护和数据共享之间取得平衡。
第一,数据不是天然具有固定价值的物品。数据价值取决于使用者、任务、时间、制度和政策环境。相同数据对不同人的价值可能差异很大,数据容量增加也不必然增加价值(p.67–68)。
第二,数据价值链不是原始数据到价格的直接转换,而是“原始数据—处理与整合—分析—可行动洞见—行动—价值”的过程(p.66)。因此,价值往往在数据加工、组合和应用中产生。
第三,数据要素市场不能简单复制石油、股票等私人产品市场。作者认为,把数据比喻成“石油”并不准确,因为许多数据更接近公共产品或准公共产品,所有权难以界定;“阳光”是更合适的比喻(p.66)。
第四,合规有效的数据市场需要技术和制度共同作用。可验证计算、同态加密、安全多方计算和区块链可以支持数据使用权交易、数据存证和授权;法律制度则通过被遗忘权、可携带权、有条件授权和最小化采集原则等方式细化产权(p.74–75)。
3 关键概念
3.1 DIKW模型
DIKW分别指数据(Data)、信息(Information)、知识(Knowledge)和智慧(Wisdom)。从数据中可以提取信息,从信息中总结知识,从知识中升华智慧,但这些过程依赖方法论、应用场景和相关学科背景,并非机械转换(p.63)。
- 数据:对物体、个人、机构、事件及环境进行观察,并用文字、数字、图表、声音、视频等符号记录其特征和行为。
- 信息:经过认知处理、有组织且结构化的数据,能够回答谁、什么、何时、何地等问题。
- 知识:对数据和信息的应用,回答“如何做”。
- 智慧:具有价值判断,常涉及未来预测和价值取向(p.64)。
3.2 数据的技术特征
主要包括样本分布、时间范围、变量类型、容量、质量、时效性、来源、数据类型、互操作性和可联接性,以及是否属于个人数据(p.64–65)。
数据质量不仅包括准确性,还包括代表性、规范性、颗粒度、精度、误差和完整性。不同数据集能否联接,还取决于样本识别、变量定义和数据单位是否一致。
3.3 数据的经济学特征
数据具有资产属性,同时兼有商品和服务的特征:可以存储、转移和积累,又有无形性。大部分数据可以重复使用,具有非竞争性;一些数据可以通过技术和制度设计实现排他性(p.65)。
许多数据属于公共产品或准公共产品。数据的所有权尤其是个人数据的所有权难以清晰界定,因为数据可能被未经授权地收集、复制、汇集和加工,且加工后还会产生新数据(p.66)。
3.4 数据价值的三个特征
- 同样的数据对不同人的价值差异很大:取决于分析方法、使用场景、待解决问题、时间维度和制度政策(p.67)。
- 数据价值随时间变化:数据存在时效性和数据折旧,也可能存在因新技术、新机会产生的期权价值(p.68)。
- 数据会产生外部性:数据具有私人价值和公共价值;数据聚合后的价值可能递增,也可能因噪声增加而递减(p.68)。
3.5 绝对估值与相对估值
绝对估值试图评估数据本身的价值,目前没有公认方法,主要包括成本法、收入法、市场法和问卷测试法,但各有明显缺陷(p.69)。
相对估值是在共同任务下,评估不同数据集对任务完成的贡献。沙普利值符合直觉,但数据集数量增加时计算量呈指数上升(p.70)。相对估值还说明,偏离数据集合“主流”的异常值可能具有较高价值。
3.6 数据产权
数据产权主要包括所有权、使用权和控制权。控制权涉及谁能使用数据、如何使用数据、能否继续向外分享数据。数据所有权和控制权可以分离,尤其适用于所有权不清晰的个人数据(p.75)。
4 重要论据
-
数据不是简单的私人商品。
大部分数据具有非竞争性,同一数据可以同时被不同人使用;许多数据还具有非排他性。因此,数据交易无法完全依照传统私人产品的产权和价格机制运行(p.65–66)。 -
数据价值并不等于数据规模。
数据容量越大,价值不一定越高。更多数据可能揭示规律,也可能引入噪声;1小时的视频监控数据中,真正有价值的内容可能只有1–2秒(p.68)。 -
数据价值内生于制度和政策。
不同国家对个人数据的保护程度不同,数据收集、使用和商业化的空间也不同。数据滥用还会损害用户信任、品牌形象和公司价值(p.67–68)。 -
绝对定价存在结构性困难。
成本法无法充分反映不同使用者、不同时间和数据组合带来的价值差异;收入法难以建模社会经济影响和期权价值;市场法受限于数据交易不足、市场厚度不足和价格发现不健全;问卷测试法适用范围窄且成本高(p.69)。 -
配置机制首先要解决信息不对称与非完全契约。
数据主体不清楚数据何时、为何及产生何种后果;数据生产者不清楚数据使用者的价值判断;使用者事前也难以完全了解数据价值。由于数据应用场景丰富、价值链条较长,契约很难事先覆盖所有情况(p.70)。 -
技术只能解决部分问题。
密码学技术能够使数据以密文形式使用,支持数据确权和使用权交易,但加密后同一数据仍可同时向多方提供,数据仍具有非竞争性。因此,密码学市场不会自然形成“多个买方竞价,价高者得”的模式(p.74)。
5 具体案例
5.1 百行征信的合资共享模式
**背景:**金融科技机构拥有大量用户数据,但这些数据是核心商业秘密。机构之间存在竞争关系,彼此直接共享用户数据的激励不足(p.74–75)。
**机制/做法:**多家金融科技机构成立合资公司,按照数据贡献比例分配合资公司股权。各机构把用户数据共享给合资公司,由合资公司整合成数据产品,对外销售,例如用户信用分析和不良用户黑名单。
**论证结果:**该模式通过股权利益绑定,使各机构既不用直接向竞争对手交出用户数据,又能获得完整用户信息,并作为股东分享合资公司利润;数据整合还可能形成“1+1>2”的效果,从而缓解数据共享中的激励相容问题。原文将我国个人征信市场的百行征信公司列为代表(p.75)。
**边界:**该模式不能消除个人数据产权、隐私保护和数据使用授权问题,也不能证明所有数据整合都会产生规模报酬递增。原文只说明其在金融机构竞争与共享之间提供了一种配置安排,不应扩大解释为普遍适用的唯一模式。
5.2 政府数据开放
美国联邦政府于2009年推出Data.gov,将原本分散于不同机构网站的数据统一托管;2019年《开放政府数据法案》要求,除国家安全和其他特殊原因外,联邦政府应在线发布其拥有的数据,并采用标准化、机器可读形式(p.71)。
其机制是:政府作为公共数据的提供者,在不涉密前提下开放数据,以发挥数据公共价值。边界在于,国家安全等特殊原因可以构成不公开的限制;开放数据也需要标准化和机器可读形式,不能只停留在形式上的发布。
6 作者提出的方法
本章没有把全部内容命名为一个独立操作框架,而是按照数据的经济学特征和应用场景提出配置机制。
6.1 按公共产品属性配置
当数据属于公共产品时,私人部门可能投资不足、供给不足,通常由政府利用税收收入提供。政府应在不涉密前提下尽可能开放政府数据(p.71)。
**判断标准:**数据是否具有公共价值,私人供给是否不足,是否涉及国家安全或其他特殊限制。
**失败模式:**不加区分地开放涉密数据;只公开数据而没有标准化、机器可读形式;把政府数据开放误解为所有数据都应无条件公开。
6.2 对准公共产品采用差异化机制
- 具有排他性的数据,可以采用付费订购,例如收费媒体信息终端。
- 开放银行通过API向经授权的第三方开放用户数据,由银行限制开放数据范围和机构范围,部分实现用户数据可携带性(p.71)。
- 数据信托由受托机构保管多个委托人的数据,按委托人预先确定的目标使用和分享数据(p.72)。
**判断标准:**所有权是否相对清晰、是否具有排他性、是否需要授权中介和目标约束。
**失败模式:**授权范围不清;数据被用于超出原目标的业务;数据主体无法控制数据迁移和再次分享。
6.3 改进互联网平台的PIK模式
PIK模式中,用户以注意力和个人数据换取资讯和社交服务,平台通过广告、精准营销和信贷产品等方式变现(p.72)。
其主要弊端是平台与用户地位不平等、平台可能过度收集或跨业务使用数据、平台生态可能锁定用户并造成数据垄断、用户也难以获得合理报酬。
**改进方向:**需要纠正平台作为数据控制者相对于用户这一数据主体的主导地位,明确数据产权和授权边界,并保护用户隐私、迁移和合理利益。原文没有提出一个具体命名的PIK改革方案。
6.4 采用密码学与制度共同确权
- 可验证计算:生成简短证明,验证者无需重复执行计算即可判断任务是否准确执行。
- 同态加密、安全多方计算:以密文而非明文方式提供数据,使数据具备排他性。
- 区块链:用于数据存证和使用授权。
- 制度设计:通过法律和规则界定所有权、使用权和控制权(p.74–75)。
**判断标准:**是否需要在不暴露明文的前提下完成计算,是否需要证明计算正确,是否需要记录授权和使用过程。
**失败模式:**误以为加密会使数据变成完全竞争性的私人产品;误以为技术可以替代隐私制度;忽视不同应用场景导致的数据价值差异。
6.5 使用相对估值辅助配置
在给定数据集和共同任务的情况下,可以用沙普利值评估各数据集对任务的贡献(p.70)。
**判断标准:**任务是否明确,数据集贡献能否比较,是否可以承受随数据集数量增长而增加的计算成本。
**失败模式:**把相对贡献误当成数据的绝对市场价格;忽视任务变化、分析方法变化和数据组合变化;忽略异常值可能具有较高贡献。
7 可能的隐含假设
- 【阅读推断】有效数据市场必须承认数据类型和应用场景的差异,而不能假设所有数据都适用同一种交易模式。依据是原文明确指出数据有多种类型和不同特征,且很多数据不适合参与市场交易(p.70)。
- 【阅读推断】数据主体的授权应当具有目标、范围和过程控制。依据是原文讨论了数据主体不清楚收集目的和后果,并强调有条件授权、最小化采集和隐私保护(p.70、75–76)。
- 【阅读推断】数据交易的有效性不仅取决于价格,还取决于产权、信任、技术可验证性和利益激励。依据是原文同时讨论信息不对称、非完全契约、密码学、制度设计和合资公司的利益绑定(p.70、74–75)。
- 【阅读推断】数据开放需要在公共价值和安全边界之间平衡,而非绝对开放。依据是政府数据开放以“不涉密”为前提(p.71)。
- 【阅读推断】数据市场的价格未必能完整反映社会价值。依据是数据外部性可能造成私人价值与公共价值差异,市场交易不一定实现最大社会价值(p.73)。
8 与其他章节的联系
- 【学习关联】与ch04《金融科技的基础设施》:本文开头把信息基础设施列为与金融科技有关的三类基础设施之一,ch05进一步讨论信息基础设施中的数据要素、数据安全和数据产权(p.62)。
- 【学习关联】与ch06《从开放银行看银行业务平台化》:本文已经提出开放银行模式,即银行通过API向经授权的第三方开放用户数据;但本文只说明其作为数据配置机制的作用,未展开开放银行的业务平台化过程(p.71)。
- 【学习关联】与ch10–ch13区块链相关章节:本文仅指出区块链可用于数据存证和使用授权,并参与数据产权界定;不能据此替代未提供章节中的区块链功能、边界或应用论证(p.74)。
- 【学习关联】与ch20–ch21监管科技相关章节:本文强调数据安全、隐私保护、授权和制度设计,为监管科技可能处理的数据治理问题提供基础背景;但本文没有展开监管科技机制。
- 【学习关联】与ch22《大科技公司涉足金融的挑战》:本文讨论互联网平台的数据控制、用户锁定和数据垄断,和大科技公司可能形成的竞争与隐私挑战存在主题联系;这里仅作学习关联,不补充ch22未提供的具体内容。
9 一句话总结
数据不是可以直接按石油或普通商品方式交易的同质化资产;只有结合数据类型、应用场景、产权界定、隐私保护、技术确权和利益激励,才能建立合规有效的数据要素配置机制与市场。
10 原文依据或页码
- E1 | PDF p.62 | 「首次将数据与土地、劳动力、资本、技术等传统要素并列」 | 说明数据被正式作为一种生产要素提出。
- E2 | PDF p.63 | 「从数据中可以提取信息」 | 支持DIKW模型及数据价值链的起点。
- E3 | PDF p.65 | 「大部分数据可以被重复使用」 | 支持数据具有非竞争性。
- E4 | PDF p.66 | 「把数据比喻成阳光更为合适」 | 支持数据不同于典型私人产品石油的判断。
- E5 | PDF p.68 | 「数据容量越大,数据价值不一定越高」 | 支持数据规模不等于数据价值。
- E6 | PDF p.69 | 「目前还没有公认方法」 | 支持数据绝对估值困难。
- E7 | PDF p.70 | 「市场化配置不等于市场交易模式」 | 支持数据配置机制不能简化为买卖交易。
- E8 | PDF p.72 | 「用户用自己的注意力和个人数据换取资讯和社交服务」 | 支持PIK模式的基本机制。
- E9 | PDF p.74 | 「采取密文而非明文形式」 | 支持密码学技术对数据使用权交易的作用。
- E10 | PDF p.75 | 「解决了数据共享中的激励相容问题」 | 支持百行征信合资共享模式的论证结果。
- E11 | PDF p.76 | 「在保护和共享个人数据之间做好平衡」 | 支持隐私保护与数据共享之间的基本边界。
自测与参考答案(5题含答案)
-
为什么作者认为数据更像“阳光”而不是“石油”?
**答案:**石油通常具有竞争性和排他性,产权较易界定;许多数据具有非竞争性、非排他性,所有权难以清晰界定,因此更接近公共产品或准公共产品(p.65–66)。 -
数据价值为什么不能只用数据容量衡量?
**答案:**数据价值受使用者、任务、分析方法、时间和数据组合影响;数据越多可能增加信息,也可能增加噪声,容量越大不必然价值越高(p.67–68)。 -
数据绝对估值的四种方法及主要缺陷是什么?
**答案:**成本法难以反映场景和组合价值;收入法难以建模社会影响和期权价值;市场法受交易不足和流动性不足限制;问卷测试法适用范围窄、成本较高(p.69)。 -
开放银行如何作为数据配置机制?
**答案:**银行通过API向经授权的第三方开放用户数据,同时限制可开放的数据和机构范围,部分实现用户数据可携带性(p.71)。 -
为什么密码学数据市场不会自然形成传统的价高者得?
**答案:**同一数据加密后仍可同时提供给多个使用者,数据仍具有非竞争性;且同一数据对不同人的价值差别很大,价格难以提供统一、有效的定价信息(p.74)。
易错点与原文疑点
- 不要把“数据是要素”理解为所有数据都应进入集中化交易市场;原文明确指出目前不存在集中化、流动性好的数据要素市场(p.73)。
- 不要把“数据产权”简化为单一所有权。原文区分所有权、使用权和控制权,且个人数据尤其复杂(p.75)。
- 不要把隐私保护理解为拒绝一切数据共享。原文认为隐私的核心是有效控制共享过程,在保护和共享之间平衡(p.76)。
- 不要把密码学技术理解为彻底解决产权和定价问题。原文仍强调加密数据的非竞争性、场景依赖和定价困难(p.74)。
- 不要把“1+1>2”当作所有数据聚合必然成立的规律。原文同时指出数据聚合可能规模报酬递增,也可能规模报酬递减(p.68)。
- p.65的“表2.2 公共产品、准公共产品和私人产品的分类”在给出的文字材料中表格内容未完整呈现;此处依据正文解释,不重构表格。
- p.63的DIKW模型图、p.72–73的PIK模式图在给出的文字材料中图形细节未完整呈现;相关笔记仅使用正文明确说明的内容。
- 文中涉及2009年、2018年、2019年、2020年及欧盟计划等内容,均按原文写作时点理解,不作为2026年现状、法律意见或投资建议。
- 文中提及BIPP、DIKW、API、PIK等缩写或名称时,只有原文给出全称的才作解释;原文未展开的缩写不补充外部全称。