|
|
1、资料名称:2025-2001年上市公司企业数据要素应用能力数据(数据要素广度应用能力、数据要素深度应用能力)
2、测算方式:参考顶刊《中国工业经济》巫强(2026)老师的做法,本文利用文本分析法, 通过上市公司年报管理层讨论与分析 ( MD&A ) 中特定词汇的披露频次来刻画企业数据要素应用能力( Dea )。具体而言, Dea 指标从两个维度构建: 广度应用能力 ( Breadth ) 与深度应用能力( Depth )。各指标通过关键词词频计数后加 1 取自然对数来量化。在量化实现上, 针对传统词频统计方法和 Word2Vec 模型在识别低频术语和复杂语义表达方面的局限, 本文引入基于 BERT 的预训练语言模型, 对预先构建的技术术语种子词表进行上下文敏感的语义嵌入表示,具体做法如下图文献所示
我们是严格按照参考文献做法来的,有Bert模型的详细部分及余弦相似度阈值0.75和 0.60 为概率阈值,考虑的非常详细!
具体步骤如下:
Step 1 - 构建关键词体系
依据论文附录2的完整关键词表,广度维度涵盖数据基础设施(17词)、数据处理与分析(24词)、数据管理与存储(16词)三类共111个关键词;深度维度涵盖数据驱动应用(32词)、数据安全与隐私(18词)两类共72个关键词。并采用 BERT模型(bge-small-zh-v1.5)对采样年报做语义匹配(余弦相似度阈值0.75),经人工审核去噪后补充精选扩展词(广度53个 + 深度23个)。
Step 2 - 否定语境过滤
使用正则规则检测"未部署""不涉及""尚未应用"等10类否定/疑问/假设表达模式。同时已训练 hfl/rbt3(BERT)二分类模型,以 0.60 为概率阈值,供有GPU环境的用户使用。
Step 3 - 场景约束规则
对"数字化""智能""AI"等辅助性术语,仅当句子中还包含具体技术、设施或业务场景类关键词时才计数,排除"持续推进数字化转型"等笼统口号式表述。
Step 4 - 指标计算
对每家上市公司每年,统计有效关键词词频后取自然对数:
Breadth = ln(广度词频 + 1)
Depth = ln(深度词频 + 1)
Dea = ln(广度词频 + 深度词频 + 1)
3、资料范围:7万多个样本,5700多家企业,包含原始数据、测算代码(代码真实有效,可以向期刊公布,非自己主观生成,可复现和做重复实验)、测算详细复现说明(包括数据处理合并及代码测算和最终结果输出)和最终计算结果,大家可以验证一下确保准确性!
描述性统计如下
─────────────────────────────────────────────────
变量名称 样本量 均值 标准差 最小值 最大值
数据要素应用能力(Dea) 71,116 2.547 1.476 0.000 9.009
数据要素应用广度(Breadth) 71,116 1.895 1.258 0.000 8.134
数据要素应用深度(Depth) 71,116 1.902 1.522 0.000 8.469
4、参考文献:
巫强,曹长帅,汪阳昕.企业数据要素应用能力与供应链韧性:广度与深度的差异化机制[J/OL].中国工业经济,2026,(03):170-193[2026-04-22].
此资料我复刻了相关原文,购买了原文也可以下载此资料,并且附带全文讲解,掌握全文逻辑对自己学习有很大帮助,大家有需要可以看一下!
顶刊论文复刻讲解《企业数据要素应用能力与供应链韧性:广度与深度的差异化机制》(数据要素、两阶段最小二乘法2SLS、 安慰剂、双重机器学习)
https://www.caomeikeyan.com/forum.php?mod=viewthread&tid=6670
(出处: 草莓科研服务网——中国专业社科交流平台)
|
本帖子中包含更多资源
您需要 登录 才可以下载或查看,没有帐号? 建议用 立即注册
x

|