|
|
1、资料名称:2025-2000年上市公司企业颠覆性创新数据、企业颠覆性创新数据
2、测算方式:参考顶刊《中国工业经济》余泳泽(2025)老师的做法, 本文通过以下技术手段进行颠覆性创新的两阶段识别: 在第一阶段, 从所有的专利中提取 “离群专利”。本文借鉴既有文献的做法, 使用人工智能领域最前沿的 BERT 语言模型计算专利间的文本相似度, 以此识别离群专利。在第二阶段, 从离群专利中进一步筛选能够产生技术影响力的专利表征颠覆性创新,具体做法如下方文献图片展示
具体为使用上市公司A股专利全量数据(7,798万条),通过两阶段识别方法测算企业层面的颠覆式创新水平:
阶段1:离群专利识别(技术维度)
- 按(申请年, IPC部)将专利分为209组
- 使用BERT模型(TaylorAI/bge-micro-v2)对中文摘要进行向量化
- 采用O(N×D)算法计算组内每篇专利的平均余弦距离
- 平均距离 > 组内均值 → 标记为离群专利
阶段2:被引筛选(影响力维度)
- 每组内计算非离群专利的平均被引次数作为阈值
- 离群专利中,被引次数 > 该阈值 → 颠覆式创新
- 对边界专利(被引在均值±1std内),精确计算授权后3年被引次数
- 最终识别出颠覆式创新专利,并按(股票代码, 年份)聚合为企业年度面板数据
3、资料范围:4800多家企业,5.8万个样本,年份跨度2000-2025年。具体数据分布情况如下方描述性统计。
我们多做了几个变量,大家可以做核心变量或者稳健性检验,数据量多论文更好发和调整显著!
包括原始数据、计算代码(真实代码,可以向期刊公布,可以复现和做重复实验)、完整的复现说明(教大家一步步复现,做法过程全部公开,无数据黑箱,并且对复现过程常见问题做了解答)及最终结果,大家可以验证一下确保准确性!
BERT模型对7000多万条专利的运行时间在50多个小时左右,我们这个是真的用Bert模型(大语言模型真正做过的就是非常的慢)一步步做的,大家可以对比一下或者按照参考文献自行复刻一下,难度还是挺大的!
4、参考文献:
余泳泽,胡鹏,朱子政.耐心资本与企业颠覆性创新——基于企业机构投资者视角[J].中国工业经济,2025(10):59-77.
此数据为科研课题组自用数据,根据真实的专利引用数据一步步做出来的,资料可以复现和做重复实验,非仅仅只有一堆文件胡编乱造(根据参考文献瞎编结果根本就没有研究价值,不能反映真正的颠覆性创新,实证围绕着错的结果根本就毫无意义浪费大家时间),真正的原创一手认真整理数据,数据处理较为复杂大家可以自行试试。
此资料复刻了原文,购买了原文也可以下载此资料,并且附带全文讲解,掌握全文逻辑对自己学习有帮助,大家有需要可以看一下
顶刊论文复刻全文老师讲《耐心资本与企业颠覆性创新》(企业机构投资者视角、机构投资者耐心资本、离群专利颠覆创新、改变固定效应聚类层级)
https://www.caomeikeyan.com/forum.php?mod=viewthread&tid=6473
(出处: 草莓科研服务网——中国专业社科交流平台)
|
本帖子中包含更多资源
您需要 登录 才可以下载或查看,没有帐号? 建议用 立即注册
x

|