|
|
1、资料名称:2025-2000年上市公司专利质量数据(绿色专利版)、专利质量(文本相似度法)、平均被引证次数、平均权利要求数量、知识宽度、发明授权占比、专利数量
2、测算方式:
参考顶刊陈志远等(2026)的研究做法,基于上市公司绿色专利名称数据测算企业-年份层面的专利质量指标。核心指标专利质量采用文本相似度法:对每件专利的标题+摘要+首项权利要求做jieba分词,构建TF-IDF词向量,以"年度质心"法测算专利的后向相似度(新颖性)与前向相似度(影响力),专利质量=前向相似度/后向相似度,数值越大代表相对已有技术越新颖、且对后续技术影响力越大。同时给出平均被引证次数(引用类指标)、平均权利要求数量与首权字数(文本类指标)、知识宽度(1-Σ各IPC大类占比²)、发明授权占比、专利数量等系列质量与稳健性指标。
我们多做了几个变量,如下图所示,包括核心变量或者稳健性检验及过程变量,数据全流程公开,每个原始数据及过程都清晰可查(非主观编造),大家可以做核心变量或者稳健性检验,多个数据更加容易显著!
3、资料范围:
3200多家企业,17803多个观测值,年份跨度2000-2025年
(这个年份需要说明一下,此文献用的是前向和后向技术相似度,2025年需要用2026年专利,因此最新数据是年份2024年的,2025年实际用到2024年上了)。
具体数据分布情况如下方描述性统计。
包括原始数据、计算代码(stata和python代码都有,真实代码,可以向期刊公布,每一步都可以复现和做重复实验)、完整的复现说明(教大家一步步复现,做法过程全部公开,无数据黑箱,并且对复现过程常见问题做了解答)及最终结果(最终结果格式是excel电子表格格式,非常方便大家导入到自己数据里面),大家可以验证一下确保准确性!
4、参考文献:
[1]陈志远,章逸然,张杰,等.中国专利质量的测度、变化机制与经济增长效应[J].经济研究,2026,61(3):28-52.
此数据为科研课题组自用数据,根据真实的上千万专利名称数据一步步做出来的,每一步都可以复现和做重复实验,非仅仅只有一堆文件胡编乱造(根据参考文献瞎编结果根本就没有研究价值,不能反映真正的专利质量水平,实证围绕着错的结果根本就毫无意义浪费大家时间),真正的原创一手认真整理数据,数据处理较为复杂。
|
本帖子中包含更多资源
您需要 登录 才可以下载或查看,没有帐号? 建议用 立即注册
x

|