|
|
1、资料名称:2025-2000年上市公司前瞻性信息披露数据、前瞻性信息披露、前瞻性关键词词频、MD&A总词数、将来时态词频、前景类词频、展望类词频
2、测算方式:
参考顶刊刘瑶瑶、路军伟(2023)《外国经济与管理》的研究做法,采用关键词法度量前瞻性信息披露,具体做法为:确定前瞻性关键词的种子词集(将来时态词语:未来、将来、今后、以后、来年、明年等;前景词语:前景、展望、愿景、发展、机遇、机会、目标、挑战、风险等;展望词语:希望、相信、期望、期待、预期、预计、预测、计划、可能、如果等),借鉴胡楠等(2021)做法以Word2Vec机器学习技术对种子词集进行相似词扩充(新年度、下一年、下一步、下一阶段、近期、后期、之后、后续、使命、战略定位、突破口、潜力、成长、扩张、趋势、面临、不确定性、有望、开拓、拓展、探索、争取、倘若、假如等),利用Aho-Corasick多模式匹配算法统计年报MD&A文本中前瞻性关键词出现频次,以jieba中文分词模块统计MD&A总词数,前瞻性信息披露 FTR = 100 × 前瞻性关键词数 / MD&A总词数,并输出将来时态、前景、展望三类关键词词频。前瞻性信息主要存在于年报管理层讨论与分析(MD&A)部分,故以MD&A文本为测算对象。
我们多做了几个变量,如下图所示,包括核心变量或者稳健性检验及过程变量,数据全流程公开,每个原始数据及过程都清晰可查(非主观编造),大家可以做核心变量或者稳健性检验,多个数据更加容易显著!
3、资料范围:
5775多家企业,71116多个观测值,年份跨度2000-2025年。
具体数据分布情况如下方描述性统计。
包括原始数据、计算代码(stata和python代码都有,真实代码,可以向期刊公布,每一步都可以复现和做重复实验)、完整的复现说明(教大家一步步复现,做法过程全部公开,无数据黑箱,并且对复现过程常见问题做了解答)及最终结果(最终结果格式是excel电子表格格式,非常方便大家导入到自己数据里面),大家可以验证一下确保准确性!
4、参考文献:
[1]刘瑶瑶,路军伟.前瞻性信息披露与分析师盈余预测——基于文本分析和机器学习的证据[J].外国经济与管理,2023,45(10):102-114.
此数据为科研课题组自用数据,根据真实的A股上市公司年报MD&A文本一步步做出来的,每一步都可以复现和做重复实验,非仅仅只有一堆文件胡编乱造(根据参考文献瞎编结果根本就没有研究价值,不能反映真正的前瞻性信息披露水平,实证围绕着错的结果根本就毫无意义浪费大家时间),真正的原创一手认真整理数据,数据处理较为复杂大家可以自行试试。
|
本帖子中包含更多资源
您需要 登录 才可以下载或查看,没有帐号? 建议用 立即注册
x

|