|
|
1、资料名称:2025-2000年上市公司MD&A文本相似度与可读性数据、文本相似度、文本可读性、MD&A文本长度、MD&A总词数、年度比较企业数、词汇多样性
2、测算方式:
参考顶刊于李胜、王泽豪、王艳艳、李文涛(2024)《会计研究》的研究做法,利用VSM模型与TF-IDF算法测算上市公司MD&A叙述性信息披露的相似度与可读性。具体做法为:相似度——利用VSM模型将每份MD&A文本向量化,以词频TF(i,j)=n(i,j)/Σn(k,j)(用文本总词数加权防止偏向长文本)计算词频,以逆文档频率IDF(i)=log(D/(df(i)+1))赋予不同权重,将TF与IDF相乘得到TF-IDF值,将公司m的MD&A与同一年度所有其他公司{n}的MD&A分别比较,计算两份文本之间向量夹角余弦值,取均值作为文本相似度(向量L2归一化后两两余弦均值=(v_m·Σv_n)/(n-1),无需逐对计算);可读性——参考中文可读性研究的普遍做法,采用MD&A文本长度的自然对数作为文本可读性的主要度量方式,文本越长复杂程度越高、可读性越低。另输出MD&A文本长度、MD&A总词数、年度比较企业数、词汇多样性等过程变量。
我们多做了几个变量,如下图所示,包括核心变量或者稳健性检验及过程变量,数据全流程公开,每个原始数据及过程都清晰可查(非主观编造),大家可以做核心变量或者稳健性检验,多个数据更加容易显著!
3、资料范围:
5775多家企业,71116多个观测值,年份跨度2000-2025年。
具体数据分布情况如下方描述性统计。
包括原始数据、计算代码(stata和python代码都有,真实代码,可以向期刊公布,每一步都可以复现和做重复实验)、完整的复现说明(教大家一步步复现,做法过程全部公开,无数据黑箱,并且对复现过程常见问题做了解答)及最终结果(最终结果格式是excel电子表格格式,非常方便大家导入到自己数据里面),大家可以验证一下确保准确性!
4、参考文献:
[1]于李胜,王泽豪,王艳艳,李文涛.创新对企业MD&A叙述性信息披露策略的影响[J].会计研究,2024(3):150-160.
此数据为科研课题组自用数据,根据真实的A股上市公司年报MD&A文本一步步做出来的,每一步都可以复现和做重复实验,非仅仅只有一堆文件胡编乱造(根据参考文献瞎编结果根本就没有研究价值,不能反映真正的MD&A文本相似度与可读性水平,实证围绕着错的结果根本就毫无意义浪费大家时间),真正的原创一手认真整理数据,数据处理较为复杂大家可以自行试试。
|
本帖子中包含更多资源
您需要 登录 才可以下载或查看,没有帐号? 建议用 立即注册
x

|