草莓科研服务网——中国专业社科交流平台

 找回密码
 立即注册
建议用户用微信快捷登录

快捷登录

查看: 3344|回复: 4

2025-2001年上市公司企业MD&A文本相似度与可读性数据、文本相似度、文本可读性

[复制链接]
发表于 2024-12-14 10:09:00 | 显示全部楼层 |阅读模式
1、资料名称:2025-2000年上市公司MD&A文本相似度与可读性数据、文本相似度、文本可读性、MD&A文本长度、MD&A总词数、年度比较企业数、词汇多样性

2、测算方式:
参考顶刊于李胜、王泽豪、王艳艳、李文涛(2024)《会计研究》的研究做法,利用VSM模型与TF-IDF算法测算上市公司MD&A叙述性信息披露的相似度与可读性。具体做法为:相似度——利用VSM模型将每份MD&A文本向量化,以词频TF(i,j)=n(i,j)/Σn(k,j)(用文本总词数加权防止偏向长文本)计算词频,以逆文档频率IDF(i)=log(D/(df(i)+1))赋予不同权重,将TF与IDF相乘得到TF-IDF值,将公司m的MD&A与同一年度所有其他公司{n}的MD&A分别比较,计算两份文本之间向量夹角余弦值,取均值作为文本相似度(向量L2归一化后两两余弦均值=(v_m·Σv_n)/(n-1),无需逐对计算);可读性——参考中文可读性研究的普遍做法,采用MD&A文本长度的自然对数作为文本可读性的主要度量方式,文本越长复杂程度越高、可读性越低。另输出MD&A文本长度、MD&A总词数、年度比较企业数、词汇多样性等过程变量。

我们多做了几个变量,如下图所示,包括核心变量或者稳健性检验及过程变量,数据全流程公开,每个原始数据及过程都清晰可查(非主观编造),大家可以做核心变量或者稳健性检验,多个数据更加容易显著!

3、资料范围:
5775多家企业,71116多个观测值,年份跨度2000-2025年。
具体数据分布情况如下方描述性统计。
包括原始数据、计算代码(stata和python代码都有,真实代码,可以向期刊公布,每一步都可以复现和做重复实验)、完整的复现说明(教大家一步步复现,做法过程全部公开,无数据黑箱,并且对复现过程常见问题做了解答)及最终结果(最终结果格式是excel电子表格格式,非常方便大家导入到自己数据里面),大家可以验证一下确保准确性!

4、参考文献:
[1]于李胜,王泽豪,王艳艳,李文涛.创新对企业MD&A叙述性信息披露策略的影响[J].会计研究,2024(3):150-160.

此数据为科研课题组自用数据,根据真实的A股上市公司年报MD&A文本一步步做出来的每一步都可以复现和做重复实验,非仅仅只有一堆文件胡编乱造(根据参考文献瞎编结果根本就没有研究价值,不能反映真正的MD&A文本相似度与可读性水平,实证围绕着错的结果根本就毫无意义浪费大家时间),真正的原创一手认真整理数据,数据处理较为复杂大家可以自行试试。


本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有帐号? 建议用 立即注册

x
发表于 2024-12-15 14:31:52 | 显示全部楼层
楼主的资料挺全的,谢谢分享
回复

使用道具 举报

发表于 2024-12-17 18:09:10 | 显示全部楼层
楼主的资料挺全的,谢谢分享
回复

使用道具 举报

发表于 2024-12-22 06:30:06 | 显示全部楼层
已买,期待后续更新
回复

使用道具 举报

发表于 2026-8-28 12:41:34 | 显示全部楼层
感谢分享
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册 建议用 立即注册

本版积分规则

回帖奖励

[详情]

  • * 每天自己主题被回复3次可获得额外5论坛币奖励。
  • * 每天回复他人主题5次可获得额外8论坛币的奖励。
  • * 奖励每天都可领取,一定要多参与论坛讨论哦。
  • * 同一主题的重复回复不计。
    • 俏**** 购买了本资料
    • k**** 购买了本资料
    • 陆**** 购买了本资料
    • w**** 购买了本资料
    • 啾**** 购买了本资料

    草莓科研服务网——中国专业社科交流平台 ( 津ICP备2023000499号 )|网站地图

    GMT+8, 2026-9-9 07:52 , Processed in 0.099326 second(s), 65 queries .

    Copyright © caomeikeyan

    快速回复 返回顶部 返回列表