立即打开
一、数据简介
数据名称:上市公司数字赋能数据
时间范围:2000—2025年
数据层级:上市公司—年度(公司年度面板数据)
核心指标:企业数字赋能
识别变量:stkcd、year;证券代码为保留前导零的字符型公司代码
文件格式:结果数据同时提供.dta与.xlsx格式,计算和评估代码提供.do与.py格式,质量评估结果提供.csv、.jpg与.log格式
二、原始数据与基本信息合并
上市公司数字赋能词频数据.dta:上市公司数字赋能指标的原始计算数据,主要字段为证券代码、年份、总词数以及人工智能至开放银行等76个数字技术关键词词频;同目录下的上市公司数字赋能词频数据.xlsx为内容对等的Excel格式文件。
上市公司年度行业与所属省份城市数据.dta:上市公司年度层面的证券简称、行业和注册地区数据,主要字段为证券代码、证券简称、stkcd、year、行业代码、行业名称、所属省份、所属省份代码、所属城市、所属城市代码,按stkcd-year与核心指标数据合并。
行业代码/上市公司基本信息数据.dta:上市公司公司层面的静态基本信息数据,主要字段为证券代码、证券中文简称、上市日期、股票类型、公司名称、行业名称A—D、行业代码A—D、注册资本、成立日期、退市日期、stkcd,按stkcd与公司年度数据合并;同名字段以该基本信息数据为主,未匹配的证券代码使用年度数据中的代码回填。
三、计算说明
【企业数字赋能】用于衡量上市公司年报文本中数字技术应用和数字化转型相关内容的强度。对每个关键词i计算TF_i=ln(关键词i词频/年报总词数+1);在剔除B股后的72,971篇文档中,统计出现关键词i的文档数Doc_i,并计算IDF_i=ln[72971/(Doc_i+1)];关键词TF-IDF_i=TF_i×IDF_i,企业数字赋能为人工智能至开放银行共76个关键词TF-IDF的逐行合计。取值越大,表示上市公司年报中数字技术相关表述经词频和文档稀缺程度加权后的强度越高;取值为0表示各关键词未形成正的TF-IDF贡献。
【stkcd】由六位证券代码转换得到的数值型上市公司识别码,用于公司层面的静态信息合并;字符型证券代码同时保留,以避免丢失前导零。
【year】由原始年份字段前四位转换得到的数值型会计年度,用于公司年度识别、年度行业地域信息合并及分年度缩尾。
【金融行业筛选】依据年度行业代码识别J类金融行业;“剔除金融ST”版本删除行业代码含J的公司年度。
【ST/PT/退市筛选】依据年度证券简称识别ST、*ST、PT和退市相关标记,并结合公司静态退市日期剔除已退市公司样本。
【缩尾处理】仅对核心连续指标企业数字赋能按year分组,在各年度第1百分位和第99百分位处进行缩尾;低于第1百分位的值替换为年度第1百分位,高于第99百分位的值替换为年度第99百分位,不改变样本量。
四、结果数据文件
共有3套结果数据文件,每套均同时提供.dta和.xlsx格式。样本筛选步骤如下:
(1) 从原始词频数据中剔除证券代码以200或900开头的B股样本,保留A股口径,并按照固定文档数72,971计算企业数字赋能指标;
(2) 按stkcd-year合并年度行业、证券简称和省市信息,删除未取得证券简称的观测,再按stkcd合并上市公司静态基本信息;
(3) 从同一基础结果分别生成保留金融、ST/PT及退市公司的未缩尾版本,剔除金融、ST/PT及退市公司的未缩尾版本,以及在剔除样本基础上按年度对企业数字赋能进行1%和99%缩尾的版本。
编号 文件名称 说明
1 计算结果未剔除金融ST未缩尾版本.dta/.xlsx 保留金融行业、ST/PT及退市公司且不缩尾的A股基础结果,共72,584个公司年度观测,用于全样本留档和计算复核。
2 计算结果剔除金融ST未缩尾版本.dta/.xlsx 剔除金融行业、ST/PT及退市公司但不缩尾的清洗结果,共64,795个公司年度观测,用于保留极端值的清洗样本分析。
3 计算结果剔除金融ST缩尾版本.dta/.xlsx 在剔除金融行业、ST/PT及退市公司后,按年度对企业数字赋能进行1%和99%缩尾,共64,795个公司年度观测,用于常规实证回归和稳健性分析。
五、变量说明
序号 变量名称 变量类型 变量说明
1 证券代码 str 六位上市公司证券代码,以字符形式保存并保留前导零,优先取自上市公司基本信息数据。
2 证券简称 str 公司在对应年度使用的证券简称,来源于年度行业与所属省份城市数据,也是ST/PT样本识别依据。
3 证券中文简称 str 上市公司基本信息数据中的证券中文简称。
4 stkcd double 数值型上市公司证券代码,是公司层面静态信息的合并键。
5 year double 数值型会计年度,是公司年度面板的时间变量和年度缩尾分组变量。
6 企业数字赋能 float 76个数字技术关键词TF-IDF的合计值,取值越大表示年报文本反映的数字赋能强度越高。
7 上市日期 str 公司股票首次上市日期。
8 股票类型 str 上市股票类型,如A股等。
9 行业代码 str 公司对应年度的行业代码,用于年度行业识别和J类金融行业筛选。
10 行业名称 str 公司对应年度的行业名称。
11 所属省份 str 公司对应年度所属省份名称。
12 所属省份代码 str 公司对应年度所属省份行政区划代码。
13 所属城市 str 公司对应年度所属城市名称。
14 所属城市代码 str 公司对应年度所属城市行政区划代码。
15 行业名称A str 上市公司基本信息数据中的A级行业名称。
16 行业代码A str 上市公司基本信息数据中的A级行业代码。
17 行业名称B str 上市公司基本信息数据中的B级行业名称。
18 行业代码B str 上市公司基本信息数据中的B级行业代码。
19 行业名称C str 上市公司基本信息数据中的C级行业名称。
20 行业代码C str 上市公司基本信息数据中的C级行业代码。
21 行业名称D str 上市公司基本信息数据中的D级行业名称。
22 行业代码D str 上市公司基本信息数据中的D级行业代码。
23 注册资本 double 上市公司的注册资本金额,单位沿用基本信息原始数据口径。
24 成立日期 str 公司成立日期。
25 退市日期 str 公司退市日期;空值通常表示在基本信息记录中没有退市日期,“剔除金融ST”版本据此删除已退市公司。
26 ABH股交叉码 str 公司A股、B股或H股之间的交叉上市证券代码信息。
27 公司名称 str 上市公司法定中文全称。
28 公司中文简称 str 上市公司的公司层面中文简称。
29 公司英文名称 str 上市公司的英文名称。
六、代码文件
文件名称 语言 说明
上市公司数字赋能数据计算代码.py Python 读取词频原始数据,按Stata原口径计算企业数字赋能,合并年度与静态基本信息,并输出三套dta和xlsx结果数据。
上市公司数字赋能数据计算代码.do Stata 读取词频原始数据,计算企业数字赋能,完成两类基本信息合并、样本筛选和分年度缩尾,并输出三套dta和xlsx结果数据。
上市公司数字赋能数据评估代码.py Python 递归识别结果dta,完成变量分流、描述统计、频数、缺失、IQR与Z-score异常、取值范围、面板连续性、图形及跨版本稳健性评估。
上市公司数字赋能数据评估代码.do Stata 独立读取结果dta,自动识别stkcd和year,生成数据分布、异常值、逻辑合理性、稳健性和总评估结论表,并输出论文风格图形。
七、数据质量评估
评估结果存放于数据质量评估报告_YYYYMMDD文件夹,当前已生成数据质量评估报告_20260807,运行日志为评估日志_YYYYMMDD.log,当前日志为评估日志_20260807.log。各子文件夹内容如下:
子文件夹名 内容说明
1 数据分布分析 保存各套结果数据的描述性统计、数值变量频率或分箱分布、字符变量频数前200项等CSV文件。
2 分布图 保存未剔除金融ST未缩尾版本的直方图、箱线图、核密度图、散点图矩阵和年度趋势图,图片为JPG格式且按300dpi输出。
3 异常值检验 保存各变量缺失值统计、Z-score异常和IQR温和或极端异常统计结果。
4 逻辑合理性验证 保存stkcd-year重复与时间断档明细、指标合理取值范围检验及数据文件面板结构汇总。
5 稳健性测试 保存不同样本期、不同处理版本的样本量、均值、趋势、核心指标相关性及处理方式对比结果。
总评估结论表.csv 汇总每套数据中每个变量的样本量、缺失率、异常值占比、越界占比以及缺失、异常、范围、一致性和总体判定。
八、参考文献
[1] 耿景珠, 杜明威, 刘文革. 企业数字赋能与全球价值链嵌入[J]. 当代财经, 2023(8): 122-133.
[2] 吴非, 胡慧芷, 林慧妍, 任晓怡. 企业数字化转型与资本市场表现——来自股票流动性的经验证据[J]. 管理世界, 2021, 37(7): 130-144.
扫码加我 拉你入群
请注明:姓名-公司-职位
以便审核进群资格,未注明则拒绝
相关推荐
栏目导航
热门文章
推荐文章
扫码加好友,拉您进群