A Practical Guide to Research Databases
Kaggle
作为知名数据科学竞赛平台,Kaggle 提供大量的公开数据集并且允许用户自行上传数据集,目前已经形成了一个巨大的数据集社区。
Kaggle 的数据集访问方式为 跳转链接。
Kaggle 的数据集分类方式仍然较为粗糙,但是其提供了模块检索(NLP、CV、Education、Visualization、Pre-trained Model 等)以及精细检索功能。想要根据任务类型进行精确的检索比较困难。
Wiki 数据的图表示——DBpedia 数据集
DBpedia 项目是 WikiCities 数据集的初始形态,它是从 Wiki 百科信息框中获取资源的一种方法和一个配套的数据集。
Wiki 百科提供信息框作为一种 URL 形式的数据,它链接了和正在查阅的网页相关的一些信息。
DBpedia 致力于对 Wiki 百科现有的信息进行清理和标准化,将信息框转换为一种高质量的结构化信息,并且使用图的形式来表达。
DBpedia 建立了一种语义图,它的顶点表示实体或者字面量,边表示命名关系。它使用 RDF 框架(一种图描述语言)将图表示为一个三元组,包括源实体(主语)、命名关系(动词)、目标实体或者字面量(宾语)。基于 RDF 框架,DBpedia 可以以三元组集合文件的形式进行传递与分发。
一个简单的例子:我们选取实体 New York City,那么它的实体可以存储在 resource/New_York_City 的 URI(改进的 URL)中;我们想研究 leader title 这一关系,那么它可以存储在 ontology/leaderTitle 的 URI 中。宾语可以是一个字面量(一个数字)或者其他的实体——字面量可以直接使用三元组存储而无需外部引用。
信息框与 RDF 的映射关系存储在一个类似于 Wiki 的资源网站中。相比于 Wiki 百科的源页面,DBpedia 项目创建的语义图非常简洁且直观。但是由于其高度依赖原本的信息框结构,而 Wiki 项目是大量志愿者半独立进行的,因此 DBpedia 项目中会发现大量错误与不一致——在原本的 Wikipedia 中没有明显地暴露这些问题。
我们可以基于 DBpedia 项目的数据集进行图信息的数据挖掘。在最常见的方法中,我们还是将原本的数据集整合为结构化的数据框形式来进行分析。
WikiCities 是对原本 DBpedia 项目的扩展,包含:
- Geonames 项目:研究人类城市定居点的数据集。当我们希望用 DBpedia 挖掘城市变迁信息,需要率先找到那些城市实体。
- WikiCountries 项目:从挖掘城市变迁到挖掘国家实体,这实际上是为了应对 WikiCities 项目中出现的大量残缺的情况。
临床医学数据库
NHANES 数据库
临床医学横断面研究公开数据库,总共覆盖约 10 万被试者(单次研究在 10000 人左右),覆盖约 260 个临床数据模块。NHANES(National Health and Nutrition Examination Survey),使用问卷调查和医学检查的方式收集数据。数据库网址为 https://wwwn.cdc.gov/nchs/nhanes/,直接打开就可以访问使用。
NHANES 数据库从 1999 年开始,每两年为一个调查周期。首页的年份即为一次横断面研究。网站的其他部分是一些相关研究的介绍,这里不需要叙述。
每一次 NHANES 调查都包含了四个部分:Data(调查的详细结果)、Using data(调查数据概览)、Detail(调查方法的介绍)、Content(关于 NHANES 的介绍)。其中的 Data 部分是我们主要使用的数据,包含了五个自由使用的数据板块和一个受限制使用的数据板块。其他部分都是我们的研究参考。
点开数据板块的任意一个子项,即可查看详细的数据描述,每个子项都包含了一些文档说明信息。其中最主要的数据板块包含 4 列:
- Data File Name:指标名称(可能是复合指标)
- Doc File:一个用于说明这个指标的 doc 文档
- Data File:数据文件,使用 XPT 格式
- Data Published:数据公布时间
NHANES 是横断面研究,但是可以结合纵向的分析,比较多年的横断面研究结果。数据库常见的思路有:
- 某种暴露因素与疾病的关系
- 某种药物使用与疾病的关系
- 在某人群中某些因素的关系——此时的因素可以自由选取
- 因素关系的中介效应——A 是不是通过 B 影响 C
- 某疾病的发病趋势分析与全因死亡率的分析,可以结合相关性进行分析
具体的选题需要结合文献带来的提示。
提示:NHANES 数据集的信息也可以作为一个横断面研究的引子,在研究出一定关系后结合更加复杂的数据与分析方法,如生信分析等。
重要:这个数据库的抽样并不是简单随机抽样,而是多阶段的复杂抽样,因此每个样本都有属于自己的权重,分析的时候需要考虑。
UK Biobank 数据库
UK Biobank 数据库——全球最大的纵向医疗健康数据库。同时包含了足够的横断面数据,可以用于多种分析。其调查对象来自苏格兰,覆盖年龄从 40 岁至 69 岁不等的 50 万人(以调查启动时间计)。
UKB 有着非常好的研究连续性——其受试者是固定的一批人,从 2012 年启动到现在,覆盖基本的医疗健康的数据,同时不断增加新的类型的数据,可以帮助我们进行非常好的纵向研究。
多数据库交叉对比也可以让我们更加确认自己的结论。
注意:这是一个付费的数据库并且需要申请。
CHARLS 数据库
中国健康与养老追踪调查(China Health and Retirement Longitudinal Survey,简称 CHARLS)是由北京大学国家发展研究院主持展开,是国家自然科学基金委资助的重大项目。这是一项持续的纵向调查,旨在收集一套代表中国 45 岁及以上中老年人家庭和个人的高质量微观数据(全面调查),涵盖社会、经济和健康状况,用以分析我国人口老龄化问题,推动老龄化问题的跨学科研究。从 2010 年开始研究,两年进行一次追踪调查。
调查范围包括:
- 个人基本信息
- 家庭结构和经济支持
- 健康状况
- 体格测量
- 医疗服务利用和医疗保险
- 工作、退休
最新的一期数据增加了疫情相关的内容,包括了个人的疾病防范意识、个人患病和隔离、疫情期间个人活动、疫情期间居住地管控。
使用权限需要工作邮箱申请,需要在文章致信处添加附注即可进行使用。
GBD 数据库
想要介绍 GBD 数据库,我们首先需要了解什么是疾病负担(Burden of Disease):
- 在个人层面上,疾病负担是疾病通过伤残和过早死亡(premature death)对患病患者造成的负面影响
- 在社会/国家层面上,疾病负担还包括疾病的发病(Incidence)、患病(Prevalence)对社会造成的负面影响
疾病负担的相关指标包括:疾病的发病和患病、死亡的相关数据、伤残调整生命年(DALY)、健康预期寿命(HALE)、风险因素归因。
GBD(Global Burden of Disease,全球疾病负担)是一个由世界银行和世界卫生组织等机构共同发起的免费公共数据库。
- 截止目前的 GBD2021,包含了 204 个国家与地区的 371 种疾病和损伤以及对应的主要 88 种危险因素的数据。
- GBD 是地区性的汇总数据,没有单个病例的数据,是基于宏观意义上的人数与率的数据。
- GBD 主要涉及的是流行病学负担。
由于是对地区汇总数据的研究,缺少单个病例的数据,GBD 数据库和其他数据库的分析方法会产生差异,更倾向与公共卫生领域而不是临床医学领域。相对而言,这个数据库的分析会更加简单。
- Title: A Practical Guide to Research Databases
- Author: Hyacehila
- Created at : 2025-09-18 04:00:00
- Link: https://hyacehila.github.io//blog/2025/09/18/research-datasets-guide/
- License: This work is licensed under CC BY-NC-SA 4.0.