科研理论与实践经验

Hyacehila

科研方法论基础

这篇文章中的问题也可以和科学写作指南文献综述方法论指南放在一起阅读,以比较相近的概念如何在不同语境中展开。

读大量的相关领域内文献是非常重要的,我们需要梳理当前领域都在解决什么问题 ➕ 当前领域都在怎么解决问题,借此选择自己的研究方向。

我们需要学习的有:

  • 核心的领域内课程过一遍——这要依赖于 MIT、B 站、网易公开课、MOOC 等平台进行学习
  • 对于文献,保证广度(哪怕粗读),细读经典文章,看看顶尖学者的研讨课

我们需要发现论文中的 failure cases。事实上作者往往倾向于在文章中展现自己做的比较好的部分,而规避自己做不好的 failure cases——这就是复现的作用:要么在新数据上测试,要么看看同样的方法用于处理不同的问题。

如何解决问题?还是依赖于多读文献,看看当前的学者都在怎么解决问题。

对于具体的科研过程,我们应该先在简单的数据上测试自己的想法,根据试验结果来继续优化自己的想法。遇到不 work 并不可怕,尝试去分析具体的原因,然后解决它。寻找具体的原因可以比较效果好与不好的数据之间的差异。看相关文献的算法设计可以帮我们看看是不是算法有问题。最后别忘了看看我们寻找到的问题是不是对的。最后迁移到真实数据上。

对于开展长期研究,主要的方向有:

  • 推动产业层面的进步
  • 推进算法的进步,处理已经被提出的有定义的问题
  • 提出新的问题并且尝试解决

关注知识之间的联系,扩大自己的知识面,想法总会产生的。所做的每一个小东西都是一个更大的东西的小方面,先把这些小方面做好再组合成一个大系统,以小见大才是科学研究领域的常态。

上手指南

身份转变

客观现实:自主学习的占比增加,从学习旧知识转向研究新知识。

要做什么

  • 和其他人多交流,多学习
  • 在接触陌生理论的时候,迷茫和上手慢非常正常,走弯路也没关系

科研节奏

首先需要明确个人的研究兴趣。在明确兴趣之后,需要研究领域内的现状,看看是否可以找到合适的方向。综合兴趣和硬件条件的支撑来决定是否要进行前面选定的课题。

试错并不可怕,也是一种积累与收获,并且试错是非常普遍的。

节奏是非常重要的——失去标准化的课表之后,平衡文献的阅读与实验,平衡科研工作与生活非常的重要,保证 WLB 才能保证效率。

论文撰写

万事开头难,完成比完美更重要。

基本结构——保证清晰明了的介绍:

  1. 引言部分:我们解决的问题是什么
  2. 引言部分:国内外这个问题研究到了什么程度
  3. 正文部分:我们是怎么解决的
  4. 结果与讨论部分:我们解决这个问题到了什么程度

使用一些文献管理工具是非常好的,可以大大提高效率。

学术报告

最基本的学术报告就是组会了,这也是获取听众反馈的重要手段。设计一场学术报告和组会是完全不同的。

学术报告需要考虑:

  • 听众背景
  • 互动模式
  • 报告的完整性与时长等因素

学术报告的 PPT 也非常重要——简洁清晰是最重要的,LESS IS MORE

文章撰写技巧

关于工作量

  • 整体的工作量一定要充足,这是期刊发文趋势
  • 充足之一就是对比实验要充足——要挑选近几年的 10-20 个算法尽可能多地对比指标,保证一个巨大的表格
  • 消融实验也要充足——多挑选可以进行消融的模块,移除可能可以移除的机制。如果实验数量不足,可以考虑同时移除多个模块研究组合作用;如果还是不够可以考虑把原本复杂的模块简化,这也是一种消融。对于消融实验最少要 3-4 个,当然越多越好

关于数据集

科研数据既可以来自公开数据库,也可以由研究者自行采集。选择数据源时不能只看规模或使用热度,而应先确定研究问题所需的观察单位、研究设计、时间跨度、抽样机制和可获得变量,再核对访问条件、数据字典与可复现性要求。公开数据库便于复现和比较,自建数据则更容易贴合特定问题;两者都必须正视代表性、测量误差与选择偏差。

临床与公共卫生数据库参考

数据库 研究设计与数据粒度 访问方式 主要限制
NHANES 重复横断面调查;提供个体级问卷、体检和实验室数据 公开下载 各调查周期不能直接视为同一批人的纵向随访,合并周期时需要按官方规则调整权重
UK Biobank 前瞻性队列;提供个体级长期随访和多模态健康数据 研究申请 参与者存在选择偏差,将结论外推到一般人群时需要谨慎
CHARLS 中国 45 岁及以上中老年人的纵向调查;包含个体与家庭数据 注册申请 跨期研究需要处理追踪失访、变量口径变化和调查权重
GBD 按地区、时期、疾病和危险因素组织的模型估计汇总数据 公开工具与下载 不包含个体病例,不能据此进行个体层面推断,并需警惕生态谬误

NHANES 采用复杂的多阶段分层概率抽样,并不是简单随机抽样。进行总体推断时,需要同时使用相应的样本权重、分层变量与主抽样单元(PSU);使用特定检查或实验室子样本时,还应选择与该模块匹配的权重。

深度学习模块化创新

深度学习是多个模块组成的结构,因此出现了比较严重的水文现象——因为他们的工作都是各种模块的堆叠,只要堆叠不同的结构就是创新点的产生,最后画一个花里胡哨的网络结构图。

**关于一类特殊的 trick:自适应动态 XX 模块。**举个例子:对于原本的标准问题,我们经常会在很多地方同时使用两个一样作用的模块(如特征提取的部分,实现特征融合)进行并行。而在融合部分我们以前的做法一般是等权重加和,而自适应动态模块就是在融合的基础上增加一个动态权重分支,自适应分配权重,然后再起一个名字就可以了。

这里不介绍串行——虽然使用量较大,但如果希望更加复杂的话一般会让模块之间产生交互,但这种程度的修改就比较复杂了,因此这里不介绍。

论文撰写思维

  1. 变更变量:原始研究 x1, x2, x3 等对 y 的影响,我们可以更换其中的部分 x 和 y 得到一个新的文章。这种一般是定量研究。
  2. 创新方法:用一个比较新颖的方法去再次研究已经有的问题,来得到更好的结论。或者自己根据现有的研究创新模型。
  3. 切换情景:对于已有的基于部分地区或者部分来源的数据的研究,切换我们的数据来源和研究情景,或许可以得到新的结论。既可以研究单一情景,也可以对比不同情景。
  4. 反向证明:去否定现有的主流研究趋势的结论或者社会大众的普遍认知。

以上的内容只适用于实证分析问题。

综合排名与数据美化

  1. 缩小样本,降低估计精度,避免假设检验发现差距
  2. 多指标综合评估算法,避免单一指标需要直接美化指标的造假行为
  3. 由于各指标本身特性不同,我们根据单一指标给予各个方法独立的排名,然后基于排名二次开发最终评价体系
  4. 考虑利用排名的均值、中位数、第一名/第二名最多的(众数)等基础数理统计指标进行排名
  5. 考虑根据名次进行综合赋分——各个 rank 的赋分根据情况确定,保证需要的算法得高分
  6. 继续根据 rank 进行二次开发指标,使用统计无监督学习提取指标
  7. 以上都是单数据集,或许可以在多数据集综合上再搞一次——毕竟多数据集本质就是一个多视角的指标
  • 标题: 科研理论与实践经验
  • 作者: Hyacehila
  • 创建于 : 2025-09-04 04:00:00
  • 链接: https://hyacehila.github.io//blog/2025/09/04/research-theory-and-practice/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。
评论