科研理论与实践经验
科研方法论基础
这篇文章中的问题也可以和科学写作指南、文献综述方法论指南放在一起阅读,以比较相近的概念如何在不同语境中展开。
读大量的相关领域内文献是非常重要的,我们需要梳理当前领域都在解决什么问题 ➕ 当前领域都在怎么解决问题,借此选择自己的研究方向。
我们需要学习的有:
- 核心的领域内课程过一遍——这要依赖于 MIT、B 站、网易公开课、MOOC 等平台进行学习
- 对于文献,保证广度(哪怕粗读),细读经典文章,看看顶尖学者的研讨课
我们需要发现论文中的 failure cases。事实上作者往往倾向于在文章中展现自己做的比较好的部分,而规避自己做不好的 failure cases——这就是复现的作用:要么在新数据上测试,要么看看同样的方法用于处理不同的问题。
如何解决问题?还是依赖于多读文献,看看当前的学者都在怎么解决问题。
对于具体的科研过程,我们应该先在简单的数据上测试自己的想法,根据试验结果来继续优化自己的想法。遇到不 work 并不可怕,尝试去分析具体的原因,然后解决它。寻找具体的原因可以比较效果好与不好的数据之间的差异。看相关文献的算法设计可以帮我们看看是不是算法有问题。最后别忘了看看我们寻找到的问题是不是对的。最后迁移到真实数据上。
对于开展长期研究,主要的方向有:
- 推动产业层面的进步
- 推进算法的进步,处理已经被提出的有定义的问题
- 提出新的问题并且尝试解决
关注知识之间的联系,扩大自己的知识面,想法总会产生的。所做的每一个小东西都是一个更大的东西的小方面,先把这些小方面做好再组合成一个大系统,以小见大才是科学研究领域的常态。
上手指南
身份转变
客观现实:自主学习的占比增加,从学习旧知识转向研究新知识。
要做什么:
- 和其他人多交流,多学习
- 在接触陌生理论的时候,迷茫和上手慢非常正常,走弯路也没关系
科研节奏
首先需要明确个人的研究兴趣。在明确兴趣之后,需要研究领域内的现状,看看是否可以找到合适的方向。综合兴趣和硬件条件的支撑来决定是否要进行前面选定的课题。
试错并不可怕,也是一种积累与收获,并且试错是非常普遍的。
节奏是非常重要的——失去标准化的课表之后,平衡文献的阅读与实验,平衡科研工作与生活非常的重要,保证 WLB 才能保证效率。
论文撰写
万事开头难,完成比完美更重要。
基本结构——保证清晰明了的介绍:
- 引言部分:我们解决的问题是什么
- 引言部分:国内外这个问题研究到了什么程度
- 正文部分:我们是怎么解决的
- 结果与讨论部分:我们解决这个问题到了什么程度
使用一些文献管理工具是非常好的,可以大大提高效率。
学术报告
最基本的学术报告就是组会了,这也是获取听众反馈的重要手段。设计一场学术报告和组会是完全不同的。
学术报告需要考虑:
- 听众背景
- 互动模式
- 报告的完整性与时长等因素
学术报告的 PPT 也非常重要——简洁清晰是最重要的,LESS IS MORE。
文章撰写技巧
关于工作量
- 整体的工作量一定要充足,这是期刊发文趋势
- 充足之一就是对比实验要充足——要挑选近几年的 10-20 个算法尽可能多地对比指标,保证一个巨大的表格
- 消融实验也要充足——多挑选可以进行消融的模块,移除可能可以移除的机制。如果实验数量不足,可以考虑同时移除多个模块研究组合作用;如果还是不够可以考虑把原本复杂的模块简化,这也是一种消融。对于消融实验最少要 3-4 个,当然越多越好
关于数据集
科研数据既可以来自公开数据库,也可以由研究者自行采集。选择数据源时不能只看规模或使用热度,而应先确定研究问题所需的观察单位、研究设计、时间跨度、抽样机制和可获得变量,再核对访问条件、数据字典与可复现性要求。公开数据库便于复现和比较,自建数据则更容易贴合特定问题;两者都必须正视代表性、测量误差与选择偏差。
临床与公共卫生数据库参考
| 数据库 | 研究设计与数据粒度 | 访问方式 | 主要限制 |
|---|---|---|---|
| NHANES | 重复横断面调查;提供个体级问卷、体检和实验室数据 | 公开下载 | 各调查周期不能直接视为同一批人的纵向随访,合并周期时需要按官方规则调整权重 |
| UK Biobank | 前瞻性队列;提供个体级长期随访和多模态健康数据 | 研究申请 | 参与者存在选择偏差,将结论外推到一般人群时需要谨慎 |
| CHARLS | 中国 45 岁及以上中老年人的纵向调查;包含个体与家庭数据 | 注册申请 | 跨期研究需要处理追踪失访、变量口径变化和调查权重 |
| GBD | 按地区、时期、疾病和危险因素组织的模型估计汇总数据 | 公开工具与下载 | 不包含个体病例,不能据此进行个体层面推断,并需警惕生态谬误 |
NHANES 采用复杂的多阶段分层概率抽样,并不是简单随机抽样。进行总体推断时,需要同时使用相应的样本权重、分层变量与主抽样单元(PSU);使用特定检查或实验室子样本时,还应选择与该模块匹配的权重。
深度学习模块化创新
深度学习是多个模块组成的结构,因此出现了比较严重的水文现象——因为他们的工作都是各种模块的堆叠,只要堆叠不同的结构就是创新点的产生,最后画一个花里胡哨的网络结构图。
**关于一类特殊的 trick:自适应动态 XX 模块。**举个例子:对于原本的标准问题,我们经常会在很多地方同时使用两个一样作用的模块(如特征提取的部分,实现特征融合)进行并行。而在融合部分我们以前的做法一般是等权重加和,而自适应动态模块就是在融合的基础上增加一个动态权重分支,自适应分配权重,然后再起一个名字就可以了。
这里不介绍串行——虽然使用量较大,但如果希望更加复杂的话一般会让模块之间产生交互,但这种程度的修改就比较复杂了,因此这里不介绍。
论文撰写思维
- 变更变量:原始研究 x1, x2, x3 等对 y 的影响,我们可以更换其中的部分 x 和 y 得到一个新的文章。这种一般是定量研究。
- 创新方法:用一个比较新颖的方法去再次研究已经有的问题,来得到更好的结论。或者自己根据现有的研究创新模型。
- 切换情景:对于已有的基于部分地区或者部分来源的数据的研究,切换我们的数据来源和研究情景,或许可以得到新的结论。既可以研究单一情景,也可以对比不同情景。
- 反向证明:去否定现有的主流研究趋势的结论或者社会大众的普遍认知。
以上的内容只适用于实证分析问题。
综合排名与数据美化
- 缩小样本,降低估计精度,避免假设检验发现差距
- 多指标综合评估算法,避免单一指标需要直接美化指标的造假行为
- 由于各指标本身特性不同,我们根据单一指标给予各个方法独立的排名,然后基于排名二次开发最终评价体系
- 考虑利用排名的均值、中位数、第一名/第二名最多的(众数)等基础数理统计指标进行排名
- 考虑根据名次进行综合赋分——各个 rank 的赋分根据情况确定,保证需要的算法得高分
- 继续根据 rank 进行二次开发指标,使用统计无监督学习提取指标
- 以上都是单数据集,或许可以在多数据集综合上再搞一次——毕竟多数据集本质就是一个多视角的指标
- 标题: 科研理论与实践经验
- 作者: Hyacehila
- 创建于 : 2025-09-04 04:00:00
- 链接: https://hyacehila.github.io//blog/2025/09/04/research-theory-and-practice/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。