Research Theory and Practical Experience

Hyacehila

科研方法论基础

读大量的相关领域内文献是非常重要的,我们需要梳理当前领域都在解决什么问题 ➕ 当前领域都在怎么解决问题,借此选择自己的研究方向。

我们需要学习的有:

  • 核心的领域内课程过一遍——这要依赖于 MIT、B 站、网易公开课、MOOC 等平台进行学习
  • 对于文献,保证广度(哪怕粗读),细读经典文章,看看顶尖学者的研讨课

我们需要发现论文中的 failure cases。事实上作者往往倾向于在文章中展现自己做的比较好的部分,而规避自己做不好的 failure cases——这就是复现的作用:要么在新数据上测试,要么看看同样的方法用于处理不同的问题。

如何解决问题?还是依赖于多读文献,看看当前的学者都在怎么解决问题。

对于具体的科研过程,我们应该先在简单的数据上测试自己的想法,根据试验结果来继续优化自己的想法。遇到不 work 并不可怕,尝试去分析具体的原因,然后解决它。寻找具体的原因可以比较效果好与不好的数据之间的差异。看相关文献的算法设计可以帮我们看看是不是算法有问题。最后别忘了看看我们寻找到的问题是不是对的。最后迁移到真实数据上。

对于开展长期研究,主要的方向有:

  • 推动产业层面的进步
  • 推进算法的进步,处理已经被提出的有定义的问题
  • 提出新的问题并且尝试解决

关注知识之间的联系,扩大自己的知识面,想法总会产生的。所做的每一个小东西都是一个更大的东西的小方面,先把这些小方面做好再组合成一个大系统,以小见大才是科学研究领域的常态。

上手指南

身份转变

客观现实:自主学习的占比增加,从学习旧知识转向研究新知识。

要做什么

  • 和其他人多交流,多学习
  • 在接触陌生理论的时候,迷茫和上手慢非常正常,走弯路也没关系

科研节奏

首先需要明确个人的研究兴趣。在明确兴趣之后,需要研究领域内的现状,看看是否可以找到合适的方向。综合兴趣和硬件条件的支撑来决定是否要进行前面选定的课题。

试错并不可怕,也是一种积累与收获,并且试错是非常普遍的。

节奏是非常重要的——失去标准化的课表之后,平衡文献的阅读与实验,平衡科研工作与生活非常的重要,保证 WLB 才能保证效率。

论文撰写

万事开头难,完成比完美更重要。

基本结构——保证清晰明了的介绍:

  1. 引言部分:我们解决的问题是什么
  2. 引言部分:国内外这个问题研究到了什么程度
  3. 正文部分:我们是怎么解决的
  4. 结果与讨论部分:我们解决这个问题到了什么程度

使用一些文献管理工具是非常好的,可以大大提高效率。

学术报告

最基本的学术报告就是组会了,这也是获取听众反馈的重要手段。设计一场学术报告和组会是完全不同的。

学术报告需要考虑:

  • 听众背景
  • 互动模式
  • 报告的完整性与时长等因素

学术报告的 PPT 也非常重要——简洁清晰是最重要的,LESS IS MORE

文章撰写技巧

关于工作量

  • 整体的工作量一定要充足,这是期刊发文趋势
  • 充足之一就是对比实验要充足——要挑选近几年的 10-20 个算法尽可能多地对比指标,保证一个巨大的表格
  • 消融实验也要充足——多挑选可以进行消融的模块,移除可能可以移除的机制。如果实验数量不足,可以考虑同时移除多个模块研究组合作用;如果还是不够可以考虑把原本复杂的模块简化,这也是一种消融。对于消融实验最少要 3-4 个,当然越多越好

关于数据集

数据集主要包括公开数据集和自己的数据集。公开数据集发文是相对比较有难度的,需要所谓的 SOTA——当然也可以发出更好的文章,而个人数据集可以减少那些比较。

深度学习模块化创新

深度学习是多个模块组成的结构,因此出现了比较严重的水文现象——因为他们的工作都是各种模块的堆叠,只要堆叠不同的结构就是创新点的产生,最后画一个花里胡哨的网络结构图。

**关于一类特殊的 trick:自适应动态 XX 模块。**举个例子:对于原本的标准问题,我们经常会在很多地方同时使用两个一样作用的模块(如特征提取的部分,实现特征融合)进行并行。而在融合部分我们以前的做法一般是等权重加和,而自适应动态模块就是在融合的基础上增加一个动态权重分支,自适应分配权重,然后再起一个名字就可以了。

这里不介绍串行——虽然使用量较大,但如果希望更加复杂的话一般会让模块之间产生交互,但这种程度的修改就比较复杂了,因此这里不介绍。

论文撰写思维

  1. 变更变量:原始研究 x1, x2, x3 等对 y 的影响,我们可以更换其中的部分 x 和 y 得到一个新的文章。这种一般是定量研究。
  2. 创新方法:用一个比较新颖的方法去再次研究已经有的问题,来得到更好的结论。或者自己根据现有的研究创新模型。
  3. 切换情景:对于已有的基于部分地区或者部分来源的数据的研究,切换我们的数据来源和研究情景,或许可以得到新的结论。既可以研究单一情景,也可以对比不同情景。
  4. 反向证明:去否定现有的主流研究趋势的结论或者社会大众的普遍认知。

以上的内容只适用于实证分析问题。

综合排名与数据美化

  1. 缩小样本,降低估计精度,避免假设检验发现差距
  2. 多指标综合评估算法,避免单一指标需要直接美化指标的造假行为
  3. 由于各指标本身特性不同,我们根据单一指标给予各个方法独立的排名,然后基于排名二次开发最终评价体系
  4. 考虑利用排名的均值、中位数、第一名/第二名最多的(众数)等基础数理统计指标进行排名
  5. 考虑根据名次进行综合赋分——各个 rank 的赋分根据情况确定,保证需要的算法得高分
  6. 继续根据 rank 进行二次开发指标,使用统计无监督学习提取指标
  7. 以上都是单数据集,或许可以在多数据集综合上再搞一次——毕竟多数据集本质就是一个多视角的指标
  • Title: Research Theory and Practical Experience
  • Author: Hyacehila
  • Created at : 2025-09-04 04:00:00
  • Link: https://hyacehila.github.io//blog/2025/09/04/research-theory-and-practice/
  • License: This work is licensed under CC BY-NC-SA 4.0.
Comments