假设检验很强大,但它依赖前提;p 值显著也不等于“结论正确”的概;任何不精通统计学的人都可能在无意中进行统计造假。
-
表格数据上仍旧是SOTA:XGBoost、LightGBM 与 CatBoost
为什么结构化表格数据场景里,提升树至今仍常是最强 baseline?本文聚焦 XGBoost、LightGBM 与 CatBoost,讨论它们各自的技术重心、工程取舍与最佳战场。
-
从 LLM 到 VLM,语言模型如何实现视觉理解
梳理从纯语言模型到视觉-语言模型的技术路线,说明 CLIP、VLM、扩散模型与原生多模态在输入表示、训练目标和推理方式上的差异。
-
从欧氏空间到流形拓扑:高维数据的降维之旅
从高维小样本与维数灾难出发,梳理 EDA、正则化与稀疏性等高维统计思路,并重点介绍 PCA/MDS、t-SNE、UMAP、Autoencoder 等降维方法的数学直觉与适用场景。
-
安斯库姆四重奏:可视化的力量与统计错觉
数值计算是精确的,图表是粗略的?统计学家 Francis Anscombe 用四组特殊的数据集打破了这一成见。本文通过安斯库姆四重奏(Anscombe’s Quartet)讨论探索性数据分析(EDA)在统计推断中的必要性。
-
统计与真理:如何运用偶然性 (Statistics and Truth)
在终极的分析中,一切知识都是历史;在抽象的意义下,一切科学都是数学;在理性的基础上,所有的判断都是统计学。—— C.R. Rao。本文重读这本统计学经典,回顾统计学的历史以及发展中产生的诸多问题。
-
LLM 是否带来技术平权?(Does LLM Bring Equality?)
LLM 让知识接触、解释、翻译和表达变得前所未有地便宜,但答案入口的平权并不等于理解、判断和学习路径的平权。问题在于,AI 能否帮助人获得能力,而不只是更快拿到答案。
-
2025 年度总结:远近之间
总结 2025,以及过去的二十多年:我做了什么,又该去做些什么。
-
PocketFlow 源码解读:用百行代码理解 Agent Flow 抽象
从 PocketFlow 的 BaseNode、Node、Flow、Batch 与 Async 实现出发,梳理一个极简 LLM Agent 框架如何用图、共享存储和节点协议组织工作流。