介绍 MCP 的 Host、Client、Server 分层,stdio 与 Streamable HTTP 传输,以及用 Python SDK 编写和调试 MCP Server/Client 的基本流程。
-
统计学的应用与应用的统计学
讨论统计学在追求理论完备的过程中为什么逐渐远离应用现场,以及数据科学与机器学习如何在大数据时代重新接上“从数据中学习”的问题。
-
数据科学的第60年
回顾数据科学60年的发展历程,从 John Tukey 的预言到 David Donoho 的广义数据科学。讨论统计学、计算机科学与机器学习如何合流,以及数据科学为什么需要同时处理推断、计算和现实问题。
-
统计学常用评估指标R方,它从不衡量模型与真实世界的拟合程度
R 方不是单纯的模型误差函数,它的定义中还隐含了两个模型的比较:一个是当前被分析的模型,一个是所谓的常数模型,即只利用因变量均值进行预测的模型。基于此,R 方从不衡量模型与真实世界的拟合程度。
-
常见的统计检验本质上都是线性模型 (Common statistical tests are linear models)
转载自 Jonas Kristoffer Lindeløv 的文章。揭示了 t 检验、ANOVA、卡方检验等常用统计方法背后的统一线性模型原理。
-
基础预测模型的基本限制:多模态与严谨评估的必要性
深度学习在时间序列预测中真的总是有效吗?本文基于 Christoph Bergmeir 在 NeurIPS 2024 的演讲,讨论基础预测模型的局限性、评估中的陷阱,以及为什么时间序列预测需要引入多模态上下文。
-
从主成分回归 (PCR) 到偏最小二乘 (PLS)
当数据存在多重共线性时,PCR 和 PLSR 都是常用的降维回归方法。本文详细推导了 PCR 与 PLSR 的数学原理,分析了 PCR “只看 X 不看 Y” 的潜在缺陷,并直观解释了 PLSR 如何通过引入因变量相关性来解决这一问题。
-
数字不会撒谎,但撒谎的人会编数字:从本福特定律聊聊统计造假识别
数据过于平滑或数字分布异常时,可能值得进一步检查。本文介绍本福特定律、末位数字、方差、相关结构和门槛聚束等检测思路。
-
The Illustrated Guide to a Ph.D.
每年秋天,Matt Might 都要向新一批博士生解释什么是博士学位。用来描绘从小学到博士毕业的知识积累过程。
-
Neural Scaling Laws:从 Kaplan 到 Chinchilla
本文从 Kaplan 定律到 Chinchilla 修正,整理 Scaling Law 的经验规律,并简单讨论 Tree Model 与 Scaling Law 的关系。