从RL Agent到LLM Agent的演进不是简单的模型替换,而是学习信号从数值空间迁移到语言空间的范式转换。The Second Half 之后,开放世界研究、语言空间推理与混合架构共同证明:预训练先验、评估与记忆正在重写智能体的主范式
-
从智能体的认知结构到智能体框架
本文从 CoALA 的认知结构出发,讨论 Workflow、Agent、Supervisor、Agent Team 与 MAS 的边界,并分析 LangGraph 等框架的工程价值、抽象代价和未来框架应该提供的基础设施。
-
让Agent变得可行,大模型结构化输出与受限解码技术
介绍 Agent 中结构化输出为什么难,以及提示词、JSON Mode、受限解码和底层推理引擎分别解决了哪些问题。
-
为什么数据总在“骗”你?——反直觉的检查悖论
你是否经常觉得,自己等公交的时间总是比官方公布的平均间隔长?或者学校宣传的“平均小班授课”,到了自己身上却总是上百人的大课?这其实并非你的运气糟糕,而是一个普遍存在于统计学中的陷阱——检查悖论(Inspection Paradox)
-
Why Language Models Hallucinate
基于 OpenAI 团队论文《Why Language Models Hallucinate》:幻觉并非单纯源于数据噪声或模型缺陷,也和现代训练范式与二元评估机制带来的统计压力有关。
-
LLM 推理与训练的本质:从 Surrogate 到强化学习的几何空间
从Loss 只是 Surrogate的视角出发,回顾 Test-Time Compute (TTS) 如何控制泛化误差,并结合 CMU 的能力边缘理论揭示 RL 后训练的边界;微观剖析策略熵坍缩现象与 Meta 的 Three-Gate 理论,了解RL和SFT在微观的差异。
-
大模型的 Loss Landscape 是什么样的?
基于论文 Unveiling the Basin-Like Loss Landscape in Large Language Models,解读大模型 loss landscape 的 basin 现象及其对微调、对齐、越狱与预训练的启示。
-
Compression for AGI:压缩即智能
整理 Jack Rae 在《Compression for AGI》中的观点:基础模型训练可以理解为对有效信息的无损压缩;压缩率越高(loss 越低),模型越可能呈现更强的泛化行为。
-
聊聊齐普夫定律:从伏尼契手稿到外星文明
伏尼契手稿是胡乱涂鸦还是失落的语言?外星人信号长什么样?这一切都指向同一个统计学定律。
-
如何与统计学家分享数据 (Jeff Leek)
本文转载自 Jeff Leek 的经典文章,详细介绍了在与统计学家合作分析数据前,应该如何准备和整理数据(Raw Data, Tidy Data, Code Book)。