真正让 Agent 变成可交付系统的,不是核心 loop,而是围绕 LLM 不确定性搭出来的外围工程:把语言请求进一步下沉成工具契约、知识路由、生命周期验证、隔离恢复与自治治理。
-
从 LSH 到 K-center-greedy:语义嵌入如何做数据去重、清洗与样本筛选
语义嵌入不只是用来做检索。LSH 初筛、Faiss 语义去重和 K-center-greedy 样本筛选,都在利用同一个表示空间处理冗余、覆盖与召回问题。
-
Reward 设计的演化:从 RLHF 到 RLVR,监督对象如何被重写
梳理 reward 如何从偏好对、可验证结果、过程监督、rubric 到开放 agent 排序,逐步把“好回答”改写成更稳的监督对象。
-
Model Is Good Enough:2026 年,AI 真正稀缺的是应用而不是更大的模型
Model 已经跨过够用阈值。2026 年更稀缺的,不是下一个更大的基模,而是那些能进入工作流与生活、并反过来生产数据与反馈的应用。
-
从黑盒预测器到可追溯医疗 Agent:医疗AI的未来
按技术演进梳理医疗 AI 如何从黑盒预测器走向可追溯医疗 Agent。
-
行为审计与行为解码:从 Reward 之后到 Agent 可观测性
Reward 负责把目标写进优化器,但它不负责证明模型真的学会了正确目标。本文从初学者视角重写行为审计与行为解码:为什么 reward 之后还需要后验校验,Anthropic 与 Transluce 两条路线分别在补什么空白。
-
AEnvironment:Agent Dev 为什么需要交互环境层?
SWE-bench、SWE-agent 和 Tau-bench 都在提醒一件事:Agent Dev 不能只盯模型和框架。任务、工具、用户、状态、规则和验证器怎样被组织成环境,会直接影响 agent 能不能工作。
-
LLM 对齐中的强化学习:从奖励信号到优势估计
从 reward、baseline、advantage 与 normalization 这条信号链出发,解释为什么 LLM 对齐中的 RL 算法总在重写奖励信号。
-
为什么更好的 Simulator 往往是 Learning + Rules:从 PDE、光线追踪到 DLSS
更好的 simulator 往往来自明确分工:把守恒、几何、因果、边界条件与渲染/求解结构当作归纳偏置,再让 learning 去补昂贵、模糊或难解析的部分。
-
从 MCP 到 Agent Skills:为什么 Agent 又需要一种新的上下文工程协议?
Agent Skills 的流行主要来自低摩擦的能力封装。它是上下文工程中有价值的一层,但不是新的统一协议,也不是 Agent 的终局。