BettaFish/MiroFish 和 OpenClaw 分别把 Agent 推到两条信任边界上:我们能相信 AI 说到什么程度,以及我们愿意让 AI 在自己的环境里做到什么程度。
-
Claude Code or Codex:编码模型差异如何变成产品体验的不同
一篇面向开发者的研究综述:从 Claude 系列与 GPT 系列在编码场景中的能力差异出发,理解这些差异如何投射到 Claude Code 与 Codex 的 agent runtime、任务执行边界、上下文组织和工作流体验中。
-
Spec 不是新范式:Vibe Coding、SDD 与 AI 时代的软件工程转向
代码生成成本下降后,软件工程需要更早获得原型和集成反馈,再把经过验证的约束整理成文档、契约、测试与 ADR。Spec 仍然有用,但它更适合系统逐渐收敛之后。
-
Harness 到底是什么:从 model + harness 到工程、产品与用户友好外壳
LangChain 关于 agent = model + harness 的说法只在粗粒度上成立;真实工程里更有解释力的是工程、产品、用户友好外壳与 task interface。
-
Three Gate Problem
三门问题最迷惑人的地方,不是算不出 2/3,而是主持人开门以后,人会本能地把局面看成 50/50。真正关键在于,主持人的行动不是随机事件,而是一次带约束的信息披露。
-
《科幻短篇*3》
科幻短篇三则,灵感来源于被 Anthropic 封号后;当人类社会被人工智能接管,除了金钱的贫富以外另一种阶级的差距;包括大纲在内,正文由 LLM 辅助撰写。
-
生成式 AI 不会直接终结工作,它先重排劳动,再放大需求
凯恩斯低估的不是生产率,而是人类欲望与社会分工的弹性。生成式 AI 更可能压缩旧任务、重排劳动结构,并催生新的服务与需求,而不是直接让劳动消失。
-
Reward 与 Training 在真实 Agent 中如何闭环:从数据治理到在线 RL
按真实系统的训练流水线重写 Agent 训练闭环:从数据治理、工具环境和 verifier 设计,到 trajectories、SFT、curriculum、online RL 与 benchmark audit。
-
Agentic RL:为什么训练闭环比训练算法更重要
当 LLM 从回答问题变成在环境中持续行动,真正决定系统上限的往往不是某个 loss 的名字,而是从数据治理、环境合同、反馈栈到 online RL 再到蒸馏回流的这条训练闭环有没有被接对。
-
从记忆形成到记忆治理:Agent Memory 的全景图
Memory 不是外挂数据库,而是长期认知状态的形成、激活、更新与治理问题。本文梳理 Agent Memory 的全景:五种记忆类型、激活与写入两端、研究演化脉络,以及为什么评测仍跟不上方法演进——难点在写入正确性、时间有效性、冲突消解、遗忘和系统级评测。