2026

31 posts

Agent Memory 设计

Agent Memory 是让 Agent 在多次对话甚至多次会话之后,仍然记得用户是谁、偏好什么、之前处理过什么的关键组件。这里的 Memory 就是 Context Engineering 中说到的**应该从当前窗口 ISOLATE 到长期档案的信息**。 在 CoALA 的认知架构分类中,Memory 的类型如下: - **Working memory**:当前...

Agent 会话管理的原理

在前面的文章中我们提到:nonoka cli 每轮对话 spawn 一个全新进程,进程跑完就自己关掉了。初步接触这个流程的人可能会有下面的疑惑:“进程死了,内存里的执行状态全没了。新进程是从头开始跑入口代码的,它凭什么知道接着上次聊?怎么知道该拿哪个 checkpoint?” 弄清这个问题需要明确下面三个东西: 1. **代码在磁盘上**(Python 源文件,随时可以重新启动); 2...

从零开始的 Nonoka Agent 框架设计

> 这篇文章简单介绍一下前面 nonoka cli 文章中提到的自研 nonoka agent 框架的设计思路,这个框架也是经过了很多次推倒重来才初步完成的,在开发过程中也学到了很多东西,欢迎讨论。 最初想做 nonoka agent 框架是因为四月份看到 babyagi 项目和深入学了下装饰器的使用,想做一个类型安全、事件驱动、使用装饰器配置组装的 Agent...

基于 Vercel AI SDK 设计 Agent2OpenCode 协议

> 最近实现了一个使用 Opencode 作为 TUI 前端的 CLI 应用,之后会记录一下这期间的一些设计思路和实现细节。 和 Langchain、LlamaIndex 等框架不同,Vercel AI SDK 是一个**面向前端/UI的框架**,它解决了如何将大模型的输出优雅地在前端/UI中渲染出来的问题。 在 Vercel AI SDK 中,所有的模型...

DPO

DPO 是用来让模型和人类需要的偏好进行对齐的开发方法。在传统的 RLHF 中,我们需要用四个模型:Actor,Reference,Reward 与 Critic,这给显存带来和很大压力。而 DPO 跳过了“训练奖励模型”和“强化学习”这两个阶段,通过一个数学上的等价变换,直接**利用 Chosen(优) 和 Rejected(劣) 数据**对来更新模型。 首先先看最原始的...