NextGen Research
经管领域的 AI 学术前沿技术分享

Agent 的诞生

从无状态概率机器到 Claude Code
开场一问:你用过 ChatGPT——那它和 Agent 差在哪?
02 · Definition

什么是 Agent

以 LLM 为大脑,感知环境、规划决策、调用工具、验证结果,在动态循环中完成目标的系统。

Agent = LLM + Harness
感知环境 规划决策 调用工具 验证结果
动态循环
「循环」是与一次性问答的分水岭。Agent 中文译作「智能体」;Harness Engineering,即构造 LLM 外围系统的一切工程——完整组件清单,结尾揭晓。
NextGen Research
Chapter 01
什么是 LLM
先拆开大脑,再谈身体。
04 · 地基

LLM 的本质

一台无状态条件概率机器

Token 序列 LLM 下一 Token 概率分布 采样拼接
每轮重新读入全部上下文 · 无状态
输入什么是 LLM?
输出LLM 是一台无状态的条件概率机器——给定上文,预测下一个 Token。
这一页是全课的地基——后面每一个结论,都从「无状态」三个字推出来。
05 · 训练

预训练、后训练与知识的边界

预训练

海量语料上做下一 Token 预测,把世界知识压进参数,完成后即冻结——参数越大、知识越多,但有两个前提。

前提一喂得够多:语料里真的出现过
前提二不是长尾:出现频率足够高

后训练

在冻结的基座之上,对齐人的意图与偏好——教格式、练推理,但不增加新知识。

SFT指令数据:教格式与遵循
RLHF · DPO偏好反馈:对齐人类喜好
RLVR可验证奖励:练推理——不增加知识
海量语料 预训练 基座模型(参数冻结) 后训练 对话 & 推理模型
GLM5.2 以 744B-40B(MoE:总参 744B,每次推理激活约 40B)在编程领域追平万亿级 SOTA——后训练在易构建 RLVR 的场景收益最大;而长尾知识谁也记不住——这为后面的 RAG 埋下伏笔。
06 · 推理

推理与思维链

思维链(CoT)= 多步推理的显式草稿纸

反例没有思维链 = 强迫一步心算——中间状态无处安放,一步错全错
外化中间状态写到上下文里,看得见
回溯错误定位在某一步,可以纠正
问题 步骤 ① 步骤 ② 步骤 ③ 答案
本质:用 test-time 的计算量,换正确率。
07 · 选型

LLM 选择

场景追求的能力推荐
科研写作世界知识、逻辑严谨与多步骤推理GPT / Gemini (平替 Qwen3.8-Max)
代码与数据分析工具调用与长上下文代码能力Claude (平替 Kimi-K3)
中文政策解读中文语料与政策语境理解DeepSeek
低成本探索成本优先,能力够用即可DeepSeek-v4-Flash
能力对比 · 定性
GPT / GeminiClaudeDeepSeek
世界知识
多步推理
代码与工具调用
中文语境
成本优势
选型就两根轴:任务类型 × 成本。对比为定性(● 强 / ◐ 中 / ○ 弱),依讲义推荐逻辑,非基准测试分数。
08 · Prompt Engineering

PE 六要素 × 代码审查

要素解释示例 · 代码审查
Role定视角——以什么身份说话你是资深后端工程师
Goal定任务——唯一必需项审查 PR 的正确性 (差:帮我看看这段代码)
Context消猜测——背景一次给足支付服务 / Go 1.22
Constraint收窄发挥——明确不做什么只报告 bug 与并发风险
Format保证可用——输出即交付物按严重度排序的列表
Acceptance Criteria内置裁判——可检查的验收线每条附代码行号与复现路径 (「代码要优雅」不算)
Goal 是唯一必需项,验收标准必须「可检查」。两个技巧:Few-shot = 最便宜的「后训练」;思维链提示——「请一步步思考」。
NextGen Research
Chapter 02
Agent 萌芽
大脑有六个先天缺陷——每一块补丁,都是一块积木。
10 · 缺陷清单

LLM 的六个先天问题

01无记忆每次调用从零开始补丁 · 对话历史
02知识冻结训练截止后一无所知补丁 · RAG 检索
03幻觉不懂也照答补丁 · 检索 + 引用验证
04上下文有限注意力机制的计算约束补丁 · 上下文压缩调度
05不会行动只能输出文本补丁 · Function Calling
06精确计算差token 化 + 概率采样的天性补丁 · 代码执行
核心矛盾 · 全课题眼

无限的信息需求 vs 有限的上下文窗口

限制唯一入口是 Prompt,窗口又有限 技术走向所有技术都在回答:什么信息、什么时机、什么形态进入窗口
每条都追问一句「怎么补?」——答案贯穿后半场。
11 · 第一块补丁

ChatGPT:最小的 Harness

补 · 01 无记忆每次调用从零开始对话历史当记忆
ChatGPT = 对话循环 + 历史消息当记忆
历史消息 + 新消息 LLM 回复 追加进历史
多轮对话循环
补上了「无状态」的第一块补丁:多轮对话里,模型像有了记忆
天花板记忆溢出窗口 → 逼出下一步:接工具
产品化ChatGPT 的搜索工具 = RAG 产品化:搜索 → 抓网页 → 塞进窗口;2023.6 Function Calling 提出——接工具的起点
12 · RAG

RAG:开卷考试

补 · 02 知识冻结训练截止后一无所知检索材料注入窗口
提问 检索(向量库 / grep) Top-K 材料 注入 Prompt 基于材料作答
分工记忆管主干,检索管长尾
Agent 时代向量索引 → Agentic Search(grep,在线迭代)
没有失业窗口涨到 1M 后 RAG 仍在——装得下 ≠ 用得好;非结构化知识库,向量 RAG 仍是主力
代码场景 grep 为什么赢:符号精确、可迭代、永远新鲜。
13 · 工具协议

Function Calling

补 · 05 不会行动只能输出文本结构化请求,Harness 执行
模型输出 JSON 请求 Harness 解析并执行 环境返回结果 写入上下文
下一轮生成
模型输出{"name": "get_weather", "arguments": {"city": "北京"}}
Harness 执行后回流{"temperature": "32°C", …}
最终回答「北京今天 32°C,晴」
要点一模型从不「调」函数——它只输出结构化请求
要点二工具结果绕不开上下文,仍占窗口
权责划分:模型决策、Harness 执行、环境反馈。
14 · ReAct

ReAct:循环的骨架

补 · 03 幻觉不懂也照答现实反馈当裁判
Thought想一步 · 推理 Action做一步 · 调工具 Observation外部世界看结果 · 环境反馈
结果写回上下文 · 循环
上下文窗口 · 随循环累积
Thought₁用户问北京天气——得先查
Action₁get_weather(city="北京")
Observation₁32°C,晴 ← 外部世界写回
Thought₂拿到结果,可以回答了
Action₂输出最终回答
交织LLM 负责想 → 想法经 Function Calling 交给工具执行 → 结果写回上下文,成为下一步推理的条件
与 CoT 之别思维链是封闭循环——中间 token 全是模型自己生成,想错了没有外部信号纠正;ReAct 打开缺口,把环境反馈写进循环
出处Google Brain《ReAct: Synergizing Reasoning and Acting》· 2022.10 发布、2023 走红——至今仍是 Agent 的骨架
想错了,现实会打脸——封闭循环缺的裁判补上了:循环里有了外部世界。
15 · 突破口

为什么从 Code 突破

补 · 06 精确计算差token 化 + 概率采样的天性代码执行

反馈可验证:编译 / 测试就是裁判

对照营销文案需要人来评判 → 循环被中断
土壤shell / Git / 编译器 / linter / CI——全是文本进出、接口标准,Harness 接上就能用;Git 改错了可撤销,是天然沙箱
语料代码是「LLM 友好型」文本:语法严格、歧义少、模块化——GitHub 给了最丰富的训练语料
演进 · 循环主动权:人 → AI
2021
CopilotGitHub 出品,IDE 插件形态做代码补全——内核始终是「人是司机,AI 是副驾」
2023
Cursor围绕 AI 重做编辑器:全仓库 RAG 索引、Composer 多文件编辑、Tab 预测,2024 底加 Agent 模式
2025
Claude Code相反的赌注:把 Agent 循环而非编辑器作为产品内核——终端即界面,shell 即工具集,人退为「验收者」
金句:每外溢一个领域,先问「谁来当裁判?」
16 · 2023.3 · 破圈

AutoGPT:补丁连成循环

给一个目标(「帮我调研竞品并写报告」),让它自己拆解、搜索、读写文件、循环迭代——两周冲上 GitHub 星标纪录。

目标 拆解任务 执行 观察 再规划
自主循环
失败模式 · 死循环 / 跑偏 / 烧钱
意义让大众第一次看见「AI 自己干活」;BabyAGI、AgentGPT 同期追随——Agent 从论文概念变成全民话题
时机2025 才成日用品:推理可靠性 ↑、FC 稳定性 ↑、长上下文价格 ↓
落地Copilot → Cursor → Claude Code:循环的主动权,一步一步交给了 AI
破圈靠的不是好用,而是想象力。
17 · 收束

Harness:事实标准

上下文调度 补 · 无记忆 / 上下文有限 / 知识冻结
01System Prompt角色、边界与行为准则
03CLAUDE.md注入持久知识,补「无状态」
04SubAgent上下文分治,隔离脏活
06压缩窗口的生命周期管理
09Skills流程与领域知识封装成包,按需加载
行动能力 补 · 不会行动 / 精确计算差
02工具集补上「没有手和脚」
10MCP工具的标准化接入协议
确定性控制 补 · 幻觉 / 概率机器的不确定性
05PlanMode「想」和「做」显式分阶段
07权限给工具划边界,控制破坏半径
08Hooks在循环确定点位注入确定性逻辑
全课收束:LLM 是无状态概率机器 → 缺陷逼出核心矛盾 → 每个补丁都是一块积木 → Claude Code 拼成标准。
下一讲预告:通过 Claude Code CLI,逐一拆解这十个组件。
← / → · space · R reset