经管领域的 AI 学术前沿技术分享
Agent 的诞生
从无状态概率机器到 Claude Code
开场一问:你用过 ChatGPT——那它和 Agent 差在哪?
02 · Definition
什么是 Agent
以 LLM 为大脑,感知环境、规划决策、调用工具、验证结果,在动态循环中完成目标的系统。
Agent = LLM + Harness
感知环境→
规划决策→
调用工具→
验证结果
←
动态循环
「循环」是与一次性问答的分水岭。Agent 中文译作「智能体」;Harness Engineering,即构造 LLM 外围系统的一切工程——完整组件清单,结尾揭晓。
Chapter 01
什么是 LLM
先拆开大脑,再谈身体。
04 · 地基
LLM 的本质
一台无状态的条件概率机器。
Token 序列→
LLM→
下一 Token 概率分布→
采样拼接
←
每轮重新读入全部上下文 · 无状态
输入什么是 LLM?
输出LLM 是一台无状态的条件概率机器——给定上文,预测下一个 Token。
这一页是全课的地基——后面每一个结论,都从「无状态」三个字推出来。
05 · 训练
预训练、后训练与知识的边界
预训练
海量语料上做下一 Token 预测,把世界知识压进参数,完成后即冻结——参数越大、知识越多,但有两个前提。
前提一喂得够多:语料里真的出现过
前提二不是长尾:出现频率足够高
后训练
在冻结的基座之上,对齐人的意图与偏好——教格式、练推理,但不增加新知识。
SFT指令数据:教格式与遵循
RLHF · DPO偏好反馈:对齐人类喜好
RLVR可验证奖励:练推理——不增加知识
海量语料
预训练→
基座模型(参数冻结)
后训练→
对话 & 推理模型
GLM5.2 以 744B-40B(MoE:总参 744B,每次推理激活约 40B)在编程领域追平万亿级 SOTA——后训练在易构建 RLVR 的场景收益最大;而长尾知识谁也记不住——这为后面的 RAG 埋下伏笔。
06 · 推理
推理与思维链
思维链(CoT)= 多步推理的显式草稿纸。
反例没有思维链 = 强迫一步心算——中间状态无处安放,一步错全错
外化中间状态写到上下文里,看得见
回溯错误定位在某一步,可以纠正
问题→
步骤 ①→
步骤 ②→
步骤 ③→
答案
本质:用 test-time 的计算量,换正确率。
07 · 选型
LLM 选择
场景追求的能力推荐
科研写作世界知识、逻辑严谨与多步骤推理GPT / Gemini (平替 Qwen3.8-Max)
代码与数据分析工具调用与长上下文代码能力Claude (平替 Kimi-K3)
中文政策解读中文语料与政策语境理解DeepSeek
低成本探索成本优先,能力够用即可DeepSeek-v4-Flash
能力对比 · 定性
GPT / GeminiClaudeDeepSeek
世界知识●◐◐
多步推理●◐◐
代码与工具调用◐●◐
中文语境◐◐●
成本优势○○●
选型就两根轴:任务类型 × 成本。对比为定性(● 强 / ◐ 中 / ○ 弱),依讲义推荐逻辑,非基准测试分数。
08 · Prompt Engineering
PE 六要素 × 代码审查
要素解释示例 · 代码审查
Role定视角——以什么身份说话你是资深后端工程师
Goal定任务——唯一必需项审查 PR 的正确性 (差:帮我看看这段代码)
Context消猜测——背景一次给足支付服务 / Go 1.22
Constraint收窄发挥——明确不做什么只报告 bug 与并发风险
Format保证可用——输出即交付物按严重度排序的列表
Acceptance Criteria内置裁判——可检查的验收线每条附代码行号与复现路径 (「代码要优雅」不算)
Goal 是唯一必需项,验收标准必须「可检查」。两个技巧:Few-shot = 最便宜的「后训练」;思维链提示——「请一步步思考」。
Chapter 02
Agent 萌芽
大脑有六个先天缺陷——每一块补丁,都是一块积木。
10 · 缺陷清单
LLM 的六个先天问题
01无记忆每次调用从零开始补丁 · 对话历史
02知识冻结训练截止后一无所知补丁 · RAG 检索
03幻觉不懂也照答补丁 · 检索 + 引用验证
04上下文有限注意力机制的计算约束补丁 · 上下文压缩调度
05不会行动只能输出文本补丁 · Function Calling
06精确计算差token 化 + 概率采样的天性补丁 · 代码执行
核心矛盾 · 全课题眼
无限的信息需求 vs 有限的上下文窗口
限制唯一入口是 Prompt,窗口又有限
技术走向所有技术都在回答:什么信息、什么时机、什么形态进入窗口
每条都追问一句「怎么补?」——答案贯穿后半场。
11 · 第一块补丁
ChatGPT:最小的 Harness
补 · 01 无记忆每次调用从零开始→对话历史当记忆
ChatGPT = 对话循环 + 历史消息当记忆
历史消息 + 新消息→
LLM→
回复→
追加进历史
←
多轮对话循环
补上了「无状态」的第一块补丁:多轮对话里,模型像有了记忆
天花板记忆溢出窗口 → 逼出下一步:接工具
产品化ChatGPT 的搜索工具 = RAG 产品化:搜索 → 抓网页 → 塞进窗口;2023.6 Function Calling 提出——接工具的起点
12 · RAG
RAG:开卷考试
补 · 02 知识冻结训练截止后一无所知→检索材料注入窗口
提问→
检索(向量库 / grep)→
Top-K 材料→
注入 Prompt→
基于材料作答
分工记忆管主干,检索管长尾
Agent 时代向量索引 → Agentic Search(grep,在线迭代)
没有失业窗口涨到 1M 后 RAG 仍在——装得下 ≠ 用得好;非结构化知识库,向量 RAG 仍是主力
代码场景 grep 为什么赢:符号精确、可迭代、永远新鲜。
13 · 工具协议
Function Calling
补 · 05 不会行动只能输出文本→结构化请求,Harness 执行
模型输出 JSON 请求→
Harness 解析并执行→
环境返回结果→
写入上下文
←
下一轮生成
模型输出{"name": "get_weather", "arguments": {"city": "北京"}}
Harness 执行后回流{"temperature": "32°C", …}
最终回答「北京今天 32°C,晴」
要点一模型从不「调」函数——它只输出结构化请求
要点二工具结果绕不开上下文,仍占窗口
权责划分:模型决策、Harness 执行、环境反馈。
14 · ReAct
ReAct:循环的骨架
补 · 03 幻觉不懂也照答→现实反馈当裁判
Thought想一步 · 推理
→
Action做一步 · 调工具
→
Observation外部世界看结果 · 环境反馈
←
结果写回上下文 · 循环
上下文窗口 · 随循环累积
Thought₁用户问北京天气——得先查
Action₁get_weather(city="北京")
Observation₁32°C,晴 ← 外部世界写回
Thought₂拿到结果,可以回答了
Action₂输出最终回答
交织LLM 负责想 → 想法经 Function Calling 交给工具执行 → 结果写回上下文,成为下一步推理的条件
与 CoT 之别思维链是封闭循环——中间 token 全是模型自己生成,想错了没有外部信号纠正;ReAct 打开缺口,把环境反馈写进循环
出处Google Brain《ReAct: Synergizing Reasoning and Acting》· 2022.10 发布、2023 走红——至今仍是 Agent 的骨架
想错了,现实会打脸——封闭循环缺的裁判补上了:循环里有了外部世界。
15 · 突破口
为什么从 Code 突破
补 · 06 精确计算差token 化 + 概率采样的天性→代码执行
反馈可验证:编译 / 测试就是裁判。
对照营销文案需要人来评判 → 循环被中断
土壤shell / Git / 编译器 / linter / CI——全是文本进出、接口标准,Harness 接上就能用;Git 改错了可撤销,是天然沙箱
语料代码是「LLM 友好型」文本:语法严格、歧义少、模块化——GitHub 给了最丰富的训练语料
演进 · 循环主动权:人 → AI
2021
CopilotGitHub 出品,IDE 插件形态做代码补全——内核始终是「人是司机,AI 是副驾」
2023
Cursor围绕 AI 重做编辑器:全仓库 RAG 索引、Composer 多文件编辑、Tab 预测,2024 底加 Agent 模式
2025
Claude Code相反的赌注:把 Agent 循环而非编辑器作为产品内核——终端即界面,shell 即工具集,人退为「验收者」
金句:每外溢一个领域,先问「谁来当裁判?」
16 · 2023.3 · 破圈
AutoGPT:补丁连成循环
给一个目标(「帮我调研竞品并写报告」),让它自己拆解、搜索、读写文件、循环迭代——两周冲上 GitHub 星标纪录。
目标→
拆解任务→
执行→
观察→
再规划
←
自主循环
失败模式 · 死循环 / 跑偏 / 烧钱
意义让大众第一次看见「AI 自己干活」;BabyAGI、AgentGPT 同期追随——Agent 从论文概念变成全民话题
时机2025 才成日用品:推理可靠性 ↑、FC 稳定性 ↑、长上下文价格 ↓
落地Copilot → Cursor → Claude Code:循环的主动权,一步一步交给了 AI
破圈靠的不是好用,而是想象力。
17 · 收束
Harness:事实标准
上下文调度
补 · 无记忆 / 上下文有限 / 知识冻结
01System Prompt角色、边界与行为准则
03CLAUDE.md注入持久知识,补「无状态」
04SubAgent上下文分治,隔离脏活
06压缩窗口的生命周期管理
09Skills流程与领域知识封装成包,按需加载
行动能力
补 · 不会行动 / 精确计算差
02工具集补上「没有手和脚」
10MCP工具的标准化接入协议
确定性控制
补 · 幻觉 / 概率机器的不确定性
05PlanMode「想」和「做」显式分阶段
07权限给工具划边界,控制破坏半径
08Hooks在循环确定点位注入确定性逻辑
全课收束:LLM 是无状态概率机器 → 缺陷逼出核心矛盾 → 每个补丁都是一块积木 → Claude Code 拼成标准。
下一讲预告:通过 Claude Code CLI,逐一拆解这十个组件。