LLM 与 Agent5 分钟

Agent 架构:循环、拓扑与骨架

裸 ReAct 跑完交不出产物,往往不是缺某种新循环,而是循环、拓扑、骨架三层缠在一起。分开定,再选论文名。

LLM 与 Agent12 分钟

从 0 到 1 构建知识库

知识库不是向量库。离线把文档写成可检索的点,在线把问句收成可引用的证据。按 parse、chunk、caption、embed、generation、hybrid、rerank、refuse 走完每一步。

LLM 与 Agent10 分钟

主流模型协议:OpenAI 与 Anthropic

Chat Completions、Responses、Messages 的对象模型、HTTP 头、请求/响应字段、工具回传和流式事件。对照官方 Create 文档。

LLM 与 Agent7 分钟

深度学习模型架构解析:以Encoder-Decoder为核心的分类体系

引言 2017 年 Transformer 把 RNN / CNN 从主流序列模型里挤出去,只留注意力。后来它自己又拆成三种用法:Encoder Only、Decoder Only、Encoder Decoder。差别不在层数,在注意力能看见哪里。 左列 BERT 吃整句(bidirectional…

LLM 与 Agent4 分钟

从模型视角看上下文工程

从模型视角看上下文工程 模型训练完成后固定的参数 训练完的 Transformer 其实已经“死”了。 所有权重、所有偏置、所有 LayerNorm 的 γ/β、词表 embedding、输出头的投影矩阵……全部冻结,再也不会变了。 从这一刻起,它不再是一个学习机器,而变成了一个极其巨大、极其复杂的…

LLM 与 Agent2 分钟

vLLM:PagedAttention 和 Continuous Batching

自回归推理的 KV Cache 不能按最大长度预留连续显存。vLLM 用 PagedAttention 把 KV 切成 block,再用 Continuous Batching 每步重组 batch,吞吐才上得去。

LLM 与 Agent6 分钟

分词

一、为什么要分词 考虑一个简单的句子 Hello world ,不分词直接拆成字符:H、e、l、l、o、空格、w、o、r、l、d共11个字符: 语义完全丢失 一个复杂的句子或片段拆分出来的字母序列非常长 考虑直接空格分词: 中文没有空格,多语言不支持 Token 和 Tokenization 语义相…