agentic4 分钟

从模型视角看上下文工程

从模型视角看上下文工程 模型训练完成后固定的参数 训练完的 Transformer 其实已经“死”了。 所有权重、所有偏置、所有 LayerNorm 的 γ/β、词表 embedding、输出头的投影矩阵……全部冻结,再也不会变了。 从这一刻起,它不再是一个学习机器,而变成了一个极其巨大、极其复杂的…

agentic3 分钟

Function Calling、MCP、Skill 三者本质区别与适用场景

一、Skill 的本质与核心设计(2025.10 开放标准) Skill 是一个 文件夹 ,里面至少包含一个 SKILL.md 文件(YAML 前言 + Markdown 正文),可选包含: scripts/ :可执行脚本(Python、Bash、JS 等) references/ :参考文档、模板…

agentic8 分钟

MCP

是什么 bookmark MCP(Model Context Protocol,由Anthropic主导)是一个基于 JSON RPC 2.0 的协议,用来规范Agent如何以“统一、可扩展、可编程”的方式调用外部能力(Tools / Resources / Prompts)。 标准化的“ 工具注册…

agentic5 分钟

Prompt Engineering

🥅 从方法论角度总结常用的 Prompt 技法。 提示工程的核心方法论 提示技术 提示工程本质上是在 不改变模型权重 的情况下,通过精心设计的输入文本,最大化引导大语言模型产生期望输出的过程。 它可以被看作以下几个层级的递进式优化策略: 1. 基础层 :让模型“明白我要什么” 2. 示范层 :让模…

agentic3 分钟

Agent

Agent = LLM(思考) + Tools(行动) 宽泛来说,AI Agent可以被定义为一个应用程序,通过观察周围世界并使用可用的工具,来实现目标。 工具的使用,是人类区别于动物的标志——也是Agent区别于大模型的标志。 工具作为 Agent 通往外部世界的关键,使 Agent 能够与外部系…

agentic4 分钟

vLLM 初体验

vLLM 1. 传统内存分配的痛点(为什么浪费严重) KV Cache 需要连续大块内存 :自回归生成时,序列长度动态增长 → 必须提前预分配一大段连续显存。 两大碎片化问题 : 内部碎片 :预分配过多,实际用不完的部分空闲浪费。 外部碎片 :请求结束释放后,显存出现很多小空洞 → 无法放入新的大请…

agentic6 分钟

分词

一、为什么要分词 考虑一个简单的句子 Hello world ,不分词直接拆成字符:H、e、l、l、o、空格、w、o、r、l、d共11个字符: 语义完全丢失 一个复杂的句子或片段拆分出来的字母序列非常长 考虑直接空格分词: 中文没有空格,多语言不支持 Token 和 Tokenization 语义相…

agentic4 分钟

A2A

A2A是什么 A2A(Agent2Agent Protocol,Agent间协议) 是由Google于2025年4月推出、同年6月捐赠给Linux基金会的 开放协议 (现由Linux基金会中立治理,Apache 2.0许可)。 解决跨agent框架通讯问题:A2A是 AI Agent之间的“通用通讯…