LiteLLM 架构拆解:请求链路、重试回退与多租户表结构
一条请求如何过鉴权、限流、Router 的 retry/fallback,再进 SDK 翻译层;Spend 为何异步落库。与 Bifrost 的 trade-off,以及组件化与 HPA/KEDA。
TOPIC
13 篇相关文章
一条请求如何过鉴权、限流、Router 的 retry/fallback,再进 SDK 翻译层;Spend 为何异步落库。与 Bifrost 的 trade-off,以及组件化与 HPA/KEDA。
裸 ReAct 跑完交不出产物,往往不是缺某种新循环,而是循环、拓扑、骨架三层缠在一起。分开定,再选论文名。
Function Calling、MCP、Skill、A2A 不在同一层。各自的协议不变量,决定一次生成如何发现、隔离、执行并写回外部世界。
从技法分层到 OpenAI 最佳实践、Meta Prompt,以及评测后如何把 prompt 持续往更好的版本靠拢。
知识库不是向量库。离线把文档写成可检索的点,在线把问句收成可引用的证据。按 parse、chunk、caption、embed、generation、hybrid、rerank、refuse 走完每一步。
纯 Relay 网关:文本零缓冲 SSE、生图异步优先、多区域 Active-Active、限流的区域边界。
Chat Completions、Responses、Messages 的对象模型、HTTP 头、请求/响应字段、工具回传和流式事件。对照官方 Create 文档。
深入浅出CUDA:GPU并行计算的入门指南 在AI和大数据时代,GPU已成为加速计算的核心力量。CUDA(Compute Unified Device Architecture)作为NVIDIA推出的GPU编程框架, 让开发者能利用GPU的并行能力处理复杂任务 。 CUDA的核心基础概念 CUDA的…
读书笔记只覆盖书里实际记下的部分:为什么 GPU 适合训练、CUDA 四步、H100 与 NVLink、Magnum IO,以及 K8s Device Plugin 怎么把 GPU 交给 Pod。空着的章节不再占标题。
引言 2017 年 Transformer 把 RNN / CNN 从主流序列模型里挤出去,只留注意力。后来它自己又拆成三种用法:Encoder Only、Decoder Only、Encoder Decoder。差别不在层数,在注意力能看见哪里。 左列 BERT 吃整句(bidirectional…
从模型视角看上下文工程 模型训练完成后固定的参数 训练完的 Transformer 其实已经“死”了。 所有权重、所有偏置、所有 LayerNorm 的 γ/β、词表 embedding、输出头的投影矩阵……全部冻结,再也不会变了。 从这一刻起,它不再是一个学习机器,而变成了一个极其巨大、极其复杂的…
自回归推理的 KV Cache 不能按最大长度预留连续显存。vLLM 用 PagedAttention 把 KV 切成 block,再用 Continuous Batching 每步重组 batch,吞吐才上得去。
一、为什么要分词 考虑一个简单的句子 Hello world ,不分词直接拆成字符:H、e、l、l、o、空格、w、o、r、l、d共11个字符: 语义完全丢失 一个复杂的句子或片段拆分出来的字母序列非常长 考虑直接空格分词: 中文没有空格,多语言不支持 Token 和 Tokenization 语义相…