从模型视角看上下文工程
从模型视角看上下文工程 模型训练完成后固定的参数 训练完的 Transformer 其实已经“死”了。 所有权重、所有偏置、所有 LayerNorm 的 γ/β、词表 embedding、输出头的投影矩阵……全部冻结,再也不会变了。 从这一刻起,它不再是一个学习机器,而变成了一个极其巨大、极其复杂的…
TOPIC
1 篇相关文章
从模型视角看上下文工程 模型训练完成后固定的参数 训练完的 Transformer 其实已经“死”了。 所有权重、所有偏置、所有 LayerNorm 的 γ/β、词表 embedding、输出头的投影矩阵……全部冻结,再也不会变了。 从这一刻起,它不再是一个学习机器,而变成了一个极其巨大、极其复杂的…