AI 大模型模型部署系列(三):从 Chat Template 到多轮对话,理解 KV Cache 复用
在上一篇文章《AI 大模型模型部署系列(二):从 Logits 到 Token,理解 llama.cpp 采样链》中,我们从 Logits 出发,验证了 Top-K、Top-P、Temperature、Seed 和最终选择器如何共同决定下一个 Token。 但是,能够连续生成 Token 还不等于能够正确对话。Instruct 模型需要知道哪段内容来自 System、哪段来自 User、什么时候轮