AI 大模型模型部署系列(二):从 Logits 到 Token,理解 llama.cpp 采样链
在上一篇文章《AI 大模型模型部署系列(一):从 Prompt 到 Token,理解 llama.cpp 最小推理》中,我们梳理了 Model、Context、Batch、Decode 和 KV Cache 之间的数据流:Prompt 经过 Tokenize 进入模型,Decode 完成计算并将 Logits 保存到 Context。但到这里,模型还没有真正决定下一个 Token。 从 Logit