AI 大模型模型部署系列(一):从 Prompt 到 Token,理解 llama.cpp 最小推理
将大模型接入 C++ 应用时,“模型能够运行”只是部署链路的起点。要进一步分析推理性能、显存占用和生成行为,需要先明确输入数据如何进入模型,以及 Model、Context、Batch、Sampler 和 KV Cache 分别承担什么职责。 本文以 llama.cpp 的最小示例 examples/simple/simple.cpp 为入口,从工程调用链的角度拆解一段 Prompt 生成 Tok