llama.cpp
C++ 实现的高效 LLM 推理引擎
亮点
- 低配硬件跑 70B 模型
- 量化格式最全最细
- 多 GPU 后端通吃
适用场景
- 边缘设备本地推理
- 自建推理服务后端
- 嵌入式 AI 部署
评测正文
llama.cpp 是本地 LLM 推理的事实标准,用纯 C++ 重写 LLaMA 架构,零依赖、单文件编译即可运行,是几乎所有本地推理工具(Ollama、LM Studio 等)的底层引擎。它把推理性能压榨做到了极致,CPU、GPU、NPU 通吃。
核心能力包括 GGUF 模型格式(已成为开源权重分发的事实标准)、CUDA/Metal/Vulkan/SYCL 多后端、KV cache 量化、Flash Attention、 speculative decoding,以及 server / cli / embedding 多种调用形态。对量化(Q4_K_M、Q5_K_M 等)支持是同类项目中最全的。
亮点是低配硬件也能跑起 70B 模型,跨平台移植性极强;不足是 API 偏底层,普通用户需要自行处理模型下载、量化、参数调优,上手门槛明显高于 Ollama 这类封装层。
适用场景:边缘设备与嵌入式推理、自建推理服务后端、为上层应用提供底层引擎。追求开箱即用者建议直接用 Ollama。