llama.cpp

纯 C++ 实现的本地推理引擎,让大模型在普通电脑上跑起来

它是什么

用 C 与 C++ 写成的大模型推理引擎,不依赖重型框架,在 CPU 与消费级显卡上都能跑量化模型。它是本地运行开源模型最重要的底层项目之一。

亮点

  • 纯 C++ 实现,依赖极少,可移植性极强
  • 支持 CPU 与多种后端加速
  • 量化格式被广泛采纳为标准
  • 大量本地应用基于它构建

怎么用

从仓库编译或用现成发行版,下载量化权重后即可在命令行或本地服务里跑模型。

协议说明

采用 MIT 协议,商用与二次开发前建议先读一遍条款,尤其是涉及对外提供服务的场景。