exllamav2

消费级显卡上的高效推理后端,量化支持好

它是什么

面向消费级显卡优化的推理后端,在量化支持与显存利用上做得非常扎实,能在单张普通显卡上跑下更大的模型,是本地玩家的常用选择。

亮点

  • 量化格式支持丰富,显存利用高效
  • 单张消费级显卡可跑更大模型
  • 推理速度快,延迟低
  • 被多款本地界面集成为后端

怎么用

安装后下载对应量化权重,用脚本加载即可在本地跑模型。

协议说明

采用 MIT 协议,商用与二次开发前建议先读一遍条款,尤其是涉及对外提供服务的场景。