详细介绍
产品定位
llama.cpp 是由 Georgi Gerganov 创建、现由 ggml-org 组织在 GitHub 上维护的高性能 C/C++ 大语言模型本地推理实现,采用 MIT 协议。它依赖极少,是本地运行大模型最底层、最广泛被引用的推理引擎之一,LM Studio、Ollama 早期版本等桌面工具都构建在它之上,目标是在多种硬件上高效、可控地执行模型推理。
核心功能
它定义并推动 GGUF 模型格式,统一描述量化模型特征,已被大量软件采用;提供从 FP16 到 2-bit 的多档量化能力,上下文长度可达 128K token;附带 llama-cli 交互式对话与文本生成、llama-server 兼容 OpenAI API 的 HTTP 服务端、llama-quantize 量化、llama-bench 性能测试、llama-gguf-split 合并拆分等工具,覆盖从实验到部署的常见需求。
技术特点
llama.cpp 用 C/C++ 从零实现推理,不依赖重型框架,可跨 macOS、Linux、Windows 运行。硬件后端支持 CPU、CUDA、Metal、Vulkan、ROCm/HIP,覆盖 NVIDIA、AMD、Apple Silicon 以及纯 CPU 推理;macOS 构建时自动启用 Metal GPU 加速,CUDA 可通过编译选项开启,官方还提供预编译二进制和 Docker 镜像。用户可 git clone 仓库后用 cmake 构建,也能用 -hf 参数从 Hugging Face 拉取并运行 GGUF 模型。
适用场景
它适合希望完全掌控本地推理栈、追求极致性能与低依赖的开发者,也适合在无网络、隐私敏感的环境中部署模型,或作为上层应用与 GUI 工具的推理内核。常用参数包括 -m 指定模型路径、-ngl 指定卸载到 GPU 的层数、--ctx-size 设置上下文、--grammar-file 用 GBNF 语法约束输出、--offline 离线使用缓存;其他格式的模型可用仓库里的 convert 脚本转成 GGUF。









