仓库地址
https://github.com/ggml-org/llama.cpp
版本下载: llama-b8925-bin-macos-arm64.tar.gz 解除 macOS 安全限制(关键)
# -c 代表清除 (clear),-r 代表递归 (recursive) 到所有子文件
xattr -cr .
验证运行
./llama-cli --version
Llama.cpp下载模型并启用指令-hf <模型网址>
模型网址
https://huggingface.co/
./llama-cli -hf mradermacher/gemma-4-26B-A4B-it-heretic-GGUF:Q4_K_M \
-p "你好,请介绍一下你自己。" \
--temp 1.0 --top-p 0.95
Llama.cpp启用本地模型指令 -m <本地模型地址>
./llama-cli -m ~/Library/Caches/llama.cpp/mradermacher_gemma-4-26B-A4B-it-heretic-GGUF_gemma-4-26B-A4B-it-heretic.Q4_K_M.gguf \
-p "你好,请介绍一下你自己,并解释一下什么是 MoE 架构。" \
-ngl 99 \
--temp 0.7
Llama.cpp部署api
./llama-server \
-m ~/Library/Caches/llama.cpp/mradermacher_gemma-4-26B-A4B-it-heretic-GGUF_gemma-4-26B-A4B-it-heretic.Q4_K_M.gguf \
--host 0.0.0.0 \
--port 8080 \
-ngl 99 \
-c 8192