Llama.cpp本地模型运行.md 1.1 KB

仓库地址

https://github.com/ggml-org/llama.cpp

版本下载: llama-b8925-bin-macos-arm64.tar.gz 解除 macOS 安全限制(关键)

# -c 代表清除 (clear),-r 代表递归 (recursive) 到所有子文件
xattr -cr .

验证运行

./llama-cli --version

Llama.cpp下载模型并启用指令-hf <模型网址>

模型网址https://huggingface.co/

./llama-cli -hf mradermacher/gemma-4-26B-A4B-it-heretic-GGUF:Q4_K_M \
    -p "你好,请介绍一下你自己。" \
    --temp 1.0 --top-p 0.95

Llama.cpp启用本地模型指令 -m <本地模型地址>

./llama-cli -m ~/Library/Caches/llama.cpp/mradermacher_gemma-4-26B-A4B-it-heretic-GGUF_gemma-4-26B-A4B-it-heretic.Q4_K_M.gguf \
    -p "你好,请介绍一下你自己,并解释一下什么是 MoE 架构。" \
    -ngl 99 \
    --temp 0.7

Llama.cpp部署api

./llama-server \
    -m ~/Library/Caches/llama.cpp/mradermacher_gemma-4-26B-A4B-it-heretic-GGUF_gemma-4-26B-A4B-it-heretic.Q4_K_M.gguf \
    --host 0.0.0.0 \
    --port 8080 \
    -ngl 99 \
    -c 8192