仓库地址 ```shell https://github.com/ggml-org/llama.cpp ``` 版本下载: **llama-b8925-bin-macos-arm64.tar.gz** 解除 macOS 安全限制(关键) ```shell # -c 代表清除 (clear),-r 代表递归 (recursive) 到所有子文件 xattr -cr . ``` 验证运行 ```shell ./llama-cli --version ``` Llama.cpp下载模型并启用指令`-hf <模型网址>` > 模型网址`https://huggingface.co/` ```shell ./llama-cli -hf mradermacher/gemma-4-26B-A4B-it-heretic-GGUF:Q4_K_M \ -p "你好,请介绍一下你自己。" \ --temp 1.0 --top-p 0.95 ``` Llama.cpp启用本地模型指令 `-m <本地模型地址>` ```shell ./llama-cli -m ~/Library/Caches/llama.cpp/mradermacher_gemma-4-26B-A4B-it-heretic-GGUF_gemma-4-26B-A4B-it-heretic.Q4_K_M.gguf \ -p "你好,请介绍一下你自己,并解释一下什么是 MoE 架构。" \ -ngl 99 \ --temp 0.7 ``` Llama.cpp部署api ```shell ./llama-server \ -m ~/Library/Caches/llama.cpp/mradermacher_gemma-4-26B-A4B-it-heretic-GGUF_gemma-4-26B-A4B-it-heretic.Q4_K_M.gguf \ --host 0.0.0.0 \ --port 8080 \ -ngl 99 \ -c 8192 ```