[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"public-theme-runtime":3,"navigation-bootstrap":38,"public-module-runtime":154,"posts-list-page":175},{"success":4,"data":5,"message":37,"globalStats":-1},true,{"slug":6,"name":7,"version":8,"source":9,"inheritanceChain":10,"layouts":11,"slots":17,"configKeys":32,"assets":34,"config":36},"default","Default Theme","1.0.0","builtin",[6],[12,13,14,15,16],"home","post-list","post-detail","tool-index","user-dashboard",[18,19,20,21,22,23,24,25,26,27,28,29,30,31],"layout.sidebar","layout.mobile-tabbar","home.hero","home.game-strip","home.featured-columns","home.trending-posts","home.trending-tags","post.author","post.body","post.related","post.comments","post.sidebar","tools.hero","user.summary",[33],"theme:default",{"stylesheets":35},[],{},"操作成功",{"navigation":39,"categories":95},{"main":40,"utility":64,"mobile":71,"mobileConfigured":4},[41,49,54,59],{"id":42,"name":43,"path":44,"icon":45,"color":46,"group":47,"target":48,"isVisible":4,"moduleSlug":46},1,"首页","\u002F","i-carbon-home","","MAIN","_self",{"id":50,"name":51,"path":52,"icon":53,"color":46,"group":47,"target":48,"isVisible":4,"moduleSlug":46},2,"文章列表","\u002Fposts","i-carbon-document",{"id":55,"name":56,"path":57,"icon":58,"color":46,"group":47,"target":48,"isVisible":4,"moduleSlug":46},4,"标签云","\u002Ftags","i-carbon-tag",{"id":60,"name":61,"path":62,"icon":63,"color":46,"group":47,"target":48,"isVisible":4,"moduleSlug":46},5,"关于我们","\u002Fabout","i-carbon-information",[65],{"id":66,"name":67,"path":68,"icon":69,"color":46,"group":70,"target":48,"isVisible":4,"moduleSlug":46},6,"Mj·工具箱","\u002Ftools","i-carbon-tool-box","UTILITY",[72,76,81,84,89],{"id":73,"name":74,"path":52,"icon":53,"color":46,"group":75,"target":48,"isVisible":4,"moduleSlug":46},27,"文章","MOBILE",{"id":77,"name":78,"path":79,"icon":80,"color":46,"group":75,"target":48,"isVisible":4,"moduleSlug":46},28,"游戏","\u002Fgames","i-carbon-game-console",{"id":82,"name":43,"path":44,"icon":45,"color":83,"group":75,"target":48,"isVisible":4,"moduleSlug":46},16,"#4f46e5",{"id":85,"name":86,"path":68,"icon":87,"color":88,"group":75,"target":48,"isVisible":4,"moduleSlug":46},18,"工具","i-carbon-tool-kit","#06b6d4",{"id":90,"name":91,"path":92,"icon":93,"color":94,"group":75,"target":48,"isVisible":4,"moduleSlug":46},22,"我的","\u002Fuser","i-carbon-user","#0f172a",[96,106,113,119,124,132,140,147],{"id":42,"name":97,"slug":98,"parentId":99,"sort":42,"createdAt":100,"description":101,"icon":102,"updatedAt":100,"type":103,"isVisible":4,"_count":104,"postCount":105},"技术文章","tech",null,"2026-03-31T13:24:10.236Z","技术相关文章分享","i-carbon-code","ARTICLE",{"posts":105},3,{"id":50,"name":107,"slug":108,"parentId":99,"sort":50,"createdAt":100,"description":109,"icon":110,"updatedAt":100,"type":103,"isVisible":4,"_count":111,"postCount":112},"生活随笔","life","生活感悟与随笔","i-carbon-cafe",{"posts":112},0,{"id":105,"name":114,"slug":115,"parentId":99,"sort":105,"createdAt":100,"description":116,"icon":117,"updatedAt":100,"type":103,"isVisible":4,"_count":118,"postCount":112},"资源分享","resources","实用资源下载分享","i-carbon-download",{"posts":112},{"id":55,"name":120,"slug":121,"parentId":99,"sort":55,"createdAt":100,"description":122,"icon":80,"updatedAt":100,"type":103,"isVisible":4,"_count":123,"postCount":105},"游戏专题","games","游戏相关内容",{"posts":105},{"id":125,"name":126,"slug":127,"parentId":99,"sort":60,"createdAt":128,"description":46,"icon":129,"updatedAt":130,"type":103,"isVisible":4,"_count":131,"postCount":42},7,"AI文章","a-i-ji-shu","2026-06-08T18:53:52.493Z","i-carbon-thumbnail-1","2026-06-08T18:57:08.371Z",{"posts":42},{"id":66,"name":133,"slug":134,"parentId":42,"sort":135,"createdAt":136,"description":46,"icon":137,"updatedAt":138,"type":103,"isVisible":4,"_count":139,"postCount":50},"前端技术","Front-end-technology",10,"2026-04-27T15:35:13.787Z","i-carbon-laptop","2026-04-27T15:35:27.999Z",{"posts":50},{"id":141,"name":142,"slug":143,"parentId":125,"sort":135,"createdAt":144,"description":46,"icon":145,"updatedAt":144,"type":103,"isVisible":4,"_count":146,"postCount":42},8,"AI模型技术","a-i-mo-xing-ji-shu","2026-06-08T18:54:32.060Z","i-carbon-ai-agent-invocation",{"posts":42},{"id":60,"name":148,"slug":149,"parentId":42,"sort":135,"createdAt":150,"description":151,"icon":152,"updatedAt":150,"type":103,"isVisible":4,"_count":153,"postCount":42},"后端技术","Back-end-technology","2026-04-27T11:46:35.299Z","后端开发技术分享","i-carbon-bookmark",{"posts":42},{"success":4,"data":155,"message":37,"globalStats":-1},[156,162,167,171],{"slug":157,"name":158,"version":8,"frontendEntryPath":159,"loadable":160,"enabled":4,"installed":4,"dependenciesResolved":4,"status":161},"ai-keywords","AI关键词库","\u002Fai-keywords",false,"enabled",{"slug":163,"name":164,"version":165,"frontendEntryPath":79,"loadable":160,"enabled":160,"installed":4,"dependenciesResolved":4,"status":166},"game","游戏模块","1.0.1","disabled",{"slug":168,"name":169,"version":8,"frontendEntryPath":170,"loadable":160,"enabled":4,"installed":4,"dependenciesResolved":4,"status":161},"software","软件中心","\u002Fsoftware",{"slug":172,"name":173,"version":174,"frontendEntryPath":68,"loadable":160,"enabled":4,"installed":4,"dependenciesResolved":4,"status":161},"tools","工具箱模块","1.0.2",{"success":4,"data":176,"message":37,"globalStats":-1},{"list":177,"total":42,"stats":202,"page":42,"pageSize":204},[178],{"id":135,"title":179,"slug":180,"cover":181,"summary":182,"content":183,"contentFormat":184,"views":185,"likes":112,"status":186,"reviewStatus":187,"reviewRemark":99,"reviewSubmittedAt":99,"reviewedAt":188,"isTop":160,"isRecommend":160,"isVipFree":160,"publishedAt":99,"createdAt":189,"authorId":42,"categoryId":141,"category":190,"author":191,"resourceCount":112,"_count":195,"tags":196,"meta":201},"本地大模型量化完整教程：从 HuggingFace 下载到 GGUF 转换，一步跑通 llama.cpp","ben-di-da-mo-xing-liang-hua-wan-zheng-jiao-cheng-cong-h-u-g-g-i-n-g-f-a-c-e-xia-zai-dao-g-g-u-f-zhuan-huan-yi-bu-pao-tong-l-l-a-m-a-c-p-p","https:\u002F\u002Fmjblog.res.ziyowl.com\u002F2026\u002F06\u002F09\u002F1780944712444-8qag43ft.png","Windows 本地把 HuggingFace 模型下载 → 合并转换为 GGUF → 量化 Q4_K_M → 测试运行 的完整教程。你这台 RTX 4080 Super 16GB 跑 8B 模型很合适，建议最终量化成 Q4_K_M \u002F Q5_K_M","\u003Cp>下面给你一份 \u003Cstrong>Windows 本地把 HuggingFace 模型下载 → 合并转换为 GGUF → 量化 Q4_K_M → 测试运行\u003C\u002Fstrong> 的完整教程。你这台 \u003Cstrong>RTX 4080 Super 16GB\u003C\u002Fstrong> 跑 8B 模型很合适，建议最终量化成 \u003Cstrong>Q4_K_M \u002F Q5_K_M\u003C\u002Fstrong>。\u003C\u002Fp>\n\u003Cblockquote>\n\u003Cp>注意：\u003Ccode>llama.cpp\u003C\u002Fcode> 当前要求模型使用 \u003Cstrong>GGUF\u003C\u002Fstrong> 格式，HF 模型一般需要用 \u003Ccode>convert_hf_to_gguf.py\u003C\u002Fcode> 转换。官方仓库也说明，非 GGUF 格式模型可用仓库里的 \u003Ccode>convert_*.py\u003C\u002Fcode> 脚本转换。(\u003Ca href=\"https:\u002F\u002Fgithub.com\u002Fggml-org\u002Fllama.cpp?utm_source=chatgpt.com\">GitHub\u003C\u002Fa>)\u003Cbr \u002F>HuggingFace 官方也推荐通过 CLI 下载仓库文件到本地目录。(\u003Ca href=\"https:\u002F\u002Fhuggingface.co\u002Fdocs\u002Fhuggingface_hub\u002Fen\u002Fguides\u002Fdownload?utm_source=chatgpt.com\">Hugging Face\u003C\u002Fa>)\u003C\u002Fp>\n\u003C\u002Fblockquote>\n\u003Chr \u002F>\n\u003Ch1>一、准备环境\u003C\u002Fh1>\n\u003Ch2>1. 安装 Git\u003C\u002Fh2>\n\u003Cp>先安装 Git：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">git --version\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>能显示版本号就行，例如：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">git version 2.xx.x\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>没有安装就去安装 Git for Windows。\u003C\u002Fp>\n\u003Chr \u002F>\n\u003Ch2>2. 安装 Python\u003C\u002Fh2>\n\u003Cp>建议安装：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">Python 3.10 \u002F 3.11\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>检查：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">python --version\npip --version\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>如果 \u003Ccode>python\u003C\u002Fcode> 不识别，试试：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">py --version\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Chr \u002F>\n\u003Ch2>3. 安装 HuggingFace CLI\u003C\u002Fh2>\n\u003Cpre>\u003Ccode class=\"language-bash\">pip install -U huggingface_hub\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>检查：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">huggingface-cli --help\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>如果提示找不到命令，可以用：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">python -m huggingface_hub.commands.huggingface_cli --help\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Chr \u002F>\n\u003Ch1>二、下载 HF 模型\u003C\u002Fh1>\n\u003Cp>你要下载的模型是：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">aifeifei798\u002Fllama3-8B-DarkIdol-2.3-Uncensored-32K\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>建议新建一个工作目录，比如：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">mkdir D:\\AIModels\ncd \u002Fd D:\\AIModels\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>然后下载：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">huggingface-cli download aifeifei798\u002Fllama3-8B-DarkIdol-2.3-Uncensored-32K --local-dir DarkIdol-HF\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>如果你原来的命令能用，也可以继续用：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">huggingface-cli download aifeifei798\u002Fllama3-8B-DarkIdol-2.3-Uncensored-32K --local-dir DarkIdol-HF --local-dir-use-symlinks False\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>不过新版 \u003Ccode>huggingface_hub\u003C\u002Fcode> 里，\u003Ccode>--local-dir-use-symlinks\u003C\u002Fcode> 相关行为可能已经不推荐依赖，所以优先用第一条更简洁。\u003C\u002Fp>\n\u003Cp>下载完成后，目录大概应该有这些文件：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">DarkIdol-HF\u002F\n├─ config.json\n├─ generation_config.json\n├─ tokenizer.json\n├─ tokenizer_config.json\n├─ special_tokens_map.json\n├─ model-00001-of-000xx.safetensors\n├─ model-00002-of-000xx.safetensors\n└─ ...\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>如果模型需要登录授权，先执行：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">huggingface-cli login\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>然后粘贴你的 HuggingFace Token。\u003C\u002Fp>\n\u003Chr \u002F>\n\u003Ch1>三、下载 llama.cpp\u003C\u002Fh1>\n\u003Cp>进入你的模型工作目录：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">cd \u002Fd D:\\AIModels\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>克隆 llama.cpp：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">git clone https:\u002F\u002Fgithub.com\u002Fggml-org\u002Fllama.cpp\ncd llama.cpp\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>安装转换依赖：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">pip install -r requirements.txt\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>官方 \u003Ccode>llama.cpp\u003C\u002Fcode> 仓库中提供了 \u003Ccode>convert_hf_to_gguf.py\u003C\u002Fcode> 这类转换脚本，用来把 HuggingFace 模型转换成 GGUF。(\u003Ca href=\"https:\u002F\u002Fgithub.com\u002Fggml-org\u002Fllama.cpp\u002Fblob\u002Fmaster\u002Fconvert_hf_to_gguf.py?utm_source=chatgpt.com\">GitHub\u003C\u002Fa>)\u003C\u002Fp>\n\u003Chr \u002F>\n\u003Ch1>四、编译 llama.cpp 工具\u003C\u002Fh1>\n\u003Cp>新版 \u003Ccode>llama.cpp\u003C\u002Fcode> 推荐用 CMake 编译。\u003C\u002Fp>\n\u003Ch2>方案 A：Windows 普通 CPU 编译\u003C\u002Fh2>\n\u003Cp>在 \u003Ccode>llama.cpp\u003C\u002Fcode> 目录下执行：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">cmake -B build\ncmake --build build --config Release\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>编译完成后，工具一般在：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">llama.cpp\\build\\bin\\Release\\\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>你需要重点找这几个文件：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">llama-cli.exe\nllama-quantize.exe\nllama-server.exe\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Chr \u002F>\n\u003Ch2>方案 B：NVIDIA 显卡 CUDA 编译\u003C\u002Fh2>\n\u003Cp>你的 RTX 4080 Super 建议用 CUDA 版，速度更好。\u003C\u002Fp>\n\u003Cp>先确保你装了：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">NVIDIA 驱动\nCUDA Toolkit\nVisual Studio Build Tools\nCMake\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>然后执行：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">cmake -B build -DGGML_CUDA=ON\ncmake --build build --config Release\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>如果成功，后面运行模型时就可以用 GPU 加速。\u003C\u002Fp>\n\u003Chr \u002F>\n\u003Ch1>五、转换 HF 模型为 F16 GGUF\u003C\u002Fh1>\n\u003Cp>现在你的目录结构应该类似：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">D:\\AIModels\\\n├─ DarkIdol-HF\\\n└─ llama.cpp\\\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>进入 llama.cpp：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">cd \u002Fd D:\\AIModels\\llama.cpp\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>执行转换：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">python convert_hf_to_gguf.py ..\u002FDarkIdol-HF --outtype f16 --outfile ..\u002FDarkIdol-F16.gguf\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>完成后会生成：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">D:\\AIModels\\DarkIdol-F16.gguf\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>这个文件会比较大，8B 模型的 F16 GGUF 通常在 \u003Cstrong>15GB 左右\u003C\u002Fstrong>。如果你的硬盘空间不够，至少准备：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">模型 HF 原始文件：约 15GB+\nF16 GGUF：约 15GB+\nQ4_K_M GGUF：约 4GB～6GB\n临时空间：建议再留 10GB+\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>所以总空间建议至少：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">50GB 以上\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Chr \u002F>\n\u003Ch1>六、量化成 Q4_K_M\u003C\u002Fh1>\n\u003Cp>进入编译后的目录：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">cd \u002Fd D:\\AIModels\\llama.cpp\\build\\bin\\Release\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>执行量化：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">llama-quantize.exe ..\u002F..\u002F..\u002FDarkIdol-F16.gguf ..\u002F..\u002F..\u002FDarkIdol-Q4_K_M.gguf Q4_K_M\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>如果你不确定相对路径是否正确，也可以直接用绝对路径：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">llama-quantize.exe D:\\AIModels\\DarkIdol-F16.gguf D:\\AIModels\\DarkIdol-Q4_K_M.gguf Q4_K_M\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>量化完成后会得到：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">D:\\AIModels\\DarkIdol-Q4_K_M.gguf\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Chr \u002F>\n\u003Ch1>七、不同量化格式怎么选\u003C\u002Fh1>\n\u003Cp>常用推荐如下：\u003C\u002Fp>\n\u003Ctable>\n\u003Cthead>\n\u003Ctr>\n\u003Cth>格式\u003C\u002Fth>\n\u003Cth>体积\u003C\u002Fth>\n\u003Cth>质量\u003C\u002Fth>\n\u003Cth>速度\u003C\u002Fth>\n\u003Cth>推荐场景\u003C\u002Fth>\n\u003C\u002Ftr>\n\u003C\u002Fthead>\n\u003Ctbody>\u003Ctr>\n\u003Ctd>F16\u003C\u002Ftd>\n\u003Ctd>最大\u003C\u002Ftd>\n\u003Ctd>最高\u003C\u002Ftd>\n\u003Ctd>慢\u002F占显存\u003C\u002Ftd>\n\u003Ctd>保存母版，不建议日常跑\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>Q8_0\u003C\u002Ftd>\n\u003Ctd>较大\u003C\u002Ftd>\n\u003Ctd>很高\u003C\u002Ftd>\n\u003Ctd>中等\u003C\u002Ftd>\n\u003Ctd>质量优先\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>Q6_K\u003C\u002Ftd>\n\u003Ctd>中大\u003C\u002Ftd>\n\u003Ctd>很高\u003C\u002Ftd>\n\u003Ctd>中等\u003C\u002Ftd>\n\u003Ctd>16GB 显存可考虑\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>Q5_K_M\u003C\u002Ftd>\n\u003Ctd>中等\u003C\u002Ftd>\n\u003Ctd>高\u003C\u002Ftd>\n\u003Ctd>快\u003C\u002Ftd>\n\u003Ctd>质量和体积平衡\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>Q4_K_M\u003C\u002Ftd>\n\u003Ctd>小\u003C\u002Ftd>\n\u003Ctd>较好\u003C\u002Ftd>\n\u003Ctd>快\u003C\u002Ftd>\n\u003Ctd>最推荐日常使用\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>Q3_K_M\u003C\u002Ftd>\n\u003Ctd>更小\u003C\u002Ftd>\n\u003Ctd>一般\u003C\u002Ftd>\n\u003Ctd>快\u003C\u002Ftd>\n\u003Ctd>显存\u002F内存很紧张\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>Q2_K\u003C\u002Ftd>\n\u003Ctd>最小\u003C\u002Ftd>\n\u003Ctd>损失明显\u003C\u002Ftd>\n\u003Ctd>快\u003C\u002Ftd>\n\u003Ctd>不太推荐\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003C\u002Ftbody>\u003C\u002Ftable>\n\u003Cp>你的 \u003Cstrong>RTX 4080 Super 16GB\u003C\u002Fstrong>，8B 模型建议：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">首选：Q4_K_M\n更高质量：Q5_K_M\n极限质量：Q6_K \u002F Q8_0\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>如果你只是自己本地聊天、接入 Ollama、LM Studio、Jan、llama.cpp，建议先做：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">DarkIdol-Q4_K_M.gguf\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>然后再补一个：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">DarkIdol-Q5_K_M.gguf\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Chr \u002F>\n\u003Ch1>八、测试 GGUF 模型是否可用\u003C\u002Fh1>\n\u003Cp>进入：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">cd \u002Fd D:\\AIModels\\llama.cpp\\build\\bin\\Release\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>CPU 测试：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">llama-cli.exe -m D:\\AIModels\\DarkIdol-Q4_K_M.gguf -p &quot;你好，请介绍一下你自己。&quot; -n 256\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>CUDA 显卡加速测试：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">llama-cli.exe -m D:\\AIModels\\DarkIdol-Q4_K_M.gguf -p &quot;你好，请介绍一下你自己。&quot; -n 256 -ngl 999\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>参数解释：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">-m     模型路径\n-p     提示词\n-n     最大生成 token 数\n-ngl   放到 GPU 的层数，999 通常表示尽量全放 GPU\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Chr \u002F>\n\u003Ch1>九、启动本地 API 服务\u003C\u002Fh1>\n\u003Cp>如果你想让软件、网页、客户端调用，可以启动 llama-server：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">llama-server.exe -m D:\\AIModels\\DarkIdol-Q4_K_M.gguf -c 8192 -ngl 999 --host 127.0.0.1 --port 8080\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>然后一般可以访问：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">http:\u002F\u002F127.0.0.1:8080\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>参数解释：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">-c 8192        上下文长度\n-ngl 999      尽量使用 GPU\n--host         监听地址\n--port         端口\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>如果你想开放给局域网其他电脑调用，可以用：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">llama-server.exe -m D:\\AIModels\\DarkIdol-Q4_K_M.gguf -c 8192 -ngl 999 --host 0.0.0.0 --port 8080\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Chr \u002F>\n\u003Ch1>十、导入 Ollama 使用\u003C\u002Fh1>\n\u003Cp>如果你想用 Ollama 跑这个 GGUF，需要创建一个 \u003Ccode>Modelfile\u003C\u002Fcode>。\u003C\u002Fp>\n\u003Cp>新建文件：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">D:\\AIModels\\DarkIdol-Modelfile\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>内容写：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">FROM D:\\AIModels\\DarkIdol-Q4_K_M.gguf\n\nPARAMETER temperature 0.7\nPARAMETER top_p 0.9\nPARAMETER num_ctx 8192\n\nTEMPLATE &quot;&quot;&quot;{{ .Prompt }}&quot;&quot;&quot;\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>然后执行：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">ollama create darkidol -f D:\\AIModels\\DarkIdol-Modelfile\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>运行：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">ollama run darkidol\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>如果要给你的软件调用，Ollama 默认 API 通常是：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">http:\u002F\u002F127.0.0.1:11434\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Chr \u002F>\n\u003Ch1>十一、推荐完整命令合集\u003C\u002Fh1>\n\u003Cp>你可以直接按这个流程走：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">mkdir D:\\AIModels\ncd \u002Fd D:\\AIModels\n\npip install -U huggingface_hub\n\nhuggingface-cli download aifeifei798\u002Fllama3-8B-DarkIdol-2.3-Uncensored-32K --local-dir DarkIdol-HF\n\ngit clone https:\u002F\u002Fgithub.com\u002Fggml-org\u002Fllama.cpp\ncd llama.cpp\n\npip install -r requirements.txt\n\ncmake -B build -DGGML_CUDA=ON\ncmake --build build --config Release\n\npython convert_hf_to_gguf.py ..\u002FDarkIdol-HF --outtype f16 --outfile ..\u002FDarkIdol-F16.gguf\n\ncd build\\bin\\Release\n\nllama-quantize.exe D:\\AIModels\\DarkIdol-F16.gguf D:\\AIModels\\DarkIdol-Q4_K_M.gguf Q4_K_M\n\nllama-cli.exe -m D:\\AIModels\\DarkIdol-Q4_K_M.gguf -p &quot;你好，请介绍一下你自己。&quot; -n 256 -ngl 999\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Chr \u002F>\n\u003Ch1>十二、常见报错处理\u003C\u002Fh1>\n\u003Ch2>1. \u003Ccode>huggingface-cli\u003C\u002Fcode> 下载太慢\u003C\u002Fh2>\n\u003Cp>可以尝试：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">set HF_HUB_ENABLE_HF_TRANSFER=1\npip install hf_transfer\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>然后重新下载。\u003C\u002Fp>\n\u003Cp>或者使用代理：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">set HTTP_PROXY=http:\u002F\u002F127.0.0.1:7890\nset HTTPS_PROXY=http:\u002F\u002F127.0.0.1:7890\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>端口根据你的代理软件实际端口修改。\u003C\u002Fp>\n\u003Chr \u002F>\n\u003Ch2>2. \u003Ccode>convert_hf_to_gguf.py\u003C\u002Fcode> 找不到\u003C\u002Fh2>\n\u003Cp>说明你可能在错误目录，先检查：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">dir convert_hf_to_gguf.py\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>正确位置应该在：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">D:\\AIModels\\llama.cpp\\convert_hf_to_gguf.py\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Chr \u002F>\n\u003Ch2>3. \u003Ccode>llama-quantize.exe\u003C\u002Fcode> 找不到\u003C\u002Fh2>\n\u003Cp>编译后找一下：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">dir \u002Fs llama-quantize.exe\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>通常在：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">llama.cpp\\build\\bin\\Release\\llama-quantize.exe\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>有些版本可能在：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">llama.cpp\\build\\bin\\llama-quantize.exe\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Chr \u002F>\n\u003Ch2>4. CUDA 编译失败\u003C\u002Fh2>\n\u003Cp>先用 CPU 编译：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">cmake -B build\ncmake --build build --config Release\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>能成功后再折腾 CUDA。\u003C\u002Fp>\n\u003Cp>也可以清理重新编译：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">rmdir \u002Fs \u002Fq build\ncmake -B build -DGGML_CUDA=ON\ncmake --build build --config Release\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Chr \u002F>\n\u003Ch2>5. 显存不够\u003C\u002Fh2>\n\u003Cp>降低上下文长度：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">-c 4096\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>或者换更小量化：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-bash\">Q4_K_M\nQ3_K_M\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>8B 的 Q4_K_M 在 16GB 显存上一般没什么压力。\u003C\u002Fp>\n\u003Chr \u002F>\n\u003Ch1>十三、最终建议\u003C\u002Fh1>\n\u003Cp>你这个模型是 \u003Cstrong>Llama3 8B 32K 上下文模型\u003C\u002Fstrong>，我建议你最终保留三个文件：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">DarkIdol-HF              原始 HF 模型，可备份\nDarkIdol-F16.gguf        母版 GGUF，用于以后重新量化\nDarkIdol-Q4_K_M.gguf     日常使用版本\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>如果硬盘空间紧张，可以保留：\u003C\u002Fp>\n\u003Cpre>\u003Ccode class=\"language-text\">DarkIdol-Q4_K_M.gguf\nDarkIdol-F16.gguf\n\u003C\u002Fcode>\u003C\u002Fpre>\n\u003Cp>原始 \u003Ccode>DarkIdol-HF\u003C\u002Fcode> 可以删除，后面需要再从 HuggingFace 下载。\u003C\u002Fp>\n","markdown",58,"published","APPROVED","2026-06-08T18:54:56.891Z","2026-06-08T18:52:32.707Z",{"id":141,"name":142},{"id":42,"username":192,"nickname":193,"avatar":99,"gender":194},"admin","小米酒","MALE",{"comments":112,"resources":112},[197],{"name":198,"slug":199,"color":200},"AI开发","a-i-kai-fa","#6366f1",{},{"total":141,"published":141,"draft":112,"totalViews":203},348,12]