
在 32GB 内存电脑上本地搭建 Qwen3.6-35B-A3B 大模型踩坑实录本文记录我在 红米RedBook 16 pro 2026 Intel core UltraX 7 358H 32GB 内存电脑上从零下载、配置、运行 Qwen3.6-35B-A3B-GGUF 本地大模型的完整过程。重点标注每一步容易踩的坑适合想在自己电脑上跑开源大模型的朋友参考。一、为什么选 Qwen3.6-35B-A3BQwen3.6-35B-A3B 是一个 MoE 架构的开源大模型虽然总参数量达到 35B但每次推理时实际激活的参数只有约 3B所以对硬件的要求比同规模的稠密模型低不少。对于只有32GB 内存、没有高端独显的普通电脑来说这是一个比较友好的选择。但友好不代表随便下载就能跑。模型文件版本多、量化方式多、工具链配置也多稍不注意就会走弯路。二、第一步选对模型文件在 ModelScope 或 Hugging Face 上搜索Qwen3.6-35B-A3B-GGUF会看到很多文件。常见文件大致有文件是否建议下载说明Qwen3.6-35B-A3B-Q4_K_M.gguf✅ 推荐约 21GB32GB 内存首选Qwen3.6-35B-A3B-Q5_K_M.gguf⚠️ 可尝试效果更好但内存压力更大Qwen3.6-35B-A3B-F16 / BF16❌ 不建议文件过大普通 32GB 内存基本跑不动mmproj-*.gguf按需只有需要图片理解时才下载我最终选择的是Qwen3.6-35B-A3B-Q4_K_M.gguf这个版本大约21.17GB对 32GB 内存比较合适。 坑 1不要下载 F16 / BF16 全精度版本一开始很容易看到文件列表里有F16、BF16这类版本觉得精度越高效果越好就直接下载。但这类文件通常有60GB 以上不仅下载时间极长而且 32GB 内存根本装不下。建议普通本地部署优先选Q4_K_M这是精度、体积、速度之间比较平衡的版本。 坑 2下载一天没下完不一定是网络问题大模型文件动辄十几 GB、二十几 GB如果用浏览器直接下载很容易出现下载速度越来越慢进度条不动中断后无法续传下载完发现文件大小不对这时候不要一直等先检查文件状态。判断方法右键文件 → 属性看文件大小。如果目标文件应该是21.17GB但本地只有几个 GB说明没有下载完整。如果文件名带有.incomplete .part .tmp说明下载还没结束不能直接拿来运行。建议大模型文件不要用浏览器下载优先使用支持断点续传的工具例如huggingface-cliaria2IDMModelScope 官方下载工具 坑 3模型文件路径不要带中文、空格、特殊符号模型加载时路径越干净越稳。推荐放在类似这样的目录D:\LocalAI\models\Qwen3.6-35B-A3B-Q4_K_M.gguf不要放在D:\我的模型\Qwen 3.6\模型文件\中文、空格、特殊符号都可能在某些工具中引发路径解析问题。三、准备推理工具llama.cpp我选择使用llama.cpp来加载 GGUF 模型。基本流程是克隆仓库使用 CMake 配置项目编译生成可执行文件使用llama-cli加载模型示例流程git clone https://github.com/ggerganov/llama.cppcd llama.cppcmake-B build cmake--build build--config Release编译成功后可执行文件一般在build\bin\Release\llama-cli 坑 4cmake不是系统自带命令第一次执行cmake-B build很多人会遇到无法将“cmake”项识别为 cmdlet、函数、脚本文件或可运行程序的名称。这不是 llama.cpp 的问题而是电脑上没有安装 CMake或者安装了但没有加入系统 PATH。解决方法去 CMake 官网下载 Windows 安装包安装时勾选Add CMake to the system PATH安装完成后关闭当前 PowerShell重新打开一个新的 PowerShell再执行cmake--version能输出版本号才说明配置成功。 坑 5安装完 CMake 后当前窗口不会立刻生效很多人安装完 CMake 后直接在原来的 PowerShell 里继续执行cmake-B build结果还是报错。这是因为环境变量更新后已经打开的终端不会自动刷新。解决方法很简单关闭当前 PowerShell重新打开一个新的窗口。 坑 6编译可能还需要 Visual Studio Build Toolsllama.cpp在 Windows 上编译通常依赖 C 编译工具链。如果执行编译命令时报错常见原因之一是缺少Visual Studio Build Tools安装时需要勾选使用 C 的桌面开发如果没有这个环境cmake --build很容易失败。四、第一次运行模型编译完成后可以用下面这条命令测试模型是否能正常加载.\build\bin\Release\llama-cli-m D:\LocalAI\models\Qwen3.6-35B-A3B-Q4_K_M.gguf-p你好请简单介绍一下你自己-n 256这条命令的含义是参数含义-m指定模型文件路径-p输入提示词-n 256最多生成 256 个 Token如果模型能正常输出中文回答说明本地环境基本跑通。 坑 7-n 256不是 256 个汉字很多人看到-n 256会以为模型会输出 256 个字。其实不是。-n 256表示最多生成256 个 Token。Token 是模型处理文本时的最小单位不等于汉字也不等于单词。粗略估算中文1 个汉字 ≈ 11.5 个 Token 英文1 个 Token ≈ 4 个英文字符所以256 个 Token ≈ 170250 个汉字这只是粗略估算实际数量会受标点、英文、数字、代码、特殊符号影响。五、常用参数整理日常测试时可以加上这些参数.\build\bin\Release\llama-cli^-m D:\LocalAI\models\Qwen3.6-35B-A3B-Q4_K_M.gguf ^-p你好请简单介绍一下你自己^-n 256 ^-c 4096 ^-t 8 ^-b 512 ^--temp 0.7 ^--repeat-penalty 1.1常用参数含义如下参数含义建议-m模型路径必填-p提示词单次问答使用-n最大生成 Token 数测试时可用 256-c上下文长度32GB 内存先试 4096-tCPU 线程数根据 CPU 调整如 8 或 12-b批处理大小可先试 512--temp温度0.7 左右较常用--repeat-penalty重复惩罚减少复读常用 1.1-i交互模式支持连续多轮对话--color彩色输出方便区分输入和输出如果想进入连续对话模式可以加-i.\build\bin\Release\llama-cli-m D:\LocalAI\models\Qwen3.6-35B-A3B-Q4_K_M.gguf-p你好-n 256-c 4096-t 8-i--color 坑 8上下文-c不要一上来开太大很多人觉得上下文越大越好一上来就设置-c 8192 -c 16384 -c 32768但上下文越大内存占用越高。32GB 内存跑 21GB 左右的 Q4_K_M 模型时建议先保守一点-c 4096如果运行稳定再尝试-c 8192如果电脑明显变卡、内存占用接近满载就降回来。 坑 9生成速度特别慢可能不是模型问题如果模型能跑但速度很慢常见原因有几个没有调用 GPUCPU 线程数设置不合理上下文太长后台程序占用内存过高llama.cpp 版本太旧没有适配当前模型架构可以先做这几件事更新显卡驱动降低上下文长度减少后台程序使用最新 llama.cpp检查是否启用了 GPU 加速如果有独立显卡或支持加速的核显可以尝试加-ngl 99表示尽量把模型层交给 GPU 处理。 坑 10加载失败不一定是模型坏了如果运行时报格式错误、版本错误、架构不支持不要急着怀疑模型文件损坏。更常见的原因是llama.cpp 版本太旧开源模型更新很快新模型架构可能需要较新的 llama.cpp 才能支持。解决方法拉取最新代码重新编译git pull cmake-B build cmake--build build--config Release六、完整踩坑清单下面是整个过程中最值得注意的坑不要下载 F16 / BF16 大文件版本浏览器下载大模型容易中断建议用断点续传工具模型路径不要包含中文、空格、特殊符号cmake需要单独安装并加入系统 PATH安装完 CMake 后必须重新打开 PowerShellWindows 编译 llama.cpp 通常需要 Visual Studio Build Tools-n 256是 256 个 Token不是 256 个汉字32GB 内存不要一上来把上下文开太大生成速度慢时优先检查 GPU 加速和上下文长度加载失败时优先更新 llama.cpp 版本七、最后总结在本地搭建大模型真正难的不是下载一个模型而是把下面几件事串起来选对模型量化版本保证文件下载完整配置好编译环境使用正确的推理工具根据内存和硬件调整参数对于 32GB 内存电脑来说Qwen3.6-35B-A3B-Q4_K_M.gguf是一个比较合适的起点。只要避开上面这些坑本地跑通一个开源大模型并没有想象中那么复杂。下一步可以继续尝试接入图形聊天界面配置 API 服务测试长文本总结测试代码生成尝试图片理解能力本地大模型的乐趣就在于所有数据都在自己电脑上可以自由调试、自由使用。