本地部署千问3.6,用WorkBuddy 10分钟搞定年中总结PPT(附双V100_16G实战配置)

发布时间:2026/7/27 6:11:42
本地部署千问3.6,用WorkBuddy 10分钟搞定年中总结PPT(附双V100_16G实战配置) 1. 结果展示最近这几周都在折腾本地部署大模型的事最近ClaudCode、OpenClaw很火。我也想使用一下。一般像OpenClaw、WorkBuddy这类的软件提供一个界面环境在后端需要使用云服务商提供的API服务云服务向我们收取服务费。因为我自己也在咸鱼上为大家提供“高性能计算服务”其中便包括深度学习的环境所以我向大家展示一下用Workbuddy接入我的本地大模型进行年中总结PPT撰写的情况。2. 本地主机及模型配置配置类型配置名称显卡NVIDIA Tesla V10016G*2显卡驱动版本580.173CUDA版本cuda 12.4推理引擎llama.cpp模型型号Qwen3.6-27B-Omnimerge-v4-MTP-Q5_K_M实测运行Q5_K_M模型可达到31tokens/s3. WorkBuddy设置助理-设置-添加模型-设置提供商、接口地址、ApiKey和模型名称-保存对话框选自定义模型;上面的接口地址、API_KEY以及模型名称在使用llama.cpp启动模型时指定如下图所示接口地址由http://0.0.0.0:8080指定一般指定的http://127.0.0.1:8080/v1也表示本地的8080端口–api-key 可以指定api,模型名称便对应着.gguf的文件名。4. 本地大模型接入踩的坑因为上下文长度的限制本地大模型在使用Workbuddy时会遇到WorkBuddy输入上下文超限的问题从而导致服务中止。根本的解决办法是在WorkBuddy中限制输入的字节数使得其小于设置的上下文大小。另外在生成整个PPT之后我再在第5页让AI帮我找了两张图片分别是文心一言和Qwen的图片在让其插入图片时读取整个PPT文件夹也出现了上下文超限的问题。通过向WorkBuddy注入下面的提示词通过分段降低上下文长度解决上下文超限问题。继续完成未完成的任务,在读取PPT之前分段读取,请按以下步骤操作 分段读取将PPT内容按页面拆分为独立单元。 定位修改只处理我指定的页面或章节。例如修改第5页的内容。 分段保存修改完成后将修改后的内容按原页面结构保存。5.咸鱼学习体验链接大家如果想体验这种模型的配置过程或者想要更具性价比的API的朋友可以点击这个链接进行远程体验https://m.tb.cn/h.8WQH9k8?tk9WfmguBUoHg tG-#22lD