
完全没接触过 Ollama 的开发者、想白嫖大模型 API 费用的学生、担心数据出境的隐私敏感用户。 阅读时长约 20 分钟跟着做即可在 15 分钟内跑通第一个本地大模型。1. Ollama 是什么Ollama 是一个「一键在本地电脑上运行大语言模型LLM」的开源工具提供命令行、HTTP API 和丰富的模型库让你像用 Docker 拉镜像一样拉取模型像用 Python 包管理器一样管理模型。一个类比大模型如 Llama 3、Qwen就像「菜谱里的菜」食材权重文件很大、很占地方Ollama 就像「智能冰箱 厨师」它帮你把菜下载、解冻、装盘、端上桌你只需要说「我要吃这道菜」ollama run qwen2.5剩下的它全包了传统做法是你自己去 GitHub 找源码、装 Python 环境、装 PyTorch、下载几十 GB 权重、写推理脚本…… 光是配环境就能劝退 80% 的新手。Ollama 帮新手解决了三大痛点环境地狱无需手动安装 CUDA、PyTorch、Transformers一条命令全部搞定模型管理混乱统一模型仓库类似 docker images 和 docker pull接入成本高自带 OpenAI 风格 REST API一行 curl 就能对话。2. 为什么你需要 Ollama核心卖点与对比表2.1 核心卖点卖点说明完全免费模型与工具都开源无按 Token 计费数据不出本机代码、文档、隐私数据不发送到云端开箱即用支持 Windows / macOS / Linux一条命令装好模型丰富官方模型库 1000 模型涵盖 Llama、Qwen、Gemma、Mistral、DeepSeek 等接口标准提供 OpenAI 兼容 API现有项目可无缝迁移生态强大与 LangChain、Dify、Open WebUI、VS Code 插件深度集成资源可控可自由选择 3B/7B/14B/32B/70B 等不同参数量按硬件选择2.2 与「云 API」对比表帮你决策对比维度Ollama本地云 API如 OpenAI / 通义千问 API费用免费只花电费按 Token 付费长期重度使用成本高隐私数据完全本地数据上传云端联网能力默认离线需自行接工具部分模型内置联网硬件要求需较高内存/显存详见 FAQ无要求只要有网模型自由度任意切换开源模型只能用厂商提供的模型上手难度稍高需装本地环境低注册拿 Key 即可适合场景隐私敏感、离线环境、长期免费使用快速原型、无本地显卡、需要最强模型结论本地有 8GB 以上内存或 4GB 以上显存强烈推荐 Ollama 作为日常主力需要最新旗舰模型如 GPT-4 级别再考虑云 API。2.3 与「手动部署 Transformers」对比表对比维度Ollama手动部署HuggingFace PyTorch安装复杂度一条命令需配置 Python、CUDA、依赖包模型量化自动默认 Q4 量化体积小需手动下载量化脚本GPU 加速自动检测开箱即用需手动配置 device_map推理服务内置 HTTP 服务需自己写 FastAPI 服务新手友好度⭐⭐⭐⭐⭐⭐⭐3. 安装Windows / macOS / Linux 三步走3.1 Windows最简单方法一官方安装包推荐打开官网 Download Ollama on Windows下载 OllamaSetup.exe约 700MB双击安装一路 Next安装完成后打开 PowerShell按 Win R 输入 powershell 回车输入 ollama --version 验证# 验证安装是否成功 ollama --version # 期望输出类似ollama version 0.6.5方法二wingetWindows 包管理器# 使用 winget 一键安装 winget install Ollama.Ollama⚠️预警安装完成后需要重新打开终端窗口否则 ollama 命令可能找不到。3.2 macOS# 使用 Homebrew 安装最推荐 brew install ollama # 或者去官网下载 .dmg 安装包 # https://ollama.com/download/mac⚠️预警Apple SiliconM1/M2/M3/M4芯片体验最佳可以直接用 GPU 加速Intel 芯片也能运行但较慢。3.3 LinuxUbuntu / Debian 系# 官方一行脚本安装 curl -fsSL https://ollama.com/install.sh | sh # 验证 ollama --version⚠️预警直接执行 curl | sh 前建议先查看脚本内容把 | sh 去掉先 curl 下来看一眼确认无异常再执行——这是所有「一行安装脚本」的安全常识。4. 第一个模型拉取并对话安装好之后我们拉取第一个模型——推荐从Qwen2.5千问或Llama 3.2开始它们的中文能力强、体积适中。# 拉取并直接进入对话模式qwen2.5 是模型名:3b 是参数量标签 ollama run qwen2.5:3b回车后会发生什么首次运行会自动下载模型约 2GB进度条走完后自动进入交互对话看到 提示符后直接输入问题即可对话 用一句话解释什么是大语言模型 大语言模型是一种通过海量文本训练、能够理解和生成自然语言的深度学习模型。 1 1 等于几 2 /bye // 输入 /bye 退出对话小贴士ollama run 首次会自动 pull拉取所以你不必先手动 ollama pull。退出对话的三种方式输入 /bye 然后回车按 Ctrl DEOF 结束按 Ctrl C 强制中断。5. 常用命令速查模型管理全家桶# 1. 查看本地已安装的所有模型类似 docker images ollama list # 2. 下载某个模型类似 docker pull ollama pull llama3.2:3b # 3. 删除某个模型类似 docker rmi释放磁盘空间 ollama rm llama3.2:3b # 4. 查看当前正在运行的模型进程类似 docker ps ollama ps # 5. 复制模型用于创建自定义模型的副本 ollama cp qwen2.5:3b my-qwen # 6. 查看帮助 ollama --help各命令输出示例$ ollama list NAME ID SIZE MODIFIED qwen2.5:3b 3b0c6d1b9e6a 2.0 GB 2 minutes ago llama3.2:3b a80c4f17acd5 2.0 GB 5 days ago $ ollama ps NAME ID SIZE PROCESSOR UNTIL qwen2.5:3b 3b0c6d1b9e6a 2.0 GB 100% CPU 4 minutes from now⚠️预警ollama rm 是永久删除模型文件不可恢复删除前请确认不再需要或用 ollama list 检查。6. API 调用让程序连上本地大模型Ollama 安装后默认在后台运行一个 HTTP 服务端口 11434这意味着任何程序都可以通过 HTTP 请求使用你的本地模型。这是 Ollama 最强大的能力之一。6.1 先确认服务在运行# 查看服务是否监听 11434 端口 curl http://localhost:11434 # 期望输出Ollama is running如果提示连接失败Windows检查右下角托盘是否有 Ollama 图标macOS / Linux手动启动 ollama serve。6.2 用 curl 直接对话零依赖# 用 curl 调用本地 API 对话 curl http://localhost:11434/api/generate -d { model: qwen2.5:3b, // 指定模型名 prompt: 用一句话介绍你自己, // 你的问题 stream: false // false 一次性返回完整结果 }返回结果类似{ model: qwen2.5:3b, response: 我是基于通义千问架构的本地大语言模型……, done: true, total_duration: 1234567890, eval_count: 32 }小贴士把 stream 设为 true默认返回的是流式输出打字机效果适合网页对话场景设为 false 则等待全部生成完再返回适合脚本处理。6.3 用 Python 调用最常用先安装官方 SDKpip install ollama然后写一个最简单的对话脚本# chat_demo.py # 用 Ollama 官方 Python SDK 与本地模型对话 import ollama # 导入官方 SDK # 调用本地模型进行对话 response ollama.chat( modelqwen2.5:3b, # 模型名必须是 ollama list 里有的 messages[ {role: user, content: 用一句话介绍 Python 的优缺点} # 用户消息 ] ) # 打印模型回复 print(response[message][content])运行python chat_demo.py6.4 用 OpenAI SDK 调用无缝迁移Ollama 提供了OpenAI 兼容接口路径为 /v1这意味着你现有的 OpenAI 代码只需改两行就能切换到本地模型# openai_compat_demo.py # 用 OpenAI SDK 连接 Ollama迁移已有项目超简单 from openai import OpenAI # 关键把 base_url 指向本地 Ollamaapi_key 随便填本地不校验 client OpenAI( base_urlhttp://localhost:11434/v1, api_keyollama # 本地服务不校验 Key占位即可 ) # 调用方式与 OpenAI 完全一致 response client.chat.completions.create( modelqwen2.5:3b, # 使用本地模型名 messages[ {role: user, content: 讲一个程序员冷笑话} ] ) print(response.choices[0].message.content)类比Ollama 的 /v1 接口就像「转换插头」让原本只认 OpenAI 插座的程序LangChain、Dify、各种 AI 工具能直接插到本地电源上。7. 模型对比表官方库里的热门选择完整列表见 library。以下按「新手友好度」推荐。7.1 按任务类型选择模型参数量推荐显存/内存需求中文能力英文能力代码能力适合场景qwen2.5:3b3B4GB 内存起步⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐中文对话、入门首选qwen2.5:7b7B8GB 内存⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐中文写作、日常问答llama3.2:3b3B4GB 内存⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐英文任务、轻量部署llama3.1:8b8B8GB 内存⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐通用英文任务gemma2:9b9B8GB 内存⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐Google 系、数学推理mistral:7b7B8GB 内存⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐英文代码、指令遵循deepseek-r1:7b7B8GB 内存⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐推理题、数学题phi3:mini3.8B4GB 内存⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐极低资源、代码llama3:70b70B32GB 内存⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐高端机、最强开源⚠️预警参数量B Billion十亿参数越大聪明程度和资源消耗同时上升。新手建议「由小到大」先跑 3B 感受效果再逐步升级到 7B/8B避免一步到位把电脑卡死。7.2 同名不同尺寸说明模型名后面的 :3b、:7b、:70b 是参数量标签。同一系列如 Qwen2.5有 0.5B ~ 72B 多个版本# 拉取 Qwen2.5 不同尺寸的版本 ollama pull qwen2.5:0.5b # 极小1GB 内存都能跑适合测试 ollama pull qwen2.5:3b # 入门推荐 ollama pull qwen2.5:7b # 平衡之选 ollama pull qwen2.5:14b # 需要 16GB 内存 ollama pull qwen2.5:72b # 需要 48GB 内存谨慎小贴士不确定自己电脑能跑多大模型先用 ollama run qwen2.5:0.5b 试试手感再逐级升级。内存不足时 Ollama 会提示 failed to load model。8. 进阶玩法自定义模型、GPU 加速、OpenAI 兼容接口8.1 自定义模型把系统提示词「固化」成新模型如果你经常用同一套系统提示词比如「你是一个美食博主」可以把它做成一个「专属模型」第一步写一个 Modelfile类似 Dockerfile# Modelfile —— Ollama 的「模型配方文件」 # 基于 qwen2.5:3b 定制 FROM qwen2.5:3b # 基础模型 # 设置系统提示词让模型扮演美食博主 SYSTEM 你是一个资深美食博主说话风格活泼、喜欢用比喻 回答美食相关问题时会给出具体菜谱和操作步骤。 # 设置温度0.7 表示中等随机性0 最保守1 最发散 PARAMETER temperature 0.7 # 设置上下文长度4096 个 token约几千字 PARAMETER num_ctx 4096第二步用 Modelfile 创建模型# 创建名为 foodie 的自定义模型 ollama create foodie -f ./Modelfile # 直接使用新模型对话 ollama run foodie类比Modelfile 就像「咖啡配方」——基础咖啡豆FROM 糖和奶比例PARAMETER 店员话术SYSTEM。做好配方后每次直接点单即可。8.2 GPU 加速让模型跑得更快NVIDIA 显卡Windows/Linux安装最新 NVIDIA 驱动确保 CUDA 可用nvidia-smi 能看到显卡Ollama 默认自动使用 GPU无需额外配置。验证是否用了 GPU# 查看运行中的模型占用了什么处理器 ollama ps # 输出中 PROCESSOR 列显示 100% GPU 即为成功AMD 显卡安装 ROCm 后 Ollama 自动识别Windows 支持有限。Apple SiliconMac M 系列开箱即用Ollama 自动走 Metal 加速。⚠️预警如果 CPU 运行极慢比如 7B 模型每秒才 2-3 个字多半是没走 GPU。先 nvidia-smi 检查驱动再 ollama ps 确认 PROCESSOR 列。8.3 设置环境变量Windows 用户常见需求# 设置模型存储路径默认在 C 盘想挪到 D 盘时用 $env:OLLAMA_MODELS D:\ollama\models # 设置 API 服务监听所有网卡默认仅本机局域网其他设备可访问 $env:OLLAMA_HOST 0.0.0.0:11434 # 设置单次请求最大并发数默认 4 $env:OLLAMA_NUM_PARALLEL 2 # 重启 Ollama 使环境变量生效Windows右下角托盘退出后重新打开⚠️预警把 OLLAMA_HOST 设为 0.0.0.0 意味着局域网内任何人都能调用你的模型请确认网络环境可信否则不要开启。8.4 与常用工具集成工具用途集成方式Open WebUI图形化聊天界面类似 ChatGPTdocker run -d -p 3000:8080 --add-hosthost.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:mainVS Code ContinueIDE 内 AI 编程助手安装 Continue 插件provider 选 OllamaLangChainAI 应用开发框架from langchain_community.llms import Ollama; llm Ollama(modelqwen2.5:3b)Dify低代码 AI 应用平台设置里添加 Ollama 为模型供应商填 base_url8.5 批量调用脚本一次处理多条文本# batch_infer.py # 用本地模型批量处理文本如给一批标题打分 import ollama titles [ 如何用 Python 爬取网页数据, 今天天气不错, 深度学习入门指南 ] for i, title in enumerate(titles, 1): # 对每个标题让模型判断是否与技术相关 resp ollama.chat( modelqwen2.5:3b, messages[ {role: user, content: f判断以下标题是否与技术相关只回答 是 或 否{title}} ] ) print(f{i}. {title} - {resp[message][content].strip()})9. 常见问题速查表FAQ问题快速解答ollama: command not found安装后没重开终端或安装路径没加入 PATH。重开终端或手动添加环境变量。failed to load model / 内存不足模型太大。换小尺寸qwen2.5:0.5b或用 ollama ps 先停掉其他模型。下载太慢 / 下载中断国内可设置镜像$env:OLLAMA_BASE_URL https://ollama.ai或用代理中断后重新 ollama pull 会断点续传。CPU 跑得太慢确认是否走 GPUollama ps 看 PROCESSOR 列没有独立显卡就只能用小模型。怎么让模型说中文选中文强模型qwen2.5 系列并在提示词中明确「请用中文回答」。模型存在哪 / 怎么换盘默认 ~/.ollama/modelsWin 为 C:\Users\xxx\.ollama用 OLLAMA_MODELS 环境变量改路径。API 端口是多少11434接口路径/api/generate生成、/api/chat对话、/v1OpenAI 兼容。如何让局域网其他设备访问设置 OLLAMA_HOST0.0.0.0:11434 后重启注意安全。Ollama 和 Docker 什么关系完全独立。Ollama 管理模型类似 Docker 管理镜像但不需要装 Docker。支持哪些模型官方库 1000Llama、Qwen、Gemma、Mistral、DeepSeek、Phi、Mixtral 等ollama search 关键词 可搜。怎么停止后台服务Windows托盘退出Mac/Linuxpkill ollama 或 ollama stop部分版本支持。上下文长度怎么调对话时设置 num_ctx 参数或写进 Modelfile 的 PARAMETER num_ctx 8192。多轮对话会记住上下文吗默认会保留一定上下文受 num_ctx 限制超长对话可手动把之前内容精简。附三分钟速通清单1. 安装 → ollama 官网下载安装包 / brew install ollama 2. 验证 → ollama --version 3. 拉模型 → ollama run qwen2.5:3b 4. 对话 → 输入问题/bye 退出 5. 查列表 → ollama list 6. 调 API → curl http://localhost:11434/api/generate -d {model:qwen2.5:3b,prompt:hi,stream:false} 7. 删模型 → ollama rm qwen2.5:3b ⚠️ 不可恢复确认后再删Ollama 是「本地 AI 时代」的入门钥匙它把过去需要一整天配置的环境问题压缩成一条命令。从今天起你的电脑不再只是一台执行指令的机器而是一个随时可以对话、思考、帮你写代码的「本地大脑」。下一步去 library 挑一个你感兴趣的模型试试吧