
简介Page Assist 是一款面向 Chrome 用户的浏览器辅助插件通过侧边栏、选项页与后台脚本增强网页浏览和交互体验适合需要研究本地 AI 助手、公式渲染或文字识别在浏览器中落地的开发者参考。压缩包共 95 个文件大小约 6MB主要包含 html、js、json、css 等插件核心文件同时收录了多套字体资源用于数学公式显示并带有 OCR 识别模块与多语言本地化配置。目前已有 3002 人学习下载。资源目录结构完整涵盖扩展清单、后台脚本、内容脚本、编译代码块、图标及国际化资源等模块便于从零拆解 Chrome 扩展的启动流程、后台任务与页面交互逻辑。无论是想快速上手扩展开发还是研究侧边栏 UI 与本地 OCR/公式渲染集成这套插件包都是一份直观的实战样例。 我平时浏览网页时经常碰到一个痛点文章太长没耐心读、英文资料看得费劲、想快速总结又没有现成工具。后来我在Chrome上装了一个叫 Page Assist 的插件专门用来和本地AI模型配合直接在浏览器侧边栏完成网页总结、翻译、问答这些操作。这篇文章就围绕 Page Assist 插件Google Chrome 环境展开聊聊它是什么、怎么部署、怎么用以及我在实际使用中踩过的坑。先说重点Page Assist 不是一个云端工具它默认连接的是你自己电脑上运行的本地大模型比如通过 Ollama 拉取的 Qwen、Llama 这类开源模型。这意味着你的网页内容不会上传到第三方服务器隐私性比云端AI好很多而且不依赖网络环境断网也能用。适合对数据敏感的人、经常需要处理长网页或技术文档的人以及喜欢折腾本地AI的开发者。1. 从需求到方案为什么我最终选择了Page Assist1.1 网页阅读的痛点与插件定位我在日常工作中会翻阅大量技术文档、英文博客和项目说明经常要做三件事快速了解文章主旨、划出关键信息、翻译不理解的长句。以前的做法是复制粘贴到在线AI对话框来回切窗口非常麻烦而且内容长了还要分段处理。Page Assist 恰好填补了这个空档。它把AI对话界面搬到了浏览器侧边栏并能读取当前标签页的正文内容。你只需要按一下快捷键或者在扩展栏点击图标侧边栏就弹出来了可以直接问“这篇博客讲了什么”“用一句话解释这里面的XX概念”插件会把网页正文作为上下文连同问题一起提交给本地模型处理。这个定位非常克制不搞花哨功能就是让“读网页”这个行为变得更顺滑。而且因为模型在本地运行速度相对稳定不会有排队等待或者限流的问题。1.2 为什么我推荐本地模型方案有人可能会问用云端AI不香吗回答这个问题之前先想清楚自己的使用场景。如果你只是偶尔问问问题云端AI确实方便。但如果你每天要看大量网页频繁把网页内容发给云端服务第一是效率问题第二是隐私问题。Page Assist 的思路很清晰本地运行模型网页上下文不出电脑。本地模型的效果这两年进步很大以 Ollama 仓库里常见的 qwen2.5:7b 为例做中文总结、翻译、信息抽取完全够用。虽然跟 GPT-4o 这类超大模型还有差距但对于“总结网页、提取要点”这类任务差距并没有想象中那么大。另外本地方案有一个云端方案无法替代的优点连接的是你自己掌控的模型。你可以随意切换不同模型比较效果也可以做针对性的微调这些在浏览器插件层面几乎是不可想象的。至少我在使用Page Assist 这段时间里最大的感受是“AI变成了浏览器的一部分”而不是一个需要单独打开的外部网站。2. 正式部署前的前置准备Ollama与模型选择2.1 安装Ollama运行时环境Page Assist 本身只是个前端界面真正干活的是本地大模型而运行大模型最省事的方式就是安装 Ollama。Ollama 是一个跨平台的本地大模型运行工具支持 Windows、macOS 和 Linux安装包在官网就能下载体积不大装完以后会默认在后台跑一个服务监听 11434 端口。装好 Ollama 后可以先验证一下服务是否正常。在终端执行ollama list如果能看到模型列表哪怕为空就说明服务已经在运行了。如果提示命令找不到可能是环境变量没配好通常是重新打开终端或者手动把 Ollama 的安装目录加入 PATH。这里有个经验Windows 上安装 Ollama 时尽量不要改默认安装路径否则后续手动配置环境变量会比较折腾。我一开始把它装到 D 盘自定义目录结果 ollama 命令只能在特定终端里识别花了一点时间才解决。2.2 选择合适的中英文模型模型选择直接决定使用体验。以我用过的几个模型为例模型参数量优势适合场景qwen2.5:7b7B中文理解强总结和问答效果均衡中文网页总结、日常问答llama3.1:8b8B英文理解强逻辑性好英文文档总结、翻译gemma2:9b9B推理能力较好生成速度较快中英文混合内容mistral:7b7B响应速度不错显存占用较低资源有限的老机器如果是新手第一次装我推荐直接用 qwen2.5:7b中文效果在开源模型里属于第一梯队而且 7B 参数量对显存要求比较友好8GB 显存就能跑得起来CPU 模式也能出结果只是慢一些。拉取模型的命令ollama pull qwen2.5:7b这个命令会从模型仓库下载对应文件大小通常在 4GB 到 5GB 左右具体看网络情况。下载完成后执行ollama list就能看到模型已经在本地了。然后建议给 Ollama 设置一个环境变量允许浏览器插件访问它的 API。因为在较新版本中Ollama 默认只允许 localhost 访问但 Page Assist 作为浏览器扩展其请求来源有时候会被浏览器标识为跨域来源。稳妥的做法是在系统的环境变量里加一行OLLAMA_ORIGINS*设置完成后重启 Ollama 服务。这一步如果漏掉后面大概率会遇到连接失败的问题。3. 在Chrome中安装Page Assist并完成配置3.1 安装方式与版本选择Page Assist 的安装方式主要有两种Chrome 网上应用店直接搜索 “Page Assist” 安装好处是后续会跟随插件商店自动更新体验最省心。从 GitHub Releases 页面下载 .zip 或 .crx 文件手动加载到 Chrome 扩展管理页面适合无法访问插件商店或想提前体验新版本的人。我个人的建议是能访问 Chrome 网上应用店就优先用第一种方式因为手动加载的扩展在 Chrome 更新或者浏览器重启后偶尔会有状态异常自动更新机制能省掉这些麻烦。需要注意一点Page Assist 在 Chrome 上使用的是侧边栏 API这是 Manifest V3 扩展支持的。如果你还停留在比较老的 Chrome 版本比如 109 这种停止更新的版本大概率会因为扩展 API 不完整而无法正常安装或运行。建议让 Chrome 保持自动更新不要刻意阻止版本升级否则后续装新扩展很容易碰壁。3.2 首次配置连接Ollama的详细步骤安装完成后点击扩展栏的图标Page Assist 会打开一个侧边栏。第一次使用需要配置 API 地址和模型列表点击侧边栏底部的设置按钮或者是齿轮图标。在模型提供商Model Provider选项中选择 “Ollama”。API 地址填http://localhost:11434这是 Ollama 的默认地址。点击 “获取模型列表”Fetch Models插件会通过 API 读取你本地的模型列表然后在下拉框中选择你想要使用的模型。配置完成后可以先用一句简单的话测试一下比如输入“你好请介绍一下你自己”。如果模型返回了正常的回复说明整个链路已经通了。如果点击获取模型列表没有反应大概率是环境变量OLLAMA_ORIGINS没有配置好检查这一步是最优先的。3.3 针对使用场景微调模型参数Page Assist 的设置里提供了几个常用参数其中影响最大的是temperature温度。这个参数控制模型的随机性数值越高回答越发散越低则越严谨。做网页总结时我一般把温度设置在 0.3 到 0.5 之间这样输出的摘要更贴紧原文事实不容易“创造”原文没有的信息。做头脑风暴或者其他创意性问答时可以调到 0.7 以上让回答更有弹性。还有max tokens最大生成长度这个参数。网页总结的输出通常不长默认的 1024 就够用但如果你希望模型输出详细的分析报告可以适当调高。这里有个权衡生成长度越大等待时间长而且本地模型的显存占用也会上升。4. 核心使用场景从网页总结到侧边栏问答4.1 网页内容快速总结与提炼这是 Page Assist 最实用的场景没有之一。在某次阅读一篇长英文技术博客时我只需要点击扩展图标在侧边栏输入“用中文总结这篇文章要求提炼出三个核心观点”然后按回车。Page Assist 会把当前标签页的正文内容提取出来连同问题一起提交给本地模型模型返回的结果直接展示在侧边栏。实际操作中有个技巧可以通过符号或关键词告诉模型重点。比如“总结这篇文章重点讲清楚第二部分的实现思路”模型会根据指令过滤信息。如果觉得总结太泛还可以继续追问“刚才总结的第2点展开解释一下”因为对话上下文还在模型能接得上。4.2 侧边栏连续对话与长文翻译除了单次提问侧边栏本身就是一个完整的聊天界面。你可以针对当前网页连续追问多个问题模型会结合之前的对话内容和网页上下文来回答。这一点在做文献阅读时特别有用第一遍先让模型总结全文然后针对每一个技术细节深入询问整个过程不需要我们来回切换网页和AI对话框。翻译也是常用功能。我经常遇到英文文档里某些句子理解不透的情况。在侧边栏输入“把这段翻译成中文注意保持技术术语的原样”模型会结合上下文给出翻译。相比在线翻译工具这种方式的优势在于它理解了全文语境某些专业性较强的翻译会更自然。不过也要提醒一下本地模型在处理超长网页时可能因为上下文窗口限制而截断部分内容导致翻译遗漏某些段落。遇到这种情况可以先让模型总结全文再单独拷贝具体段落进去翻译。4.3 自定义指令与提示词模板的利用Page Assist 支持自定义系统提示词这个功能很多人没注意到但它其实非常关键。系统提示词相当于给模型设定一个人设或行为准则。比如我可以设定你是一位资深技术编辑擅长用通俗的语言解释复杂概念。用户在网页中选中内容后请在保留原意的基础上进行通俗化改写。配置好以后配合网页内容上下文模型每次输出都会遵循这套准则。对于经常做资料整理的人来说这可以大幅减少重复描述需求的操作。我建议针对不同场景准备几套模板中文总结模板、英文翻译模板、代码解释模板、文献综述模板。以后只需要切换对应模板再把网页内容拉进上下文基本就是一键完成。5. 常见问题排查与优化心得5.1 连接失败的典型原因问题现象可能原因解决建议侧边栏提示 Cannot connect to OllamaOllama 服务未启动执行ollama serve确认服务在运行获取模型列表为空API 地址错误或存在跨域拦截检查地址是否为 localhost:11434设置OLLAMA_ORIGINS*第一次提问超时模型正在被加载到显存耐心等待几秒到数十秒后续响应会正常插件无法安装Chrome 版本过旧扩展 API 不支持升级 Chrome 到最新版本连接失败是我遇到最多的问题而且大多是同一类原因环境变量没有设置。浏览器扩展发起的请求在某些情况下会被视为跨域请求Ollama 出于安全考虑默认拒绝了非 localhost 来源的访问。通过OLLAMA_ORIGINS*放开限制后问题基本上就解决了。5.2 模型响应慢或者卡顿的处理本地模型的响应速度取决于硬件。如果体验很明显卡顿建议按以下顺序排查检查显存占用如果显卡显存不足模型数据会被换到系统内存速度会骤降几个数量级。更小的模型如 qwen2.5:3b可能更适合。关闭多余的后台服务浏览器标签页开太多也会挤占内存尤其是长时间不关的标签页。看温度设置模型运行时的参数设置与推理速度无关但过高的 max tokens 会让一次生成的时间变长。从实际体验来看qwen2.5:7b 在 8GB 显存的显卡上基本可以流畅生成速度约每秒 15 到 25 个 token。如果只有 CPU 没有独立显卡也能跑但生成速度会慢一些适合对实时性要求不高的场景。5.3 网页上下文过长时的优化策略Page Assist 会把当前网页的正文提取出来放进上下文但是网页本身可能非常长。当内容超过模型的上下文窗口时模型会自动截断或报错。这种情况下有两个优化思路先在侧边栏输入“总结一下这个网页的主要内容”拿到概述后再追问细节。如果页面内容实在太多可以用鼠标选中需要处理的段落再复制到侧边栏中提问这样避免了整页内容挤爆上下文。从原理上说上下文越长模型计算注意力矩阵的开销越大显存占用也越高。所以对于非常长的文档主动做内容裁剪比让模型硬扛更高效。我自己的习惯是长文先总结总结后带着问题寻找相关段落然后用选中段落做精确提问这样既快又准。写在最后用 Page Assist 改造浏览体验这件事我坚持了大半年最大的感受是它把“本地AI”和“网页浏览”这两件原本分离的事情真正粘合在了一起。如果你已经装了 Ollama手头又有开源模型不妨花十分钟安装 Page Assist很多日常网页处理的工作量能明显降下来。最后分享一个小技巧在设置里把侧边栏的快捷键改成顺手的组合键比如AltP这样呼出速度会快很多用起来更接近“浏览器自带功能”的体验。本文还有配套的精品资源点击获取