多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

玩转大模型 第四篇:从官网到 API——先搞懂幻觉,再看清工程落地的 5 条路

玩转大模型 第四篇:从官网到 API——先搞懂幻觉,再看清工程落地的 5 条路 玩转大模型 第四篇从官网到 API——先搞懂幻觉再看清工程落地的 5 条路前三篇讲的都是模型侧它是什么、怎么训出来、跑在什么硬件上。从这篇开始换视角——一个开发者到底怎么把大模型用起来。最省事的路径显然是打开官网对话框DeepSeek、千问这些国内顶尖模型基本都能免费用。但只要你试着做点真实需求比如接进自己的系统、挂个私有知识库、跑一条多步骤流程马上就会撞到一堵墙官网没提供这些能力你得去调 API。然后第二个问题立刻出现模型开始一本正经地胡说八道——编出不存在的论文、不存在的接口参数语气还特别肯定。这就是幻觉。这篇把工程落地的入场券讲清楚AIGC 和 AGI 的区别、访问大模型的三种方式、幻觉到底是什么毛病以及业界公认的 5 个落地模块分别解决什么问题。最后给一张选型路线。1. 先校准两个词AIGC 和 AGI这两个缩写经常同屏出现但它们完全不在一个维度上——一个是在做的事一个是目标。AIGCAGI全称Artificial Intelligence Generated ContentArtificial General Intelligence中文人工智能生成内容通用人工智能是什么技术与应用体系一种人工智能形态一句话用 AI 生成内容能自主学习并解决大多数人类能解决的问题现状已经在大规模落地尚未实现AIGC的完整定义以大规模预训练模型尤其是生成式基础模型为核心通过学习海量数据中的统计规律和语义结构在人类输入提示或条件约束下自动生成文本、图像、音频、视频、代码等多模态内容的技术与应用体系。AGI的完整定义具备跨领域、跨任务的通用认知能力的人工智能形态能在不同环境和目标下进行理解、学习、推理、规划与知识迁移并在缺乏明确任务定义或规则约束的情况下自主发现问题并制定解决策略整体智能水平接近或超越人类。1.1 通向 AGI 的两条路径主流研究普遍认为有两条路径一 提升 基础模型 的通用能力 路径二 通过 Agent 设计 对模型能力进行组织与调度 → 让模型具备 目标分解 / 长期规划 / 工具使用 / 环境交互 能力 → 在复杂任务中表现出更接近通用智能的行为这条判断其实直接解释了这个系列为什么最后要讲智能体Agent 不只是更好用的 ChatBot它被认为是通向 AGI 的两条主干路之一。2. 访问大模型的三种方式2.1 在线平台门槛最低访问大模型厂商官网即可国内的顶尖模型基本都能在官网免费使用。平台地址DeepSeekhttps://chat.deepseek.com/Qwenhttps://chat.qwen.ai/2.2 为什么不直接用官网这个问题值得单独拎出来因为很多人的技术路线是从这里开始分叉的。如果只是和大模型对话用官网是最合理的方式。但如果我们想用大模型做一些复杂任务比如个人知识库、复杂的 Agent而这类功能官网没有提供——此时就只能调用 API。简单理解只想聊天问答 -- 官网免费零成本 要挂自己的知识库 -- 本地客户端自带知识库功能或自己写代码 要做复杂 Agent -- API 框架LangChain / LangGraph 等2.3 API 调用大模型厂商基本都提供了 API 接口基于 HTTP/HTTPS 协议的REST API访问接口即可调用大模型。API 接口通常是付费的调用需要提供密钥。以 DeepSeek 为例开放平台在 https://platform.deepseek.com/ 。方式一命令行 curl流程是在官网获取 API 密钥和接口地址把命令里的${DEEPSEEK_API_KEY}替换成自己的 Key然后在 Linux 命令行执行。curlhttps://api.deepseek.com/chat/completions\-HContent-Type: application/json\-HAuthorization: Bearer${DEEPSEEK_API_KEY}\-d{ model: deepseek-chat, messages: [ {role: system, content: You are a helpful assistant.}, {role: user, content: 你好} ] }返回日志这里有个认知上很省心的一点任何能调用 HTTP 接口的方式都可以用来调用大模型接口。除了 curl还可以用 Python 代码、接口调试工具如 Postman等。大模型 API 没有任何特殊性它就是普通的 REST 接口。方式二本地客户端以 Cherry-Studio 为例命令行调用接口可读性差、交互成本高。市面上有很多本地大模型客户端配置好接口服务就能像在线平台那样调用大模型Cherry-Studio 是其中一种。这时也可以选择自带知识库搭建功能的本地客户端——用 Cherry-Studio 既能自己配 API也能直接用官方提供的模型。配置流程大致是打开 API 配置界面 → 填密钥和地址 → 按官网的模型 ID 添加模型 → 检测连接 → 添加助手并配置默认模型 → 开始聊天。一个实操细节API 地址不需要填写.com后面的部分Cherry-Studio 会自动补全可以在输入框下方的预览里确认最终拼出来的地址。方式三代码调用写代码发 API 请求这是工程上真正的主路径基于 LangChain、LangGraph 等框架或纯 Python。这部分内容在后续章节展开。3. 幻觉所有工程手段存在的理由3.1 什么是幻觉大模型的幻觉Hallucination是指模型在生成内容时给出看似合理、语言流畅但实际上不正确、无法验证或与事实不符的信息。这种输出往往具有较强迷惑性因为它符合语法、风格和上下文预期但在事实性、可追溯性或逻辑一致性上存在问题。3.2 为什么会产生模型之所以会编是因为在以下条件叠加时它会给出一个概率上最合理的答案训练语料中缺乏相关信息提示词存在歧义或不完整模型被要求必须回答超出模型知识边界或时间边界注意第三条——被要求必须回答本身就是幻觉的成因。这条后面在提示词工程里会有对应的解法允许模型说我不知道。3.3 五种常见幻觉类型类型说明示例事实性幻觉编造不存在的事实虚构论文、法律条文、接口源引用幻觉编造参考来源不存在的 DOI / 文献逻辑幻觉推理链条自洽但前提错误错误因果关系过度自信幻觉错误但语气极其肯定100% 确定式回答工具/代码幻觉调用不存在的 API / 参数编造 SDK 方法做后端的同学对最后一行应该最有共鸣让模型写它不熟的 SDK 调用方法名拼得漂漂亮亮参数列表看着完全合理一跑编译报错——这就是工具/代码幻觉。3.4 为什么幻觉无法彻底消除从系统设计角度看幻觉是不可完全消除的系统性问题LLM不是知识库而是生成模型训练数据本身存在噪声与冲突RLHF 强化了有用回答而非拒答← 第二篇的对齐阶段在这里埋了个副作用生成任务天然追求完整性而非保守性因此行业共识是幻觉只能被控制、缓解、检测不能被彻底消灭。Q为什么第 3 点说 RLHF 反而加重了幻觉因为偏好数据里给出一个具体答案通常比我不知道得分更高。模型被训练成倾向于回答而不是承认边界。这不是训练做错了而是**有用和诚实在偏好数据里天然冲突**。所以工程上要靠外部机制补引用溯源、允许拒答、事实核对——这也正是后面 RAG 和 Agent 要干的事。4. 工程落地的 5 大模块既然大模型能力强大但不能直接用就要做工程化加工。从工程实现角度看大模型应用主要分为五个模块提示词工程、RAG、微调、续训、智能体开发。1提示词工程最廉价的方式开箱即用直接调用模型。通过提示词优化和提供示例来优化输出效果。2RAG当提示词工程达不到预期且原因是缺少参考知识时尝试 RAG调用外部知识库。token 消耗往往比开箱即用略高开发略微复杂。3微调如果提示词工程效果不好且原因是指令遵循能力较差、风格/话术不一致可以尝试微调。需要收集数据并且要有硬件资源。4续训如果微调效果仍不理想且问题来自模型对领域语言/知识分布的系统性缺失可以考虑收集更多数据做续训预训练前提是有充足的硬件资源。续训的硬件开销通常远高于微调。5智能体开发当其它方式都无法解决问题时都可以尝试和智能体开发结合。智能体会涉及大模型的多次调用token 开销较大开发难度较高。但经济账有意思的地方在这智能体单次开销不及微调和续训长期成本却可能更高——因为微调和续训是一次性投入智能体是每次调用都要付费。4.1 五个模块横向对比模块解决什么问题改模型权重成本开发难度前置条件提示词工程需求没表达清楚否最低⭐无RAG缺外部/最新知识否低-中⭐⭐知识库微调指令遵循差、风格不稳是部分中一次性⭐⭐⭐标注数据 硬件续训领域知识系统性缺失是高一次性⭐⭐⭐⭐海量语料 大量硬件智能体多步骤、需工具、需状态管理否长期累积高⭐⭐⭐⭐⭐工具生态 编排4.2 决策路线如果是我按这个顺序试课件给的是分类落到实操上其实是一条成本递增的排查链效果不满意 ↓ 先改提示词最便宜 → 还不行 ↓ 是不是缺资料/最新信息 ── 是 ─→ 上 RAG → 还不行 ↓ 是模型本身不听指令、风格漂移── 是 ─→ 微调 → 还不行 ↓ 是模型对整个领域语言/知识系统性不懂─ 是 ─→ 续训 ↓ 任务本身是多步骤 / 要调工具 / 要管状态 ─────→ 智能体可与上面任意一层组合注意最后一条不是兜底而是正交智能体可以和前面任何一层叠加使用。微调效果不理想时同样可以靠 Agent 引入规则校验、结构化约束、事实核对来提升质量。最后总结AIGC 是当下AGI 是方向而 Agent 被认为是通往 AGI 的两条主干路之一这是它值得单独花一篇讲的原因。访问方式三选一按需求定聊天用官网要复杂能力知识库、Agent就得调 API本地客户端是低成本的中间态。API 没有任何特殊性它就是普通 REST 接口任何能发 HTTP 请求的工具都能调。幻觉是系统性问题不是 bugLLM 是生成模型而非知识库加上 RLHF 奖励有用、生成任务追求完整决定了它只能被控制、缓解、检测。五个模块是一条成本递增的排查链提示词 → RAG → 微调 → 续训智能体则可以正交叠加在任意一层上。笔者后端 架构的策略是除非有明确的合规或数据隔离要求前两步提示词 RAG能覆盖 80% 的业务需求一上来就想微调的团队大多数是在为一个还没定义清楚的需求买单。第五篇就沿着这条链往下走把最便宜也最容易被低估的那一层讲透提示词工程。参考资料 致谢[1] 尚硅谷大模型技术之大模型概述 V1.0.3-课件[2] DeepSeek 开放平台[3] Cherry-Studio 下载-官网[4] LangChain 官网[5] OpenAI API 参考文档
返回列表