多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

Agent 技术摘要 03 —— 基座模型、推理模型、Flash、联邦学习、分布式机器学习

Agent 技术摘要 03 —— 基座模型、推理模型、Flash、联邦学习、分布式机器学习 系列为笔者在实习过程中的所见所闻记录内容为技术摘要旨在提供关于Agent领域相关技术名词的通俗和简要介绍详细内容暂不展开供同在该领域进修的童鞋们参考。01 基座模型 VS 推理模型基座模型是“脱口而出”的快思考推理模型是“打草稿再回答”的慢思考。维度基座模型推理模型训练目标预测下一个词学会推理步骤通过强化学习奖励正确答案回答方式直接输出最终答案先输出一长串思维链再输出答案计算资源分配训练时烧钱推理时便宜训练烧钱推理时也极其烧钱自我纠错能力几乎没有强类型代表模型擅长场景基座/通用对话模型GPT-4o, DeepSeek-V3, Qwen-Max, Claude 3.5 Sonnet日常聊天、写邮件、翻译、写普通代码、总结文章推理模型OpenAI o1 / o3, DeepSeek-R1, Claude 3.5数学竞赛题、复杂逻辑推导、底层代码架构设计、科研论文分析大家发现单纯把基座模型做得更大喂更多的数据它的逻辑推理能力并没有成正比提升它依然会在简单的脑筋急转弯或者复杂的数学题上翻车。于是行业找到了新方向Test-Time Compute推理时计算既然模型脱口而出容易错那我就逼它在回答前多花点时间思考多生成一些中间 token实验证明只要给模型足够的时间打草稿它的智商会产生涌现式的飞跃能解出以前绝对解不出的奥数题和编程难题。这就是为什么 DeepSeek-R1 和 OpenAI o1 震动了整个硅谷——它们证明了让 AI 学会思考比让 AI 死记硬背更有前途。02 FlashFlash就是模型家族里的极速、便宜、性价比款主打一个天下武功唯快不破。参数变少了旗舰模型可能有 1000 亿个参数而 Flash 模型可能只有 70 亿或 140 亿个参数少计算量就小速度自然就快占用的显卡显存也少。MoE 架构想象一个有 100 个医生的大医院普通模型你去看个感冒100 个医生全跑出来给你会诊MoE 模型门口有个导诊台一看你是感冒只叫醒 2 个内科医生来给你看病其他 98 个医生在睡觉虽然医院很大但每次看病的计算量极小速度飞快量化技术把模型里高精度的数字比如 3.1415926压缩成低精度的比如 3.14虽然损失了一丁点智商但体积和计算量直接减半。03 联邦学习联邦学习Federated LearningFL是一种协作训练范式即多个参与方把原始训练数据保留在本地通过交换模型更新等信息共同训练模型。以经典 FedAvg 为例假设三家公司想共同训练客服模型但各自的对话数据不能集中存储。它们可以运行以下循环下发模型协调服务器把同一个全局模型参数发给本轮参与方本地训练每家公司用自己的数据执行若干步梯度下降得到本地参数上传更新参与方上传模型参数或参数增量原始训练样本保留在本地聚合更新服务器按规则合并得到下一轮全局模型再重复上述过程FedAvg 的典型聚合公式是θt1∑k∈Stnk∑j∈Stnjθt1(k) \theta_{t1} \sum_{k\in S_t} \frac{n_k}{\sum_{j\in S_t} n_j} \theta_{t1}^{(k)}θt1​k∈St​∑​∑j∈St​​nj​nk​​θt1(k)​其中S_t是本轮参与方集合n_k 是参与方 k 的本地样本数直观上就是对从同一个全局模型出发分别经过本地训练的模型参数按数据量做加权平均共同的初始化、参数结构和训练协议很重要。一个难点是 Non-IID非独立同分布例如一家公司主要处理金融客服另一家主要处理电商客服各自的本地更新可能朝不同方向优化。另一个难点是安全和隐私模型更新仍然携带训练数据的信息在特定条件下攻击者可以利用共享梯度重建部分训练样本。因此隐私要求较高的联邦系统通常还需要结合安全聚合Secure Aggregation让服务器获得多个参与方更新的聚合结果同时隐藏单个参与方的更新差分隐私Differential Privacy通过裁剪、加噪和隐私预算管理限制单条记录或单个用户对可观察结果的影响04 分布式机器学习分布式机器学习Distributed Machine Learning指把机器学习的计算和存储分配到多个计算节点上通过通信与协调共同完成任务。在训练语境中通常就是让多张 GPU、多台服务器协同训练模型。① 数据并行以 4 张 GPU 训练同一个模型为例在各卡样本数相同、损失取样本平均的简单情形下g14∑k14gk,θt1θt−ηg g\frac{1}{4}\sum_{k1}^{4}g_k, \qquad \theta_{t1}\theta_t-\eta gg41​k1∑4​gk​,θt1​θt​−ηg其中 g_k是第 k 张卡计算的梯度eta 是学习率。② 模型并行大模型训练中显存不仅用于存储参数还要存储梯度、优化器状态和中间激活。Ⅰ张量并行TP拆分同一层内部的张量及计算比如一个大型矩阵乘法由多张 GPU 共同完成。Ⅱ 流水线并行PP将不同层分配到不同设备比如GPU 0 计算前几层再把激活传给 GPU 1。Ⅲ 状态分片FSDP分片存储参数、梯度和优化器状态比如每张卡只常驻部分状态计算时按需通信获取参数。
返回列表