【从零实现C++AI大模型接入SDK(标准项目)】《系列(一)------项目简介+AI知识科普》

发布时间:2026/7/31 15:24:09
【从零实现C++AI大模型接入SDK(标准项目)】《系列(一)------项目简介+AI知识科普》 一. 项⽬背景从1994年接⼊互联⽹⾄今中国互联⽹的发展历经了PC时代、移动互联⽹时代尤其是在移动互联⽹时代进⾏了⼤量的海量数据、技术积累以及硬件算⼒的巨⼤提升之前不温不⽕的⼈⼯智能伴随着ChatGPT的横空出现迎来了今天AI的爆⽕各种⼤模型、智能体应⽤等如⾬后春笋版涌现出来AI在更进⼀步进⼊普通⼈的⽣活。现在各个⼚商也在积极拥抱AI作为程序员我们决不能停留在简单使⽤DeepSeek、ChatGPT这种⼤模型级别的产品⽽应该去学习⼤模型应⽤背后的相关技术将模型接⼊到我们程序中来让AI为⾃⼰服务提⾼⽣产效率。本项⽬就带领⼤家从底层学习如何接⼊⼤模型这也是进⾏⼤模型开发的第⼀步。本项⽬⽬标旨在掌握⼤模型相关的⼀些基础知识掌握官⽹提供⼤模型的API接⼝的学习掌握C下远程接⼊⼤模型思路及技术实现掌握C下本地接⼊⼤模型的思路及技术实现开发⼀套语⾔聊天⼤模型应⽤二.名词解释【模型 - Model】此处模型专指AI领域的模型。可以简单理解成⼀个从⼤量数据中学习规律、⽤于进⾏预测的数学函数只是该函数参数巨多、⽆⽐复杂。可以简单类⽐成⼀个正在学说话的⼩孩。⼩孩通过⽿朵输⼊海量的语⾳数据⽐如家⼈的⼝头教学、⽇常⽣活对话、读绘画本通过眼睛去认识各种物品⽐如家庭⽇⽤品、交通⼯具、动物、花花草草等⼩孩通过⼤⼈的⽿传⾝教不断学习成⻓慢慢地就能听懂⼤⼈的指令甚⾄模仿⼤⼈⾏为等建⽴起⾃⼰的语⾔规则。⽐如他发现我们经常将吃和饭饭、⽔果连在⼀起睡觉觉和床连在⼀起当给孩⼦说宝宝太晚了我们⼀起上床_____宝宝就会说睡觉觉~~~【⼤模型 - Large Model】⼤模型就是AI⾥的超级学霸参数巨多、知识量爆炸的AI模型像吃了百科全书全⽹数据的“六边形战⼠”。⼀个既能看懂你的照⽚视觉⼜能听懂你的指令语⾳还能⽤⽂字回答你的模型就是⼤模型。⼤体现在参数海量GPT-3有1750亿个参数⽽早期模型参数不到⼀百万。训练数据恐怖吃掉整个互联⽹⽂本(书籍、论⽂、⽹⻚、代码...)训练⼀次GPT-3 ≈ 190万度电(够5000个家庭⽤1年)【⼤语⾔模型 - Large Language Model - LLM】⼤语⾔模型就是AI界的超级话痨是⼀个吃掉整个互联⽹的⽂本能读会写、知识渊博的AI⼤脑专⻔处理⼈类语⾔⽐如聊天、协作、翻译、编程等但可能会胡说⼋道。将整个互联⽹的数据喂给⼤模型后⼤模型会通过神经⽹络分析词语之间的关系例如将猫、喵喵叫、⽑茸茸词归类到⼀起但是它并不理解当⼈类在提问的时候它会推测出最可能得回答。⼤模型的局限性可能会出现幻觉没有真正理解偏⻅与安全⻛险目前主流的大语言模型中OpenAI于2025年8月正式发布的GPT-5、Google的推理强模型Gemini 2.5 Pro、Anthropic首款混合推理模型Claude 3.7 Sonnet、深度求索的DeepSeek-V3.2其V4也已发布预览版、阿里的Qwen3系列以及字节跳动的Doubao-Seed-1.6等【提⽰词 - Prompt】给AI的任务说明书告诉AI要做什么、怎么做的指令。【提⽰词设计三要素】⻆⾊设定Role你是⼀个具有⼗年以上C后端开发的架构师请帮我设计类似微信的聊天软件 问题描述任务描述Task⽤200字总结导致拖延症原因格式约束Format请按要点分条列出每条不超过15字【上下⽂ - Content】AI在对话或任务中临时记住的信息像⼈类聊天时不会突然失忆能联系前后⽂理解意思。⽤⼾推荐⼀部科幻电影 AI《星际穿越》 ⽤⼾为什么推荐这部 AI结合上下⽂因为它的硬核科学设定和感⼈⽗⼥情...大语言模型并不会记住所有上下文信息当对话超出其上下文窗口时最早的部分会被丢弃就像内存满了自动覆盖旧数据一样。例如GPT-4的上下文窗口为128K tokens大约对应10万个英文字词【token】token 是模型⽤来表⽰⾃然语⾔⽂本的基本单位可直观理解为“字”或“词”通常 1 个中⽂词语、1 个英⽂单词、1 个数字或 1 个符号计为 1 个 token。不同模型中关于token的计算⽅式可能稍有差异。下⾯是DeepSeek官⽹中关于公布的token的计算⽅式以及收费三.DeepSeek、ChatGPT、Gemini使⽤3.1 产品和模型DeepSeek、ChatGPT、Gemini并不是⼤模型⽽是基于某个⼤模型开发出来的⼤模型应⽤产品。⼤模型具有⼤量参数(数⼗亿甚⾄百亿)的⼈⼯智能模型它学习了海量知识掌握了理解⾃然语⾔、逻辑推理、写作、编程等底层通⽤能⼒是⼀个拥有巨⼤潜⼒的⼤脑。⼤模型产品是基于具体⼤模型开发出来的应⽤或服务这些产品将⼤模型的能⼒封装成⽤⼾友好的界⾯或⼯具提供给最终⽤⼾进⾏使⽤。⽐如DeepSeek官⽹提供的能和⽤⼾聊天的⽹⻚服务实际就是DeepSeek-V4模型装上了⼀个聊天界⾯让⽤⼾低成本使⽤⼤模型提供的服务你问⼤模型问题⼤模型将理解你的问题后将⾃⼰回答输出给你。⽐如DeepSeek是深度求索公司开发的基于DeepSeek-V4模型的产品。3.2 deepseek使⽤deepseek官⽹DeepSeek | 深度求索以前打开DeepSeek官⽹显⽰如下⻚⾯DeepSeek当前最新版本截至2026年7月31日当前DeepSeek的主力是V4系列。对比项DeepSeek-V4-ProDeepSeek-V4-Flash定位旗舰推理模型性能最强轻量高效模型性价比最高总参数/激活参数1.6T / 49B284B / 13B上下文窗口100万Token标配100万Token标配架构MoE 混合注意力CSA/HCAMoE 混合注意力CSA/HCA推理模式Non-think / Think High / Think MaxNon-think / Think High / Think Max性能定位逼近闭源前沿模型如GPT-5.5差距约3-6个月推理能力接近Pro版但纯知识任务稍弱价格输出/百万Token平时$0.87高峰$1.74平时$0.28高峰$0.56适用场景复杂推理、Agent任务、长文档处理、高难度编程实时对话、高频调用、函数调用、成本敏感场景V4-Pro是“满血旗舰”V4-Flash是“高性价比轻量版”两者都标配100万Token超长上下文。① 深度推理模式和快速响应模式开关默认未选中为快速响应模式选中之后切换到深度思考模式。② 未选中时仅使⽤模型预训练知识开启后可获取最新信息注意联⽹搜索模式下不⽀持上传⽂件。③ 未选中时⽆法上传⽂件仅通过⽂本输⼊和模型交互开启后⽀持上传PDF、Word、Excel等⽂件模型会读取⽂件内容并根据内容回答问题⽬前暂不⽀持图⽚。④ 输⼊⽤⼾提⽰词之后发送给模型让模型思考回答⑤ 开新⼀轮对话。⽐如切换⼀个新话题、当对话边的混乱模型开始胡⾔乱语时。⑥ ⽀持会话管理。可以点击任意⼀条之前的会话记录快速回到该次会话中继续之前会话就想看书时返回之前章节⼀样。会话名称⼀般是第⼀次问题的开头命名。3.3 ChatGPT官⽹https://openai.com/ChatGPT从名字中看Chat是聊天的意思GPT是什么意思GPT是 Generative Pre-trained Transformer 的缩写。Generative(⽣成式) : 它能⽣成内容(⽂字、代码图像等)不是简单检索Pre-trained(预训练) 在⼤模型⽂本数据上先进⾏通⽤训练再针对具体任务做微调Transformer : ⼀种深度学习框架是⽬前⼤语⾔模型的核⼼技术擅⻓处理序列数据⽐如⾃然语⾔。GPT就是基于深度学习框架的⼀种⼤语⾔模型系列⽐如GPT-4、GPT-5。ChatGPT就是基于GPT模型的聊天式⼈⼯智能助⼿是⼀个产品。GPT-4可以处理⽂字和图⽚输⼊刚开始主要是⽂字版(GPT-4-turbo)后来逐步开放图像输⼊⽐如识别图⽚中⽂字、分析图表等但输出主要是⽂字。GPT-5是⼀个完整的多模态模型输⼊可以是⽂字、图⽚、⾳频、视频帧等输出可以是⽂字、语⾳、甚⾄可以配合Sora⽣成视频。① 使⽤ChatGPT搜索选中之后会先调⽤联⽹搜索获取⽹⻚再把结果交给ChatGPT进⾏总结和会话② 与ChatGPT交谈标准聊天模式主要⽤来对话、问答、写作、编程等③ 研究⾃动查资料并⽣成结构化且带引⽤的研究报告④ SoraSora是⽣成视频的模型输⼊⽂字即可⽣成视频内容和GPT系列不同3.4 Gemini官网https://gemini.google.com/appgemini翻译过来是双⼦座双⼦座标志是两个并排站⽴的⼈物象征则会⼆元性、合作以及强⼤的⼒量。Google在开发Gemini时将Google DeepMind和Google Research的Brain团队合并这两个团队的合作被视为双⼦共同致⼒于打造这个野⼼勃勃的多模态AI模型。还有⼀个说法是致敬NASA(美国国家航空航天局)的双⼦座计划该计划是阿波罗登⽉计划之前的关键⼀步旨在测试宇航员⻓时间太空⻜⾏和太空对接等技术这项开创性计划的巨⼤努⼒和对未来成功的奠定与开发⼤语⾔模型的艰难任务产⽣了共鸣因此团队使⽤了Gemini名字。① 上传⽂件⽀持⽂本、图⽚、视频等不同格式⽂件让⼤模型进⾏理解并进⾏各种操作⽐如总结⽂档关键内容分析表格数据等② Deep Research对问题进⾏更深⼊、全⾯的信息检索和分析⼀般在处理复杂或专业性强的问题时⾮常有⽤③ 图⽚⽣成根据⽤⼾的提⽰词Gemini会使⽤Imagen模型⽣成⼀幅符合描述的图⽚④ 创建⽂档和应⽤启⽤之后Gemini会根据⽤⼾输⼊需求使⽤Canvas⽣成⽂档初稿⽤⼾可以实时调整和优化⑤ 像⼀个私⼈导师能⽤多种⽅式来辅助学习⽐如总结提炼核⼼要点、⽣成学习材料等。⑥ ⽀持语⾳输⼊⑦ 发起新⼀轮对话和临时对话临时对话不会显⽰在会话记录中临时会话系统仅保留72⼩时发起新⼀轮对话会开启⼀个全新的聊天会话⑧ 模型切换模型切换功能目前支持Gemini 2.5 Flash和Gemini 2.5 Pro其中Flash版主打高性价比与低延迟适合实时交互、大规模分类等高频简单任务Pro版则作为旗舰推理模型专攻复杂编程、深度逻辑推理和多步骤Agent任务。不过需要留意的是随着2026年5月谷歌发布Gemini 3.5 Flash新的Flash版本在数学和知识类等多项基准测试中已反超Gemini 2.5 Pro仅在编程任务上2.5 Pro仍保持微弱优势因此如果追求最新性能表现升级至3.x系列可能是更优选择。⑨ ⽀持会话管理四. 为什么学习通过API使⽤⼤模型既然各个⼤模型⼚商已经提供了类似DeepSeek、ChatGPT、Gemini这样的⼤模型服务了开箱即⽤⾮常⾹在⽇常学习⼯作中已经收获颇丰为什么还要学习⼿动接⼊⼤模型我认为有以下⼏点原因了解更多⼤模型知识提⾼⾃⼰竞争⼒使⽤官⽅⼤模型服务就像开⻋会操作就⾏⽬的是到达终点调⽤API就像学习汽⻋原理、保养和改装能让你造出更适合任务的专⽤⻋甚⾄将发动机装到⻜机、轮船上。前者是⼤模型产品的使⽤者后者已经摇⾝成为⼤模型应⽤的创造者。构建⾃⼰的应⽤API允许你将⼤模型的⼤脑与你⾃⼰的程序、⽹站、数据库等连接起来实现通⽤机器⼈⽆法完成的任务解锁⽆限可能性。⽐如开发智能编程助⼿提⾼⽇常开发效率、构建⾃动化⼯作流(⾃动处理邮件、⽣成报告、分析数据等)、构建垂直领域应⽤(为法律、医疗、教育等领域开发专业的问答⼯具)职业发展⼤模型应⽤越来越⼴泛许多公司都在将⼤模型能⼒渐渐接⼊到⾃⼰的产品中在AI原⽣应⽤开发领域⼤模型应⽤开发相关岗位也越来越多会使⽤API集成⼤模型的能⼒能让你在求职中更具竞争⼒更好的适应⾏业的发展趋势。学术研究有些考研的学⽣研究的课题可能和⼈⼯智能相关掌握API接⼊⼤模型技术后可以为⾃⼰量⾝定制⼤模型应⽤以进⾏实验和数据分析验证⾃⼰的研究假设。因此作为⼀名计算机专业的学⽣或者将来从事计算机⽅向开发⼯作学习通过API⽅式使⽤⼤模型是⾮常有价值的不仅能帮助你更好地理解和使⽤⼤模型还能给未来职业发展打下坚实基础。五. 项⽬演⽰本项⽬是带领⼤家从零⼿搓各种⼤模型接⼊的SDK在此基础上实现⼀个智能⽹⻚版的AI聊天助⼿。该应⽤⽬前⽀持以下功能获取会话列表新建会话获取⽀持模型发送消息获取指定会话的历史聊天记录删除会话【主界⾯】【模型选择】⽬前已接⼊DeepSeek、gpt-4o-mini、gemini-2.0-flash模型以及deepseek-r1:1.5b的本地接⼊学习之后同学们也可以接⼊其他更多模型。【开始会话】【本地接⼊DeepSeek】六. 项⽬架构系统架构图说明如下应⽤层⽤⼾使⽤ChatSDK库来封装⾃⼰的应⽤层服务⽐如实现智能聊天机器⼈ChatSDK封装⼤模型管理库包括⼤模型管理、Session管理以及数据存储。⼤模型管理负责管理并接⼊各种不同⼤模型⽬前已接⼊deepseek-v3、gpt-4o-mini、gemini-2.0-flash等云端⼤模型⽀持接⼊本地⼤模型并向外提供统⼀接⼝⽤⼾可以通过提供的接⼝接⼊⾃⼰需要⼤模型。会话管理⽀持会话管理⽤⼾可以获取获取会话列表、历史消息等数据存储层⽀持会话记录的持久化存储⽅便查看历史会话。三⽅服务对于接⼊的云端模型最终由ChatSDK将⽤⼾消息转发给三⽅服务器模型回复后将结果返回给应⽤层。对于本地部署⼤模型ChatSDK会将⽤⼾消息发送给本地安装的Ollama服务器由Ollama服务器和三⽅模型服务器对接Ollama将模型的回复返回给ChatSDK由ChatSDK将结果返回给应⽤层。下⾯是本项⽬中使⽤的第三⽅库和⼯具七.AI知识科普1. ⼈⼯智能概念⼈⼯智能即Artificial Intelligence简称AI是计算机科学的⼀个分⽀旨在让计算机或机器能模仿⼈类的思维和⾏为能看、能听、能说、能学习、能决策从⼀个简单的命令执⾏者变成⼀个可以感知、理解、推理、学习等服务与⼈类的智慧伙伴。为了让机器具有⼈⼯智能的能⼒需要先让机器看更多的资料去学习⾃⼰总结规律最后具备预测的能⼒。⽐如想要教计算机智能地识别狗。可以按照下⾯步骤来⼈⼯提取特征你需要像⼀个⽼师⼀样先告诉机器要看⼀只狗你主要检查是否有⼀个湿润的、突出的⿊⾊或棕⾊的⿐⼦、⽿朵的形状和位置、尾巴的⻓度和姿态(翘起、摇摆、卷起)、有没有胡须、眼睛的形状、⽑发的⻓度和纹理等特征选择模型选择⼀个合适的机器学习模型训练把准备好的狗和⾮狗的图⽚喂给模型每张图⽚都⽤定义好的特征(湿⿐⼦、胡须等)描述好预测模型学习后看到新图⽚就会去检查这些预设的特征然后判断如果符合狗的特征则就是狗。上⾯的⽅式就是机器学习给模型看图⽚让它⾃⼰学。但有⼀定局限性因为模型是基于⼈⼯提取的特征学习的如果⼀张狗的图⽚是侧⾯的看不到胡须或者⽿朵折起来了机器可能就认不出来。那如果不⽤⼈⼯提取特征⽽是端到端学习把最原始的像素数据(即图⽚本⾝)和标签(这是狗、这不是狗)直接扔给⼀个叫做神经⽹络模型⾃动提取特征神经⽹络结构⾮常复杂有很多层(深度)它会⾃⼰从像素中由低到⾼、由抽象到具体地⾃动学习出狗的特征底层选学会认识⼀些边缘、⻆落、颜⾊中层组合底层特征学会识别纹理、形状、眼睛、⽿朵⾼层结合中层特征最终形成狗脸、狗的⾝体等抽象概念预测训练好后它看到新的图⽚就会动⽤⾃⼰学到的这⼀套从简单到复杂的特征(层级体系)来进⾏判断这个就是深度学习。对于侧⾯、遮挡、奇怪姿势的狗深度学习模型因为它⾃⼰学习的特征更丰富、更本质所以识别能⼒通常远强于传统机器学习⽅法。所以想要让机器像⼈⼀样去识别狗的图⽚可以通过看海量图⽚学习即机器学习⽽完成这个任务最有效的⽅式就是深度学习。现在⼤家所看到的酷炫的AI应⽤⽐如⼈脸识别、语⾳助⼿、⾃动驾驶等背后都是AI---ML--DL的技术在发挥作⽤。因此⼀个机器如果学习⼤量的数据之后具备推理预测能⼒时我们就可以认为该机器具备⼈⼯智能的能⼒。⽽现在ChatGPT、DeepSeek等都是基于Transformer架构的神经⽹络模型投喂海量的数据(⽹⻚、书籍、⽂章)等供模型学习让模型构建⾃⼰的知识库并具备思考、推理、决策能⼒最终成为现在ChatGPT、DeepSeek等⼈⼯智能⼤语⾔模型产品。最左边是输入最右边是输出中间经过很复杂的AI信息处理给你想要的结果就是你直接看的答案2. ⼈⼯智能发展史在更早的时期在⼈类的想象和对机器的向往中已经埋下了⼈⼯智能的影⼦和思想萌芽。⽐如战国时期《列⼦汤问》中就收录了⼀⽚⽂章《偃师献技》偃师带来了⼀个他制造的“倡者”即歌舞艺⼈。这个假⼈能够⾃如地唱歌跳舞动作姿态与真⼈⽆异。甚⾄在对周穆王的妃⼦眉⽬传情时惹得穆王⼤怒认为偃师⽤真⼈欺骗他。偃师为了证明⽴刻将这个假⼈拆解展⽰其内部完全是由⽪⾰、⽊头、胶漆、以及⿊、⽩、丹、⻘等颜料构成的机关⼈偶。周穆王这才惊叹道“⼈之巧乃可与造化者同功乎”AI兴起(1941 - 1956)⼈⼯智能诞⽣1936年阿兰·图灵Alan Turing发表了《论可计算数及其在判定问题中的应⽤》为⼈⼯智能的理论基础奠定了重要⼀步。1943年神经学家沃伦·⻨卡洛克和数学家沃尔特·⽪茨在1943年提出了⼈⼯神经元模型⽤数学⽅法模拟⽣物神经元⽹络证明简单的神经⽹络可以实现基本的逻辑功能假设你现在是⼀名⼤⼆或⼤三的学⽣已经将⽐特⼀个⽅向的课程系统学完并做出⼀两个项⽬⽼师推你找实习⽽你感觉⾃⼰没有复习好知识点忘记了在犹豫是否要找实习。假设将催同学找实习的事情交给⼈⼯神经⽹络模型决策那就需要先输⼊给模型⼀些信号(X)和权重(W)⽐如i. x1 知识储备现状同学学完【C语⾔ 数据结构 C 操作系统 ⽹络 数据库且还做过⼩项⽬权重w1 7极强正权重因为这些技能是企业所需要的能够找实习的资本ii. x2 实习经历同学找实习欲望不⾼但实习经历⾮常重要权重w2 8实习经历企业⾮常认可尤其是⼤⼚实习经历能⼤⼤提⾼简历通过率iii. x3 时间窗⼝优势⼤⼆或⼤三正是找暑期实习的⻩⾦阶段权重w3 9暑期实习表现好很容易转正直接解决就业避免挤秋招iv. x4 ⾃我怀疑、惰性拖延阻⼒感觉⾃⼰没有复习好知识点忘记权重w4 -5拖延是⾏动最⼤的敌⼈知识点忘记是正常的⽽通过⾯试检测⾃⼰成⻓是⾮常快激活函数阈值设定为15。将所有输⼊权值求和后总分超过15这个神经元就被激活输出去找实习的决定⼈⼯神经元模型的核⼼部分输⼊就像树突接收来⾃外界或其他神经元的信息权重每个输⼊都有⼀个权重代表这个输⼊的重要程度。学习的过程主要就是调整这些权重⼤⼩的过程。求和把每个输⼊对应权值全部加起来激活函数检查求和后的总值是否超过某个阈值超过就产⽣响应否则就不响应以实现开关特性。输出就向轴突将决策结果(0或1)传递出去给下⼀个神经元这个模型成为了后来所有⼈⼯神经⽹络和深度学习的基⽯1950年艾伦图灵在其《计算机与智能》论⽂中提出注明的图灵测试场景设置有⼀个测试者(⼈类)和两个被测试对象其中⼀个被测试对象是真⼈另⼀个是⼀个计算机程序AI。这两个对象在⼀个看不⻅的房间⾥测试者测试者只能通过电脑屏幕与他们⽤⽂字交流。游戏⽬标测试者的任务就是通过⼀系列提问和对话最终判断出哪个是真的⼈哪个是机器。获胜条件如果测试者经常错误地将机器判断为⼈或者说机器成功“欺骗”了测试者那么我们就说这台机器通过了图灵测试⽐如你向两个房间提问1234567 7654321 等于多少A房间会话你等于8888888B房间回答你我现在不想算你现在能区分清那个房间时机器哪个房间时真⼈吗如果⽆法区分那这台机器就通过了图灵测试。图灵的想法很实⽤别管它内部是怎么运作的只要它的⾏为表现得和⼈⼀样智能我们就当它是智能的。1956年图灵的这篇⽂章以“机器能够思考吗”为题重新发表1956年在美国达特茅斯学院汇聚了那个时代最聪明的⼀批⼈他们坐在⼀起开了个会会议主题是试图让机器精确模拟学习或其他智能⾏为该次会议也被称作AI的宪法会议约翰·⻨卡锡⾸次提出⼈⼯智能⼀词。AI早期成功(1956 - 1974)1959年亚瑟·塞缪尔开发了⾸个⾃学习程序-西洋跳棋程序并引⼊了“机器学习”这⼀概念1966年约瑟夫·魏岑保姆开发了⼀个能⼒处理⾃然语⾔的聊天程序ELIZA据说是第⼀个能够尝试图灵测试的程序展⽰了机器和⼈类⾃然语⾔交流的可能性。号称⼼理治疗师⽐如你说我很烦恼ELIZA你会经常烦恼吗ELIZA⽤程序的⽅式模拟提问形成⼀种⼼理咨询的效果其实就是模式匹配号称⼼理治疗师。虽然简单但是给⼈感觉机器很懂我。1970年第⼀个拟⼈机器⼈WABOT-1在⽇本早稻⽥⼤学建成。它由⼀个肢体控制系统、视觉系统和⼀个对话系统组成。⾸次将视觉、触觉、移动和对话能⼒整合到⼀个拟⼈化的平台上。它确⽴了“⼈形机器⼈”作为⼀个综合性研究领域的地位AI第⼀次寒冬神经⽹络预冷研究经费减少(1974 - 1980)上世纪60年代末到70年代初⼈⼯智能开始从⾼峰⾛向低估因为早起雄⼼勃勃的AI项⽬没有兑现政府和资⽅对AI的耐⼼逐渐耗尽⼤笔研究经费被削减甚⾄叫停• 机器翻译碰壁• ⼤西洋彼岸质疑• 军⽅撤资• 学术批评上述原因交织在⼀起导致70年代中期AI研究陷⼊停滞AI项⽬被砍研究经费锐减年轻⼈才专项爱过你别的领域只有少数学者在坚守阵地。AI复兴与第⼆次寒冬(1980 - 1993)AI领域出现复苏的迹象主要是由于• 专家系统在⼯业界的成功应⽤• 机器学习思想兴起专家系统就是模拟⼈类专家决策的计算机系统它把专家的知识和经验编程规则存进电脑⾥然后向专家⼀样分析问题并给出建议。专家系统的核⼼组成• 知识库类似专家的⼤脑⾥⾯存储了许多如果-那么的规则和专业知识• 推理机类似专家的思维过程。它负责提问、根据⽤⼾回答去知识库查找匹配规则进⾏逻辑推理并得出答案• ⽤⼾界⾯和系统对话的窗⼝但好景不⻓专家系统的局限性逐渐暴露他们的开发和维护成本⾼需要专家不断提供规则⽆法⾃动学习新知识其次系统脆弱⼀旦遇到超出规则范围的情况可能犯荒唐的错误。随着微型计算机性能提升性能逐渐超越运⾏专家系统的AI⼯作站⼤量AI创业公司在短时间内破产或被收购兔⼦⼈兴趣转移到1993年前后超过300加AI公司关⻔迎来了AI的第⼆次寒冬。庆幸的是AI技术并未⽌步不前⽽在其他领域悄然发展⽐如数据挖掘、⼯业机器⼈、语⾳识别、搜索引擎都在90年代获得突破性进展。1991年互联⽹的出现使在线连接和数据共享成为可能⽆论你是谁⽆论你在哪⾥。由于数据是⼈⼯智能的燃料这在以后将被理解为⼈⼯智能的⼀个关键时刻AI崛起深度学习理论和⼯程突破(1993年⾄今)1997年IBM的深蓝(Deep Blue)战胜了国际象棋冠军卡斯帕罗夫成为⾸个在标准⽐赛时限内击败国际象棋世界冠军的电脑系统。2000年⿇省理⼯学院的⾟西娅-布雷泽尔开发了Kismet⼀种能够识别并模拟⼈类情绪的机器⼈。2006年杰弗⾥·⾟顿等⼈发表重要论⽂《Reducing the dimensionality of data with neuralnetworks⽤神经⽹络降低数据维数》提出了深度置信⽹络Deep Belief Network为深度学习的发展奠定了基础。杰弗⾥·⾟顿也被称为深度学习教⽗。2006年英伟达推出CUDA(统⼀计算架构)GPU开始⽤于解决商业、⼯业以及科学⽅⾯的复杂计算GPU与深度学习结合模型的训练速度有了数量级的提升CPU(中央处理器)像是⼀个博学的⽼教授。他⾮常聪明什么复杂任务都能处理⽐如操作系统、办公软件但⼀次只能处理⼀两件事(核⼼数少)。让他去数⼀亿粒⽶他会数得很精确但速度⾮常慢。GPU(图形处理器)最初是为游戏和图形渲染设计的。它像是⼀万名⼩学⽣。每个⼩学⽣都不如⽼教授聪明只能执⾏⾮常简单的指令(⽐如算术题)。但让他们同时去数⼀亿粒⽶每⼈分⼀点瞬间就数完了AI计算尤其是深度学习的本质是什么就是海量的、⾼度重复的矩阵乘法和加法。⽐如识别⼀张猫的图⽚需要将数百万个像素值与神经⽹络中数百万个参数进⾏乘法和加法运算。这个过程不需要⼀个⽼教授去深度思考恰恰需要⼀万名⼩学⽣同时进⾏简单的计算。GPU的并⾏计算架构完美匹配了AI计算的需求。更重要的是英伟达还发明了CUDA(Computer Unified Device Architecture统⼀计算机架构)构建了⼀整个AI⽣态系统。CUDA是⼀个软件平台它允许程序员和研究⼈员⽤熟悉的编程语⾔(如C、Python)直接调⽤GPU的强⼤算⼒来进⾏通⽤计算。今天所有震撼世界的AI产品如ChatGPT、Sora等它们的训练和运⾏都完全依赖与数万甚⾄数⼗万颗GPU组成的超级计算机没有这个算⼒基础当前的⼤模型就不可能存在。英伟达是AI时代的“卖铲⼈”。当全世界都在疯狂淘⾦开发AI时英伟达提供了最好⽤、⼏乎是唯⼀的“铲⼦”GPUCUDA从⽽成为了整个浪潮中最⼤的赢家之⼀。2012年⾕歌Google Brain项⽬的研究⼈员吴恩达、杰夫·迪恩等⼈也捣⿎了⼀个神经⽹络10亿参数⽤来训练对猫的识别。他们⽤16000个CPU核⼼构建了⼀个巨⼤的神经⽹络在没有任何先验知识的情况下仅仅通过观看YouTube视频就⾃发地识别出了“猫”。这个实验让⼯业界第⼀次⼤规模地看到了深度学习的惊⼈潜⼒。2015年Google Brain团队正式发布TensorFlow机器学习框架提供了⼀整套⽤⼾构建和训练机器学习模型的⼯具、库和社区资源由于其通⽤性和强⼤功能被⼴泛应⽤于计算机视觉、⾃然语⾔处理、语⾳处理、推荐系统等。TensorFlow作为基础⼯具基⽯其应⽤领域⼏乎涵盖了AI的⽅⽅⾯⾯。2017年Google AI团队在论⽂《Attention Is All You Need》中⾸次提供了Transformer模型架构论⽂发布后其参考实现代码⻚随之公开并迅速被纳⼊TensorFlow、PyTorch等框架的官⽅库和教程中。Transformer 的诞⽣为后续⼏乎所有⼤型语⾔模型提供了最基础也最关键的架构蓝图。现在DeepSeek、ChatGPT、Gemini基本都是基于Transformer实现的。AlphaGo战胜⼈类顶尖围棋选⼿2022年11⽉30⽇ChatGPT发布彻底突破科技圈它提供了⼀个及其简单、⾃然、免费的聊天界⾯任何⼈⽆需技术背景都能直接与其互动。它能写诗、写代码、解数学题、编故事回答各种问题震惊了⽆数⼈。⽤⼾们开始在各种社交平台病毒式分享⾃⼰与ChatGPT对话的惊⼈截图短短5天内ChatGPT的⽤⼾就图⽚100万。此后各⼤科技公司Google、微软、Meta、亚⻢逊以及中国的百度、阿⾥、深度求索等全部加速⼊场发布了各⾃的竞品如Gemini、Claude、LLaMA、⽂⼼⼀⾔、通义千问、DeepSeek等将这场热潮持续推⾼形成了今天我们看到的“百模⼤战”格局。3. AI相关岗位适合绝⼤学⽣的AI开发岗位基本是AI应⽤开发。4. 程序员是否会被ai取代同学们平时在看新闻或刷视频时应该会看到⼀些博主在视频中演⽰说某款AI编程IDE写代码⾮常丝滑⾃⼰⼀⾏代码不写就完成了某个应⽤不懂任何代码通过向AI输⼊提⽰词完成某个应⽤AI替代程序员真的要来了公司20%的代码已由AI⽣成公司计划裁员...AI来了程序员天踏了AI当⽴、编程已死...看到这些帖⼦或视频之后不知道同学们是否感觉还没有毕业就感觉失业了渐渐就开始摆烂了【DeepSeek认为】【ChatGPT认为】【Gemini认为】中国科普⽹的⼀⽚⽂章http://www.kepu.gov.cn/newspaper/2024-03/15/content_183874.html以后得事情谁也不好说先顾好眼前少点焦虑打得过就⼤打不过就加⼊你可能就业的不是AI相关领域但是你不能不懂AI相关技术。