多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

从 NLP 到多模态:AI 如何理解与生成人类信息

从 NLP 到多模态:AI 如何理解与生成人类信息 目录1. NLP 是什么2. NLU 与 NLG理解与生成的双引擎3. NLU 常见任务3.1 文本分类3.2 情感分析3.3 命名实体识别NER3.4 语义相似度4. NLG 常见任务4.1 机器翻译4.2 对话生成4.3 文章摘要5. 关键趋势从任务专用到 LLM 统一6. 语音处理让机器听懂与说话6.1 语音识别ASR6.2 语音合成TTS7. 多模态AI 的下一站7.1 文生图 / 视频 / 音频7.2 视觉问答VQA8. 总结本文基于一份自然语言处理学习笔记整理系统梳理 NLP、语音处理与多模态的核心概念、常见任务、典型应用和工程趋势。1. NLP 是什么自然语言处理Natural Language Processing, NLP是人工智能领域中以自然语言文本离散符号为核心处理对象研究如何建立人类语言形式与机器可计算语义之间可逆映射关系的学科。它的目标不是简单地“处理字符串”而是让计算机具备对语言符号进行形态分析、语义理解、逻辑推理及连贯生成的能力从而消除人类自然语言的模糊性、歧义性与机器严格指令系统之间的鸿沟。换句话说NLP 要解决的是人类说得含糊机器却需要精确。2. NLU 与 NLG理解与生成的双引擎NLP 通常可以分为两个核心方向方向全称目标重点例子NLU自然语言理解让机器理解人类想表达的意思语义与意图判断“我想吃苹果”是指水果还是指手机NLG自然语言生成根据数据或意图生成人类可读文本流畅度与准确性写新闻稿、写邮件回复、生成诗歌NLU 负责“听懂”NLG 负责“说人话”。两者共同构成 NLP 的基础能力。3. NLU 常见任务3.1 文本分类文本分类是将一段不定长文本自动打上一个或多个预设类别标签。它是 NLP 最基础、最成熟的任务之一。技术本质通常是多分类或多标签问题。典型例子主题分类输入“中国乒乓球拿下奥运会大满贯” → 输出[体育]意图分类输入“我想改一下收货地址” → 输出[修改订单]新闻打标输入“央行宣布降低存款准备金率” → 输出[财经]、[政策]3.2 情感分析情感分析是文本分类的特殊子集专门判断文本背后的主观情绪、观点或态度通常输出极性或强度。例子细粒度情感输入“酒店位置绝佳但房间隔音差到离谱” → 输出位置[正向]隔音[负向]电商评价输入“这手机电池太不耐用了” → 输出负向Negative社交媒体舆情输入“XXX明星官宣结婚祝福” → 输出正向Positive且情绪[喜悦]3.3 命名实体识别NERNER 从非结构化文本中识别出具有特定意义的实体指代并将其归入预定义类别如人名、地名、组织名、日期、专有名词等。它是信息抽取的基石。例子输入马云在杭州创办了阿里巴巴时间是1999年。识别结果马云人名杭州地名阿里巴巴组织机构1999年时间3.4 语义相似度语义相似度计算两段文本在含义层面的相近程度而不是字面重复程度。它是搜索、问答和智能推荐的核心算法。例子句子 A“如何给手机快速充电”句子 B“手机快充有哪些技巧” → 相似度0.95语义一致句子 C“今天手机电量消耗很快。” → 相似度0.15话题不同难点在于如果只看字面“快充”和“充电”有重叠但模型需要发现“技巧”和“消耗”语义完全不同。可以借助 HanLP 分词与 NLP 演示工具进行体验https://hanlp.hankcs.com/demos/tok.html4. NLG 常见任务4.1 机器翻译机器翻译将一种语言的文本自动翻译成另一种语言。例子输入中文“今天天气很好”输出英文“The weather is very nice today.”4.2 对话生成对话系统指构建能与人类进行多轮交互的聊天机器人。例子用户“帮我查一下明天的天气。”系统“您所在的城市是哪里”用户“上海。”系统“明天上海晴转多云22℃〜28℃。”现在也可以借助豆包等工具创建漫画、PPT、小红书爆款文案等内容豆包 - 字节跳动旗下 AI 智能助手4.3 文章摘要文章摘要将长文本压缩成包含关键信息的短文本主要分为抽取式直接从原文中摘取重要句子。生成式重新组织语言生成新句子。例子输入一篇数千字新闻输出摘要为5月6日XX公司发布新款手机配备最新AI芯片起售价5999元。如今大模型已经具备较强的文章摘要能力。例如使用 DeepSeek 时可以输入提示词text总结下这个博客的核心内容输出 https://claude.com/blog/common-workflow-patterns-for-ai-agents-and-when-to-use-them总结结果通常能和原文核心内容保持较高一致性。DeepSeek 地址DeepSeek5. 关键趋势从任务专用到 LLM 统一过去上述每个任务都需要单独训练一个小模型文本分类一个模型、NER 一个模型、情感分析一个模型、摘要一个模型。但现在大语言模型LLMs如 GPT 系列、文心一言等已经通过“预训练 微调 / 提示词”的方式几乎能用同一个模型完成以上所有任务。这意味着 NLP 工程范式正在发生变化从“一个任务一个模型”走向“一个基座模型 多种提示/微调”从“标注数据驱动”走向“预训练知识 少样本/零样本”从“单点能力”走向“通用语言能力”6. 语音处理让机器听懂与说话语音处理是一门涉及信号处理、计算机科学、语言学和人工智能的交叉学科核心目标是让机器能够分析、理解、合成和处理人类语音信号。6.1 语音识别ASRASRAutomatic Speech Recognition即语音转文字将人类语音中的词汇内容转换为计算机可读的文本或指令。目前系统通常基于 Whisper、Paraformer 等先进架构。常见应用智能音箱小爱同学、Alexa会议纪要自动生成语音输入法无障碍辅助为听障人士提供字幕车载语音控制微信语音转文字就是典型的语音识别应用。6.2 语音合成TTSTTSText-to-Speech即文字转语音让计算机将文本转换为自然、流畅且富有表现力的语音。目前 TTS 模型如 VITS、NaturalSpeech、ChatTTS 等能够生成高度拟人、带有情感和韵律的语音甚至支持少样本克隆——仅需几秒样本即可模仿特定人声。讯飞推出的在线语音服务支持点击播放把文字转换为声音并且支持方言在线语音合成_文字转语音-讯飞开放平台7. 多模态AI 的下一站“多模态”是人工智能领域的核心概念指同时处理、理解或生成两种及以上不同类型数据的技术。人类认知天然就是多模态的我们通过视觉、听觉、触觉等多种感官理解世界。常见模态包括视觉图像、视频、图表、手势听觉语音、音乐、环境声音文本自然语言、符号、代码传感器数据触觉、深度图、惯性测量单元数据、体温等多模态 AI 主要解决三类问题理解与推理从多种数据中提取含义。例如给出图片和问题“图中穿红衣服的人在做什么”模型需要结合视觉和文本回答。生成与创作根据一种模态生成另一种模态。例如文本生成图像、文本生成视频、图像生成文本、文本生成音乐。对齐与检索找到不同模态之间的对应关系。例如用文字描述“一只在沙滩上的金毛犬”从海量图片库中找出匹配图片。7.1 文生图 / 视频 / 音频图像生成的目标是让计算机从随机噪声、文本描述、条件图像或其他模态输入中自动创建出逼真、多样且符合要求的图像。可以使用豆包输入提示词创建图片豆包 - 字节跳动旗下 AI 智能助手相关技术还包括 Stable Diffusion、Midjourney、Sora 等。7.2 视觉问答VQAVQA 不仅仅是识别图像中的物体而是要对整个场景进行语义层面的解析。它综合了感知、推理和知识试图回答关于图像的高阶问题。图像理解追求的是让计算机像人一样看懂图像中到底发生了什么并能够用自然语言描述、推理或回答关于图像的问题。8. 总结从 NLP 到语音再到多模态AI 正在逐步获得理解与生成人类信息的能力NLP 是核心研究语言形式与机器语义之间的映射。NLU 与 NLG 是双引擎分别负责理解与生成。文本分类、情感分析、NER、语义相似度、机器翻译、对话生成、文章摘要等是经典任务。大语言模型正在统一这些任务改变传统“一任务一模型”的范式。语音处理让机器获得听觉能力ASR 与 TTS 是两大核心。多模态让 AI 同时处理文本、图像、语音、视频和传感器数据走向更接近人类的全感官智能。
返回列表