多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

PaddleHub 特性详解:预训练模型、一键预测、模型服务化与迁移学习实战指南

PaddleHub 特性详解:预训练模型、一键预测、模型服务化与迁移学习实战指南 人工智能预训练微调模型推理服务【免费下载链接】PaddleFormersPaddleFormers is an easy-to-use library of pre-trained large language model zoo based on PaddlePaddle.项目地址https://gitcode.com/gh_mirrors/pa/PaddleFormers点击查看免费下载PaddleHub 是面向 PaddlePaddle 生态的模型管理与应用开发工具本文基于 figures.md 系统梳理其四大核心能力丰富的预训练模型、一行命令模型预测、一行命令模型转服务以及十行代码完成迁移学习。读完本文你将掌握如何从海量预训练模型库中检索模型、通过hub run与hub serving快速落地预测与部署并使用 Fine-tune API 完成图像分类、文本分类等场景的迁移学习实战。一、丰富的预训练模型覆盖图像、文本、语音与视频PaddleHub 内置了覆盖 CV、NLP、语音和视频等多个领域的预训练模型库每个模型以Module的形式统一封装支持直接加载、预测与迁移学习。下表按领域列举了精选模型更多模型可进入对应模块目录查看完整清单。1.1 图像领域任务方向精品模型举例模型目录图像分类菜品识别resnet50_vd_dishes、动物识别resnet50_vd_animals更多模型目标检测通用检测yolov3_darknet53_coco2017、行人检测yolov3_darknet53_pedestrian、车辆检测yolov3_darknet53_vehicles更多模型人脸检测人脸检测pyramidbox_lite_server、口罩检测pyramidbox_lite_server_mask更多模型图像分割人像分割deeplabv3p_xception65_humanseg、人体解析ace2p、肺炎 CT 影像分析Pneumonia_CT_LKM_PP更多模型关键点检测人体关键点human_pose_estimation_resnet50_mpii、人脸关键点face_landmark_localization、手部关键点hand_pose_localization更多模型文本识别超轻量中英文 OCR 文字识别chinese_ocr_db_crnn_mobile更多模型图像生成风格迁移、街景动漫画更多模型图像编辑超分辨率、黑白上色更多模型从仓库源码结构可以进一步印证模型库的丰富程度仅图像分类目录 modules/image/classification 就包含 ResNet 系列、MobileNet 系列、EfficientNet 系列、PP-LCNet、RepVGG、GhostNet 等上百个模型语义分割目录 modules/image/semantic_segmentation 同样覆盖了 DeepLabv3p、PSPNet、U2Net、OCRNet 等主流结构。1.2 文本领域任务方向精品模型举例模型目录词句分析词法分析lac、句法分析更多模型情感分析情感判断、情绪分析emotion_detection_textcnn更多模型文本审核色情审核porn_detection_gru更多模型文本生成对联生成、情话生成、藏头诗生成、土味情话更多模型语义模型ERNIE、文本相似度simnet_bow更多模型语义模型方向覆盖了 ERNIE、BERT、ALBERT、ELECTRA、RoBERTa 等经典预训练语言模型其中 ERNIE 的实现位于 modules/text/language_model/erniesimnet_bow 位于 modules/text/language_model/simnet_bow。1.3 语音与视频领域领域任务方向精品模型举例模型目录语音语音合成语音合成deepvoice3_ljspeech更多模型视频视频分类视频分类更多模型除表格所列模型外语音目录 modules/audio 还包含语音识别DeepSpeech2、U2 Conformer、声纹识别ECAPA-TDNN、语音合成FastSpeech2、TransformerTTS、Diffsinger等模型。二、一键模型预测hub run命令实战PaddleHub 的一键模型预测特性允许开发者通过单条命令直接对模型进行推理无需编写任何 Python 代码。2.1 OCR 文字识别实战以超轻量中英文 OCR 模型chinese_ocr_db_crnn_mobile为例安装 PaddleHub 后依次执行$ pip install paddlehub $ wget https://paddlehub.bj.bcebos.com/model/image/ocr/test_ocr.jpg $ hub run chinese_ocr_db_crnn_mobile --input_path test_ocr.jpg --visualizationTrue预测结果图片保存在当前运行路径下的ocr_result文件夹中效果如下图所示2.2 词法分析LAC实战使用词法分析模型 LAC 进行分词直接传入待分析的文本即可$ hub run lac --input_text 现在慕尼黑再保险公司不仅是此类行动的倡议者更是将其大量气候数据整合进保险产品中并与公众共享大量天气信息参与到新能源领域的保障中。输出结果为分词与词性标注的 JSON 结构[{ word: [现在, , 慕尼黑再保险公司, 不仅, 是, 此类, 行动, 的, 倡议者, , 更是, 将, 其, 大量, 气候, 数据, 整合, 进, 保险, 产品, 中, , 并, 与, 公众, 共享, 大量, 天气, 信息, , 参与, 到, 新能源, 领域, 的, 保障, 中, 。], tag: [TIME, w, ORG, c, v, r, n, u, n, w, d, p, r, a, n, n, v, v, n, n, f, w, c, p, n, v, a, n, n, w, v, v, n, n, u, vn, f, w] }]其中word字段为分词结果tag字段为对应的词性标注如 TIME 表示时间词、ORG 表示机构名、n 表示名词、v 表示动词。2.3hub run的底层实现解析从源码看hub run命令由 paddlehub/commands/run.py 中的RunCommand实现。其执行流程为加载模块若第一个参数是本地目录则通过Module.load加载本地模块否则以Module(namemodule_name)从远程拉取加载前会通过CacheUpdater(hub_run, module_name)记录使用情况run.py参数解析针对 CV 类模型解析--input_path图片/视频路径针对 NLP 类模型解析--input_text待预测文本同时提供--use_gpu默认 False与--batch_size默认 1两个通用配置项run.py构造输入并预测将输入包装为{key: [input]}的数据格式最终调用module(sign_name..., data..., use_gpu..., batch_size...)完成预测run.py。除命令行方式外PaddleHub 同样支持在 Python 中以 API 方式调用模型具体用法可参考每个模型目录下的详细文档。三、一键模型转服务hub serving部署 HTTP 预测服务对于需要把本地预测能力迁移到线上、对外开放服务端口或在局域网中搭建预测服务的场景PaddleHub Serving 提供了一行命令完成模型服务化部署的能力。其架构为前端通过 Flask 与 Gunicorn 处理网络请求后端直接调用 PaddleHub 预测接口并支持多进程方式利用多核 CPU 提升并发能力详见 PaddleHub 一键服务化部署文档。启动 LAC 词法分析服务的命令如下$ hub serving start -m chinese_ocr_db_crnn_mobile3.1 命令行启动方式$ hub serving start --modules Module1Version1 Module2Version2 ... \ --port XXXX \ --use_gpu \ --use_multiprocess \ --workers \ --gpu核心参数说明参数用途--modules/-m预安装模型以ModuleVersion键值对形式列出不指定版本时默认选择最新版本--port/-p服务端口默认为 8866--use_gpu使用 GPU 进行预测必须安装 paddlepaddle-gpu--use_multiprocess是否启用并发方式默认为单进程推荐多核 CPU 机器使用Windows 只支持单进程--workers并发方式下指定的并发任务数默认为2*cpu_count-1cpu_count 为 CPU 核数--gpu指定使用的 GPU 卡号如1,2表示使用 1 号和 2 号显卡默认仅使用 0 号显卡注意--use_gpu不可与--use_multiprocess共用。从源码看paddlehub/commands/serving.py 中的start_serving方法对上述参数进行了分流指定--use_gpu时走 ZMQ 服务模式仅指定--use_multiprocess时走 Gunicorn 多进程模式Windows 下自动降级为单进程否则走 Flask 单进程模式--workers的默认值由number_of_workers()计算得出即cpu_count * 2 1serving.py。3.2 配置文件启动方式对于需要同时部署多个模型或精细控制每个模型参数的情况可以使用配置文件启动$ hub serving start --config config.jsonconfig.json示例{ modules_info: { yolov3_darknet53_coco2017: { init_args: { version: 1.0.0 }, predict_args: { batch_size: 1, use_gpu: false } }, lac: { init_args: { version: 1.1.0 }, predict_args: { batch_size: 1, use_gpu: false } } }, port: 8866, use_multiprocess: false, workers: 2, gpu: 0,1,2 }配置文件字段说明字段用途modules_info预安装模型字典key 为模型名其中init_args为模型加载参数等同于paddlehub.Module(**init_args)predict_args为预测参数以 lac 为例等同于lac.analysis_lexical(**predict_args)port服务端口默认为 8866use_gpu是否使用 GPU 预测需安装 paddlepaddle-gpuuse_multiprocess是否启用并发方式默认单进程workers并发任务数仅并发模式下生效gpu指定 GPU 卡号parse_args方法在读取配置文件后会同步覆盖命令行参数use_gpu、use_multiprocess、port均从配置文件读取且仅在使用 GPU 时才解析gpu字段serving.py。3.3 访问与关闭服务服务启动后通过 HTTP POST 请求访问预测接口接口 URL 格式为http://127.0.0.1:8866/predict/MODULE其中MODULE为模型名。关闭服务使用$ hub serving stop --port XXXX--port指定要关闭的服务端口默认为 8866。停止逻辑会从配置文件目录读取记录的 PID 并向对应进程组发送 SIGTERM 信号随后提示PaddleHub Serving will stopserving.py。完整的 lac 在线分词服务部署 Demo含客户端requests调用代码与口罩人脸检测服务示例可参见 demo/serving/module_serving 目录及 docs/docs_ch/tutorial/serving.md。四、十行代码迁移学习Fine-tune API 实战PaddleHub 的 Fine-tune API 将加载预训练模型 → 准备数据集 → 定义优化器 → 启动训练的完整链路封装为极简代码只需少量代码即可完成深度学习模型在特定场景下的迁移学习。4.1 图像分类迁移示例以花朵分类为例完整代码见 demo/image_classification/train.pyimport paddle import paddlehub as hub import paddlehub.vision.transforms as T from paddlehub.finetune.trainer import Trainer from paddlehub.datasets import Flowers transforms T.Compose( [T.Resize((256, 256)), T.CenterCrop(224), T.Normalize(mean[0.485, 0.456, 0.406], std[0.229, 0.224, 0.225])], to_rgbTrue) flowers Flowers(transforms) flowers_validate Flowers(transforms, modeval) model hub.Module( nameresnet50_vd_imagenet_ssld, label_list[roses, tulips, daisy, sunflowers, dandelion], load_checkpointNone) optimizer paddle.optimizer.Adam(learning_rate0.001, parametersmodel.parameters()) trainer Trainer(model, optimizer, checkpoint_dirimg_classification_ckpt, use_gpuTrue) trainer.train(flowers, epochs100, batch_size32, eval_datasetflowers_validate, save_interval10)4.2 文本分类迁移示例以基于 ERNIE 的中文情感分类为例完整代码见 demo/text_classification/train.pyimport paddle import paddlehub as hub from paddlehub.datasets import ChnSentiCorp model hub.Module(nameernie_tiny, version2.0.1, taskseq-cls) train_dataset ChnSentiCorp(tokenizermodel.get_tokenizer(), max_seq_len128, modetrain) dev_dataset ChnSentiCorp(tokenizermodel.get_tokenizer(), max_seq_len128, modedev) test_dataset ChnSentiCorp(tokenizermodel.get_tokenizer(), max_seq_len128, modetest) optimizer paddle.optimizer.AdamW(learning_rate5e-5, parametersmodel.parameters()) trainer hub.Trainer(model, optimizer, checkpoint_dir./checkpoint, use_gpuTrue) trainer.train( train_dataset, epochs3, batch_size32, eval_datasetdev_dataset, save_interval1, ) trainer.evaluate(test_dataset, batch_size32)4.3 源码级原理解析从源码看迁移学习的核心是 paddlehub/finetune/trainer.py 中的Trainer类它负责训练全流程的调度设备与并行构造时根据use_gpu调用paddle.set_device(gpu/cpu)当世界大小大于 1 时自动init_parallel_env并以paddle.DataParallel包装模型trainer.py断点续训启动时扫描checkpoint_dir下epoch_*命名格式的检查点自动恢复最近的训练轮次与最佳指标trainer.py指标对比支持通过compare_metrics回调自定义最佳模型保存策略默认比较validation_step返回的主指标、值越大越好可视化默认开启 VisualDL 日志记录训练曲线写入checkpoint_dir/visualization目录。五、更多实战资源demo 目录提供了丰富的 Fine-tune API 使用示例涵盖图像分类、图像着色、风格迁移、语义分割、文本分类、文本匹配、序列标注与音频分类等场景服务化部署的完整教程与参数细节参见 PaddleHub 一键服务化部署若需在线快速体验可使用 AI Studio 平台提供的 GPU 算力运行 PaddleHub 官方教程合集快速验证上述全部特性。赞分享人工智能预训练微调模型推理服务【免费下载链接】PaddleFormersPaddleFormers is an easy-to-use library of pre-trained large language model zoo based on PaddlePaddle.项目地址https://gitcode.com/gh_mirrors/pa/PaddleFormers点击查看免费下载相关推荐PaddleHub 功能全览预训练模型库、一键预测、模型服务化与十行代码迁移学习PaddleFormers 仓库详解PaddleHub 功能全览预训练模型库、一键预测、模型服务化与十行代码迁移学习PaddleFormers 仓库详解 PaddleHub 是 Paddle人工智能预训练微调模型推理服务fastbook迁移学习预训练模型应用实战指南fastbook迁移学习预训练模型应用实战指南 迁移学习是深度学习领域最实用的技术之一能让你用少量数据和计算资源获得出色的模型性能。fastbook作为fa教程深度学习机器学习BiliBiliToolPro 部署教程5 分钟把 B 站每日任务跑起来BiliBiliToolPro 部署教程5 分钟把 B 站每日任务跑起来 BiliBiliToolPro 是一款 B 站自动任务工具能替你的账号自动完成看视后端任务调度工作流自动化创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表