多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

19. Unsloth中Qwen-Image-2.1生成图片 ❀ 老梅子学AI

19. Unsloth中Qwen-Image-2.1生成图片 ❀ 老梅子学AI 【简介】现在的 Unsloth Desktop 已经不只是跑 LLM它已经集成了比较完整的本地生图/图像编辑功能。官方目前明确支持 Qwen-Image-2.1、FLUX、Z-Image 等图像模型也支持 LoRA我们来了解一下生图功能。Qwen-Image-2.1如果你的主要需求是中文提示词、图片里生成中文/英文文字、修改已有图片我会优先试 Qwen-Image-2.1。① Qwen-Image-2.1qwen.ai/blog?idqwen-image-2.1是 Qwen 团队推出并开源的一款新一代统一图像生成与图像编辑模型。它不是单纯的“文生图模型”而是把文生图、参考图编辑、局部修改、透明背景 RGBA、主体提取、多图参考 等能力放在同一个模型体系里。官方将其定位为兼顾生成质量、推理效率和多功能性的图像模型。② 打开unsloth选择菜单【图像】-【Create】点击【Select image model】选择图像模型弹出菜单中选择【Recommended】可以看到推荐的大模型中有Qwen-Image-2.1和Qwen-Image-2.1-GGUF。③ 这是两个模型的差异。根据设备的性能选择不同的模型。④ 选择【On Device】可以看到两个模型都已经下载到硬盘模型大小差距很大。完整 Qwen-Image-2.1 还包括 Qwen3-VL 8B 文本编码器约 17.5 GB 和 VAE 约 1.35 GB所以完整权重规模大约在 33 GB 以上。由于咱的设备是128GB内存因此这里就直选择了Qwen-Image-2.1。⑤ 生成图片的方式非常简单只要输入提示词点击【Generate】就可以得到一张AI创建的图片但是由于提示词内容太少往往距离你的想法千里之外。⑥ 最好的办法就是让AI生成提示词比如这里我让AI生成烟雨江南图AI给我一组提示词。⑦ 将提示词复制到提示框里点击【Generate】稍等片刻就生成了图像你就说满不满意吧。⑧ 再试一试前面文章中用Qwen-3.8生成的提示词。⑨ 这效果非常Nice提示词越丰富生成的图片离你的想法就越接近。⑩ 在网上复制了一段英文提示词也成功识别并生成图片。真的有“得提示词则得天下”的感觉了。参数介绍Unsloth生图界面还有一些参数可调整以获得最佳效果。①Negative prompt负面提示词这里写的是不希望在图片上出现的内容。它不是告诉模型“画什么”而是告诉模型“尽量不要画什么”。Negative prompt 和 Guidance 是绑定在一起的只有同时满足 Guidance 1 并且 Negative Prompt 不为空才启用真正的 classifier-free guidance。上图中 Guidance 1Negative prompt 有内容基本等于 Negative Prompt 被忽略。当你设Guidance 1.5 并填写 Negative Prompt 后模型每一步需要同时计算正向和负向条件这会使每一步的计算工作量大约增加一倍。②LoRA可以理解成给 Qwen-Image 2.1 基础模型安装一个“小型技能包”。例如有人训练了真实摄影 LoRA加载之后Qwen-Image 2.1 更倾向生成摄影照片。或者有人训练了水墨画 LoRA加载之后模型就会明显往水墨风格走。还可以是特定人物、特定角色、服装、产品摄影、光影、动漫风格、某种动作等。输入框里的 owner/name or owner/name:file.safete 实际上就是让你填写类似 Hugging Face 上的 作者名/LoRA仓库名如果一个仓库里有多个 LoRA 文件还可以进一步指定具体.safetensors 文件。Weight 是 LoRA 的“音量旋钮”。数字大小表示0 → 基本没有 LoRA 效果0.3 → 很轻微0.50.7 → 中等0.81.0 → LoRA 特征明显1 → 更强但更容易影响原模型的画质和结构具体还要看 LoRA 作者训练时推荐多少因为不同 LoRA 差别很大。③Aspect ratio 画面比例Square1:1适合头像、宠物、商品、社交媒体Photo3:2适合相机摄影风格Landscope4:3适合普通摄影 3:4适合人像、宠物全身Widescreen16:9适合电影感、桌面壁纸 9:16手机壁纸、短视频Ultrawide21:9适合电影感、多人或多主体场景、横向叙事边上绿色按钮可以快速切换横图、竖图而不用自己重新选尺寸。④Resolotion 像素真正输出的尺寸。像素越大生成计算量和内存需求就会明显增加。像素并不是越大越好有时会产生多余肢体、重复人物、结构异常、构图散乱。模型通常存在比较合适的训练分辨率。⑤2K presets2K预设是Qwen-Image 2.1很值得用的功能官方模型卡给出了不同长宽比的2K尺寸不用自己算尺寸直接选一个适合 Qwen-Image 2.1 的高分辨率组合。实际工作流推荐调用提示词/找构图时用1024最终正式生成用2K。⑥Steps可以理解成从随机噪声逐渐形成图片所经历的去噪过程次数。可以粗略理解10 → 很快但容易没有充分完成细节20 → 可以用来测试30 → 较好40 → 官方质量档50 → 花更多时间但不代表画质继续同比提高官方 Qwen-Image 2.1 的示例无论文生图还是图片编辑代码都使用 40 Steps。⑦Guidance可以理解为模型有多强烈地按照你的 prompt 来画。传统模型Guidance 1 → 比较自由Guidance 5 → 更遵循 promptGuidance 7 → 非常强调 promptGuidance 15 → 可能过头颜色和结构出现问题⑧Batch size一次同时生成多少张。可以同一轮同时生成多张图片但是很吃内存。⑨Runs连续生成几轮。这里非常容易和Batch size搞混。假设 Batch size1Runs4意思是1-4轮各出1张图片最后得到4张图片。如果 Batch size4Runs3意思是1-3轮各出4张图片最后得到12张图片。两者最大的区别是Batch Size是同时算所以比较吃内存Runs是一轮一轮算所以峰值内存压力通常较低但总时间更长。⑩Seed随机种子把它理解成 AI 开始生成图片时所使用的“初始随机噪声编号”。默认 Random if empty 意思就是 留空 → 每次随机生成一个 Seed。只要保持模型、prompt、分辨率、Setps、Guidance、LorA、Seed一样通常可以重新生成非常接近甚至相同的图。所以Seed最大作用不是提高画质而是复现和微调好图。⑪ 例如这个Seed为4197356382的图很喜欢你可以锁定这个Seed然后只修改 prompt这样比较容易保留大致构图同时调整细节。需要注意换模型版本、后端、采样实现或革些硬件环境后即使Seed相同也不一定保证逐像素完全相同。⑫ 这一块是 Unsloth 图像模型的 Advanced高级加载设置。和上面的 Steps、Guidance、Seed 不一样这里的多数选项控制的是模型怎样被加载、以什么精度运行、怎样使用内存以及是否启用加速技术因此很多设置改完以后不会立刻生效而要重新加载模型。Z-Image-TurboZ-Image-Turbo 是通义团队Tongyi-MAI推出的 Z-Image 系列高速文生图模型。① Z-Image-Turbotongyi-mai.com的核心定位很明确用很少的采样步数快速生成质量较高的图片。它不是像 Qwen-Image-2.1 那样强调“统一生成 编辑 多参考图 2K”而是更偏向高效率、高速度、写实图像、中文/英文提示词和图片中文字生成。② 这里我们下载的Z-Image-Turbo也是33GB大小。③ 看看在同样的提示词的条件下生成的图片会有什么差距。在unsloth右下选择前面生成好的烟雨江南图点击【Recipe】可以看到生成图片的提示词复制提示词。④ 粘贴提示词点击【Generate】很快就生成了图片因为Z-Image-Turbo只有9步。⑤ 另一副同样提示词生成的水墨画感觉也不不错。你们觉得哪个模型更好呢
返回列表