多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

你以为AI在画画?醒醒,它只是在玩“马赛克消消乐“

你以为AI在画画?醒醒,它只是在玩“马赛克消消乐“ 刷短视频的时候总能看到那种AI生成的美女。光影细腻发丝根根分明眼神里甚至带着情绪。评论区永远有人惊叹这跟照片有什么区别AI已经这么恐怖了吗每次看到这种评论我都想隔空喊一句兄弟你被骗了。AI不仅不懂艺术它甚至是个盲人。它压根不知道美女俩字是什么意思不知道眼睛长在鼻子上面还是下面更不知道什么叫好看。那它是怎么画出来的答案会让你大跌眼镜它只是在玩一场极其无聊的像素消消乐。01. 先复习一下文字AI是接龙大神要理解AI怎么画画得先从文字AI怎么说话说起。你还记得上一期我们聊过的吗ChatGPT这类东西本质上就是个超级输入法。你打床前明月它接光。你问怎么减肥它接少吃多动。它说的每一个字都是蒙的只不过蒙得准。那好现在问题来了——如果给AI的任务不是接下一个字而是接下一张图呢这就变成了AI画画。你给它一句一只戴着墨镜的柴犬它要干的事跟你手机输入法干的事底层逻辑一模一样根据上文补全下文。只不过它的下文不是文字是几百万个像素点的颜色数值。02. 先有雪花后有画这里有个反直觉的地方。你以为AI画画是从空白画布开始一笔一笔勾勒就像人类画家那样先打草稿再上色再细化完全不是。AI画画是从一团完全的雪花噪点开始的——就是老式电视机没信号时那种滋啦滋啦的雪花屏。对你没听错。AI拿到你的提示词之后做的第一件事是生成一张纯随机的马赛克雪花图。然后它开始玩反向消消乐。它拿着你的文字提示词当攻略一步一步地把雪花里的噪点消掉。每一轮消一点每一轮消一点……经过几十轮那团混沌的雪花竟然慢慢长出了耳朵、鼻子、墨镜最终变成一只活灵活现的柴犬。这个过程叫去噪学名扩散模型。你可以想象你在玩一个极端无聊的手机游戏屏幕上全是乱码你每次划一下乱码就清晰一点点。划几百下之后乱码变成了一张照片。AI干的就是这事儿只不过它划得比你快几万倍。03. 墨镜在AI脑子里长啥样那问题来了AI怎么知道墨镜对应的是黑色块柴犬对应的是毛茸茸的棕色块这就要回到我们反复念叨的那个概念高维空间嵌入Embedding。在AI的字典里墨镜这个词不是一个词而是一个坐标——一个几千维空间里的点。这个点周围有什么有黑色的坐标有圆形的坐标有戴在脸上的坐标。这些坐标都是从几十亿张图文配对里挤出来的。更夸张的是图片本身也是坐标。AI把戴着墨镜的柴犬这张图的每一个像素也映射到这个空间里。在训练的时候它被喂了几十亿张文字图片的对子——狗配一张狗图夕阳配一张夕阳图赛博朋克配一堆赛博朋克图。经过这种训练AI的坐标系里形成了一个恐怖的能力你给它一个文字坐标它能在图片坐标区里找到最匹配的那片区域。这就好比你有一个超级巨大的图书馆每本书都有编号。你告诉管理员我要一本关于狗和墨镜的书管理员不用理解书的内容只需要查编号索引就能把那本书薅出来。AI画画就是在它的编号系统里做检索和重组。它不懂狗但它知道狗的编号附近都是毛茸茸的东西。04. 追光灯怎么打再来一个灵魂拷问如果你输入的提示词是一个穿红裙子的女孩在雨中奔跑里面有红裙子女孩雨奔跑四个关键要素AI怎么分配注意力哪个更重要这就轮到注意力机制Attention出场了。你可以把它想象成一个追光灯操作员。AI在处理这句提示词的时候追光灯在不同词之间来回扫射扫到红裙子 → 给图片中央区域施压给我变红扫到雨 → 给全图施压给我变灰蓝加模糊线条扫到奔跑 → 给腿部位置施压给我加动态模糊这个过程是同时发生的而且是几十层同时进行。每一层都在执行不同的灯光指令。第一层可能只管颜色第二层只管形状第三层只管纹理……最终所有的灯光压力叠加在一起硬生生把一团雪花压成了一幅画。05. 那些藏在背后的旋钮你可能已经猜到了——跟文字AI一样绘画AI背后也有几十亿个旋钮参数。文字AI的旋钮拧出来的是下一个字的概率绘画AI的旋钮拧出来的是下一个像素的颜色值。如果你问我这两者谁更难我会说绘画AI更惨。文字AI猜一个字只需要算一个概率。绘画AI猜一张图比如1024×1024分辨率需要同时猜超过一百万个像素的颜色。每个像素有RGB三个通道也就是要猜三百万个数值。这就好比让你蒙着眼睛去拧一台拥有十亿个旋钮的收音机。你的任务不是让它出声而是让杂音恰好组成《蒙娜丽莎》。这就是AI的训练过程一遍又一遍地加噪→去噪拧动那些旋钮直到雪花变成名画。训练数据是啥是几十亿张从网上扒来的图——名画、自拍、电影截图、表情包……不管好坏通通喂进去。AI不需要理解这幅画好不好看它只需要记住在这张图里这个像素旁边大概率是那个颜色。它不懂构图不懂配色不懂光影它只是把几十亿张图的像素邻居关系硬背了下来。06. 所以这是不是人类的想象力说到这儿你可能有点沮丧——原来AI画画这么笨纯粹是数学游戏。但你有没有想过一个问题人类的想象力本质上是不是也是这套东西你听到独角兽这个词脑子里瞬间浮现出那个画面——马的身体角的螺旋彩虹色的鬃毛。你见过马见过角见过彩虹。你从来没亲眼见过独角兽但你的大脑自动组合了这些见过的元素生成了一张你从未见过的假图。这个过程跟AI把马的坐标和角的坐标叠加有什么区别区别可能只有一个你有肉身你有被火烧过的痛觉你有摔跤后的眩晕感你有活了二三十年积累的具身经验。AI没有。它的想象力建立在纯文本和纯像素之上没有汗水的咸味没有心跳的加速。但抛开这些感官体验在把旧元素组合成新画面这件事上你跟AI干的活儿底层逻辑一模一样。所以别再用AI没有想象力来安慰自己了。它可能真的没有想象这种主观体验但它产出的结果已经让大多数人类画师感到后背发凉。当一台没有眼睛的机器能把你脑子里模模糊糊的梦渲染成一张高清大图甩在你面前时——你该追问的不是AI怎么做到的而是我这个每天在脑海里放电影的我该不会也是个高级点的扩散模型吧
返回列表