先说明一下:DALL-E 2在本文写作时(2022年2月)尚未正式发布。OpenAI在2022年1月公布了DALL-E 2的相关研究成果,展示了惊人的画图能力,预计2022年春季会开放试用。本文基于DALL-E初代版本的实际使用经验,以及OpenAI公布的DALL-E 2研究成果,分享AI画图的实际体验和能力边界。

这两年,AI画图技术发展很快。从最早的GAN,到后来的CLIP+Diffusion,再到OpenAI的DALL-E,AI生成的图片质量越来越高,已经到了以假乱真的地步。

我试用AI画图工具有一段时间了,从最开始的"画出来什么鬼",到现在的"哇这也能画",感受变化很大。今天分享AI画图的实际体验,包括能画什么、画得怎么样、有什么局限,以及对设计师和内容创作者的影响。

一、DALL-E是什么

在说体验之前,先简单介绍一下DALL-E。

DALL-E是OpenAI在2021年1月发布的AI画图模型,名字来自艺术家达利(Dalí)和机器人瓦力(WALL-E)的组合。它能根据文字描述,生成对应的图片。

比如你输入"一只穿着宇航服的猫在月球上骑自行车",DALL-E就能生成一张对应的图片。

DALL-E基于GPT-3的架构,有120亿参数,训练数据是大量的图片和文字对。它不仅能生成图片,还能理解复杂的文字描述,包括物体、属性、关系、场景等。

2022年1月,OpenAI公布了DALL-E 2的研究成果。DALL-E 2比初代强很多,生成的图片更清晰、更真实,细节更丰富,而且支持图片编辑(在现有图片上修改)。

虽然DALL-E 2还没正式开放,但从公布的样例来看,AI画图已经到了一个新的水平。

二、AI画图能画什么

我用AI画图工具生成了很多图片,总结一下它能画什么。

1. 概念插画

这是AI画图最擅长的。给一个概念描述,AI能生成很有创意的插画。

比如:

  • "未来城市的鸟瞰图,飞行汽车,赛博朋克风格"
  • "一个人坐在山顶看日出,水彩画风格"
  • "图书馆里的猫,戴着眼镜看书,温馨的氛围"

这些概念插画,AI生成得又快又好,而且每次生成的都不一样,可以选最好的。

2. 物品和场景

AI能画各种物品和场景,比如:

  • "一张木质书桌上放着笔记本电脑、咖啡杯和绿植,自然光"
  • "中世纪的城堡,阴天,电影感"
  • "一盘寿司,日式摆盘,美食摄影"

这些图片的质量很高,细节丰富,光影自然,很多都可以直接用在文章配图里。

3. 风格迁移

AI能模仿各种艺术风格,比如:

  • 梵高风格的星空
  • 宫崎骏风格的风景画
  • 毕加索风格的人物肖像
  • 中国水墨画风格的山水

虽然不能完全模仿大师的神韵,但风格的还原度已经很高了。

4. 人物和肖像

AI能画人物,但这是它的弱项。它能画出人物的大致样子,但细节经常出错,比如手指数量不对、五官不对称、表情怪异。

DALL-E 2在人物方面有进步,但还是不如画物品和场景那么自然。

5. 文字和logo

AI画图目前还不擅长画文字和logo。它生成的文字经常是乱码,logo也不够精确。如果需要带文字的图片,还是要自己后期加。

三、AI画图的实际体验

说说我用AI画图的实际体验。

1. 速度快,效率高

这是最直观的感受。以前找一张合适的配图,可能要在图片网站搜半小时,还不一定满意。现在用AI画图,输入描述,几十秒就能生成好几张,选一张合适的就行。

写文章的时候,配图不再是问题。想到什么场景,直接让AI画,效率提升很多。

2. 创意多,灵感丰富

AI每次生成的图片都不一样,而且经常会有一些意想不到的创意。有时候你描述一个场景,AI生成的图片比你想象的还好,给你新的灵感。

我经常用AI画图来 brainstorm,先让AI生成几张,看看有什么好的想法,再自己调整。

3. 质量参差不齐,需要筛选

AI生成的图片质量不稳定。有时候生成的图片很好,有时候就很奇怪。需要多生成几次,选最好的。

一般来说,描述越具体、越清晰,生成的图片质量越高。如果描述太模糊,AI就会自由发挥,结果可能和你想的不一样。

4. 需要后期处理

AI生成的图片,大部分都需要后期处理。比如裁剪、调色、加文字、修掉奇怪的细节。

完全不用后期、直接能用的图片,大概占20%左右。大部分图片,还是需要用PS或其他工具调整一下。

四、AI画图的局限

虽然AI画图很强,但它还有很多局限。

1. 逻辑和细节错误

AI画图不理解物理规律和逻辑关系,经常会出现细节错误。比如:

  • 人物的手指数量不对(经常是6根或4根)
  • 物体的透视关系不对
  • 文字是乱码
  • 复杂的场景里,物体之间的关系混乱

这些错误,人一眼就能看出来,但AI自己发现不了。

2. 不擅长精确控制

AI画图是"概率性"的,你不能精确控制每一个细节。比如你想让人物的手放在某个位置,或者让某个物体在画面的某个位置,AI不一定能做到。

你可以通过描述来引导,但最终结果还是有随机性。需要精确控制的场景(比如产品设计图、工程图),AI画图还做不到。

3. 版权和伦理问题

AI画图的训练数据来自互联网上的大量图片,这里面有版权问题。AI生成的图片,版权归谁?是否侵权?这些问题目前还没有明确的答案。

还有伦理问题,比如AI生成虚假的名人照片、生成不当内容等。OpenAI对DALL-E有内容限制,但其他工具可能没有。

4. 缺乏真正的创意

AI画图本质上是对训练数据的组合和模仿,它没有真正的创意和审美。它能生成看起来很美的图片,但很难有真正的原创性和思想性。

好的设计和艺术,需要人的创意和情感,这是AI目前替代不了的。

五、DALL-E 2的进步

虽然DALL-E 2还没正式开放,但从公布的研究成果来看,它比初代有很大进步。

1. 图片质量更高

DALL-E 2生成的图片分辨率更高(1024x1024),细节更丰富,更真实。很多图片已经很难分辨是AI生成的还是人画的。

2. 文字理解更好

DALL-E 2能理解更复杂的文字描述,包括多个物体、复杂关系、抽象概念。生成的图片更符合描述。

3. 支持图片编辑

DALL-E 2支持在现有图片上进行编辑。比如你可以上传一张图片,然后用文字描述修改它("把背景换成海滩"、"给人物戴上帽子")。这个功能很强大,相当于AI版的PS。

4. 生成多样性更好

DALL-E 2生成的图片多样性更好,同一段描述能生成差异很大的图片,给用户更多选择。

如果DALL-E 2正式开放,AI画图的体验会有质的提升。

六、对设计师和内容创作者的影响

AI画图越来越强,很多人担心设计师会失业。我的看法是:AI不会取代设计师,但会用AI的设计师会取代不会用AI的设计师。

1. 对设计师的影响

AI画图能帮设计师做很多重复性的工作,比如找参考图、画草图、做概念图。设计师可以把更多时间放在创意和设计思考上,而不是机械地画图。

但AI也会淘汰一些只会机械画图、没有创意的设计师。未来的设计师,需要更懂创意、更懂用户、更懂品牌,而不是只会用PS画图。

2. 对内容创作者的影响

对写博客、做自媒体的人来说,AI画图是福音。以前找配图很麻烦,现在可以自己生成,而且不用担心版权问题。

我现在写文章,配图基本都是AI生成的,又快又好,还不用花钱买图库。

3. 对普通人的影响

AI画图降低了创作的门槛。以前不会画画的人,现在也能通过文字描述生成图片。每个人都可以用AI来表达自己的创意。

这会带来更多的创意和内容,也会让视觉创作变得更普及。

七、怎么用好AI画图

根据我的经验,用好AI画图有几个技巧。

1. 描述要具体

描述越具体,生成的图片越符合你的预期。包括:

  • 主体是什么(一只猫、一个人、一座城市)
  • 在做什么(骑自行车、看书、看日出)
  • 在哪里(月球上、图书馆里、山顶)
  • 风格(水彩、油画、赛博朋克、电影感)
  • 光线和氛围(自然光、黄昏、温馨、神秘)

比如"一只猫"太简单,"一只橘猫坐在窗台上看外面的雨,水彩画风格,温暖的午后阳光"就具体多了。

2. 多生成几次

AI生成有随机性,一次不满意就多生成几次。一般生成5-10次,总能选到一张满意的。

3. 组合使用

可以先用AI生成草图,然后自己在PS里修改、合成、加文字。AI做基础,人做精修,这样效率最高,效果也最好。

4. 了解AI的能力边界

知道AI擅长什么、不擅长什么。擅长的让AI做,不擅长的自己做。不要指望AI能做所有事。

八、写在最后

AI画图是这两年最让人兴奋的技术之一。它让每个人都能轻松地生成图片,降低了视觉创作的门槛。

但它也不是万能的。它能生成好看的图片,但不能替代人的创意和思考。它是工具,不是创作者。真正有价值的内容,还是需要人来创造。

DALL-E 2即将开放,AI画图会进入一个新的阶段。未来,AI生成的图片会越来越真实、越来越精细,和人类创作的界限会越来越模糊。

但不管技术怎么发展,人的创意和审美,永远是最珍贵的。AI是放大器,它能放大你的创意,也能放大你的平庸。关键在于使用它的人。

2022年了,AIGC(AI生成内容)正在兴起。文字、图片、视频、音乐,AI都能生成。作为内容创作者,我们应该拥抱这些新技术,用它们来提升效率、拓展创意,而不是害怕被取代。

最后,用一句话总结:"AI不会取代创作者,但会用AI的创作者会取代不会用AI的创作者。"

希望这篇文章能让你对AI画图有更全面的了解。如果你也用过AI画图,欢迎在评论区分享你的体验和技巧。

祝大家都能用好AI工具,创作出更好的内容。