这两年大模型很火,多模态大模型更是火上加火。作为一个技术人,我当然也忍不住跟风,一头扎进了多模态大模型的世界。
从最开始的兴奋,到中间的踩坑,再到最后的理性认识,这一路走来,经历了很多。这篇文章我想记录一下这段经历,聊聊大模型多模态到底是怎么回事,有哪些坑,以及我为什么说"从入门到放弃"。
当然,这里的"放弃"不是真的完全不做了,而是从盲目跟风,变成了理性看待。
入门:被多模态的能力震撼
最开始接触多模态大模型,是被它的能力震撼到了。
那时候GPT-4V刚出来,我试了一下,把一张图片传进去,它就能理解图片的内容,回答关于图片的问题。我当时就震惊了,这也太厉害了吧。
然后我又试了更多的功能:图文问答、图片描述、OCR、图表理解、视频理解。每一个功能都让我觉得,这就是未来啊。
那时候我特别兴奋,觉得多模态大模型无所不能。我开始疯狂学习,看论文、看教程、跑demo,恨不得把所有多模态的知识都装进脑子里。
我还做了很多设想:用多模态做智能客服,用户发图片就能识别问题;用多模态做内容审核,自动识别图片和视频里的违规内容;用多模态做智能导购,用户拍张照就能推荐商品。
那时候的我,觉得多模态大模型能解决一切问题。现在想来,那时候真的是太天真了。
第一次踩坑:效果没有想象中好
第一次踩坑,是在实际项目中用多模态大模型的时候。
我们做了一个图片内容审核的项目,用多模态大模型来识别图片里的违规内容。最开始测试的时候,效果还不错,常见的违规内容都能识别出来。
但一上线,问题就来了。真实场景的图片,比测试集复杂太多了。有些图片角度奇怪,有些图片光线不好,有些图片内容很隐晦,大模型经常识别错。
而且,大模型的输出不稳定。同一张图片,有时候能识别对,有时候就识别错了。对于审核这种对准确性要求很高的场景,这种不稳定性是不可接受的。
我们花了很多时间优化提示词,调整参数,效果提升有限。最后只能加了很多规则和人工审核,才能勉强用。
那时候我才意识到,demo里的效果,和生产环境的效果,完全是两回事。demo里的图片都是精心挑选的,而生产环境的图片千奇百怪。
第二次踩坑:性能和成本
第二次踩坑,是性能和成本的问题。
多模态大模型的推理,比纯文本大模型慢很多,也贵很多。因为要处理图片和视频,计算量很大。
我们做的那个审核项目,每天要处理几百万张图片。用多模态大模型的话,推理速度慢,根本处理不过来。而且成本也很高,一张图片的推理成本,比纯文本高好几倍。
我们试过很多优化方法:模型量化、蒸馏、批量处理、缓存。效果有一些提升,但还是达不到要求。
最后我们的方案是,用传统的图像模型做初筛,把大部分正常的图片过滤掉,只有疑似违规的图片,才用多模态大模型做二次审核。这样既保证了准确性,又控制了成本和性能。
这个方案虽然解决了问题,但也说明,多模态大模型不能滥用,要和传统的方法结合起来用,才能在实际场景中落地。
第三次踩坑:数据和微调
第三次踩坑,是在微调多模态大模型的时候。
我们觉得通用的多模态大模型效果不够好,就想在自己的领域数据上微调。本来以为微调很简单,结果踩了一大堆坑。
第一个坑是数据。多模态的微调,需要大量的图文对数据。我们自己的数据量不够,就想从网上爬。但爬来的数据质量参差不齐,很多图文不相关,还有很多噪音。清洗数据花了大量时间。
第二个坑是微调的成本。多模态大模型的微调,比纯文本大模型更耗资源。我们用了好几张A100,微调了好几天,才跑完一个epoch。而且效果提升并不明显。
第三个坑是灾难性遗忘。微调之后,模型在我们的领域数据上效果好了一些,但在通用能力上下降了很多。以前能做的事情,微调之后反而做不好了。
第四个坑是评估。多模态模型的评估,比纯文本难很多。怎么衡量图片理解的好坏,没有统一的标准。我们花了很多时间建立评估集,但评估的结果和实际体验还是有差距。
最后微调的效果,没有达到我们的预期。投入了大量的时间和资源,收益却很有限。
第四次踩坑:视频理解
第四次踩坑,是在做视频理解的时候。
图片理解已经很难了,视频理解更难。视频的信息量更大,计算量也更大。一段几分钟的视频,帧数就有几千帧,全部喂给大模型,根本处理不了。
我们试过抽帧的方法,每隔几秒抽一帧,然后把这些帧喂给大模型。但抽帧会丢失很多信息,特别是动作和时序相关的内容。
而且,视频理解的推理速度很慢,一段几分钟的视频,要处理好几分钟。实时处理根本不可能。
还有成本的问题,视频理解的成本比图片理解高很多。我们算了一下,处理一个视频的成本,是处理一张图片的几十倍。
最后我们的视频理解功能,只能做一些简单的场景,比如视频内容的粗略描述。复杂的视频理解,目前还很难落地。
我为什么说"放弃"
经历了这么多坑之后,我为什么说"从入门到放弃"呢?
不是说多模态大模型没有用,而是说,我放弃了那种"多模态大模型无所不能"的幻想。
以前我觉得,有了多模态大模型,一切和图像、视频相关的问题都能解决。现在我明白了,多模态大模型只是一个工具,它有它的能力边界。
它在某些场景下确实很强,比如通用的图文问答、图片描述、OCR、简单的推理。但在很多专业场景下,它的效果、性能、成本,都还达不到生产级的要求。
而且,多模态大模型不是银弹。很多问题,用传统的计算机视觉方法,效果更好、成本更低、速度更快。不要什么都想用大模型,要根据实际场景选择合适的技术。
所以,我"放弃"的是对多模态大模型的盲目崇拜,而不是放弃多模态本身。现在的我,会更理性地看待多模态大模型,在合适的场景用它,在不合适的场景用其他方法。
给想入门的朋友的建议
如果你也想入门多模态大模型,我有几个建议。
第一,降低预期。不要被demo里的效果迷惑,实际场景的效果会打折扣。多模态大模型很强,但不是万能的。
第二,先学会用API。不要一上来就想自己训练模型,先用好现成的API,理解它的能力和边界。等你对多模态有了深入的理解,再考虑自己训练。
第三,重视工程能力。多模态大模型的落地,算法只是一部分,更多的是工程问题。怎么优化性能,怎么控制成本,怎么保证稳定性,这些都需要很强的工程能力。
第四,和传统方法结合。不要什么都用大模型,要和传统的计算机视觉方法结合起来。用传统方法做预处理和初筛,用大模型做复杂的理解和推理,这样效果和成本才能平衡。
第五,关注最新进展。多模态大模型发展很快,新的模型、新的方法层出不穷。要保持学习,关注最新的进展,不要被淘汰。
多模态的未来
虽然踩了很多坑,但我还是很看好多模态大模型的未来。
现在的多模态大模型,还处在早期阶段,还有很多不足。但它的发展速度很快,每隔几个月就有新的突破。我相信,随着技术的进步,现在的这些问题,都会慢慢解决。
未来,多模态大模型会越来越强,成本会越来越低,落地的场景会越来越多。它会像现在的纯文本大模型一样,成为很多应用的基础能力。
但在那之前,我们还是要理性看待,不要盲目跟风。根据自己的实际需求,选择合适的技术,才是正确的做法。
写在最后
从入门到"放弃",这一路走来,我学到了很多。
我学到了多模态大模型的知识,也学到了如何把技术落地到实际场景中。更重要的是,我学会了理性看待新技术,不盲目跟风,不被 hype 冲昏头脑。
新技术的发展,总是伴随着 hype 和泡沫。但 hype 退去之后,真正有价值的技术会留下来。多模态大模型,我相信是有价值的,但它的价值需要时间来证明。
如果你也在学习多模态大模型,希望我的经历能给你一些参考。少踩一些坑,少走一些弯路。
最后用一句话来结束这篇文章:"技术是工具,不是信仰。理性看待,合理使用,才能发挥它的最大价值。"
愿每一个技术人,都能在新技术的浪潮中,保持清醒,做出正确的选择。
评论(0)
暂无评论,快来抢沙发~
评论功能仅对会员开放,请先登录
登录