ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

多模态大模型:从CLIP到语义空间,落地挑战与实践

多模态大模型:从CLIP到语义空间,落地挑战与实践 1. 从一条朋友圈动态说起为什么单模态注定不够用我有个做电商运营的朋友前阵子跟我说了一件事。他们的客服团队每天要处理上千条咨询其中很大一部分是发一张商品照片问有没有这款拍个截图问怎么退款——纯文字客服根本接不住这种需求。用户那边拍了一张躺在快递盒里的破损商品客服这边还在机械地回复亲请您描述一下问题呢。这事让我一下子想到了一个点用户在用多模态的方式表达世界但过去的系统只能用单模态去理解。这其实就是多模态大模型出现之前整个AI应用最尴尬的处境。我们训练一个图像分类模型它只能回答这张图是猫还是狗训练一个文本模型它只能处理字符序列。但真实世界的信息从来不是单一形式的——你看到一辆车的照片旁边还有引擎轰鸣声说明书上是文字销售那边是视频。单模态模型的本质缺陷是它们只看到了世界的一个切片。多模态大模型要解决的恰恰是这个切片化的问题。它不是把几个模型拼在一起而是让模型真正在大规模的图文、音视频、时序数据上去学习这些东西到底在共同指涉什么拥有跨模态的语义理解能力。这个转变说大很大说透其实可以从数据、模型、应用三个层面讲清楚。这篇文章我会围绕三个核心问题展开多模态大模型和以前的多模型拼装到底差在哪它在实际场景里真正改变了哪些工作流以及——这是我最想聊的——那些看起来挺美好落地才发现坑很深的地方是什么。无论你是做算法的、做产品的还是正在评估要不要引入多模态方案的决策者应该都能在里面找到对自己有用的部分。2. 共享语义空间多模态模型打通六感的技术真相2.1 CLIP给了大模型第一双眼睛要做多模态第一步得让模型能看见图像。这一步的里程碑是OpenAI的CLIP模型Contrastive Language-Image Pre-training对比语言-图像预训练在2021年的出现。它的核心训练方法今天回头再看其实是整个多模态革命的起点用图像-文本对做对比学习让模型把图片和它对应的文字描述拉到同一个向量空间里靠近的位置把不匹配的推开。这个思路妙在哪妙在它彻底抛弃了手动标注。以前训练图像模型你得找一万人去给数据打标签这张图是狗——成本高、类目固定、而且标注者的主观偏差会漏掉大量语义细节。但CLIP用的数据是互联网上已有的数亿个图文对一张晚霞的照片旁边跟着一段游记文字一张产品图旁边是它的简介。模型自己去对齐这些信息。我用一个生活化的类比帮你理解这就像你学外语时随身带着一本图文对照词典——看到一张梨的图片旁边写着pear见多了之后你根本不需要别人告诉你pear是什么意思你的大脑已经在图片和单词之间建立了映射。CLIP做的就是这个事只不过这个词典有数亿个条目。CLIP之后视觉-语言预训练成了一个巨大的技术方向各种所谓的图文对齐模型层出不穷把对比学习、生成学习、掩码重建等思路都用了个遍。但不管技术流派怎么变它们的工作都可以概括为一个相同的内核把视觉信息和语言信息放进同一个向量空间让模型既懂图又懂文还懂图和文之间的关系。2.2 从跨界翻译到联合推理但这里有个很关键的问题对齐了图文是不是就意味着理解了不是。CLIP能告诉我们这张图在语义上接近哪句描述这本质上是检索或者匹配。但真实世界的任务往往不是匹配而是推理。比如你给模型看一段厨房着火、旁边有灭火器的视频片段问它下一步应该做什么——这不只需要让它知道视频里的画面和哪个句子比较像还需要它理解物理常识、因果链条、时序关系。这里就要说到从CLIP到多模态大语言模型MLLM的跃迁。大语言模型LLM本身就是一个极强的推理引擎——它学习了海量文本中的逻辑关系、常识知识。多模态大模型要做的是把视觉、音频等感知能力嫁接到这个推理引擎上。最常见的技术架构是用视觉编码器ViT, Vision Transformer把图像切块编码成视觉token再通过一个连接模块Adapter或Projector把这些visual token映射到语言模型的语义空间里之后语言模型就可以边看图边推理了。你可以把它理解成给一个博学多识的专家配了一副能看清细节的眼镜——认知能力本来就有新增的是感知通道。我接触过一些刚入门的朋友会觉得多模态大模型神秘实际上它最核心的部分语言模型其实还在扮演推理者的角色视觉模块做的更多是把图像翻译成模型能理解的语义符号。这也是为什么好多多模态模型在纯语言任务上依然保持了较强的能力——底座是语言模型视觉是输入接口。2.3 训练阶段预训练、指令微调和对齐多模态大模型的训练大致可以分成三个阶段理解这三个阶段你就理解为什么只需要给它看一眼图它就能干各种各样的事。第一阶段是多模态预训练。在这个阶段模型在海量图文对上做对比学习、生成学习学的是图片里的信息如何用语言表达。这个阶段非常贵动不动就是上亿的数据量、上万张GPU卡。第二阶段是多模态指令微调。这一步让模型学会听指令——不仅仅是描述图片内容还能看图回答问题根据图片写代码把图中文字转成表格等具体任务。这靠的是人工构造的图像问题回答三元组数据。第三阶段是基于人类反馈的对齐也就是RLHF、DPO这类方法让模型的输出更符合人类的偏好——比如描述图片时更自然、更有重点而不是机械地罗列元素。我在实际训练中会特别强调第二阶段的数据质量。很多人误以为数据越多越好其实对指令微调而言数据的多样性远比数据量重要。你给了一万道这张图里有什么颜色的问题模型只会变成颜色界的专家去了真实场景照样抓瞎。好的微调数据应该是混合的、任务覆盖广的、难度分层的。3. 三个被多模态大模型真正改变的战场技术讲得再天花乱坠不如看场景来得直接。我观察下来多模态大模型真正改变游戏规则的集中在下面三个战场。3.1 客服与内容理解从多模型串联到一句话端到端过去做智能客服遇到用户上传的图片技术上怎么处理通常是先用OCR光学字符识别模型抽文字再用图像分类打标签再用目标检测框出关键区域最后把这些结果统统塞给一个文本模型去组织语言。整个链路冗长、容易出错、维护成本极高而且每个环节的错误还会不断累积。多模态大模型直接把这条链路缩成了一步。用户发来一张快递破损商品瑕疵的图片模型自己去看图同时理解用户输入的这还能修吗我要退货综合多模态信息给出回答。不需要OCR模块不需要独立的图像分类器不需要专门的流程编排。我见过一个真实的部署案例某家电品牌的售后客服接入多模态模型之后用户拍照报修、AI自动识别故障类型、生成维修建议、转接人工时的上下文摘要全流程耗时从平均7分钟降到了不到2分钟。这个效率提升的本质就是信息不再需要在多个模型之间转手而是可以在同一个模型的语义空间里被合并处理。这也带来一个很微妙的产品变化以前多模态是一个复杂的工程架构问题现在它变成了一个模型选型数据准备问题。架构简化了但数据工程、评测监控的难度上来了。这点我在后面的章节会展开讲。3.2 内容生成从模式拼接到语义一致的创作图像生成、视频生成这些方向过去更多是按照样式模板堆像素——你要一张赛博朋克风格的图它可能真的给你画出非常赛博朋克的霓虹灯但画面里的人在喝咖啡这种语义组合可能就是错乱的手指六个、咖啡杯悬浮、影子方向错误。原因是纯粹的扩散模型并没有真正理解咖啡杯放在桌上的物理规则。多模态大模型的介入改变了这个局面。最新的图像生成模型普遍采用文本编码器多模态模型 扩散模型的组合方式先用语言模型深刻理解你的描述一个穿红色裙子的女孩坐在窗边手里拿着冒着热气的咖啡窗外下雨再把这个语义翻译成像素。生成结果的物理合理性、细节一致性都大幅提升了。视频生成领域更是如此。现在的AI视频模型为什么会长出6根手指根本原因是训练数据中缺乏足够的人手在不同姿态下的精确对应关系模型只能基于概率猜测。而多模态模型训练的关键就是要让模型看大量带文字说明的动作视频了解挥手是一个连贯的动作序列而不是每一帧各自为政。从只会生成像图片的图片到生成符合语义描述的世界这是本质差异。3.3 具身智能与实时交互多模态成为感官底座这两年大热的具身智能机器人操作、自动驾驶感知领域多模态大模型扮演的角色已经不是锦上添花而是底座。机器人到了一个新环境它需要做什么看视觉、听语音指令、读说明书/标签、推理下一步动作规划。每一个环节都是多模态的。过去每一环都要单独部署模型视觉感知模型、语音识别模型、自然语言理解模型、路径规划算法……整个系统臃肿而且模型之间信息传递的损耗非常大。现在一个端到端的多模态大模型可能直接吃掉摄像头画面麦克风语音触觉反馈作为输入直接输出行动计划。虽然这个方向还在早期但可以确定地说空间智能时代的核心底座一定是一个能同时处理多通道感官信息的大模型。我自己做过一个很基础的实验让小型的多模态模型代替传统的物体识别状态判断流水线去判断桌上有没有杯子、杯子里有没有水、水是否满了。以前至少要三步现在一步到位而且准确率还更高。这个体验非常直观——你能感受到传统CV流水线正在被重构。4. 理想很丰满落地很骨感多模态项目的真实硬骨头上面讲的变化是真切的、看得见的特别令人兴奋。但我必须诚实地说从2023年到现在我在真实落地多模态项目时踩过的坑一点都不比收获少。4.1 幻觉不是bug是尚未解决的特性多模态大模型最让人头疼的问题我把它排第一位跨模态幻觉。简单说就是模型看了图片却编造出图片里不存在的东西。我测过一个很典型的case给模型看一张干净的白色办公桌问它桌面上有什么它回答有一台笔记本电脑、一本翻开的笔记本、还有一个马克杯。实际上桌上什么都没有。它为什么会这么回答因为它的训练数据里办公桌这种场景最常出现的物品组合就是这些。它在用语言世界的高频先验填补视觉信息的空白。这个问题为什么难解因为它是模型统计特性的必然产物——语言模型的本能就是预测最可能的下一句。要缓解它一是靠更好的视觉编码器让视觉特征更强、更细二是靠专门构造容易幻觉的负样本做微调让模型在不确定的时候学会说不确定三是靠推理时的手段比如给模型更多图片中的局部线索强制它参考视觉内容。但说实话这些问题至今没有一个完全解法只能缓解。在实际产品里最稳妥的办法是在高幻觉风险的场景中加一层规则矫正比如检索增强、数据库校验不要让模型裸奔。4.2 评测感觉挺好和真的好之间隔着十万八千里纯文本模型好评测有大量的benchmark基准测试集答对了就是答对了。多模态模型怎么评你说让AI描述一张图怎么算好一只狗躺在草地上和一只金毛犬慵懒地趴在公园草地上阳光洒在它的皮毛上都是正确的描述前者简洁后者细节丰富哪个更优这没有标准答案。更麻烦的是多模态数据的伪相关问题。比如一个看图问答数据集中问图中是什么动物模型可能根本不需要看图只要看数据集里图问题的配对规律就能蒙对答案——因为同一批数据里草地狗的组合出现频率极高。很多模型在公开benchmark上分数虚高一到复杂真实场景就露馅。我在选型时会把大约三分之一的精力花在自行构建评测集上拿真实业务场景的图片、过去半年用户反馈中最难处理的case自己标注自己测。4.3 数据活水多模态项目真正的护城河很多人以为多模态模型开源了、API可以调了数据工作就不重要了。我的体会正好相反数据工程在两三年后可能比模型架构更决定项目成败。为什么因为基础模型的能力天花板是公开的谁都能调API但你的业务场景是独特的。医院影像科的多模态助手需要能理解CT片上的病灶医生的口头描述病历文档电商客服需要理解商品主图详情参数聊天上下文。这些领域数据不在任何一个公开数据集里。所以多模态项目的落地团队最核心的岗位可能不是算法工程师而是数据工程师领域专家。前者负责构建数据采集、清洗、标注的流程后者负责确保指令数据贴近真实场景。我见过不少团队算法能力很强但数据分析一塌糊涂图都不用筛一下就往进灌结果模型学了一堆噪声。我现在做项目的第一原则是先用两周把数据管线跑通再谈模型选型。数据准备没到位再强的模型也白搭。4.4 算力和成本多模态吃硬件的能力多模态模型对算力的需求比纯文本大模型高一个量级。一张768×768的图切块输入模型后可能产生几百个visual token每一个token都要参与语言模型的注意力计算。这就意味着同样的硬件条件下多模态推理的吞吐量远比纯文本低延迟也更高。我实测过几个主流开源多模态模型模型规模纯文本推理延迟图像输入文本输出延迟吞吐下降幅度7B-8B参数~50-100ms/token首Token延迟增加0.5-1.5秒明显下降13B-14B参数~100-200ms/token首Token延迟增加1-2秒显著下降70B级更高需要特殊优化才能实时严重在没有GPU加速优化的情况下很多小团队的实测效果会比我上面列的更差。所以落地时量化、剪枝、视觉token压缩这些优化手段几乎都是必选项。但优化只减少计算量不会消除计算需求。5. 研发范式正在悄悄改变对团队和个人的影响多模态大模型带来的不只是技术上的改变研发流程、团队结构、个体能力模型也在被重构。这里面的变化可能比技术本身更值得关注。5.1 从训练模型到善用模型我2018年入行做CV时大部分人还在自己设计网络结构、调整损失函数、炼丹调参。到了多模态时代训练一个模型这件事的门槛和成本对绝大多数团队来说已经不可接受了——你要么用开源的底座微调要么直接调商业API。这意味着团队的重心从造模型变成了用模型。你会花更多时间在如何组织数据让模型发挥出能力如何设计好的提示词和交互链路如何构建评测和监控体系如何处理模型回答不理想时的兜底逻辑。这像什么像早期移动互联网时代大部分人从写客户端变成了写服务端——基础设施在变岗位的价值在往上层移动。5.2 新岗位提示词工程和AI产品经理真的这么值钱吗这两年提示词工程师AI产品经理的岗位炙手可热但我必须泼一盆冷水只写提示词是没有门槛的也很容易被替代。真正值钱的是理解模型行为逻辑理解业务场景的人。举个具体的例子给一个AI客服写提示词你是客服要有礼貌、要解决问题这个谁都会。但你有没有分析过这个模型在什么输入下最容易情绪失控什么样的用户表达方式会让模型误解图片文字混合输入时模型优先看图还是看字这些行为洞察才是构建高质量AI应用的护城河。它需要的是跨领域的经验积累而不是背几个提示词模板。5.3 多模态模型时代的伦理与边界问题多模态模型因为能理解图文也带来了一系列新问题。最典型的是深伪——一张图片一段音频可以生成完全虚构的视频而且普通人几乎无法辨别。图像生成模型可以创建不存在的真实场景语音克隆可以让任何人说出从未说过的话。这些技术在带来创作自由的同时也对信任体系提出了很大挑战。对开发者来说我需要提醒如果你的产品涉及人脸、证件、声音、票据这类高可信数据一定要做生成内容的标记和溯源。这不是出于合规压力而是长期来看AI生成内容如果不加以区分会严重侵蚀人们对整个信息环境的信任最终损害的是所有AI应用的价值。我在团队里现在坚持一条原则涉及真实世界事实表达的场景新闻、金融、医疗、证件尽量不让模型直接生成输出而是让模型做抽取、检索、整理所有关键信息都要能溯源到原始资料。这看起来不酷但能避免很多麻烦。6. 如果现在让我从零开始做一个多模态项目最后我想结合自己的实际项目经验给正在考虑做多模态项目的团队一份少走弯路的行动清单。它不是标准流程是我自己踩过坑之后总结出来的节奏。第一步先卡场景再选模型绝不先上模型再找场景。你们的产品到底要解决什么任务这个任务的核心信息载体是什么是图片文字、视频语音还是多通道混合把场景边界画清楚这决定着你后续至少一半的数据工作。第二步用两周时间构建你的最小评测集。不要用公开benchmark去找50-100个真实的业务case自己标注好标准答案多次对比不同模型的输出形成你自己的选型依据。这一步花的钱远比你选错模型后返工花的钱少。第三步建立数据回流闭环。模型上线后每天的坏case必须自动回流到数据标注池每周更新版本。我见过太多团队上线跑一个月效果越跑越差还不知所以问题就出在没有数据回流机制。多模态模型的失败模式太多不可能一次性覆盖必须持续推进。第四步把兜底方案设计成产品功能而不是技术补丁。模型不确定或幻觉风险高的时候产品要主动触发转人工“请用户补充信息”显示参考来源等降级路径。不要试图让模型永远不出错要让产品在模型出错时优雅应对。第五步关注模型更新节奏但保持稳健。大模型领域三四个月一代今年开源模型的能力已经接近去年商业模型。但你不用每次都追新——你的评测集稳定地摆在那里新模型来了就跑一遍评测分数明显高、稳定性好的时候再切。任何时候都不要听风就是雨用数据说话。写到最后说点个人体会。我参与多模态项目这两年最大的感受不是技术好强而是**以前我们做AI是在教机器如何分辨东西现在做多模态大模型是在教机器如何理解世界**。这个转变比想象中来得快但远远没有结束。今天文章里提到的幻觉问题、评测困境、数据工程每一个都还是开放性问题至少未来两三年内会是整个行业的关键挑战。也正因为如此现在恰恰是动手做多模态应用最好的时间窗口——竞争者都还在学走路你先跑起来哪怕姿势难看也占住了先机。
返回列表