名词解释 / 01

多模态模型

第 3 / 127 个名词认识 AI 和常见产品

英文名称:Multimodal Model
常见别名:Multimodal、多模态、多模态大模型;规模较大的多模态模型也常缩写为 MLLM
所属分类:认识 AI 和常见产品

一句话解释

多模态模型是能够接收、关联或生成文字、图片、声音、视频等多种信息形式的模型。“多模态”描述这种信息形式或能力,“多模态大模型”是其中规模较大、用途较广的一类,普通使用场景下可以放在同一概念下理解。

工作中什么时候会遇到

当系统能识别设备照片并回答文字问题、把会议录音转成纪要,或结合图纸与说明书检索信息时,可能使用了多模态模型。

能解决什么问题

  • 将图片、文字和声音放在同一任务中处理。
  • 提取照片、截图、录音和视频中的信息。
  • 支持看图问答、语音交互及跨模态检索。
  • 减少不同材料之间的人工转换。

举个例子

售后人员上传故障照片和客户语音描述,模型先识别可见部件、转写问题并生成信息清单。它只能提供排查线索,无法仅凭照片确认内部损坏或安全状态。

怎么使用

提供清晰原始材料,注明材料之间的关系和需要关注的位置;要求模型分别列出观察到的事实、推断和无法确认的信息,再由人员核对。

使用时要注意什么

能接收某种文件不等于能准确理解其中所有内容。小字、复杂图纸、噪声、方言和长视频容易造成遗漏;高风险结论必须回到原始材料和专业检测。

容易混淆的词

  • 视觉语言模型:重点连接图像与语言,属于多模态模型的一类。
  • 文件上传:产品能接收图片、音频或视频,不代表底层模型能够准确理解所有内容。
  • 计算机视觉:主要处理图像和视频;多模态模型还会把视觉与语言、声音等信息关联起来。

相关名词

文件解析大模型

参考来源