名词解释 / 01
多模态模型
第 3 / 127 个名词认识 AI 和常见产品
英文名称:Multimodal Model
常见别名:Multimodal、多模态、多模态大模型;规模较大的多模态模型也常缩写为 MLLM
所属分类:认识 AI 和常见产品
一句话解释
多模态模型是能够接收、关联或生成文字、图片、声音、视频等多种信息形式的模型。“多模态”描述这种信息形式或能力,“多模态大模型”是其中规模较大、用途较广的一类,普通使用场景下可以放在同一概念下理解。
工作中什么时候会遇到
当系统能识别设备照片并回答文字问题、把会议录音转成纪要,或结合图纸与说明书检索信息时,可能使用了多模态模型。
能解决什么问题
- 将图片、文字和声音放在同一任务中处理。
- 提取照片、截图、录音和视频中的信息。
- 支持看图问答、语音交互及跨模态检索。
- 减少不同材料之间的人工转换。
举个例子
售后人员上传故障照片和客户语音描述,模型先识别可见部件、转写问题并生成信息清单。它只能提供排查线索,无法仅凭照片确认内部损坏或安全状态。
怎么使用
提供清晰原始材料,注明材料之间的关系和需要关注的位置;要求模型分别列出观察到的事实、推断和无法确认的信息,再由人员核对。
使用时要注意什么
能接收某种文件不等于能准确理解其中所有内容。小字、复杂图纸、噪声、方言和长视频容易造成遗漏;高风险结论必须回到原始材料和专业检测。
容易混淆的词
- 视觉语言模型:重点连接图像与语言,属于多模态模型的一类。
- 文件上传:产品能接收图片、音频或视频,不代表底层模型能够准确理解所有内容。
- 计算机视觉:主要处理图像和视频;多模态模型还会把视觉与语言、声音等信息关联起来。