3.4 什么是多模态 AI?
文字、图片、声音和视频是不同的信息形式,也叫不同模态(modality)。能够处理不止一种模态的系统称为多模态 AI(multimodal AI)。
例如,用户可以输入文字问题、上传一张收据、提供会议录音,或让产品生成图片。支持哪些模态取决于具体产品和当前功能,不能因为一个聊天框能输入文字,就假设它一定能听音频或看懂表格。
正在加载交互实验...
正在加载概念检查...
能接收不等于能完整理解
图片可能模糊、裁切或缺页;录音可能有噪声和多人同时说话;表格可能因合并单元格而错位。AI 会根据实际读到的信号生成结果,输入质量差时,不确定性会增加。
正在加载交互实验...
正在加载概念检查...
使用多模态功能时,先说明任务范围,例如“只提取收据上的商户、日期和总金额”;得到结果后,对照原始材料核实关键数字。若画面不清,应允许 AI 标记“无法确认”,而不是要求它必须给出一个确定答案。
多模态也不意味着产品拥有人的所有感官。它处理的是被提供和允许访问的数据,看不到镜头外、文件外或录音之外的情况。
正在加载本节练习...
正在加载本节练习...