多模态

基础概念

Multimodal

简明定义

多模态AI指能够同时处理文本、图像、音频、视频等多种类型输入的模型。2026年主流AI模型均已支持多模态能力,用户可以上传图片让AI分析、用语音与AI对话、让AI生成视频等。