系列文章见: 《回忆AI时代-从图灵机到人工智能》
2023年发生了两件足以改变AI历史的大事“大模型进入多模态时代”和“图片生成进入全民时代”
大模型进入多模态时代
什么是多模态
多模态(Multimodality)顾名思义就是让人工智能能够理解和处理多种类型的数据,包括但不限于文本、图像、音频、视频等。换句话说,人类通过眼睛看图像、耳朵听声音、语言进行交流来获取信息,而AI也开始逐步具备类似的感知与理解能力,不再局限于处理单一的文本数据。
模态的演进
2023年被普遍认为是“大模型多模态时代”的起点,在2023年之前大多数大模型还是单模态,如:
- GPT-3:只能处理文本
- ChatGPT(2022年11月发布):主要也是文本对话
- Stable Diffusion(2022):只能生成图片
2023年3月OpenAI发布了GPT-4,首次赋予大模型强大的视觉理解能力,使其能够同时处理文本与图像,标志着多模态能力正式进入大众视野。
同年Google发布了Gemini,从设计之初便采用原生多模态(Native Multimodal)架构,在训练阶段就将文本、图像、音频、视频等多种数据统一融合,而不是将多个单一模型简单拼接。这意味着AI开始能够像人类一样,对来自不同感官的信息进行综合理解与推理。
多模态应用场景
我们在使用大模型时,不只可以文本聊天,还可以与他语音对话、上传一些图片识别内容,这也带来了很多的应用场景,譬如:
- 语音: 语音陪聊提供情绪价值、英语口语对话提升英语能力
- 图片生成: 生成创益的广告图片与文案、个人照片优化
- OCR: 识别发票、身份证、合同等信息
- 生成视频:生成视频应用在广告、短视频、个人宣传片和动画等领域