多模态 AI 是什么
多模态 AI 指模型可以处理或生成多种类型的信息,包括文本、图片、音频、视频、3D 等。
常见能力
- 图像理解:读截图、识别图表、分析设计稿。
- 图像生成:根据文本生成插画、海报、概念图。
- 视频理解:总结视频内容、提取关键片段。
- 视频生成:根据文本或图片生成视频。
- 语音交互:语音输入、语音合成、实时对话。
典型产品
- ChatGPT / Gemini:通用多模态理解。
- Midjourney / DALL·E / Stable Diffusion:图片生成。
- Sora / Kling / Runway:视频生成。
- ElevenLabs:语音生成。
选型建议
如果目标是“看懂资料”,优先选通用多模态模型;如果目标是“生成高质量视觉内容”,优先选垂直生成工具;如果目标是进入业务流程,需要看 API、权限、安全和成本。