GLOSSARY
能同时处理多种媒介的模型——读图、生成音频、看懂视频——而不只处理文本。
多模态模型能处理不止一种数据:文本之外还有图像、音频或视频。你可以给 ChatGPT 看一张照片并提问,用语音口述提示词,或把视频交给 Gemini 分析——都通过同一个界面。
多模态正在悄然重塑本目录中的每个品类:助手能看懂你的截图,视频生成器理解静态图,音频模型能从样本克隆声音。它还解锁了纯文本系统无法企及的无障碍场景——为视障用户描述图像、为语音生成字幕。