GLOSSARY
原生多模态
一个模型在同一次前向里看图、听音频、写文本——不是把专家流水线粘在一起。
早期的多模态产品是流水线:一个 OCR、一个配文模型、一个 LLM。原生多模态在混合 token 上训练同一个网络——图像块、频谱、文本——于是同一套权重能把一句话钉在截图上。Gemini、GPT-4o 以及同类模型靠这种统一来卖。
收益是从未外挂的交叉注意力:“这张图哪里不对”不会在配文往返中丢掉像素。代价是数据与评测必须覆盖每对模态,以及原生路径失败时产品仍会静默退回流水线。册子上的多模态,追踪里不一定是。